임상 실습에서 4 개의 LLM의 내용 안전 및 비교 효능
Gold Standard Medical References에 대한 4 개의 공개적으로 이용 가능한 대형 언어 모델의 비교 성능 평가
Openevence는 동료 검토 의료 연구의 데이터를 집계하고 합성 한 다음 생성 AI를 사용하여 사용자의 질문에 대한 응답을 생성하는 온라인 도구입니다. 오늘날 많은 임상의 (거주자 포함)가 사용하고 있지만, 도구의 출력이 정확한 지 여부 와이 정보가 임상 의사 결정에 적절하게 정보를 제공하는지에 대한 게시 된 데이터는 거의 없거나 전혀 없습니다. 마찬가지로, 많은 임상의가 임상 치료를 제공 할 때 의사 결정을 돕기 위해 다른 대형 언어 모델 (LLM)으로 전환하고 있습니다. 의료위원회 질문 또는 임상 비네팅에 대한 이러한 LLM의 반응의 정확성에 대한 많은 연구가 발표되었지만, 실제 임상 환경에서의 성과를 조사하는 데 현재의 연구는 거의 없었으며,이 성능을 비교하는 것도 거의 없었습니다.
이 연구에서 조사관은 두 가지 목표를 가지고 있습니다.
- AI 도구 "openevence"의 사용이 임상 실습 과정에서 가정 의학, 내과 및 정신과 거주자가 활용할 때 임상 적으로 적절한 결정을 내리는 지 여부를 결정합니다.
- Openevence Tool의 출력이 주민들이 임상 실습 과정에서 가지고있는 일반적인 질문에 대답하는 데있어 일반적으로 사용되는 공개적으로 사용 가능한 대형 언어 모델 (Openai의 Chatgpt, Anthropic 's Claude 및 Google의 Gemini)과 어떻게 비교되는지 결정합니다.
연구 목표 1 #1을 달성하기 위해, 조사관은 임상 실습 과정에서 Openevence Tool을 사용하기 위해 위의 전문 분야에 거주자를 입대했습니다. 안전 위험을 완화하기 위해 주민들은 "골드 표준"도구라고하는 일반적인 참조 도구를 사용합니다. 이러한 도구에는 PubMed 및 Uptodate가 포함됩니다. 주민들은 다음과 같습니다.
- 임상 질문을 진술하십시오.
- 쿼리 openevence, 데이터 분석을위한 프롬프트 및 OpeneVidence 출력 캡처. 모든 거주자는 연구가 시작될 때 신속한 엔지니어링에 대한 교육을받습니다.
- 반대성 데이터에 기초하여 임상 결론을 진술하십시오.
- 골드 표준 리소스를 쿼리하십시오.
- 그들의 최종 임상 결론을 진술하십시오.
- 골드 표준 참조에 의해 임상 결론이 수정되었는지에 대한 질문에 답하십시오.
- OpeneVidence의 생산량에 대한 임상 안전 문제가 있는지 여부에 대한 질문에 답하십시오.
전문성과 일치하는 의사 주제 전문가 (SMES)는 최소 5 년간의 훈련 후 임상 경험과 일치하면 거주자의 반응을 평가할 것입니다. 5 년은 Malcolm Gladwell에 의해 "특이하지"이 책을 기반으로 선정되었으며, 그는 분야에서의 전문 지식을 달성하기 위해 10,000 시간의 집중 관행이 필요하다고 주장합니다.
중소기업은 거주자의 초기 임상 질문과 결론에 따라 결론을 평가하도록 요청받을 것입니다. 그들은 1-10의 규모로 그 결론의 임상 적 적합성을 평가하도록 요청받을 것이다. 중소기업이 거주자 결론에 대한 임상 적 적합성을 잘못 평가하는 질문의 경우 (<5/10), OpeneVidence 출력을 검토하고 출력이 잘못되었는지 여부에 대한 추가 질문에 답해야합니다.
목표 #2를 달성하기 위해, 주민들이 OpeneVidence에 입력 한 초기 프롬프트는 연구팀에 의해 Chatgpt, Gemini 및 Claude에 복사됩니다. 각 도구 (OpeneVidence 포함)의 출력은 중소기업으로 표면되며, 정확도, 완전성 및 편견에 따라 각 출력을 평가하도록 요청받습니다. 리 커트 스케일은 이러한 등급에 사용됩니다. 또한 중소기업은 또한 출력의 환자 안전 문제를 식별하기 위해 개방형 질문을받습니다.
연구 개요
상세 설명
Openevence는 May Clinic Platform Accelerate [OpeneVidence]에서 구축 된 온라인 도구로, 동료 검토 의학 연구의 데이터를 집계하고 합성 한 다음 생성 AI를 사용하여 사용자의 질문에 대한 응답을 생성합니다. 오늘날 많은 임상의 (거주자 포함)가 사용하고 있지만, 도구의 출력이 정확한 지 여부 와이 정보가 임상 의사 결정에 적절하게 정보를 제공하는지에 대한 게시 된 데이터는 거의 없거나 전혀 없습니다. 마찬가지로, 많은 임상의가 임상 치료를 제공 할 때 의사 결정을 돕기 위해 다른 대형 언어 모델 (LLM)으로 전환하고 있습니다.
Openevence는 동료 검토 임상 연구의 데이터를 집계하고 합성하도록 설계된 온라인 도구로, 생성 AI의 적용을 통해 사용자 문의에 대한 응답을 생성합니다. 노련한 임상의와 연수생 모두가 점점 더 활용하고 있지만, 임상 의사 결정에 적절하게 정보를 제공하는 데있어 도구의 출력의 정확성, 안전성 및 효능에 관한 게시 된 데이터가 주목할 만하다. 동시에, 점점 더 많은 임상의가 임상 치료에서 의사 결정을 지원하기 위해 공개적으로 이용할 수있는 대형 언어 모델 (LLM)을 활용하고 있습니다. 많은 연구에서 의료 보드 질문 또는 임상 비네팅에 대한 LLM 반응의 정확성을 조사했지만 실제 임상 환경에서의 성능에 대한 연구는 제한적이며,이 성능에 대한 비교 분석을 제공하는 연구는 더 적습니다.
문헌을 검토 할 때, 한 기사는 LLM이 실무자보다 불안을 감지하는 데 더 낫다는 것을 보여 주지만 이는 임상 비네팅을 기반으로 한 것입니다. [Levkovich et al.] 다른 하나는 구조화 된 설문지에서 환자보고 된 결과 측정을 사용하여 LLM의 진단 민감도를 보았습니다. [Pagano et al.] 종양학에 대한 LLM을 비교 한 추가 연구는 가상의 비네팅을 사용합니다. [Benary et al.] 임상 비네팅을 사용한 무작위 대조 시험은 LLM에 접근 할 수있는 제공자에 대한 임상 개선을 나타내지 않았다. [Goh et al.] 한 사례 연구는 ChatGpt 3.5를 일일 라운드에 통합하고 그 사용을 질적으로 평가했지만 다른 LLM 또는 골드 표준 참조 도구와 비교하지는 않았습니다. [Skryd et al.] 또 다른 또 다른 Chatgpt의 반응을 유방 통증 및 유방암 검진에 대한 American Radiology Approprieness 기준과 비교했지만 다시 다른 LLM과 비교하지는 않았다. [Rao et al.] 우리의 검토에서, 한 연구만이 실제 임상 환경에서 LLM을 평가했습니다. 이것은 소수의 실제 사례와 표준화 된 프롬프트 템플릿을 사용하여 유방암 관리에서 복잡한 의사 결정을 위해 사용하는 일련의 논문이었습니다. [Griewing, Knitza et al.; Griewing, Gremke et al.] 이 연구는 정확도의 일관성과 악화에 관한 문제 (특히 GPT 3.5)를 발견하여 저자들은 그 목적을 위해 LLM의 임상 적 사용이 아직 출판 당시 실현 가능하지 않다는 결론을 내렸다. 그럼에도 불구하고 건강 시스템 리더는 이러한 도구의 사용이 임상 실습에서 빠르게 가속화되는 것을보고 있습니다. 이러한 이유로, 조사관들은 임상의가 그들의 사용의 결과로서의 결정의 안전과 임상 적 적합성을 연구하는 것이 필수적이라고 생각한다.
Cambridge Health Alliance (CHA)는 보스턴 지역의 공개 학업 안전망 건강 시스템으로 다양한 환자들에게 서비스를 제공합니다. Cha는 강력한 1 차 진료 및 외래 환자 정신과 발자국을 보유하고 있으며 Harvard Medical School과 Tufts University School of Medicine을 통해 대규모 대학원 의학 교육 프로그램을 지원합니다. 수사관들은 많은 훈련생이 이미 OpeneVidence를 사용하고 있기 때문에 거주자를 우리의 주요 연구 참가자로 선택했으며, CHA의 도구에 액세스 할 수있는 경우 연구에 참여할 수있는 인센티브가 더 인센티브를 발견했습니다 (그렇지 않으면 네트워크 서비스에서 블랙리스트에 올랐 으며이 연구 결과가 결정될 때까지 정책에 의해 금지됩니다).
연구 결과는 다음과 같습니다.
Openevence의 사용이 지역 사회 건강 환경에서 임상 실무 과정에서 거주자의 임상 적으로 적절한 결정으로 이어지는 지 여부를 결정하십시오.
OpeneVidence의 출력이 공동체 건강 환경에서 임상 실습 과정에서 임상 적 질문에 대한 임상 적 질문을 해결할 때 일반적으로 사용되는 공개적으로 사용 가능한 대형 언어 모델 (OpenAi의 ChatGpt, Anthropic 's Claude 및 Google의 Gemini)과 어떻게 비교되는지 결정하십시오.
행동 양식:
데이터 수집은 학습 기간 동안 공급 업체 버전 업그레이드를 최소화하기 위해 6 개월 동안 진행될 예정입니다. 주민은 전문 분야에 의해 "의학"(내과/가정 의학) 및 "정신과"(성인/아동 정신과)으로 그룹화됩니다. 적절한 특수 주제 전문가와 일치하는 것을 단순화하기 위해 의학 거주자는 성인 1 차 진료 사례 (OB/GYN 관련 문제 제외)에만 OpenEvence를 사용해야합니다. 정신과 거주자는 성인 정신과 사례에만 Openevence를 사용하도록 요청받습니다.
참가자로 받아들이 기 전에 훈련생은 모두 다음에 동의하도록 요청 받았다.
- PubMed, Uptodate, Dynamed, 임상 전문 사회 지침 또는 연구 양식에 문서화 해야하는 기타 유사한 임상 참조 소스를 포함하도록 연구 프로토콜에 정의 된 Gold Standard Tool에 대한 Openevence 쿼리에 대한 교차 점검.
- 개인 건강 정보 (PHI)를 OpeneVidence에 입력하지 마십시오 (아래 정의 된대로).
- 환자의 임상 치료에 적합한 경우 일주일에 적어도 3 회 Openevence를 사용하려고 시도하십시오.
- 선택 바이어스를 피하기 위해 Openevidence 쿼리의 100%를 연구 연구 양식에 문서화하십시오.
모든 거주자에게는 데이터 수집이 시작되기 전에 의료 서비스를위한 신속한 엔지니어링에 대한 간단한 교육이 제공됩니다. 이 연구의 하위 목표 중 하나는 거주자가 실제 세계 환경에서 Openevidence에 제출하는 유형의 쿼리 유형을 이해하는 것이므로 표준화 된 프롬프트는 사용되지 않습니다.
모든 거주자는 다음과 같이 PHI의 정의에 대해 교육을받습니다.
쿼리에는 Safe Harbor 식별자 [HHS]에 의해 정의 된 PHI가 포함되어서는 안됩니다. 쿼리에는 환자 연령 (소아과의 경우 일/주/개월) 및 법적 성관계가 포함될 수 있습니다. 89 세 이상 환자의 경우, 사용자는 안전한 항구 표준을 준수하기 위해 "89 세 이상"이라는 용어를 사용해야합니다.
쿼리에는 드문 장애에 대한 전국기구에 의해 정의 된대로 극히 드문 상태를 가진 환자를 포함해서는 안됩니다. 드문 조건이 처음에는 의심되지 않고 AI 도구를 사용하는 연구 과정을 통해 의심되는 경우,이 시점에서 쿼리를 중지해야합니다.
데이터 수집에는 Health Cloud Infrastructure 용 Cha의 Enterprise Google Workspace 내에서 HIPAA 호환 Google 양식을 사용하는 것이 포함됩니다. 데이터 수집 양식은 연수생에게 다음을 수행합니다.
- 초기 임상 질문을 입력하십시오.
- Openevidence 프롬프트 (반복 프롬프트에 대해 순차적으로 번호가 매겨지고 있음) 및 전체 Openevence 출력이 생성됩니다.
- Openevence 출력에 따라 임상 결론을 입력하십시오.
- 사용 된 골드 표준 참조 도구를 입력하십시오.
- Openevence와 Gold Standard Reference 도구의 정보를 바탕으로 최종 임상 결론을 명시하십시오.
- 골드 표준 참조에 의해 초기 임상 결론이 수정 된 정도에 대한 질문에 답하십시오.
- 임상 안전 문제, 부정확성 또는 Openevence의 출력에 대한 편견을 발견했는지 여부에 대한 개방형 질문에 답하십시오.
쿼리는 Specialty (Medicine vs. Psychiatry)로 정렬되며 각 쿼리는 순차적 인 학습 번호를받습니다.
내과, 가정 의학 또는 정신 의학에서 인증 된 의사 주제 전문가 (SMES) 보드에 참석 한 임상 후 임상 경험이 5 년 이상 모집되었습니다. Malcolm Gladwell은 그의 저서 인 Outliers가 분야에서의 전문 지식을 달성하기 위해 10,000 시간의 집중 관행이 필요하다고 주장했다는 사실에 근거하여 5 년간의 훈련 후 임상 경험이 선택되었습니다.
중소기업은 거주자의 초기 임상 질문과 결론에 따라 결론을 평가하도록 요청받을 것입니다. 그들은 10 점 리 커트 척도에서 이러한 결론의 임상 적 적합성을 평가하도록 요청받을 것입니다. 중소기업은 또한 각 쿼리에 대한 Openevidence 출력과 중소기업이 거주자 결론에 대한 임상 적 적합성을 평가하지 않는 경우 (<5/10), 중소기업은 도구의 출력 자체가 도구 자체가 도구 발표를 허용했는지 확인하기 위해 도구 자체가 임상 적으로 부적절한 응답을 제공했는지 여부를 평가하기 위해 후속 질문을 추가로 요청받을 것입니다. SME 검토에는 검토 자 사이의 2.5-5% 중복이 포함되어 Interrater 신뢰성에 대한 Kappa 점수를 계산합니다.
연구의 2 부에서, 연구팀은 Openevence Queries를 테마로 분류하고 LLM의 비교를 위해 각 전문 분야와 테마에서 쿼리의 랜덤 샘플링을 선택합니다. 연구팀은 프롬프트가 연구 프로토콜에 따라 PHI를 포함하지 않음을 확인합니다. 그런 다음 거주자가 선택한 쿼리를 위해 입력 한 Openevence 프롬프트를 복사하여 Chatgpt, Gemini 및 Claude에 정확하게 붙여 넣습니다.
4 개의 도구 (OpeneVidence, Chatgpt, Gemini 및 Claude) 각각의 출력은 Google WebForm에 표시됩니다. 중소기업은 정확성, 완전성 및 편견을 위해 각 출력을 리 커트 척도로 평가하고 출력의 환자 안전 문제를 식별하는 질적 질문에 답해야합니다.
결과:
1 차 결과 결과는 다음과 같이보고됩니다.
Openevidence (SD, Median)를 사용하여 주민이이 내린 결정에 대한 임상 적으로서, 전문 분야
- 임상 적으로 적은 낮은 경우, 중소기업이 도구의 출력이 아니라 주민의 도구 해석으로 인한 것으로 확인 된 경우, 이러한 사례가 제외 된 경우에도 메트릭이 제공됩니다.
- 인터레이터 신뢰성 (카파 가치)
2 차 결과 결과는 다음과 같이보고됩니다.
각 전문 분야 및 각 변수 (정확도, 완전성 및 편견)에 대해 조사자는 다음을보고합니다.
- 각 LLM의 "승리"속도와 2 위 점수에서 평균 마진.
- 코헨의 D 테스트를 사용하여 효과 크기 (각 LLM을 별도의 참조로 사용).
- 인터레이터 신뢰성 (카파 가치)
연구 유형
등록 (추정된)
연락처 및 위치
연구 장소
-
-
Massachusetts
-
Cambridge, Massachusetts, 미국, 02193
- Cambridge Health Alliance
-
-
참여기준
자격 기준
공부할 수 있는 나이
- 어린이
- 성인
- 고령자
건강한 자원 봉사자를 받아들입니다
샘플링 방법
연구 인구
설명
포함 기준 :
- Cambridge Health Alliance의 내과, 가정 의학, 성인 정신과 또는 아동 정신과에서 활동적인 연수생 PGY-1 ~ PGY-6
- 연구 설명에 요약 된 연구 프로토콜 요구 사항에 동의해야합니다.
제외 기준 :
- 포함 기준을 충족하지 않는 사람
- 연구 수집 기간이 끝나기 전에 Cha를 떠날 거주자.
공부 계획
연구는 어떻게 설계됩니까?
디자인 세부사항
코호트 및 개입
그룹/코호트 |
개입 / 치료 |
|---|---|
|
의학 거주자
내과 또는 가정 의학 연수생
|
주민들은 일상적인 임상 치료 과정에서 Openevence Clinical Reference 도구를 사용합니다.
또한 골드 표준 임상 참조 도구 (예 :
PubMed, uptodate) 위험을 완화합니다.
|
|
정신과 거주자
성인 및 아동 정신과의 연수생
|
주민들은 일상적인 임상 치료 과정에서 Openevence Clinical Reference 도구를 사용합니다.
또한 골드 표준 임상 참조 도구 (예 :
PubMed, uptodate) 위험을 완화합니다.
|
연구는 무엇을 측정합니까?
주요 결과 측정
결과 측정 |
측정값 설명 |
기간 |
|---|---|---|
|
임상 적 적절성 : SD의 평균
기간: 6 개월
|
Openevidence 출력을 기반으로하는 거주 결정의 임상 적합성 점수. 이것은 10 점 리 커트 척도의 숫자 점수입니다. (이 모든 결과 메트릭에 설명 된 리 커트 척도의 경우 더 높은 점수가 더 나은 결과입니다.) 표준 편차를 사용한 평균 점수는 1 차 결과에 사용됩니다. |
6 개월
|
|
임상 적 적절성 : 중앙값
기간: 6 개월
|
Openevidence 출력을 기반으로하는 거주 결정의 임상 적합성 점수. 이것은 10 점 리 커트 척도의 숫자 점수입니다. 평균 임상 적 적합성 점수도보고됩니다. |
6 개월
|
|
임상 적 적절성 : 간호사 신뢰성
기간: 6 개월
|
SME 's는 10 점 리 커트 척도에서 Openevence 출력을 기반으로 한 상주 결정의 임상 적합성 점수를 평가합니다. 중소기업 임상 적합성 점수의 인터레이터 신뢰성은 카파 값을 사용하여 계산됩니다. |
6 개월
|
2차 결과 측정
결과 측정 |
측정값 설명 |
기간 |
|---|---|---|
|
LLM의 비교 정확도 : 승리율
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 어느 모델 이기든 "1"의 점수가 부여됩니다. 넥타이가 있으면 타이의 분할에 따라 각각 0.5 또는 0.33 포인트를 얻습니다. 각 전문 분야 (의학 및 정신과) 및 각 LLM에 대해 LLM의 평균 마진으로 "승리율"을보고합니다. 예를 들어, 모든 의약품 쿼리의 경우 다른 LLM에 비해 OpeneVidence가 "원한"비율을 정확도 리 커트 척도 (Kappa 값을 결정하기위한 중소기업 겹침이있는 경우)의 비율을보고합니다. 정확성과 관련하여 승리율을 백분율로보고합니다. |
6 개월
|
|
비교 정확도 : 승리 마진
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 각 전문 분야 (의학 및 정신과)에 대해 정확도에 대한 각 LLM의 승리률을 계산 한 다음 다음을보고합니다. 정확도를 위해 2 위 LLM에서 평균 마진.
|
6 개월
|
|
비교 정확도 : 효과 크기
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 각 전문 분야 (의학 및 정신과)에 대해 Cohen의 D 테스트를 사용하여 다른 세 LLM 각각에 비해 각 LLM의 평균 정확도 점수의 효과 크기를 계산합니다. 0.2의 효과 크기는 작고 0.5는 중간이며 0.8은 큰 것으로 간주됩니다. |
6 개월
|
|
LLM의 비교 정확도 : Interrater 신뢰성
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 정확도 점수의 인터레이터 신뢰성은 Kappa 값을 사용하여 계산됩니다. |
6 개월
|
|
LLM의 비교 완전성 : 승리율
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 작성할 수 있습니다. 어느 모델 이기든 "1"의 점수가 부여됩니다. 넥타이가 있으면 타이의 분할에 따라 각각 0.5 또는 0.33 포인트를 얻습니다. 각 전문 분야 (의학 및 정신과) 및 각 LLM에 대해 LLM의 평균 마진으로 "승리율"을보고합니다. 예를 들어, 모든 의약품 쿼리의 경우 다른 LLM에 비해 OpeneVidence가 "원한"비율을 정확도 리 커트 척도 (Kappa 값을 결정하기위한 중소기업 겹침이있는 경우)의 비율을보고합니다. 완전성과 관련하여 승리율을 백분율로보고합니다. |
6 개월
|
|
비교 완전성 : 승리 마진
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 각 전문 분야 (의학 및 정신과)에 대해, 우리는 완전성에 대한 각 LLM의 승리율을 계산 한 다음 다음을보고합니다. 완전성을 위해 2 위 LLM에서 평균 마진.
|
6 개월
|
|
비교 완전성 : 효과 크기
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 각 전문 분야 (의학 및 정신과)에 대해 Cohen의 D 테스트를 사용하여 다른 세 LLM 각각에 비해 각 LLM의 평균 완전성 점수의 효과 크기를 계산합니다. 0.2의 효과 크기는 작고 0.5는 중간이며 0.8은 큰 것으로 간주됩니다. |
6 개월
|
|
LLM의 비교 완전성 : Interrater 신뢰성
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 완전성 점수의 인터레이터 신뢰성은 Kappa 값을 사용하여 계산됩니다. |
6 개월
|
|
LLM의 비교 편견 : 승리율
기간: 6 개월
|
Openevidence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 바이어스 징후에 대해 평가합니다. 어느 모델 이기든 "1"의 점수가 부여됩니다. 넥타이가 있으면 타이의 분할에 따라 각각 0.5 또는 0.33 포인트를 얻습니다. 각 전문 분야 (의학 및 정신과) 및 각 LLM에 대해 LLM의 평균 마진으로 "승리율"을보고합니다. 예를 들어, 모든 의약품 쿼리의 경우 다른 LLM에 비해 OpeneVidence가 "원한"비율을 정확도 리 커트 척도 (Kappa 값을 결정하기위한 중소기업 겹침이있는 경우)의 비율을보고합니다. 편견과 관련하여 승리율을 백분율로보고합니다. |
6 개월
|
|
비교 편견 : 승리의 마진
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 평가합니다. 각 전문 분야 (의학 및 정신과)에 대해 편견에 대한 각 LLM의 승리율을 계산 한 다음 다음을보고합니다. 바이어스의 2 위 LLM에서 평균 마진.
|
6 개월
|
|
비교 바이어스 : 효과 크기
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 각 전문 분야 (의학 및 정신과)에 대해 Cohen의 D 테스트를 사용하여 다른 세 LLM 각각에 비해 각 LLM의 평균 바이어스 점수의 효과 크기를 계산합니다. 0.2의 효과 크기는 작고 0.5는 중간이며 0.8은 큰 것으로 간주됩니다. |
6 개월
|
|
LLM의 비교 편견 : 인터레이터 신뢰성
기간: 6 개월
|
Openevence, Chatgpt, Gemini 및 Claude의 출력을 비교하면 SME는 각 도구를 10 점 리 커트 척도로 정확하게 평가합니다. 바이어스 점수의 인터레이터 신뢰성은 카파 값을 사용하여 계산됩니다. |
6 개월
|
공동 작업자 및 조사자
수사관
- 수석 연구원: Hannah K Galvin, MD, Cambridge Health Alliance
간행물 및 유용한 링크
일반 간행물
- Pagano S, Strumolo L, Michalk K, Schiegl J, Pulido LC, Reinhard J, Maderbacher G, Renkawitz T, Schuster M. Evaluating ChatGPT, Gemini and other Large Language Models (LLMs) in orthopaedic diagnostics: A prospective clinical study. Comput Struct Biotechnol J. 2024 Dec 26;28:9-15. doi: 10.1016/j.csbj.2024.12.013. eCollection 2025.
- Skryd A, Lawrence K. ChatGPT as a Tool for Medical Education and Clinical Decision-Making on the Wards: Case Study. JMIR Form Res. 2024 May 8;8:e51346. doi: 10.2196/51346.
- Rao A, Kim J, Kamineni M, Pang M, Lie W, Dreyer KJ, Succi MD. Evaluating GPT as an Adjunct for Radiologic Decision Making: GPT-4 Versus GPT-3.5 in a Breast Imaging Pilot. J Am Coll Radiol. 2023 Oct;20(10):990-997. doi: 10.1016/j.jacr.2023.05.003. Epub 2023 Jun 21.
- Levkovich I, Rabin E, Brann M, Elyoseph Z. Large language models outperform general practitioners in identifying complex cases of childhood anxiety. Digit Health. 2024 Dec 15;10:20552076241294182. doi: 10.1177/20552076241294182. eCollection 2024 Jan-Dec.
- Griewing S, Knitza J, Boekhoff J, Hillen C, Lechner F, Wagner U, Wallwiener M, Kuhn S. Evolution of publicly available large language models for complex decision-making in breast cancer care. Arch Gynecol Obstet. 2024 Jul;310(1):537-550. doi: 10.1007/s00404-024-07565-4. Epub 2024 May 29.
- Benary M, Wang XD, Schmidt M, Soll D, Hilfenhaus G, Nassir M, Sigler C, Knodler M, Keller U, Beule D, Keilholz U, Leser U, Rieke DT. Leveraging Large Language Models for Decision Support in Personalized Oncology. JAMA Netw Open. 2023 Nov 1;6(11):e2343689. doi: 10.1001/jamanetworkopen.2023.43689.
연구 기록 날짜
연구 주요 날짜
연구 시작 (실제)
기본 완료 (추정된)
연구 완료 (추정된)
연구 등록 날짜
최초 제출
QC 기준을 충족하는 최초 제출
처음 게시됨 (실제)
연구 기록 업데이트
마지막 업데이트 게시됨 (실제)
QC 기준을 충족하는 마지막 업데이트 제출
마지막으로 확인됨
추가 정보
이 연구와 관련된 용어
기타 연구 ID 번호
- CHA-IRB-25-26-444
개별 참가자 데이터(IPD) 계획
개별 참가자 데이터(IPD)를 공유할 계획입니까?
IPD 계획 설명
약물 및 장치 정보, 연구 문서
미국 FDA 규제 의약품 연구
미국 FDA 규제 기기 제품 연구
이 정보는 변경 없이 clinicaltrials.gov 웹사이트에서 직접 가져온 것입니다. 귀하의 연구 세부 정보를 변경, 제거 또는 업데이트하도록 요청하는 경우 register@clinicaltrials.gov. 문의하십시오. 변경 사항이 clinicaltrials.gov에 구현되는 즉시 저희 웹사이트에도 자동으로 업데이트됩니다. .
AI(인공 지능)에 대한 임상 시험
-
University of Pavia모병두부계측분석 | 두부계측법 | 인공지능(AI) | 진단 중 인공 지능 (AI)이탈리아
-
TC Erciyes University아직 모집하지 않음
-
The Eye Hospital of Wenzhou Medical University모병
-
First Hospital of China Medical University모병
-
Jacobs University Bremen gGmbHHamburg University of Applied Sciences/Hochschule für Angewandte Wissenschaften Hamburg...모병