이 페이지는 자동 번역되었으며 번역의 정확성을 보장하지 않습니다. 참조하십시오 영문판 원본 텍스트의 경우.

호흡기 질환 상담을 위한 대규모 언어 모델의 잠재력 평가 (EPLLMMRDC)

2024년 11월 24일 업데이트: Zining Luo, North Sichuan Medical College

호흡기 질환 상담을 위한 대규모 언어 모델의 잠재력 평가: 무작위 교차 시험

임상 시험은 세 가지 주요 의료 상담 시나리오에 걸쳐 인간 의사의 성능과 비교하여 호흡기 질환 상담에서 여러 대규모 언어 모델을 평가하는 것을 목표로 합니다.

대답하려는 주요 질문은 다음과 같습니다.

  • 다양한 임상 시나리오에서 호흡기 질환을 진단하고 컨설팅하는 데 있어 인간 의사와 비교하여 대규모 언어 모델의 성능은 어떻습니까?

온라인 쿼리 섹션, 질병 진단 섹션 및 의학적 설명 섹션을 포함한 세 가지 임상 시나리오에서 연구 보조원 또는 자원봉사자는 사전 정의된 온라인 질문과 자체 문제를 사용하여 모든 LLM 또는 실제 의사에 대해 교차 질문하도록 요청받습니다. 각 질문 세션 후에는 잠재적인 편견을 제거하기 위해 짧은 휴약 기간이 시행됩니다.

연구 개요

연구 유형

중재적

등록 (실제)

703

단계

  • 해당 없음

연락처 및 위치

이 섹션에서는 연구를 수행하는 사람들의 연락처 정보와 이 연구가 수행되는 장소에 대한 정보를 제공합니다.

연구 장소

    • Sichuan
      • Nanchong, Sichuan, 중국, 637000
        • The Affiliated Hospital of North Sichuan Medical College

참여기준

연구원은 적격성 기준이라는 특정 설명에 맞는 사람을 찾습니다. 이러한 기준의 몇 가지 예는 개인의 일반적인 건강 상태 또는 이전 치료입니다.

자격 기준

공부할 수 있는 나이

  • 어린이
  • 성인
  • 고령자

건강한 자원 봉사자를 받아들입니다

아니

설명

포함 기준:

  1. 기침, 가슴 답답함, 발열, 천명음 등 일반적인 호흡기 질환의 자가 보고 증상
  2. 독립적으로 또는 최소한의 동료 교육을 통해 LLM 대화 작업에 참여할 수 있는 능력
  3. 호흡기내과 전문가가 연구 참여에 적합하다고 판단하는 건강 상태

제외 기준:

1) 건강상태가 지나치게 불량한 경우

공부 계획

이 섹션에서는 연구 설계 방법과 연구가 측정하는 내용을 포함하여 연구 계획에 대한 세부 정보를 제공합니다.

연구는 어떻게 설계됩니까?

디자인 세부사항

  • 주 목적: 특수 증상
  • 할당: 무작위
  • 중재 모델: 크로스오버 할당
  • 마스킹: 네 배로

무기와 개입

참가자 그룹 / 팔
개입 / 치료
다른: 교차비교그룹(질병진단과)
교차 비교 그룹(인간 의사 통제 및 모든 LLM 포함)
이 개입에는 다양한 인간 의사의 환자 문의에 답변하는 것이 포함됩니다. 각 환자는 시스템에 의해 의사 데이터베이스에서 선택된 중국 내 여러 지역의 의사 3명에게 무작위로 배정됩니다. 의사들은 모두 중국의 여러 온라인 상담 플랫폼에서 왔으며 진단 자격과 의료 면허증은 엄격한 검증을 거쳤습니다.
이 개입에는 검색 기능을 갖춘 ChatGPT-3.5의 환자 문의에 대한 답변이 포함되며, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력합니다.
이 개입에는 검색 기능 없이 ChatGPT-3.5를 통해 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 ChatGPT-4.0을 통한 환자 문의에 대한 답변이 포함됩니다. 검색 기능을 사용하면 질문에 답하기 전에 이전 환자의 채팅 기록을 지우고 미리 정해진 초기화 문을 입력하세요.
이 개입에는 ChatGPT-4.0을 통한 환자 문의에 대한 답변이 포함됩니다. 검색 기능이 없으면 질문에 대답하기 전에 이전 환자의 채팅 기록을 지우고 미리 정해진 초기화 문을 입력하십시오.
이 개입에는 검색 기능을 사용하여 Claude가 환자 문의에 즉시 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 검색 기능 없이 즉시 Claude가 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 검색 기능을 사용하여 Claude 2의 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 검색 기능 없이 Claude 2의 환자 문의에 응답하는 작업이 포함되며, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 문을 입력합니다.
이 개입에는 검색 기능을 갖춘 Gemini Pro의 환자 문의에 대한 답변이 포함되며, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력합니다.
이 개입에는 검색 기능 없이 Gemini Pro가 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
다른: 교차비교그룹(의학적 설명 코너)
교차 비교 그룹(인간 의사 통제 및 모든 LLM 포함)
이 개입에는 다양한 인간 의사의 환자 문의에 답변하는 것이 포함됩니다. 각 환자는 시스템에 의해 의사 데이터베이스에서 선택된 중국 내 여러 지역의 의사 3명에게 무작위로 배정됩니다. 의사들은 모두 중국의 여러 온라인 상담 플랫폼에서 왔으며 진단 자격과 의료 면허증은 엄격한 검증을 거쳤습니다.
이 개입에는 검색 기능을 갖춘 ChatGPT-3.5의 환자 문의에 대한 답변이 포함되며, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력합니다.
이 개입에는 검색 기능 없이 ChatGPT-3.5를 통해 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 ChatGPT-4.0을 통한 환자 문의에 대한 답변이 포함됩니다. 검색 기능을 사용하면 질문에 답하기 전에 이전 환자의 채팅 기록을 지우고 미리 정해진 초기화 문을 입력하세요.
이 개입에는 ChatGPT-4.0을 통한 환자 문의에 대한 답변이 포함됩니다. 검색 기능이 없으면 질문에 대답하기 전에 이전 환자의 채팅 기록을 지우고 미리 정해진 초기화 문을 입력하십시오.
이 개입에는 검색 기능을 사용하여 Claude가 환자 문의에 즉시 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 검색 기능 없이 즉시 Claude가 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 검색 기능을 사용하여 Claude 2의 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.
이 개입에는 검색 기능 없이 Claude 2의 환자 문의에 응답하는 작업이 포함되며, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 문을 입력합니다.
이 개입에는 검색 기능을 갖춘 Gemini Pro의 환자 문의에 대한 답변이 포함되며, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력합니다.
이 개입에는 검색 기능 없이 Gemini Pro가 환자 문의에 응답하고, 질문에 답변하기 전에 이전 환자의 채팅 기록을 지우고 미리 결정된 초기화 설명을 입력하는 것이 포함됩니다.

연구는 무엇을 측정합니까?

주요 결과 측정

결과 측정
측정값 설명
기간
전문가 지표-정확도
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
환자의 문제에 대한 의사의 응답을 바탕으로 전문가 패널의 점수 매기기에 5점 척도가 사용됩니다. 5- 응답이 완전히 정확하고, 환자의 모든 질문을 해결하거나 환자의 핵심 사항을 파악하여 진단합니다. 불평. 4- 응답은 대부분 정확하며 일반적으로 환자의 질문을 해결하거나 환자 불만의 핵심 사항을 식별하여 진단합니다. 3- 응답이 어느 정도 정확하며 환자의 질문을 해결하거나 환자 불만 사항의 ​​핵심 사항을 식별하여 진단합니다. 2- 응답이 정확할 경우가 거의 없으며 환자의 질문에 거의 답변하지 않거나 환자 불만 사항의 ​​핵심 사항을 식별하여 진단하지 않습니다. 1- 응답이 매우 부정확하며, 환자의 질문에 전혀 답변하지 않거나 환자 불만의 핵심 사항을 파악하여 진단하지 않습니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
전문가 지표-포괄성
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
환자 문제에 대한 의사의 반응을 바탕으로 전문가 패널의 점수 매기기에는 5점 척도가 사용됩니다. 5-응답은 매우 포괄적이며, 환자의 증상에 해당하는 잠재적인 질병의 다양한 측면을 다루며, 자세한 조언을 제공합니다. 그리고 자신만의 확장된 해석을 제시합니다. 4-응답은 대부분 포괄적이며, 환자의 증상과 관련된 잠재적인 일반적인 질병의 대부분의 측면을 다루고 상당히 자세한 조언을 제공합니다. 3-응답은 적당히 포괄적이며 환자의 증상과 관련된 잠재적인 일반적인 질병의 일부 측면을 다루고 기본적인 조언을 제공합니다. 2-응답이 거의 포괄적이지 않고, 환자의 증상과 관련된 잠재적인 일반적인 질병의 다양한 측면을 고려하지 못하고, 매우 제한적인 조언을 제공합니다. 1-응답이 전혀 포괄적이지 않고 환자의 증상과 관련된 대부분의 잠재적 질병을 간과하고 어떠한 조언도 제공하지 않습니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
전문가 지표-정확성
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
환자의 문제에 대한 의사의 반응을 바탕으로 전문가 패널의 점수 매기기 위해 5점 척도가 사용됩니다. 5- 응답이 부적절하거나 모호한 진술이 없이 완전히 정확합니다. 4- 응답은 대부분 정확하며 대부분의 진술이 적절하고 모호하지 않습니다. 3- 답변은 전반적으로 정확하지만, 부적절하거나 모호한 진술이 있더라도 허용됩니다. 2- 응답이 부분적으로 정확하며, 적절하거나 모호하지 않은 진술은 거의 없습니다. 1- 응답이 완전히 부정확하며 거의 모든 진술이 부적절하고 모호함으로 가득 차 있습니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
전문가 지표-윤리 준수
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
환자의 질문에 대한 의사의 답변을 바탕으로 전문가 패널은 헬싱키 선언 및 국제 의료 윤리 강령에 따라 각 항목을 검토하여 잠재적으로 환자에게 해를 끼치거나 위반할 수 있는 답변이나 제안이 있는지 판단합니다. 윤리적 지침. 결과는 이진 변수를 사용하여 기록됩니다. 참-응답은 완전히 윤리적입니다. 거짓 - 불확실성이 존재하는 경우, 대응에는 통제된 약물 사용에 대한 제안과 일부 부적절하거나 심지어 비생산적인 조언이 포함됩니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 전문가 지표에 대해서는 2개월 이내에 평가가 진행될 예정이다.
공감 지표
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 공감 지표는 2개월 이내에 평가가 진행될 예정이다.
각 진단 세션 후 환자가 완료한 의사-환자 관계에 관한 CARE 척도의 결과입니다. 특히 온라인 쿼리 섹션에서는 CARE 척도 평가가 적용되지 않습니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 주관적 공감 지표는 2개월 이내에 평가가 진행될 예정이다.

2차 결과 측정

결과 측정
측정값 설명
기간
일반지표 - 총 문항수
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
완전한 대화에서 기본적인 답변을 제공한 후 LLM 또는 실제 의사가 환자에게 묻는 후속 질문 수입니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
일반 지표 - 후속 단어
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
완전한 대화에서 기본적인 답변을 제공한 후 LLM 또는 실제 의사가 환자에게 묻는 후속 질문의 단어 수입니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
일반 지표 - 총 대화 수
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
사용자와 LLM 또는 실제 의사 간의 전체 대화에서 대화의 총 수입니다. 각 대화는 하나의 질문과 하나의 답변으로 구성됩니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
일반 지표 - 총 대화 비용($)
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
전체 대화를 완료하는 데 드는 총 비용(달러)입니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
일반 지표 - 총 대화 시간(분)
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
타이밍은 사용자의 입력부터 시작되어 LLM 또는 실제 의사가 마지막 문장의 출력을 완료하면 중지됩니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
정규지표 - 출력문의 개수
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
LLM 또는 실제 의사가 출력한 총 단어 수입니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
정규지표 - 입력문 개수
기간: 각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.
사용자가 입력한 문자 수의 합입니다.
각 참가자에게는 무작위 대화 당일부터 최대 1주일의 참여 시간이 주어집니다. 대화가 완료된 후 시스템은 모든 객관적인 지표와 대화 정보를 자동으로 요약합니다.

공동 작업자 및 조사자

여기에서 이 연구와 관련된 사람과 조직을 찾을 수 있습니다.

수사관

  • 수석 연구원: Jiebin Xie, Doctor, North Sichuan Medical College

간행물 및 유용한 링크

연구에 대한 정보 입력을 담당하는 사람이 자발적으로 이러한 간행물을 제공합니다. 이것은 연구와 관련된 모든 것에 관한 것일 수 있습니다.

연구 기록 날짜

이 날짜는 ClinicalTrials.gov에 대한 연구 기록 및 요약 결과 제출의 진행 상황을 추적합니다. 연구 기록 및 보고된 결과는 공개 웹사이트에 게시되기 전에 특정 품질 관리 기준을 충족하는지 확인하기 위해 국립 의학 도서관(NLM)에서 검토합니다.

연구 주요 날짜

연구 시작 (실제)

2023년 10월 1일

기본 완료 (실제)

2023년 12월 12일

연구 완료 (실제)

2024년 10월 12일

연구 등록 날짜

최초 제출

2024년 6월 4일

QC 기준을 충족하는 최초 제출

2024년 6월 8일

처음 게시됨 (실제)

2024년 6월 13일

연구 기록 업데이트

마지막 업데이트 게시됨 (추정된)

2024년 11월 27일

QC 기준을 충족하는 마지막 업데이트 제출

2024년 11월 24일

마지막으로 확인됨

2024년 11월 1일

추가 정보

이 연구와 관련된 용어

기타 연구 ID 번호

  • 1426887-2024-1
  • 22XQT0309 (기타 보조금/기금 번호: the cooperation of urban schools in Nanchong City)
  • CBY22-QDA15 (기타 보조금/기금 번호: the doctoral startup fund of North Sichuan Medical College)
  • 2022LC005 (기타 보조금/기금 번호: the affiliated hospital of North Sichuan Medical College)
  • 23JCYJPT0014 (기타 보조금/기금 번호: the scientific research project of the science and technology bureau of Nanchong)

약물 및 장치 정보, 연구 문서

미국 FDA 규제 의약품 연구

아니

미국 FDA 규제 기기 제품 연구

아니

이 정보는 변경 없이 clinicaltrials.gov 웹사이트에서 직접 가져온 것입니다. 귀하의 연구 세부 정보를 변경, 제거 또는 업데이트하도록 요청하는 경우 register@clinicaltrials.gov. 문의하십시오. 변경 사항이 clinicaltrials.gov에 구현되는 즉시 저희 웹사이트에도 자동으로 업데이트됩니다. .

구독하다