- ICH GCP
- 미국 임상 시험 레지스트리
- 임상시험 NCT07352475
신장학 임상시험에서 인공지능 피드백을 통한 추론 강화 (REFINe)
신장학에서 생성형 AI 피드백을 통한 추론 강화(REFINe): 신장학 진단에서 생성형 AI 지원에 대한 무작위 평가
이 임상 시험의 목표는 인공 지능(AI)이 신장 의학 분야에서 의사들이 진단을 내리는 데 어떻게 도움을 줄 수 있는지 알아보는 것입니다. 연구자들은 대규모 언어 모델(LLM)이라는 AI 도구가 의사들이 더 자주 정확한 진단을 선택하고 자신의 답변에 더 자신감을 느끼도록 도울 수 있는지 알고 싶어합니다.
연구를 시작하기 전에 연구팀은 여러 AI 모델을 테스트하고 가장 우수한 성능을 보인 모델 중 하나인 GPT-5급 모델을 높은 추론 노력을 사용하도록 설정하여 선택했습니다.
이 연구가 답하고자 하는 주요 질문은 다음과 같습니다:
- 의사들이 AI 제안을 볼 수 있을 때 더 정확한 진단을 내릴까요?
- AI 제안을 보는 것이 의사들이 자신의 진단에 대해 느끼는 자신감을 변화시킬까요?
연구자들은 AI 제안을 받는 의사들과 AI 제안을 받지 않는 의사들을 비교하여 AI가 정확성, 자신감 및 의사 결정에 어떻게 영향을 미치는지 확인할 것입니다.
참가자는 최대 10개의 온라인 임상 사례를 완료합니다. 각 사례에 대해 그들은:
- 짧은 의료 시나리오를 읽습니다
- 최대 세 가지 가능한 진단을 제안합니다
(AI 그룹에 속한 경우) AI의 제안을 검토하고 자신의 답변을 변경할지 결정합니다
이 연구는 또한 참가자가 각 사례에 답하는 데 걸리는 시간과 AI의 성능이 인간의 답변과 어떻게 비교되는지 살펴볼 것입니다.
연구 개요
상세 설명
이 연구는 신장학 임상 사례를 해결할 때, 고추론 대규모 언어 모델(GPT-5)의 실시간 진단 제안을 임상의에게 제공하는 것이 진단 정확도, 확신도 및 효율성을 향상시키는지 평가합니다. 시험에 사용할 모델을 선택하기 전에, 연구팀은 GPT-5, GPT-5-mini, O3, GPT-4o, Llama-4 Maverick-17B, Gemini-2.5-Pro, Qwen-3 VL-235B Thinking, DeepSeek-V3.2-Exp, MedGEMMA-27B, Claude Sonnet-4.5, Magistral-Medium-2509를 포함한 파일럿 신장학 사례 세트를 통해 여러 최첨단 모델을 벤치마크했습니다. GPT-5(고추론)가 가장 높은 진단 성능, 안정성 및 해석 가능성을 보여주었으며, 중재군에서 사용된 AI 시스템으로 선택되었습니다.
참가자에는 의과대학생, 레지던트, 펠로우 및 현직 의사가 포함됩니다. 계정을 생성한 후, 참가자는 인구통계학적 설문지(전문 분야, 경력 연수, 진료 유형, 연령대, AI 친숙도)를 작성하고, 사례에 접근하기 전에 연구 목적으로 이 데이터 사용에 명시적으로 동의해야 합니다. 직접적인 신원 식별 정보는 수집되지 않습니다.
참가자는 AI 지원군 또는 대조군에 무작위 배정됩니다(직업적 지위별 계층화 포함). 각 참가자는 프랑스어 또는 영어로 된 10개의 신장학 사례를 할당받으며, 여러 세션에 걸쳐 완료할 수 있습니다. 사례가 제출되면 다시 검토할 수 없습니다("되돌아가기 불가"). 사례별 완료 시간은 자동으로 기록됩니다.
대조군
참가자는 각 사례를 보고 최대 세 개의 진단("상위 3")을 제공한 후, 확신도 평가(0-10)를 합니다.
AI 지원군
참가자는 먼저 AI 도움 없이 초기 상위 3 진단과 확신도 평가를 입력합니다. 그런 다음 시스템이 GPT-5의 진단 제안을 표시한 후, 참가자는 진단을 한 번 수정할 수 있습니다. 사례는 제출 후 잠깁니다.
연구는 다음을 수집합니다:
- 초기 및 최종 진단,
- AI 제안 전과 (해당 시) 후의 확신도 평가,
- 완료 시간,
- 참가자 인구통계학적 변수,
- AI 모델 자체의 진단 출력.
부분 완료가 허용되며, 완료된 모든 사례는 분석에 기여합니다.
주요 및 부차적 결과에는 진단 정확도(상위 3 및 상위 1), AI 전후 정확도 향상, 진단 확신도 변화, AI 유도 진단 오류, 인간 대 AI 벤치마킹, 완료 시간 효율성 지표, 할당된 사례 완료 비율이 포함됩니다.
주요 분석은 대조군(의사 단독)과 실험군(AI 모델 지원 의사) 간의 진단 정확도를 비교할 것입니다. 정확도는 이분형 결과(정확한 진단 대 부정확한 진단)로 분석됩니다. 각 참가자가 여러 임상 사례를 평가하기 때문에, 정확도는 연구군에 대한 고정 효과와 참가자 및 사례에 대한 랜덤 절편을 포함한 혼합 효과 로지스틱 회귀를 사용하여 모델링됩니다. 이 접근 방식은 클러스터링과 사례 간 난이도 변동을 고려합니다. 주요 가설 검정은 양측 α = 0.05를 사용합니다. 효과 크기는 95% 신뢰 구간을 가진 오즈비로 보고됩니다. 부차적 분석은 상호작용 항을 사용하여 정확도가 인구통계학적 요인(예: 경력 수준, 전문 분야)에 따라 변하는지 탐색할 것입니다.
각 참가자가 여러 사례를 평가하기 때문에, 팀은 참가자 및 사례에 대한 랜덤 절편을 포함한 혼합 효과 로지스틱 회귀 모델을 사용하여 시뮬레이션 기반 검정력 분석도 수행했으며, 참가자 내 ICC를 0.10으로 가정했습니다. 이러한 가정 하에, 참가자당 10개의 사례를 가진 총 100명의 참가자(군당 50명)는 진단 정확도의 임상적으로 의미 있는 향상을 감지하는 데 >99%의 검정력을 제공합니다. 따라서 연구자들은 총 약 100명의 참가자를 등록할 계획입니다.
이 연구는 임상의가 복잡한 신장학 사례를 평가할 때, AI 보강 추론이 진단 성능과 의사 결정을 의미 있게 향상시키는지 정량화하는 것을 목표로 합니다.
연구 유형
등록 (추정된)
단계
- 해당 없음
연락처 및 위치
연구 연락처
- 이름: Raphaël BENTEGEAC, MD, MPH
- 전화번호: +33651204000
- 이메일: raphael.bentegeac@univ-lille.fr
연구 장소
-
-
-
Lille, 프랑스, 59000
- 모병
- Lille University Hospital (online study)
-
연락하다:
- Raphaël BENTEGEAC, MD, MPH
- 전화번호: +33651204000
- 이메일: raphael.bentegeac@chu-lille.fr
-
연락하다:
- Aghiles HAMROUN, MD, PhD
- 이메일: aghiles.hamroun@univ-lille.fr
-
-
참여기준
자격 기준
공부할 수 있는 나이
- 성인
- 고령자
건강한 자원 봉사자를 받아들입니다
설명
포함 기준:
18세 이상 성인.
영어 또는 프랑스어로 임상 시나리오를 읽고 답변할 수 있음.
인터넷 연결이 가능한 컴퓨터 또는 스마트폰 접근 가능.
온라인으로 동의서 제공.
참가자는 최소한 기본 의학 교육을 받은 것으로 예상되며(예: 의대생, 레지던트, 펠로우 또는 임상 의사), 공식 검증은 필요하지 않음.
제외 기준:
18세 미만 개인.
온라인 연구 절차 완료 불가능.
본 연구에 사용된 AI 시스템의 설계, 개발 또는 평가에 사전 참여 경험.
공부 계획
연구는 어떻게 설계됩니까?
디자인 세부사항
- 주 목적: 특수 증상
- 할당: 무작위
- 중재 모델: 병렬 할당
- 마스킹: 없음(오픈 라벨)
무기와 개입
참가자 그룹 / 팔 |
개입 / 치료 |
|---|---|
|
실험적: AI 제안이 포함된 그룹
이 군의 참가자들은 대조군과 동일한 임상 사례 비네트를 완료합니다.
각 사례에 대해, 내부 벤치마킹 후 선정된 대규모 언어 모델(GPT-5, 고사고 설정)이 생성한 제안 진단을 받게 됩니다.
참가자는 자신의 최종 진단 답변을 입력하기 전에 AI 제안을 검토할 수 있습니다.
추가 정보, 프롬프트 또는 코칭은 제공되지 않습니다.
중재는 사례 해결 작업 중 AI 생성 진단 제안을 표시하는 것만으로 구성됩니다.
|
이 중재는 임상 사례 해결 과제 중 AI 생성 진단 제안을 표시하는 것으로 구성됩니다.
각 비네트를 읽은 후, 참가자들은 내부 벤치마킹 후 선정된 대형 언어 모델(GPT-5, 고사고 설정)이 생성한 최상위 진단 제안을 확인합니다.
AI 제안은 비네트당 한 번 표시되며, 재요청하거나 수정할 수 없습니다.
참가자들은 제안을 확인한 후 자신의 진단 답변을 수정할 수 있지만, 이후 비네트로 돌아갈 수는 없습니다.
추가 지침, 코칭 또는 상호작용 기능은 제공되지 않습니다.
|
|
간섭 없음: AI 제안이 없는 그룹
이 그룹의 참가자는 AI가 생성한 진단 제안 없이 임상 사례 비네트를 독립적으로 완료합니다.
그들은 각 비네트를 읽고 제시된 정보만을 바탕으로 자신의 진단 답변을 제공할 것입니다.
외부 의사 결정 지원이나 추가 자료는 제공되지 않습니다.
|
연구는 무엇을 측정합니까?
주요 결과 측정
결과 측정 |
측정값 설명 |
기간 |
|---|---|---|
|
AI 지원 유무에 따른 최종 진단 정확도(상위 3개)
기간: 첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
각 참가자에 대해 참가자의 최종 상위 3개 진단에 올바른 주요 진단이 포함된 비네트의 비율입니다. AI 군(AI 제안 후)과 대조군(AI 없음) 간의 최종 상위 3개 진단 정확도를 비교합니다. 올바르게 진단된 사례의 비율(상위 3개). |
첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
2차 결과 측정
결과 측정 |
측정값 설명 |
기간 |
|---|---|---|
|
AI 지원 유무에 따른 최종 진단 정확도 (top-1)
기간: 첫 번째 비네트 응답 시점부터 연구 종료 시점까지(최대 12개월).
|
각 참가자에 대해, 참가자의 최종 상위-1 진단에 올바른 주 진단이 포함된 비네트의 비율.
AI 군(AI 제안 후)과 대조군(AI 없음) 사이의 최종 상위-1 정확도를 비교하십시오.
올바르게 진단된 사례의 비율(상위-1).
|
첫 번째 비네트 응답 시점부터 연구 종료 시점까지(최대 12개월).
|
|
AI 제안 전후 상위 3개 진단 정확도 변화 (AI 군만 해당)
기간: 첫 번째 비네트 응답부터 연구 종료까지(최대 12개월).
|
AI 지원 그룹에서 참가자는 먼저 AI 제안 없이 초기 답변(최대 세 가지 진단)을 제공한 후, AI 생성 제안을 보고 답변을 한 번 수정할 수 있습니다. 참가자는 이후 해당 비네트로 돌아갈 수 없습니다. 각 참가자에 대해 연구자들은 완료된 모든 비네트에서 초기 답변과 최종 답변 간의 상위 3개 정확도 차이를 계산합니다. 상위 3개 진단 정확도의 백분율 포인트 변화 |
첫 번째 비네트 응답부터 연구 종료까지(최대 12개월).
|
|
AI 제안 전후 상위-1 진단 정확도 변화 (AI 군만)
기간: 첫 번째 비네트 응답부터 연구 종료까지(최대 12개월).
|
AI 지원 그룹에서는 참가자들이 먼저 AI 제안 없이 초기 답변(최대 세 개의 진단)을 제공한 후, AI가 생성한 제안을 보고 한 번 답변을 수정할 수 있으며, 이후에는 해당 비네트로 돌아갈 수 없습니다. 각 참가자에 대해 연구자들은 완료된 모든 비네트에서 초기 답변과 최종 답변 간의 Top-1 정확도 차이를 계산합니다. Top-1 진단 정확도의 백분율 포인트 변화 |
첫 번째 비네트 응답부터 연구 종료까지(최대 12개월).
|
|
AI 제안 전 진단 확신도 (0-10): 대조군 vs AI 군
기간: 첫 번째 비네트 응답부터 연구 종료 시점(최대 12개월)까지.
|
양쪽 그룹의 참가자들은 AI 제안 이전에 자신의 상위 3개 진단 제안에 대한 확신(0-10 척도)을 평가합니다. AI 그룹에서는 이것이 "AI 이전" 평가입니다. 대조군에서는 이것이 단일 확신 평가입니다(AI가 표시되지 않기 때문). 연구자들은 참가자별로 완료된 모든 비네트를 종합하여 그룹 간 AI 이전 확신을 비교합니다. |
첫 번째 비네트 응답부터 연구 종료 시점(최대 12개월)까지.
|
|
AI 제안 후 최종 진단 확신도 (0-10): 대조군 대 AI군
기간: 첫 번째 비네트 응답부터 연구 종료까지(최대 12개월).
|
완료된 모든 비네트에서 상위 3개 진단 제안에 대한 최종 진단 확신도(0-10 척도)를 그룹 간 비교합니다. AI 그룹에서는 AI 지원 후의 확신도 평가입니다. 대조군에서는 동일한 확신도 평가입니다(참가자는 AI 제안을 받지 않습니다). |
첫 번째 비네트 응답부터 연구 종료까지(최대 12개월).
|
|
AI 제안 전후 진단 신뢰도 변화(0-10)(AI 그룹만 해당)
기간: 첫 번째 비네트 응답 시점부터 연구 종료 시점까지(최대 12개월).
|
AI 그룹에서 참가자들은 AI 제안을 보기 전과 후 모두에 대해 자신의 상위 3개 진단에 대한 신뢰도 평가(0-10 척도)를 제공합니다. 각 참가자에 대해 연구자들은 완료된 모든 비네트(vignette)에 걸쳐 참가자 내 변화(AI 후 - AI 전)를 계산합니다. 신뢰도 점수 변화(0-10 척도) |
첫 번째 비네트 응답 시점부터 연구 종료 시점까지(최대 12개월).
|
|
AI로 인한 진단 오류 (AI군만 해당)
기간: 첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
참가자의 초기 Top-1 진단이 정확한 완료된 비네트 중에서 AI 제안 이후 최종 Top-1 진단이 부정확해지는 비율.
|
첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
|
AI 제안 후 상위 3개 진단 변경 (AI 군만)
기간: 첫 번째 비네트에 답변한 시점부터 연구 종료 시점까지(최대 12개월).
|
AI 군에서 완료된 비네트 중, AI 도입 전과 후의 답변에서 상위 3개 진단이 서로 다른 비율.
|
첫 번째 비네트에 답변한 시점부터 연구 종료 시점까지(최대 12개월).
|
|
Top-3 진단 정확도: AI 이전의 모든 인간 답변 대 AI 정확도
기간: 첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
각각의 비네트(vignette)에 대해, AI 제안 이전 단계에서 인간 참가자들의 Top-3 진단 정확도(두 연구 그룹의 참가자들을 AI 이전 단계에서 결합한 것)를 동일한 비네트에 대한 AI 모델의 Top-3 진단 정확도와 비교합니다. 보고된 결과는 정확도 차이로, AI Top-3 정확도에서 인간 AI 이전 Top-3 정확도를 뺀 값을 백분율 포인트로 표현하며, 모든 완료된 비네트에 걸쳐 비네트 수준에서 계산됩니다. Top-3 진단 정확도의 백분율 포인트 차이 |
첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
|
상위 3개 진단 정확도: AI 대 AI 정확도 대비 인간 최종 답변 (AI 그룹만)
기간: 첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
AI 지원 그룹에서 완료된 각 비네트에 대해, AI 제안을 확인한 후 인간 참가자의 Top-3 진단 정확도가 AI 모델의 Top-3 진단 정확도와 비교됩니다. (Top-3 정확도는 단일 측정값입니다) 보고된 결과는 정확도 차이로, AI Top-3 정확도에서 인간의 AI 후 Top-3 정확도를 뺀 값으로 정의되며, 백분율 포인트로 표현되고 AI 그룹의 모든 완료된 비네트에 걸쳐 비네트 수준에서 계산됩니다. AI와 인간 간 Top-3 진단 정확도의 백분율 포인트 차이 |
첫 번째 비네트 응답부터 연구 종료 시점까지(최대 12개월).
|
|
AI 지원 유무에 따른 비네트별 완료 시간
기간: 첫 번째 빈네트 응답부터 연구 종료 시점(최대 12개월)까지.
|
각각의 비네트에 대해, 플랫폼은 비네트 개시부터 답변 제출까지의 시간을 기록합니다. 대조군에서는 각 비네트에 대해 단일 완료 시간이 기록됩니다. AI 지원군에서는 AI 제안을 보기 전과 AI 제안을 본 후에 각각 완료 시간이 기록됩니다. 결과는 연구 군 간 완료 시간 차이를 초 단위로 보고하며, 모든 완료된 비네트를 대상으로 계산됩니다. 초 (완료 시간 차이) |
첫 번째 빈네트 응답부터 연구 종료 시점(최대 12개월)까지.
|
|
할당된 비네트 완료 비율
기간: 첫 번째 빈네트 응답부터 연구 종료 시점(최대 12개월)까지.
|
각 참가자에 대해, 연구 기간 내에 완료된 10개의 비네트 중 비율을 군 간에 비교합니다.
|
첫 번째 빈네트 응답부터 연구 종료 시점(최대 12개월)까지.
|
공동 작업자 및 조사자
연구 기록 날짜
연구 주요 날짜
연구 시작 (실제)
기본 완료 (추정된)
연구 완료 (추정된)
연구 등록 날짜
최초 제출
QC 기준을 충족하는 최초 제출
처음 게시됨 (실제)
연구 기록 업데이트
마지막 업데이트 게시됨 (실제)
QC 기준을 충족하는 마지막 업데이트 제출
마지막으로 확인됨
추가 정보
이 연구와 관련된 용어
추가 관련 MeSH 약관
기타 연구 ID 번호
- CHUL-191125
약물 및 장치 정보, 연구 문서
미국 FDA 규제 의약품 연구
미국 FDA 규제 기기 제품 연구
이 정보는 변경 없이 clinicaltrials.gov 웹사이트에서 직접 가져온 것입니다. 귀하의 연구 세부 정보를 변경, 제거 또는 업데이트하도록 요청하는 경우 register@clinicaltrials.gov. 문의하십시오. 변경 사항이 clinicaltrials.gov에 구현되는 즉시 저희 웹사이트에도 자동으로 업데이트됩니다. .