- ICH GCP
- 미국 임상 시험 레지스트리
- 임상시험 NCT07281066
LLM 성능의 치근단 진단
ChatGPT-4o, Gemini 및 Claude 3.7의 치근단 진단 평가: 전향적 임상 연구
이 전향적 관찰 연구의 목적은 흔한 치근단 질환을 가진 성인 환자의 진단 및 치료 결정을 지원하는 세 가지 대형 언어 모델(ChatGPT-4o, Gemini Advanced, Claude 3.7)의 능력을 평가하는 것입니다.
연구가 답하고자 하는 주요 질문은 다음과 같습니다:
구조화된 임상 정보와 치근단 방사선 사진이 제공될 때, LLM이 정확하게 치근단 진단을 결정할 수 있는가?
LLM이 치근단 전문가의 결정과 비교 가능한 적절한 치료 계획을 제안할 수 있는가?
이러한 질문에 답하기 위해, 연구진은 치근단 전문가의 합의 진단을 기준 표준으로 사용하여 세 가지 AI 모델의 진단 및 치료 정확도를 비교할 것입니다.
참가자는:
표준 임상 치료의 일환으로 정기적인 치근단 검사와 치근단 방사선 사진을 받습니다.
익명화된 임상 기록과 방사선 사진이 세 가지 AI 모델에 입력됩니다.
어떤 AI 시스템과도 직접 상호작용하지 않으며, 모든 평가는 연구팀에 의해 수행됩니다.
이 연구는 대형 언어 모델이 실제 임상 조건에서 어떻게 수행되는지 이해하고, 이러한 시스템이 미래에 치근단 진단에서 지원 역할을 할 수 있는지 여부를 목표로 합니다.
연구 개요
상세 설명
이 전향적 관찰 연구는 치근단 임상 환경에서 세 가지 대형 언어 모델—ChatGPT-4o, Gemini Advanced, Claude 3.7—의 실시간 진단 및 치료 의사 결정 성능을 평가하는 것을 목표로 합니다. 총 120명의 치근단 클리닉 환자를 검사하고, 상세한 의료/치과 병력, 임상 소견, 치근단 방사선 사진을 수집했습니다. 그런 다음 각 익명화된 사례를 진단과 적절한 치료 계획을 요청하는 표준화된 프롬프트를 사용하여 세 가지 LLM에 제시했습니다.
모든 모델은 웹 검색 기능, 플러그인 또는 외부 데이터 검색을 활성화하지 않고 기본 다중 모드 구성으로 사용되었습니다. 각 질문은 메모리 이전을 방지하기 위해 고립된 채팅 세션에서 한 번만 제출되었습니다. 응답은 그대로 저장되었으며, 치근단 전문가 패널이 확립한 기준 진단 및 치료 계획과 비교되었습니다.
이 연구는 실제 임상 조건을 최대한 가깝게 모방하도록 설계되어, 임상의가 일상 진료에서 이러한 시스템을 사용할 때 어떻게 수행될 수 있는지에 대한 현실적인 평가를 제공합니다. LLM이 향후 치과 치료, 특히 의사 결정 지원, 분류, 환자 교육에서 점점 더 중요한 역할을 할 것으로 예상되므로, 실제 임상 시나리오에서의 능력과 한계를 이해하는 것이 필수적입니다. 이러한 모델이 잘 수행되는 부분과 부족한 부분을 식별함으로써, 이 연구는 LLM 기술이 계속 발전함에 따라 안전하고 효과적인 임상 통합에 정보를 제공하는 것을 목표로 합니다.
연구 유형
등록 (실제)
연락처 및 위치
연구 장소
-
-
Istanbul
-
Maltepe, Istanbul, 터키 (Türkiye), 34856
- Faculty of Dentistry, Marmara University
-
-
참여기준
자격 기준
공부할 수 있는 나이
- 성인
- 고령자
건강한 자원 봉사자를 받아들입니다
샘플링 방법
연구 인구
설명
포함 기준:
- 치근단 치료 클리닉에 방문하거나 의뢰된 성인 환자(≥18세).
진단 및 치료 계획이 필요한 임상적으로 확인된 치근단 질환을 가진 환자.
참여에 동의하고 사전 동의서를 제공한 환자.
임상 방문 시 완전한 종이 기반 의료/치과 병력 및 치근단 방사선 사진이 확보된 환자.
제외 기준:
- 제외 기준
참여를 거부하거나 사전 동의서를 제공하지 않은 환자.
소아치과 클리닉에 의뢰된 소아 환자(<18세).
비치근단 관련 증상(예: 발치 후 치조염, 사랑니 발치 문제)으로 클리닉을 방문한 환자.
불완전한 임상 정보 또는 누락된 방사선 사진이 있는 경우.
표준 치근단 검사 절차를 받을 수 없는 환자.
공부 계획
연구는 어떻게 설계됩니까?
디자인 세부사항
코호트 및 개입
그룹/코호트 |
개입 / 치료 |
|---|---|
|
치근단 치료 환자 코호트
이 코호트는 임상적으로 확인된 치근단 질환으로 치근단 치료 클리닉에 내원한 연속 120명의 환자를 포함합니다.
임상 병력과 치근단 방사선 사진이 수집되었으며, AI 모델이 생성한 진단/치료 권고 사항이 전문가 합의와 비교되었습니다.
|
참가자의 익명화된 임상 정보(구조화된 환자 병력 및 치근단 방사선 사진 포함)는 세 가지 대규모 언어 모델(ChatGPT-4o, Gemini Advanced, Claude 3.7)의 입력으로 사용되었습니다.
이 모델들은 치근단 치료 진단을 결정하고 적절한 치료 계획을 제안하도록 요청받았습니다.
참가자에게는 어떠한 치료, 장치 또는 약물도 투여되지 않았습니다.
중재는 기존 임상 데이터에 대한 AI 기반 해석으로만 구성됩니다.
|
연구는 무엇을 측정합니까?
주요 결과 측정
결과 측정 |
측정값 설명 |
기간 |
|---|---|---|
|
종이 기반 병력과 치근단 방사선 사진에 기반한 임상의 진단 정확도
기간: 7월 7일-8월 5일
|
치과 내과 전문의들이 종이 기반 환자 병력 양식과 표준화된 치근단 방사선 사진을 검토한 후 내린 진단 결정의 평가.
정확성은 임상의의 진단과 세 명의 독립된 치과 내과 전문가들이 확립한 합의 진단을 비교하여 결정됩니다.
데이터는 초기 임상 평가 시점에 모든 120명의 환자에 대해 수집됩니다.
|
7월 7일-8월 5일
|
2차 결과 측정
결과 측정 |
측정값 설명 |
기간 |
|---|---|---|
|
LLM 생성 진단 및 치료 계획 성능
기간: 8월-9월
|
동일한 서면 환자 병력과 치근단 방사선 사진을 임상의들에게 제공한 후, 대규모 언어 모델(LLM)-ChatGPT-4o, Gemini Advanced, Claude 3.7-이 생성한 진단 및 치료 권장 사항의 평가.
LLM 응답은 진단과 치료 결정 모두에 대한 표준 전문가 합의 기준과 비교됩니다.
|
8월-9월
|
공동 작업자 및 조사자
수사관
- 연구 책임자: ayşe karadayı, asst. prof., Marmara University Faculty of Dentistry
간행물 및 유용한 링크
일반 간행물
- Abd-Alrazaq A, AlSaad R, Alhuwail D, Ahmed A, Healy PM, Latifi S, Aziz S, Damseh R, Alabed Alrazak S, Sheikh J. Large Language Models in Medical Education: Opportunities, Challenges, and Future Directions. JMIR Med Educ. 2023 Jun 1;9:e48291. doi: 10.2196/48291.
- Schwendicke F, Samek W, Krois J. Artificial Intelligence in Dentistry: Chances and Challenges. J Dent Res. 2020 Jul;99(7):769-774. doi: 10.1177/0022034520915714. Epub 2020 Apr 21.
연구 기록 날짜
연구 주요 날짜
연구 시작 (실제)
기본 완료 (실제)
연구 완료 (실제)
연구 등록 날짜
최초 제출
QC 기준을 충족하는 최초 제출
처음 게시됨 (실제)
연구 기록 업데이트
마지막 업데이트 게시됨 (실제)
QC 기준을 충족하는 마지막 업데이트 제출
마지막으로 확인됨
추가 정보
이 연구와 관련된 용어
기타 연구 ID 번호
- 2025-38
개별 참가자 데이터(IPD) 계획
개별 참가자 데이터(IPD)를 공유할 계획입니까?
약물 및 장치 정보, 연구 문서
미국 FDA 규제 의약품 연구
미국 FDA 규제 기기 제품 연구
이 정보는 변경 없이 clinicaltrials.gov 웹사이트에서 직접 가져온 것입니다. 귀하의 연구 세부 정보를 변경, 제거 또는 업데이트하도록 요청하는 경우 register@clinicaltrials.gov. 문의하십시오. 변경 사항이 clinicaltrials.gov에 구현되는 즉시 저희 웹사이트에도 자동으로 업데이트됩니다. .