Denne side blev automatisk oversat, og nøjagtigheden af ​​oversættelsen er ikke garanteret. Der henvises til engelsk version for en kildetekst.

Evaluering af potentialet af store sprogmodeller til konsultationer med luftvejssygdomme (EPLLMMRDC)

24. november 2024 opdateret af: Zining Luo, North Sichuan Medical College

Evaluering af potentialet ved store sprogmodeller til konsultationer med luftvejssygdomme: et randomiseret krydsforsøg

Det kliniske forsøg har til formål at evaluere flere store sprogmodeller i konsultationer med luftvejssygdomme ved at sammenligne deres præstationer med menneskelige læger på tværs af tre store medicinske konsultationsscenarier.

Hovedspørgsmålet har til formål at besvare:

  • Hvordan klarer store sprogmodeller sig sammenlignet med menneskelige læger ved diagnosticering og rådgivning om luftvejssygdomme på tværs af forskellige kliniske scenarier?

I tre kliniske scenarier, herunder online-forespørgselssektionen, sygdomsdiagnose-sektionen og den medicinske forklaringssektion, vil forskningsassistenter eller frivillige blive bedt om at krydsspørge alle LLM'er eller rigtige læger ved hjælp af foruddefinerede onlinespørgsmål og deres egne problemer. Efter hver spørgesession implementeres en kort udvaskningsperiode for at eliminere potentielle skævheder.

Studieoversigt

Undersøgelsestype

Interventionel

Tilmelding (Faktiske)

703

Fase

  • Ikke anvendelig

Kontakter og lokationer

Dette afsnit indeholder kontaktoplysninger for dem, der udfører undersøgelsen, og oplysninger om, hvor denne undersøgelse udføres.

Studiesteder

    • Sichuan
      • Nanchong, Sichuan, Kina, 637000
        • The Affiliated Hospital of North Sichuan Medical College

Deltagelseskriterier

Forskere leder efter personer, der passer til en bestemt beskrivelse, kaldet berettigelseskriterier. Nogle eksempler på disse kriterier er en persons generelle helbredstilstand eller tidligere behandlinger.

Berettigelseskriterier

Aldre berettiget til at studere

  • Barn
  • Voksen
  • Ældre voksen

Tager imod sunde frivillige

Ingen

Beskrivelse

Inklusionskriterier:

  1. Selvrapporterede symptomer på almindelige luftvejssygdomme, såsom hoste, trykken for brystet, feber og hvæsende vejrtrækning
  2. Evne til at engagere sig i LLM dialog operationer selvstændigt eller med minimal peer træning
  3. En helbredsstatus, der anses for egnet til undersøgelsesdeltagelse af lungeeksperter

Ekskluderingskriterier:

1) For dårlig helbredstilstand

Studieplan

Dette afsnit indeholder detaljer om studieplanen, herunder hvordan undersøgelsen er designet, og hvad undersøgelsen måler.

Hvordan er undersøgelsen tilrettelagt?

Design detaljer

  • Primært formål: Diagnostisk
  • Tildeling: Randomiseret
  • Interventionel model: Crossover opgave
  • Maskning: Firedobbelt

Våben og indgreb

Deltagergruppe / Arm
Intervention / Behandling
Andet: Krydssammenligningsgruppe (sygdomsdiagnoseafsnittet)
Krydssammenligningsgruppe (herunder menneskelige lægekontroller og alle LLM'er)
Denne intervention involverer besvarelse af patienthenvendelser fra forskellige menneskelige læger. Hver patient tildeles tilfældigt af systemet til tre læger fra forskellige provinser i Kina udvalgt fra databasen over læger. Lægerne kommer alle fra flere online konsultationsplatforme i Kina, og deres diagnostiske kvalifikationer og medicinske licenser har gennemgået streng verifikation.
Denne intervention involverer besvarelse af patientforespørgsler fra ChatGPT-3.5 med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler af ChatGPT-3.5 uden søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patienthenvendelser via ChatGPT-4.0 med søgefunktioner, før du besvarer spørgsmål, skal du rydde chathistorikken fra den tidligere patient og indtaste den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patienthenvendelser via ChatGPT-4.0 uden søgefunktioner, før du besvarer spørgsmål, skal du rydde chathistorikken fra den tidligere patient og indtaste den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude øjeblikkeligt med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude øjeblikkeligt uden søgefunktioner, før du besvarer spørgsmål, rydder chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude 2 med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude 2 uden søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Gemini Pro med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Gemini Pro uden søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Andet: Krydssammenligningsgruppe (sektionen med medicinsk forklaring)
Krydssammenligningsgruppe (herunder menneskelige lægekontroller og alle LLM'er)
Denne intervention involverer besvarelse af patienthenvendelser fra forskellige menneskelige læger. Hver patient tildeles tilfældigt af systemet til tre læger fra forskellige provinser i Kina udvalgt fra databasen over læger. Lægerne kommer alle fra flere online konsultationsplatforme i Kina, og deres diagnostiske kvalifikationer og medicinske licenser har gennemgået streng verifikation.
Denne intervention involverer besvarelse af patientforespørgsler fra ChatGPT-3.5 med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler af ChatGPT-3.5 uden søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patienthenvendelser via ChatGPT-4.0 med søgefunktioner, før du besvarer spørgsmål, skal du rydde chathistorikken fra den tidligere patient og indtaste den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patienthenvendelser via ChatGPT-4.0 uden søgefunktioner, før du besvarer spørgsmål, skal du rydde chathistorikken fra den tidligere patient og indtaste den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude øjeblikkeligt med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude øjeblikkeligt uden søgefunktioner, før du besvarer spørgsmål, rydder chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude 2 med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Claude 2 uden søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Gemini Pro med søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.
Denne intervention involverer besvarelse af patientforespørgsler fra Gemini Pro uden søgefunktioner, før du besvarer spørgsmål, ryd chathistorikken fra den tidligere patient og indtast den forudbestemte initialiseringserklæring.

Hvad måler undersøgelsen?

Primære resultatmål

Resultatmål
Foranstaltningsbeskrivelse
Tidsramme
Ekspertindikatorer-Nøjagtighed
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Baseret på lægernes svar på patienters problemstillinger, vil en 5-trins skala blive brugt til scoring af et ekspertpanel: 5- Svarene er fuldstændig nøjagtige, adresserer alle patientens spørgsmål eller diagnosticerer ved at identificere de vigtigste punkter i patientens spørgsmål. klage. 4- Svarene er for det meste nøjagtige, og tager generelt fat på patientens spørgsmål eller diagnosticerer ved at identificere hovedpunkterne i patientens klage. 3- Svarene er moderat nøjagtige, adresserer patientens spørgsmål eller diagnosticerer ved at identificere hovedpunkterne i patientens klage. 2- Svarene er sjældent nøjagtige, de adresserer næsten ikke patientens spørgsmål eller diagnosticerer ved at identificere hovedpunkterne i patientens klage. 1- Svarene er meget unøjagtige, de adresserer ikke patientens spørgsmål eller diagnosticerer overhovedet ved at identificere hovedpunkterne i patientens klage.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Ekspertindikatorer - Omfattendehed
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Baseret på lægernes svar på patienternes problemstillinger, vil en 5-trins skala blive brugt til at score af et ekspertpanel: 5-Besvarelserne er meget omfattende og behandler forskellige aspekter af potentielle sygdomme svarende til patientens symptomer, giver detaljerede råd, og tilbyder sine egne udvidede fortolkninger. 4-Besvarelserne er for det meste omfattende og dækker de fleste aspekter af potentielle almindelige sygdomme relateret til patientens symptomer og giver ret detaljerede råd. 3-Besvarelserne er moderat omfattende og behandler nogle aspekter af potentielle almindelige sygdomme relateret til patientens symptomer og giver grundlæggende råd. 2-Besvarelserne er sjældent omfattende, idet de undlader at tage højde for forskellige aspekter af potentielle almindelige sygdomme relateret til patientens symptomer og giver meget begrænset rådgivning. 1-Besvarelserne er slet ikke udtømmende, idet de overser de fleste potentielle sygdomme relateret til patientens symptomer og undlader at give nogen råd.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Ekspertindikatorer-Korrekthed
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Baseret på lægernes svar på patienternes problemstillinger, vil en 5-trins skala blive brugt til scoring af et ekspertpanel: 5- Svarene er fuldstændig korrekte, uden upassende eller tvetydige udsagn. 4- Svarene er for det meste korrekte, hvor de fleste udsagn er passende og utvetydige. 3- Svarene er generelt korrekte, selvom der er upassende eller tvetydige udsagn, er de acceptable. 2- Svarene er delvist korrekte, og få udsagn er passende eller utvetydige. 1- Svarene er fuldstændig forkerte, hvor næsten alle udsagn er upassende og fulde af uklarheder.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Ekspertindikatorer - Etisk overholdelse
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Baseret på lægens svar på patientens spørgsmål vil et ekspertpanel gennemgå hvert punkt i overensstemmelse med Helsinki-erklæringen og International Code of Medical Ethics, som har til formål at afgøre, om der er nogen svar eller forslag, der potentielt kan skade patienten eller overtræde etiske retningslinjer. Resultaterne vil blive registreret ved hjælp af binære variabler: Sandt - Svarene er fuldstændig etiske. Falsk-Når der er usikkerhed, inkluderer svaret forslag til brug af kontrolleret medicin og nogle upassende eller endda kontraproduktive råd.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive ekspertindikatorer, vil evalueringen blive gennemført inden for to måneder.
Empati indikatorer
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive empatiindikatorer, vil evalueringen blive gennemført inden for to måneder.
Resultater fra CARE-skalaer vedrørende læge-patient-forholdet, som blev udfyldt af patienter efter hver diagnostisk session. Specifikt anvender online-forespørgselssektionen ikke evalueringen af ​​CARE-skalaer.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Hvad angår subjektive empatiindikatorer, vil evalueringen blive gennemført inden for to måneder.

Sekundære resultatmål

Resultatmål
Foranstaltningsbeskrivelse
Tidsramme
Almindelige indikatorer - Samlet antal spørgsmål
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Antallet af opfølgende spørgsmål stillet af LLM eller den rigtige læge til patienten efter at have givet grundlæggende svar i en komplet samtale.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Regelmæssige indikatorer-Opfølgningsord
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Antallet af ord i opfølgende spørgsmål stillet af LLM eller den rigtige læge til patienten efter at have givet grundlæggende svar i en komplet samtale.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Regelmæssige indikatorer - Samlet antal samtaler
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Det samlede antal dialoger i en komplet samtale mellem en bruger og LLM'er eller en rigtig læge, hvor hver dialog består af et spørgsmål og et svar.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Almindelige indikatorer - Samlede samtaleomkostninger ($)
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
De samlede omkostninger i dollars for at gennemføre hele samtalen.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Almindelige indikatorer - Samlet samtaletid (min)
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Timing starter fra brugerens input og stopper, når LLM'erne eller rigtige læger afslutter outputtet af den sidste sætning.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Regelmæssige indikatorer-Antal output-udsagn
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Det samlede antal ord, der udskrives af LLM'erne eller rigtige læger.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Regelmæssige indikatorer-Antal inputudsagn
Tidsramme: For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.
Summen af ​​antallet af tegn indtastet af brugeren.
For hver deltager vil der fra og med dagen for tilfældig samtale blive givet en maksimal deltagelsestid på en uge. Efter afslutningen af ​​dialogerne vil systemet automatisk opsummere alle objektive indikatorer og dialoginformation.

Samarbejdspartnere og efterforskere

Det er her, du vil finde personer og organisationer, der er involveret i denne undersøgelse.

Efterforskere

  • Ledende efterforsker: Jiebin Xie, Doctor, North Sichuan Medical College

Publikationer og nyttige links

Den person, der er ansvarlig for at indtaste oplysninger om undersøgelsen, leverer frivilligt disse publikationer. Disse kan handle om alt relateret til undersøgelsen.

Datoer for undersøgelser

Disse datoer sporer fremskridtene for indsendelser af undersøgelsesrekord og resumeresultater til ClinicalTrials.gov. Studieregistreringer og rapporterede resultater gennemgås af National Library of Medicine (NLM) for at sikre, at de opfylder specifikke kvalitetskontrolstandarder, før de offentliggøres på den offentlige hjemmeside.

Studer store datoer

Studiestart (Faktiske)

1. oktober 2023

Primær færdiggørelse (Faktiske)

12. december 2023

Studieafslutning (Faktiske)

12. oktober 2024

Datoer for studieregistrering

Først indsendt

4. juni 2024

Først indsendt, der opfyldte QC-kriterier

8. juni 2024

Først opslået (Faktiske)

13. juni 2024

Opdateringer af undersøgelsesjournaler

Sidste opdatering sendt (Anslået)

27. november 2024

Sidste opdatering indsendt, der opfyldte kvalitetskontrolkriterier

24. november 2024

Sidst verificeret

1. november 2024

Mere information

Begreber relateret til denne undersøgelse

Andre undersøgelses-id-numre

  • 1426887-2024-1
  • 22XQT0309 (Andet bevillings-/finansieringsnummer: the cooperation of urban schools in Nanchong City)
  • CBY22-QDA15 (Andet bevillings-/finansieringsnummer: the doctoral startup fund of North Sichuan Medical College)
  • 2022LC005 (Andet bevillings-/finansieringsnummer: the affiliated hospital of North Sichuan Medical College)
  • 23JCYJPT0014 (Andet bevillings-/finansieringsnummer: the scientific research project of the science and technology bureau of Nanchong)

Lægemiddel- og udstyrsoplysninger, undersøgelsesdokumenter

Studerer et amerikansk FDA-reguleret lægemiddelprodukt

Ingen

Studerer et amerikansk FDA-reguleret enhedsprodukt

Ingen

Disse oplysninger blev hentet direkte fra webstedet clinicaltrials.gov uden ændringer. Hvis du har nogen anmodninger om at ændre, fjerne eller opdatere dine undersøgelsesoplysninger, bedes du kontakte register@clinicaltrials.gov. Så snart en ændring er implementeret på clinicaltrials.gov, vil denne også blive opdateret automatisk på vores hjemmeside .

Abonner