HyperAIHyperAI

Command Palette

Search for a command to run...

구글의 AMIE 대화형 의료 시스템은 제미니 1.5의 광범위한 문맥 처리 기능을 활용하여 여러 환자 방문이 포함된 100가지 시나리오에서 일반의 수준의 추론 능력을 달성했습니다.

Featured Image

대규모 언어 모델이 의료 분야에 빠르게 도입되고 있으며, 문헌 검색 및 의료 기록 생성부터 임상 의사 결정 지원에 이르기까지 다양한 응용 분야가 있습니다. 이러한 응용 분야 중에서도 진단 보조는 가장 성숙한 방향 중 하나입니다. 의학적으로 정밀하게 조정된 모델은 병력, 신체 징후 및 검사 결과를 기반으로 고품질의 감별 진단을 제공할 수 있으며, 다중 턴 대화 기능을 갖춘 시스템은 상담 방식의 상호 작용을 통해 병력 정보를 보완할 수도 있습니다.

그러나 진단은 임상적 의사결정의 출발점에 불과합니다. 치료의 질에 진정으로 영향을 미치는 것은 진단 후 이루어지는 관리 결정, 즉 추가 검사의 필요성, 치료 계획 선택, 약물 조정 시기, 추적 관찰 일정 수립, 그리고 환자 상태 변화에 따른 계획의 지속적인 수정 등입니다. 이러한 유형의 "관리적 추론"이 실제 임상 업무의 핵심에 더 가깝습니다.또한 이는 증거 기반 지침, 임상 경로, 약물 지식 및 개별 환자 차이에 대한 모델의 포괄적인 이해도를 더욱 철저하게 검증하는 계기가 됩니다.

진단적 추론에 비해 관리적 추론은 평가하기가 더 어렵습니다. 진단 문제는 일반적으로 비교적 명확한 표준적인 답이 있는 반면, 관리적 의사 결정은 종종 단일한 해결책이 없고 의료 자원, 지침, 약물 접근성 및 의사의 경험과 같은 제약 조건에 따라 달라집니다. 현재 의학 교육에서 이러한 유형의 종합적인 능력을 평가하는 주요 방법은 객관적 구조화 임상 시험(OSCE)이지만, 이는 실제 사람과의 상호작용과 전문가의 채점에 의존하기 때문에 대규모 언어 모델의 자동화된 평가에 직접 적용하기 어렵습니다.

이러한 격차를 해소하기 위해 구글 딥마인드와 구글 리서치는 최근 연구에서 대화형 의료 시스템인 AMIE를 기반으로 하는 새로운 LLM 기반 지능형 에이전트 시스템을 개발했습니다. 이 시스템은 다양한 후속 진료 시나리오에 대한 임상 관리 및 의사-환자 대화 최적화를 가능하게 합니다. AMIE는 제미니 모델의 장기 문맥 처리 기능을 활용하여 문맥 내 정보 검색과 구조적 추론을 결합함으로써 최신 임상 진료 지침 및 약물 처방 목록과 일치하는 결과를 도출합니다.

무작위 이중맹검 가상 객관적 구조화 임상 시험(OSCE) 연구에서 연구진은 AMIE를 21명의 일차 진료 의사(PCP)와 비교했습니다. 이 시험은 100개의 다회 방문 시나리오를 다루었으며, 사례 설계는 영국 NICE 가이드라인과 BMJ Best Practice 임상 가이드라인을 참고했습니다. 결과는 다음과 같습니다...전문가들이 평가한 질병 관리 추론 능력 측면에서 AMIE는 (열등하지 않은) 인간 의사보다 나쁘지 않은 성과를 보였습니다.한편, AMIE는 치료 계획 및 검사 권고의 정확성, 임상 지침 준수 정도, 지식 기반의 신뢰도 측면에서 의사 그룹보다 높은 점수를 받았습니다.

"질병 관리를 위한 대화형 AI를 향하여"라는 제목의 관련 연구 결과가 네이처(Nature)에 게재되었습니다.

연구 하이라이트:

* 본 연구는 대화형 의료 시스템인 AMIE의 기능을 단일 진단에서 질병 진행, 다회 방문 결정, 치료 반응 피드백 및 약물 처방을 포괄하는 전체 프로세스 임상 관리 추론으로 발전시킵니다.

* 이 시스템은 Gemini의 장기적인 맥락 정보 처리 기능을 활용하여 맥락 기반 검색과 구조화된 추론을 결합함으로써 관리 프로토콜이 NICE 가이드라인 및 BMJ 모범 사례와 같은 권위 있는 임상 지식과 높은 일관성을 유지하도록 보장합니다.

* 해당 시스템은 프로토콜의 전반적인 적합성, 치료 권고의 질, 검사 권고의 정확성을 포함한 여러 지표에서 일반의 수준 이상 또는 그에 준하는 성능을 보였습니다.


논문 보기:
https://www.nature.com/articles/s41586-026-10764-5

데이터셋: 단일 질문 답변부터 수직적 임상 시나리오까지

연구팀은 대화형 의료 AI가 장기적인 관리 추론에 있어 실제적인 역량을 발휘하는지 평가하기 위해 다단계 데이터 시스템을 구축했습니다.이 책은 여러 차례 방문이 필요한 임상 시나리오를 다루며, 근거 기반 지침과 약물 지식도 포함하고 있습니다.모델 학습, 체계 생성 및 표준화된 평가에 사용됩니다.

핵심 평가 도구는 "다중 방문 가상 OSCE 시나리오 데이터 세트"입니다.본 연구는 총 100건의 독립적인 사례 연구를 종합했습니다.사례는 심장학, 호흡기학, 산부인과/비뇨기과, 소화기내과, 신경학/근골격계의학 등 5개 전문 분야에 걸쳐 각 전문 분야별로 20개씩 고르게 분포되어 있습니다. 모든 사례는 캐나다와 인도의 임상의들이 공동으로 설계했으며, NICE 임상 가이드라인과 BMJ 최적 진료 가이드라인의 치료 경로를 참고하여 구성되었습니다.

일반적인 단일 회차 의료 질의응답 세션과는 달리, 이러한 사례들은 3회 연속 상담을 포함하도록 설계되었습니다. 각 시나리오에는 환자의 초기 증상뿐만 아니라,또한 증상 변화, 치료 반응 및 보조 검사 결과 보고서와 같은 장기적인 정보도 포함됩니다.본 연구의 목표는 만성 질환 관리 및 복잡한 사례 추적 관찰에서 실제 의사 결정 과정을 정확하게 반영하는 것이었습니다. 임상적 난이도를 높이기 위해 일부 사례에는 정보 불일치 및 다중 장기 동반 질환과 같은 요소를 포함하여 비표준 조건에서의 시스템 판단 능력을 테스트했습니다.본 연구는 100건의 공식 평가 사례 외에도 사전 실험 및 점수 조정을 위한 20건의 검증 시나리오를 설정했습니다.

증거 기반 접근 방식은 임상 지침 지식 기반에서 비롯됩니다.이 지식 기반에는 527개의 NICE 가이드라인과 100개의 BMJ 모범 사례 문서를 포함하여 총 627개의 문서가 수록되어 있습니다.전체 규모는 약 1,050만 개의 토큰으로 구성되어 있으며, 진단 기준, 검사 경로, 치료 계획 및 후속 진료 지침을 포함합니다. 평가 과정에서 이 지식 기반은 AI 시스템과 참여하는 일반의 모두에게 공개되어 실제 임상 환경에서 지침 자료를 참조하는 시나리오를 시뮬레이션하고 인간과 기계 간의 비교에서 최대한 공정성을 확보합니다.

약물 선택은 경영진의 추론에서 필수적인 부분입니다. 따라서,연구팀은 RxQA를 위한 특별한 벤치마크도 구축했습니다.이 벤치마크는 모델이 약물 사용 설명서, 적응증, 금기 사항, 복용량 및 약물 관련 위험을 얼마나 잘 이해하고 있는지 평가하는 데 사용됩니다. 미국 OpenFDA와 영국 국가 의약품 목록(National Formulary)의 약물 사용 설명서에서 발췌한 600개의 객관식 문항으로 구성되어 있으며, 기본 단답형 문항과 장문 시나리오 종합 문항의 두 가지 범주로 나뉩니다.질문의 초안은 지침에 따라 제미니 모델을 사용하여 생성되었으며, 이후 양국의 면허를 소지한 약사 8명이 검토, 수정 및 난이도 평가를 진행했습니다.라이선스 제한으로 인해 현재 OpenFDA에서 공개된 질문은 300개에 불과하며, 이는 약물 추론 능력을 비교하기 위한 표준화된 참고 자료를 제공합니다.

AMIE 모델: 시스템이 "대화 기능"과 "심층 관리 기능"을 모두 갖추도록 지원

본 연구는 구글이 이전에 제안했던 대화형 의료 시스템인 AMIE를 기반으로 하며, 관리자의 추론 요구 사항을 충족하기 위한 구체적인 개선 사항을 포함합니다. 새로운 시스템은 인지 과학의 "이중 과정 이론"에서 영감을 얻은 이중 에이전트 협업 아키텍처를 채택하고 있습니다.한 에이전트는 의사와 환자 간의 빠르고 지속적인 대화를 담당하고, 다른 에이전트는 더 느리지만 심층적인 관리 추론을 담당합니다.기본 모델은 실시간 응답 속도와 장기적인 컨텍스트 추론 능력의 균형을 맞추기 위해 Gemini 1.5 플래시를 일관되게 사용합니다.

구체적으로,이 시스템은 대화 에이전트와 Mx 관리 추론 에이전트로 구성됩니다.대화 에이전트는 "시스템 1"에 더 가깝습니다. 환자와 실시간으로 소통하며 병력을 문의하고 치료 계획을 설명하며 대화 중 환자의 상태를 관리하는 역할을 합니다. Mx 에이전트는 "시스템 2"에 더 가깝습니다. 완전한 질병 정보와 임상 지침을 기반으로 구조화되고 추적 가능한 관리 계획을 생성하는 것이 주된 역할입니다. 두 시스템은 공유 상태 모듈을 통해 정보를 동기화하며, 대화 에이전트는 언제든지 Mx의 추론 결과에 접근할 수 있습니다. 이를 통해 자연스러운 소통을 유지하면서도 강력한 지침이 담긴 의료 조언을 제공할 수 있습니다.

AMIE 모델의 시스템 아키텍처


대화형 허브로서, 대화 에이전트는 기존 진단 모델에 비해 세 번의 업그레이드를 거쳤습니다.첫 번째,기본 모델은 긴 문맥 처리 기능을 갖춘 Gemini 1.5 Flash로 교체되었으며, 이를 통해 더 긴 의료 기록과 여러 차례에 걸친 대화 정보를 처리할 수 있습니다.두번째,훈련 데이터에는 질병 진행 및 장기 관리에 대한 시스템의 이해도를 높이기 위해 여러 차례의 모의 의료 상담이 포함되었습니다.제삼,지도 학습을 통한 미세 조정 후, 본 연구는 대화 품질과 의사 결정 성능을 최적화하기 위해 인간과 AI의 피드백을 기반으로 한 강화 학습을 추가로 통합했습니다.

실시간 추론 과정에서 대화 에이전트는 "계획-생성-정제"의 3단계 프로세스를 채택합니다.먼저 현재 상태를 기반으로 상담 또는 대응을 위한 다음 단계를 계획하고, 환자에게 자연어 답변을 생성한 다음, 자체 점검 및 수정을 수행합니다. 여러 차례의 환자 방문에 걸쳐 지속적인 관리를 지원하기 위해 환자 요약, 감별 진단, 현재 관리 계획 및 기타 정보를 포함하는 모듈식 상태 구조를 유지하고, 각 대화마다 처음부터 다시 시작하지 않도록 백그라운드에서 지속적으로 업데이트합니다.

Mx 에이전트는 전체 시스템의 핵심 모듈로서 심층적인 관리 추론을 담당합니다.이 시스템은 "간략한 검색 + 전체 컨텍스트 추론" 전략을 사용하여 Gemini 1.5 플래시의 장기 컨텍스트 처리 기능을 최대한 활용합니다.기존의 분할 검색 방식에서 발생할 수 있는 정보 파편화를 최소화하기 위해, 본 시스템은 먼저 Gecko 1B 임베딩 모델을 사용하여 모든 진료 지침 문서를 인덱싱합니다. 그런 다음, 현재 환자의 사례를 기반으로 자연어 쿼리를 생성하고, 진료 지침 라이브러리에서 관련성이 높은 전체 문서 약 6개를 선택하여 총 약 256,000개의 토큰을 추출합니다. 이후, 시스템은 이러한 전체 진료 지침 문서와 환자의 전체 병력을 모델에 입력하여, 단일 호출로 문서와 치료 단계를 아우르는 통합적인 추론을 수행할 수 있도록 합니다.

Mx 에이전트는 출력물의 사용성과 검증 가능성을 향상시키기 위해 JSON 스키마 제약 조건을 사용하여 "임상 상황 분석 - 관리 목표 설정 - 관리 단계 수립 및 가이드라인 출처 인용" 프레임워크에 따라 결과를 생성하고 출력합니다. 각 제안에는 해당 가이드라인 인용이 반드시 포함되어야 합니다. 동시에 시스템은 먼저 네 가지 관리 초안을 독립적으로 생성한 다음, 원본 가이드라인 텍스트를 기반으로 이를 통합 및 개선하여 최종 솔루션의 완성도와 적용성을 향상시킵니다.

15가지 지표 모두에서 일반의에 비해 전혀 뒤떨어지지 않습니다.

본 연구에서는 업그레이드된 시스템의 임상 관리 추론 능력을 검증하기 위해 무작위 배정, 이중맹검 방식의 가상 OSCE 프레임워크와 RxQA 약물 벤치마크 테스트를 결합하여 사용했습니다.AMIE 시스템을 21명의 일반의와 비교했습니다.전반적인 평가는 관리 계획의 전반적인 질, 조사 권고 사항의 질, 치료 권고 사항의 질이라는 세 가지 차원을 중심으로 이루어집니다.

임상 평가에서 전문의와 일반의 모두 100세트의 다양한 외래 환자 사례를 완료해야 합니다. 30명의 전문의와 표준화된 환자가 전문적인 품질과 환자 경험이라는 두 가지 관점에서 블라인드 평가를 수행했습니다. 즉, 평가자들은 치료 계획이 AI 시스템에서 나온 것인지 아니면 인간 의사가 제시한 것인지 알지 못했으므로 결과에 대한 정체성 편향의 영향을 최소화했습니다. 약물 테스트는 외부 데이터가 시스템과 의사의 성과에 영향을 미치는지 관찰하기 위해 폐쇄형 및 개방형 환경 모두에서 진행되었습니다.

결과는 다음과 같습니다치료 계획의 전반적인 질적인 측면에서 볼 때, 이 시스템은 15가지 평가 항목 모두에서 일반의에 비해 전혀 뒤지지 않으며, 많은 지표에서 통계적으로 우월한 결과를 보여줍니다.치료 계획의 전반적인 적절성을 예로 들면, 시스템은 세 번의 방문에서 각각 95%, 96%, 98%를 기록했는데, 이는 일반의의 72%, 80%, 81%보다 높은 점수입니다. 치료 권고의 적절성 측면에서도 시스템은 각각 87%, 90%, 94%를 기록했으며, 이 역시 일반의의 66%, 62%, 71%보다 높은 점수입니다.

또한 이 시스템은 검사 및 치료 권고의 정확도 측면에서 지속적인 우위를 보여줍니다.해당 프로그램의 치료 권고 정확도는 일관적으로 95% 이상인 반면, 일반의의 정확도는 62%에서 67% 사이입니다.지침 준수 측면에서, 각 권고사항에 명시적인 출처 표기가 요구되기 때문에 시스템의 추적성은 인간 의사보다 훨씬 뛰어납니다. 이러한 결과는 장문맥 추론 메커니즘과 원본 지침 텍스트의 통합이 복잡한 관리 작업에서 모델의 안정성과 해석 가능성을 향상시키는 데 도움이 될 수 있음을 시사합니다.

관리 계획 품질


이중 관점 선호도 평가에서, 본 연구는 관리자의 추론에 대한 10가지 핵심 차원을 다루었으며, 그 결과 51개의 비교 사례가 도출되었습니다. 거의 절반에 가까운 사례에서 전문가와 환자 모두 자신의 수행 능력을 동등하다고 평가했습니다.선호도가 명확하게 나타난 경우, 시스템의 승률은 47%로 일반의의 7%보다 훨씬 높았습니다.더욱 주목할 만한 점은 전문의와 환자의 평가 경향이 대체로 일치한다는 사실인데, 이는 해당 시스템의 장점이 전문가의 판단뿐만 아니라 환자 경험과 관련된 측면에서도 반영되고 있음을 보여줍니다.

방문 횟수가 증가함에 따라 동적 모니터링, 환자 흐름, 의사-환자 관계 등 시간 관련 측면에서 시스템의 장점이 더욱 분명해집니다. 이는 연구의 초기 목적과 일맥상통합니다. 즉, 추론 관리의 어려움은 단 하나의 정답이 옳은지 여부가 아니라 환자 상태 변화, 치료 피드백, 그리고 치료 계획의 다음 단계를 지속적으로 연결하는 능력에 있다는 것입니다.

51개의 독립적인 차원에 걸쳐 선호도 비율을 시각화


약물 사용에 대한 추론 측면에서,RxQA 벤치마크 결과에 따르면, 해당 시스템은 약사가 평가한 매우 어려운 질문에서 일반의보다 우수한 성능을 보였습니다.참고 문헌이 제한된 환경에서 시스템의 정확도는 50.61 TP3T였고, 일반의의 정확도는 41.51 TP3T였습니다. 참고 문헌이 제공된 환경에서는 시스템의 정확도가 57.91 TP3T였고, 일반의의 정확도는 47.81 TP3T였습니다. 쉬운 문제에서는 두 방법 간에 유의미한 차이가 없었습니다. 참고 문헌은 시스템과 의사 모두에게 도움이 되었으며, 특히 쉬운 문제에서 정확도를 20%포인트 이상 향상시켰습니다. 어려운 문제에서는 향상 폭이 다소 작았지만, 여전히 통계적으로 유의미했습니다. 이는 모델이 복잡한 약물 정보 통합 작업에서 상대적인 이점을 가지고 있지만, 외부 자료만으로는 매우 어려운 약물 추론 문제를 완전히 해결할 수 없음을 시사합니다.

RxQA 약물 추론 정확도

마지막 말

본 연구의 가치는 대규모 의료 모델이 의사를 대체할 수 있음을 증명하는 데 있는 것이 아니라, 평가의 초점을 "진단"에서 "지속적인 관리"로 전환하는 데 있습니다. 단발적인 질의응답 방식과 비교했을 때, 관리적 추론은 실제 임상 현장에 더 가깝습니다. 의사는 질병 진행, 치료 피드백, 가이드라인 근거, 그리고 개별 환자의 차이에 따라 끊임없이 판단을 조정해야 하기 때문입니다. 본 연구에서 제안하는 다회 방문 가상 OSCE, 가이드라인 지식 기반, 약물별 벤치마크, 그리고 이중 에이전트 시스템은 의료 AI 평가를 위한 보다 임상적으로 적합한 프레임워크를 제공합니다. 그러나 가상 환경은 여전히 실제 의료 현장의 신체 검사, 자원 제약, 환자 순응도, 그리고 책임 문제 등을 완벽하게 재현할 수는 없습니다.

따라서 보다 신중한 평가는 의료 빅데이터 모델이 "진단 지원"에서 "치료 관리 지원"으로 전환되고 있다는 것입니다. 단기적인 가치는 최종 결정에서 의사를 대체하는 것이 아니라, 질병 진행 분석, 진료 지침 매칭, 약물 검증, 후속 치료 계획 수립, 환자 소통 등과 같은 분야에서 추적 가능하고 감사 가능하며 지속적으로 업데이트되는 임상 의사 결정 지원 도구가 되는 데 있습니다.