小穗步分享#3|運用 LLM 輔助病程紀錄撰寫的正確性優於人類
Hi, 我是小穗步。 每周一篇醫療AI論文,讓我們站在前人肩膀上,優化自己的系統,走在遇見更好自己的道路上。 一篇醫療論文摘要與心得 我是 ChatGPT 的重度使用者,因為對自己很有幫助,所以推理到…
Hi, 我是小穗步。
每周一篇醫療AI論文,讓我們站在前人肩膀上,優化自己的系統,走在遇見更好自己的道路上。
一篇醫療論文摘要與心得
我是 ChatGPT 的重度使用者,因為對自己很有幫助,所以推理到將 LLM 模型運用至醫療場域,協助醫師輔助病歷的撰寫與檢視應該有很大的幫助,但這只是我的推測。今天看到了一篇2024年2月發表在 nature medicine 的論文,《Adapted large language models can outperform medical experts in clinical text summarization》 它的標題吸引了我的目光。這周小穗步就跟大家分享這篇論文,讓 LLM 導入輔助病歷的撰寫,有了第一步的實證研究來佐證。
這篇論文透過一個嚴謹的架構,來說明LLM 模型的能力,研究運用公開資料集,採用6種模型(4個開源,兩個非開源)與2種方法,測試放射科報告、病人問答病人健康問題與病程紀錄(progress note)四種任務上,以正確性,完整性與簡潔性三個面向切入,比較專業醫師與 LLM 模型效果上的差異。

在病程記錄(progress notes)任務中,GPT-4與醫學專家相比,在正確性(correctness)方面GPT-4表現出顯著優勢,而在完整性(completeness)和簡潔性(conciseness)方面,兩者差異不大。在安全性分析中,GPT-4與醫學專家都會面臨安全性的挑戰,這篇研究中,GPT-4的錯誤率稍低於人類的錯誤。
目前最佳模型為非開源模型(GPT-4),透過上下文學習(ICL)使用少量範例進行調整,證明了對特定任務和領域的適應有比較好的表現。導入LLM可能會減輕文檔負擔,進而減少臨床醫生的壓力並改善病人護理,未來的研究將需在臨床環境中進行前瞻性研究來測試這一假設。

- 不同開源語言模型在不同適應策略下對臨床文本摘要任務的性能評估,平均而言,QLoRA比 ICL 來的好。其中FLAN-T5 + QLoRA 在使用 QLoRA 適應策略時,在BLEU指標上有顯著提升,這表明 QLoRA 對於某些模型和任務可能更為適合。

- 這張圖表展示了不同數量的範例如何影響各個模型在不同醫學文本處理任務(例如 Open-i、MIMIC-CXR、MIMIC-III、Patient questions、Progress notes 和 Dialogue)上的性能。x軸:表示在模型提供的上下文中包括的範例數量。通過這些曲線,我們可以看到模型性能隨著提供給模型的上下文範例數量的增加而如何變化。GPT4 的效果最好,一般而言例子越多,效果越好。

展示了閱讀者對於人類與GPT-4生成的臨床文檔的偏好,特別是在完整性(Completeness)、正確性(Correctness)、以及簡潔性(Conciseness)這三個層面。1500筆資料,僅在少數情況下 (19%) 首選醫學專家摘要,大型語言模型在臨床文本摘要中的表現可以超越醫學專家,在大多數情況下,LLMs 的摘要被認為與醫學專家的摘要相當(45%)或更優秀(36%)
對於放射學報告,人類和GPT-4之間的偏好似乎很接近,GPT-4完整性較高,正確性也高一些些,但在簡潔性上,人類的簡潔性較好。
病人問答上,在完整性上人類和 GPT-4 差不多,在正確性上也差異不大,簡潔性上也差不多。
病程報告上,GTP4的正確性明顯優於人類,正確性上差不多,簡潔性上也差異不大。
閱讀後的下一步
雖然後續還需要前瞻性的臨床研究來證實LLM 的實際臨床效益,但是這篇論文打了一個好的基礎,讓我們知道目前做法的方式是正確的,運用最佳模型為非開源模型(GPT-4),透過上下文學習(ICL)使用少量範例進行調整,證明了對特定任務和領域的適應有比較好的表現。
同時文中提到護理師的文件記錄職責可能會佔用其 60% 的時間,並帶來相當大的工作壓力,目前病歷小助手的使用最多的就是一位特定的專科護理師,下周訪談也會看一下導入病歷小助手,對她在撰寫病歷的時間有沒有減少,以及還有那些地方用起來卡卡的,可以改善的地方。
希望你從這週的分享帶走一些對你有用的資訊。祝你有個美好的一週!
小穗步 2023/04/14
#第3次發刊