Journal of Medical Internet Research· Ziyan Wu·· 5 小时前AI 评分42
11 个大语言模型中英文回答消费者健康问题的双语基准比较研究
Bilingual Performance of Large Language Models in Answering Consumer Health Questions in English and Chinese: Comparative Benchmark Study
AI 导读
一项对照评估用 150 道中英文消费者健康问题测试了 11 个大语言模型(含 GPT-4.5、Claude Sonnet 4、DeepSeek R1、Qwen 3 等),无上下文条件下英文与中文总体准确率相当(95.27% vs 93.82%),语言主效应不显著(β=0.00,P=.99)。
来源:Journal of Medical Internet Research · jmir.org
猜你喜欢
- JMIR系统综述与元分析:AI用光电容积描记诊断阻塞性睡眠呼吸暂停的准确性Journal of Medical Internet Research · 4 天前
- JMIR Mental Health:基于自然语言的心理健康支持需求评估模型开发与验证JMIR Mental Health · 4 天前
- 系统综述:医院网络攻击中的患者伤害与高危临床人群Journal of Medical Internet Research · 1 天前
- JMIR系统综述与元分析:VR干预用于成人血液透析症状管理的有效性与安全性Journal of Medical Internet Research · 1 天前
- 研究:持续接触自伤鼓励网站与美国青少年后续心理健康结局的纵向关联JMIR Mental Health · 6 天前