跳到正文
原文
Journal of Medical Internet Research· Ziyan Wu·· 5 小时前AI 评分42

11 个大语言模型中英文回答消费者健康问题的双语基准比较研究

Bilingual Performance of Large Language Models in Answering Consumer Health Questions in English and Chinese: Comparative Benchmark Study

AI 导读

一项对照评估用 150 道中英文消费者健康问题测试了 11 个大语言模型(含 GPT-4.5、Claude Sonnet 4、DeepSeek R1、Qwen 3 等),无上下文条件下英文与中文总体准确率相当(95.27% vs 93.82%),语言主效应不显著(β=0.00,P=.99)。

来源:Journal of Medical Internet Research · jmir.org

猜你喜欢