Gaokerena:为消费级硬件设计的波斯语医疗语言模型家族发布
伊朗研究团队推出Gaokerena-V与Gaokerena-R,在波斯语医疗问答基准上分别达到 49.31% 和 52.98%,但论文明确表示当前性能不足以直接用于临床。
AI解读:波斯语属于低资源语言,医疗AI研究长期以英语为主,导致本地化数字医疗工具缺乏。Gaokerena家族的论文试图填补这一空白:研究者用 9000 万token的波斯语医疗语料和 2 万条经专家审核的问答对训练出Gaokerena-V,把翻译版医疗MMLU基准分数从基线 46.28% 提升到 49.31%。随后他们为临床推理场景开发了Gaokerena-R,引入思维链和两种基于AI反馈的强化学习框架,用较小数据集就把分数推高到 52.98%。对实际使用者(如波斯语地区的医疗AI开发者和研究人员)而言,这意味着有了一个可部署在消费级硬件上的开源起点,但论文也明确警示:分数仍不支持直接临床应用。真正的价值在于,团队同时设计了不确定性预测头,让模型能基于内部状态估计自身回答的置信度——这正是安全落地前最缺的一环。普通读者无需立即行动,但若你在做多语言医疗模型,Gaokerena的语料构建方法和RLAIF偏好优化路径值得作为基准参考,而非上线方案。
arXiv论文(编号 2608.00932)介绍了Gaokerena,一个面向波斯语的紧凑型医疗语言模型家族,目标是在消费级硬件上运行。论文由Mehrdad Ghassabi等多名作者提交,最新版本于 2026 年 9 月 3 日更新。
该家族包含两个模型:Gaokerena-V和Gaokerena-R。Gaokerena-V在一个 9000 万token的波斯语医疗语料库和 2 万条经专家审核的医生问答对上训练基线模型,将翻译版医疗MMLU基准成绩从 46.28% 提升至 49.31%。
Gaokerena-R在相同基线架构上引入思维链方法和两种新的基于AI反馈的强化学习框架,尽管使用更小数据集,基准成绩达到 52.98%。
两个模型都配备了定制的不确定性预测头,仅依据内部隐藏状态来预测模型对回答的置信度。
论文明确表示,当前性能水平不足以直接用于临床,真实世界部署前仍需在知识获取鲁棒性和安全验证方面开展进一步研究。