谷歌发布Gemini 3.8 Flash,四个月内第四款Flash模型,智能指数59
Gemini 3.8 Flash在Artificial Analysis智能指数上得59分,较3.7 Flash高3分,并进入智能与成本帕累托前沿。
谷歌DeepMind今天发布Gemini 3.8 Flash(高推理档),在Artificial Analysis智能指数上得59分,比3.7 Flash高3分,与GPT-5.6 Sol(xhigh,59)和Grok 4.6(medium,59)的最高推理档成绩持平。
Gemini 3.8 Flash维持与3.7 Flash相同的折扣价(每百万输入/输出token为0.75/3.75美元),但每个智能任务的平均成本为0.58美元,比3.7 Flash的0.40美元上涨约40%,原因是平均每个任务的输出token增加了30%至4.8万,以及智能体评测中交互次数增多。
基准测试成绩
在中等推理档下,Gemini 3.8 Flash得57分,追平GPT-5.6 Terra(max,57)和Muse Spark 1.2(xhigh,57)。在低推理档下得52分,与Gemini 3.6 Flash(high,52)持平,但单任务成本低30%,单任务时间约为后者的三分之一。
智能指数提升3分主要来自智能体评测,包括τ³-Banking(工具使用)、Terminal-Bench v2.1(编程)和GDPval-AA v2(真实世界任务)。其中τ³-Banking进步最大,比3.7 Flash高12个百分点,达到45%。
成本与速度
Gemini 3.8 Flash(高推理)在智能与单任务成本的帕累托前沿上,是同级别智能下最便宜的模型,单任务成本0.58美元,接近GPT-5.6 Terra(max,0.53美元)。中等推理单任务成本降至0.41美元,低推理为0.24美元。
输出速度仍快,高推理时平均每秒约300个token,单任务时间2.5分钟,快于GPT-5.6 Luna(max,2.6分钟)和GPT-5.6 Terra(max,3.3分钟)。但相比3.7 Flash的2.2分钟有所增加,且落后于Claude Fable 5.1(medium,2.1分钟)。低推理时单任务时间降至0.8分钟,使模型进入智能与单任务时间的帕累托前沿。
模型规格与定价
上下文窗口为100万token,与Gemini 3.7 Flash一致。支持文本、图像、视频和语音输入,文本输出。
定价方面,折扣价每百万输入/输出token为0.75/3.75美元(与3.7 Flash当前折扣价一致),持续到今年年底。标准价为1.50/7.50美元。缓存输入token仍享受90%折扣。