以近乎下饺子的速度,Gemini 又双叒更新了。 今天凌晨,Gemini 3.8 Flash 正式上线。这已经是 Google 在六周之内发布的第三款 Flash 模型。 看起来,Google 要把「小步快跑」的战略贯彻到底。但我比较担心的是,按这个速度,在 Gemini 4 出来之前 3.x 的版本号好像不太够用了…… 从版本号上看这只是一个常规更新,但 Google 给 Flash 系列模型安排的任务却越来越重。官方说法称,它的目标是编写和修改大型项目、反复调用工具、独立完成持续数小时的复杂工作。 这些一般用来衡量顶级 Agentic 模型的活儿,如今都委派给了 3.8 Flash。 Flash 系列原本的意义是跑得更快、花得更少,但现在,它不得不代替迟迟没有出现的 3.5 Pro,证明 Google 仍有能力留在牌桌上。 看官方跑分,Google 似乎真的做到了;但社区反馈和我们的简单测试得出了一个相反的结论: 六周连更三代,Gemini 3.8 Flash 依然「圣质如初」。 三周一个新模型,跑分已逼近 Opus 5 Google 将 Gemini 3.8 Flash 称为「迄今最聪明的 Flash 模型」,主要面向长程软件工程、自主 Agent 和复杂企业工作流。 话都这样说了,那最显眼的提升自然是编程。 在测试长程软件工程能力的 DeepSWE v1.1 中,Gemini 3.8 Flash 拿到 71.0% 的成绩,相比 3.7 Flash 的 65.3% 又提高了近 6 个百分点,距离 Claude Opus 5 的 74.0% 只剩一步之遥——要知道,一个半月以前的 3.6 Flash 只有 49%。 而在跨越 STEM、人文和专业知识的 HLE-Verified 中,3.8 Flash 得分 54.9%,略高于 Opus 5 的 54.4%。 在部分多模态测试中,优势甚至更为明显:复杂图表理解测试 CharXiv Reasoning 得分 86.2%,超过 Opus 5 的 83.7%;采用 Agent 模式处理长视频时,LVBench 得分达到 8...
本文转载自 爱范儿,仅供学习交流。查看原文