Google 与 Meta 周三几乎同时发布了最新一代前沿 AI 大模型。Google 推出 Gemini 3.8 Flash 及其网络安全专用版本,Meta 则上线了 Muse Spark 1.3。
这两项发布引发了直接对比。独立测评机构 Artificial Analysis 给出了大致均衡的结果:Meta 在智能代理知识处理和科学推理领域表现领先,而 Google 则在事实回忆能力和终端级编程方面占优势。
两大前沿模型同日发布
Gemini 3.8 Flash 是 Google 在过去六周内推出的第三个 Flash 版本,每 100 万输入 Token 收费 0.75 美元,每 100 万输出 Token 收费 3.75 美元。
关注我们的 X 账号,实时获取最新快讯
Today we’re introducing a new 3.8 Flash model, our 3rd Flash release in just 6 wks.
— Sundar Pichai (@sundarpichai) September 2, 2026
It delivers significant leaps from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. On DeepSWE v1.1, it outperforms most larger frontier models in autonomously… pic.twitter.com/MB5seliluh
该优惠价格将持续至 2026 年 12 月 31 日,之后将翻倍至每 100 万 Token 分别为 1.50 美元和 7.50 美元。
Google 此次还同步推出了 Gemini 3.8 Flash Cyber 网络安全模型。目前仅向受信任的安全防御者开放。该模型在安全漏洞检测基准 CyberGym 上取得 86.2% 的成绩。
网络安全专用版在 CWE-Bench 修复基准测试中达到了 47.2%。Google 表示,该模型为 Chrome 浏览器漏洞生成正确修复补丁的数量是大型商用模型的 2.6 倍。
相关访问权限受限于 Fairwind Program,仅对政府机构及关键基础设施运营方开放。OpenAI 也在前一天对其达到关键网络安全标准的 Astra 模型设置了类似门槛。
与此同时,Meta 通过 Muse Code 和 Meta Model API 更新发布了 Muse Spark 1.3。据公司工程师测算,新版本工具调用次数较 1.2 版减少约 20%。
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the biggest jump we've made so far on coding and agentic work. Try it in Muse Code and our API.
— Mark Zuckerberg (@finkd) September 2, 2026
Next up 🍉 and Muse Spark open weights releases coming soon. pic.twitter.com/XQQEDEJGD7
Gemini 3.8 Flash 与 Muse Spark 1.3 独立评测结果分化
Artificial Analysis 对两大模型进行了评测,测试结果显示各有所长。Muse Spark 1.3 在 Max 模式下 GDPval-AA v2 测试分数为 1,754,Gemini 3.8 Flash(高性能版)得分为 1,545。
Meta 同时在 Sierra Research 银行业代理测试(52.4% 对 44.9%)以及 CritPt 物理推理任务中均取得领先。Gemini 3.8 Flash 则分别在 Terminal-Bench 2.1 以 87.6%、AA-LCR 长文本场景下以 81%、AA-Omniscience 准确率以 55% 表现最佳。
在 GPQA Diamond 测试中,Gemini 3.8 Flash 以 95% 获得该项目最高分,领先于同类模型。在 Humanity's Last Exam 测试中,Meta 与 Gemini 3.8 Flash 的成绩也仅相差 1 分。
不过,Meta 此次得分最高的模型版本暂未上线。Meta 官方表示,该版本将在完成进一步安全测试后开放,目前用户可用的仍为 xhigh 版本。
该版本在人工分析智能指数(Artificial Analysis Intelligence Index)中取得 61 分,较 Muse Spark 1.2 高 4 分。对比来看,Claude Fable 5.1 得分为 66,Claude Opus 5 得分为 63。
此外,更多大模型版本已在发布排期中。马斯克此前表示,Grok 4.7 即将上线。若按计划推进,将在两周内迎来四款前沿模型面世。
订阅我们的 YouTube 频道,观看行业领袖与资深记者带来的深度解读
https://youtu.be/6uixXOg1e8I在 cn.beincrypto.com 阅读由 Kamina Bashir 撰写的原始文章 谷歌 Meta AI 模型同日发布 行业格局未定