Google 连发三个新 Gemini 模型,官方宣传与网友差评落差大,Gemini 4 能救场吗?

发布时间:2026/7/23 23:20:01
Google 连发三个新 Gemini 模型,官方宣传与网友差评落差大,Gemini 4 能救场吗? 主角登场3.6 Flash 到底强在哪如果你从去年就开始用 Gemini会感觉像看着自家兄弟得阿尔茨海默症这是网友调侃。Google 发三个新模型后网友反应更大。三个模型是 3.6 Flash、3.5 Flash - Lite、3.5 Flash Cyber官方措辞熟悉但实际体验不同。先说 3.6 Flash官方定位是“主力”干活模型。3.5 Flash 今年 5 月发布此次小迭代卖点是省 token。按数据3.6 Flash 比 3.5 Flash 少用 17%输出 token特定场景省 65%。跑多步任务时推理步数和工具调用少。价格下降输入 1.5 美元/百万 token输出 7.5 美元/百万 token上一代输出是 9 美元。基准测试中代码能力提升DeepSWE 从 37%到 49%MLE Bench 从 49.7%到 63.9%计算机操作能力 OSWorld - Verified 从 78.4%到 83%“计算机操作”成内置工具。知识工作方面GDPval - AA v2 从 1349 到 1421客户反馈多模态任务表现好有企业背书。知识截止日期从 2025 年 1 月到 2026 年 3 月安全上有升级版防护。以小博大便宜大碗的 3.5 Flash - Lite 也能更换推理档位了3.5 Flash - Lite 定位低于 3.6 Flash主打“快”和“便宜”适合高吞吐、低延迟任务。它是 3.5 系列最快的每秒吐 350 个 token价格便宜。质量比 3 月的 3.1 Flash - Lite 好。支持调“推理档位”电脑操作成内置工具。跟前代比提升明显在不少任务上反超 3 Flash官方举例多种用法有客户夸赞。3.5 Flash Cyber专门修补代码安全漏洞3.5 Flash Cyber 专门找和修代码安全漏洞。因 AI 找漏洞快Google 用 Flash 补漏洞。它在 3.5 Flash 基础微调搭配 CodeMender 工具在业内基准上达第一梯队且省 token。只对“可信合作伙伴”限量内测防漏洞被利用。说好的 3.5 Pro 呢官方称 3.5 Pro 正和合作伙伴测试。但据报道其代码生成能力未达预期更新数据后仍无起色甚至可能重训。宣传委员跳过 3.5 Pro 预告 Gemini 4有转移视线之嫌。网友并不买账第三方评测机构称新模型有提升但 3.6 Flash 智能水平基本原地踏步价格和能力不匹配。网友吐槽 3.6 Flash 不如对手性价比低。OpenAI 因用户达 1000 万给付费用户重置额度。实测网友指出新模型性能差有诸多问题。一边是官方宣传一边是网友差评让人怀疑 Google 是否点歪科技树Gemini 4 若再翻车调侃或成真。