Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
Google 发布的 Gemini 3.6 Flash 和 3.5 Flash-Lite 被视为一次以速度为主的温和升级,而非前沿突破;许多人指出其表现大致与 GLM 5.2 等热门竞品相当,但往往更贵。评论者强调,Flash 和 Flash-Lite 层级在低成本、高吞吐、多模态或 agentic 工作负载中可能非常有效,但也对 Google 频繁弃用模型、令人困惑的产品结构以及不断上涨的成本表示沮丧,这些都让长期依赖变得有风险。缺少有竞争力的新“Pro”或前沿模型,再加上更强的开源权重和中国方案,令外界担心 Google 正在把 AI 市场的高端拱手让出,同时却在为自身生态和搜索功能押注快速、可扩展的模型。
总体情绪
- 很多人认为这次发布只是增量更新,更像是“存在证明”,而不是推动前沿进展。
- 有些人对速度和实际可用性感到满意;也有人认为与最近的美国和中国模型相比令人失望。
- Gemini 3.5 Pro / 前沿模型持续缺席,加剧了失望情绪。
基准测试与智能水平
- Google 帖子中的基准测试因大多只是自我比较(与过去的 Gemini 相比)而受到批评,而不是与 Fable、GPT-5.6、GLM 5.2、DeepSeek、Kimi 等对比。
- Artificial Analysis 和其他自定义基准通常将 3.6 Flash 排在 Sonnet-5-High / Opus-4.8-Medium 区间,大致可与 GLM-5.2 相比,但低于顶级前沿模型。
- 一些独立测试框架和类似“pelican/MacBook SVG”的测试发现 3.6 Flash 出人意料地强;另一些则说它整体上与 3.5 Flash 相当,只是在优劣项上有所取舍。
速度、token 效率与定价
- 3.6 Flash 被反复描述为“非常快”,在某些排行榜上有时甚至是最快的模型。
- Google 声称相比 3.5,它具有更高的 token 效率和更低的任务成本;但一些用户自己的基准测试发现它的 token 效率反而更低,因此真实世界成本可能持平甚至更高。
- Flash-Lite 的价格在几代之间大幅上涨;运行对价格敏感或高吞吐工作负载的人觉得自己被“煮熟”了,因为更老、更便宜的模型被弃用。
- 多条评论认为简单的 $/token 对比具有误导性;“每任务成本”和输出冗长程度同样重要。
优势与实际使用
- Flash/Flash-Lite 因以下方面受到好评:
- 低延迟,以及在长时间运行的 agent 中稳定、可预测的工具调用。
- 良好的多模态表现,尤其是图像理解和非英语校对。
- 在廉价分类、抽取和文档处理任务上价值很高。
- 一些人更偏好 Gemini 处理“帮我搜 Google”/知识类任务,因为它与 Search 和 Knowledge Graph 的集成。
弱点与回退
- 编码和 agentic coding 被视为 Gemini 的弱项;几位用户报告 3.6/3.5 Flash 或 3.5 Flash-Lite 会破坏现有的工具调用工作流,或生成脆弱的代码。
- 许多人表示,Claude/Codex/其他工具在严肃编码工作上仍然明显更强。
产品、生态与信任
- 对以下方面的批评很强烈:
- 品牌命名混乱(Flash vs Flash-Lite vs Nano,Antigravity 变体,消费版 vs Workspace 版 vs 企业版)。
- 突然弃用与价格变动破坏生产工作流。
- 开发者工具薄弱或别扭(尤其是 Antigravity 以及旧 CLI 的消失)。
- 尽管技术上有劣势,一些企业仍因合规、地域和“大厂”带来的安心感而选择 Gemini。
竞争与策略
- 普遍认为 Google 正在将前沿领导地位让给 OpenAI/Anthropic,并且越来越让位于中国的开源权重实验室。
- 一个常见假设是:Google 正在优化廉价、快速的模型来支撑 Search 和大规模消费级功能,而不是为了赢得编码/前沿基准。