更快,更便宜。

Gemini总算上新了。


没有发布会,官方发了条播客,三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber就这么直接挂上去了……


说实话,我都快忘记自己上次认真打开Gemini是什么时候了。


这倒不是说Gemini完全不能用,你要知道,我可是去年才整了一整年的Gemini Pro订阅,当时Gemini 3.1 Pro和Nano Banana2那叫一个意气风发,即便放到今天依然是中上水平的大语言模型和图片生成模型。


问题是最近几个月,外面的模型更新得实在太快。


gemini-3-5_3-6_3-5-Cyber__key-ar.width-1600.format-webp.webp

(图源:Gemini)


Kimi K3冲进旗舰模型第一梯队;DeepSeek V4正式版预计本月上线;Anthropic接连推出Fable 5和Sonnet 5;OpenAI更是刚把GPT-5.6端上来;只有谷歌这边却还在循环播放同一句话:Gemini 3.5 Pro快来了。


5月说下个月发布,6月没来,7月还是没来,Gemini到头来只有Flash更新了,这多少让人有些失望。


Gemini三模齐发:更快,更便宜


言归正传,咱们来说说Gemini家族的新模型。


只看发布页和跑分,Gemini 3.6 Flash的卖点被官方概括成一句话:更快、更便宜、更聪明。


为啥?因为基础参数就没啥亮点能说的。


谷歌依然没有公开参数量,3.6 Flash整套架构、训练数据和硬件信息基本沿用前代,输入上下文还是104.8token,默认思考等级也是中等,支持文本、图片、音频、视频和PDF。


好消息是,谷歌更新知识库了,从原有的2025年1月推进到了2026年3月,现在不用联网也能获得很多新鲜知识。


image.png

(图源:谷歌)


至于具体卖点嘛,按照官方博客的说明,第三方基准测试机构Artificial Analysis Index的实测显示,该模型输出token使用量较前代降低了17%,在DeepSWE这类代码测试场景上甚至能减少了65%。


image.png

(图源:谷歌)


不仅如此,该模型完成多步工作流程所需的推理步骤和工具调用也更少,在OSWorld-Verified计算机使用测试中,3.6 Flash比3.5 Flash少用55.8%的token,推理步骤更少之余,得到的结果也更好。


屏幕截图 2026-07-22 104242.png

(图源:谷歌)


众所周知,在大语言模型的设计中,输出token的数量直接关联到延迟和费用。


更短的思考链,更低的token消耗,带来了更快的响应速度。根据Artificial Analysis的任务时间测试,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash约2.7分钟,减少了整整一半。


dababf5c-86d4-4006-a9bf-a0893b8af24b.png

(图源:谷歌)


不过在成绩上,这俩却是50对50,完全没有提升可言。


只能说,虽然它没有更聪明,但是确实做到了能用更少的token、更短的时间完成同样水平的工作。


至于价格嘛...Gemini 3.6 Flash定价为每百万输入1.50美元,每百万输出7.50美元。相较于3.5 Flash每百万输出token9美元的价格,单次任务的总成本肯定是有所降低的,但依然比国产模型贵得多。


ChatGPT Image 2026年7月22日 11_01_09.png

(图源:雷科技自制)


至于什么产品落地,客户追捧,那都属于互吹,建议大伙别当真了。


再来看看Gemini 3.5 Flash-Lite


顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。


每百万输入0.3美元、每百万输出2.5美元,速度更是最高能达到前代的三倍。


86419af4-8fc4-4cf1-aea1-d03c64a5db67.png

(图源:谷歌)


不过能力就很弱了,虽然官方介绍各方面性能都有提升,例如代码和agent基准的 Terminal-Bench 2.1,从31%干到54%,但是横向对比起来,属于是远不如已经预览了两个月的DeepSeek v4 Flash,而且输出价格高了接近10倍。


就...很难想象为什么会有人专门去用它好吧。


至于最后一款模型,Gemini 3.5 Flash Cyber,是专门用来发现和修补网络安全漏洞的,不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放,和咱们就没什么关系,所以直接按下不表。


新模实测:小有提升,未达预期


老样子,咱们过了一遍参数,接下来就该给大伙整点实测了。


目前Gemini 3.6 Flash已经正式上线Gemini网页版和客户端,不过由于个人的使用习惯,我这边还是用AI Studio和Antigravity做测试,毕竟这俩参数比较好调,而且也能直接切换模型进行对比。


我给3.6 Flash和3.5 Flash安排了逻辑、计算和网页制作几轮同题测试。两边都使用默认的中等思考,不额外进行任何提醒,主打一个让它释放天性。


先看逻辑题,我给了一个带多重条件的座位排列题,故意塞了两条很容易混淆的限制,要求它们确定五个人从1号到5号的唯一座位顺序。


屏幕截图 2026-07-22 111807.png

(图源:雷科技)


Gemini 3.6 Flash回答得挺快,没有上来先复述题目,再用几百字告诉我“这是一个典型的约束满足问题”,而且直接列条件、逐步排除,最后给出答案,过程和结论也全部正确,最终消耗了2338tokens。


尽管Gemini 3.5 Flash也能完成啦,但是速度慢了约1/3,而且消耗了3707tokens。


image.png

(图源:雷科技)


这样看来,Gemini 3.6 Flash的速度更快应该不是token本身算得更快,主要还是靠思考链的优化来实现的。


整个问题的思考链就下面四段话,简单明了。


image.png

(图源:雷科技)


作为反面例子,我也拿这题问了一下DeepSeek v4 Flash,那叫一个停不下来,模型在那里反复穷举检查各种可能性,算出来之后,还要回头重新算一遍的,最终用了76秒才做完。


只能说,还好最后是算对了。


image.png

(图源:雷科技)


算数环节,我没拿什么竞赛题欺负模型,而是出了一个更贴近日常的问题,“满减、折扣、税费、优惠券不能叠加,最后四个人怎么AA”。


这次Gemini 3.6 Flash只用9.4s就思考出了答案,共消耗3505tokens,答案正确。


image.png

(图源:雷科技)


作为对比,Gemini 3.5 Flash用了12.4s思考答案,共消耗4081tokens,答案正确;DeepSeek v4 Flash则耗时113s,深度思考国产滑三次滚轮都看不完,理论上消耗的tokens差不多也是10倍。


我说思考优化是对的,你们聋了吗?


不过DeepSeek v4 Flash的输出价格只有Gemini 3.6 Flash的1/30,所以还是国产更省钱,同价格的API你甚至都能用上GPT-5.6 Luna了...


接下来,我准备不给设计稿,让它直接写一个能看的前端页面。


直接打开Google Canvas,选择Gemini 3.6 Flash,要求它制作一个“雷科技AI模型评测中心”网站,具体需求如下,主要是想看在没有明确设计参考的情况下,它到底能做出什么效果。


页面约一分钟生成完成,生成过程中,Canvas会实时显示当前阶段,例如定义样式变量、渲染指标卡等,而不是让用户一直面对空白等待。


image.png

(图源:雷科技)


你别说,这玩意的完成度还真不差,虽然这种设计模板我们在AI生成的网页里见得多了,但是Gemini 3.6 Flash做到了主标题、指标卡和按钮层级清楚;配色统一;首屏留白和视觉重心处理得比较成熟。


主题虽然不够Frutiger Aero,但也却是做到了三套设计的切换。


image.png

(图源:雷科技)


此外,各项测试内容都很完整,雷达图和指标卡能够正常渲染,确实挑不出什么大问题。


作为对比,这是目前GPT 5.5极速做出来的效果,差不多也是1分钟。


image.png

(图源:雷科技)


这是DeepSeek v4 Flash的效果,大部分功能都缺失了,用了3分钟左右。


image.png

(图源:雷科技)


然后,这是价格接近的GPT 5.6 Luna做出来的效果,前后用了10分钟,整体观感确实更丰富一些,但是很难说和Gemini 3.6 Flash做的网页有什么代差。


image.png

(图源:雷科技)


只能说,如果你和我一样对HTML一窍不通,用它做个可交互的网页原型,那完成度足够高;但是要上线的话,肯定还是需要设计师和前端工程师去对数据真实性、可访问性、移动端细节和交互状态进行一系列优化的。


这是我偷X上面的提示词做的行星发动机交互网页,全程不到两分钟,感兴趣的可以体验一下:https://share.gemini.google/NN5vQ7Vdw4ba。


image.png

(图源:雷科技)


当然,Gemini 3.6 Flash也不能说是全面提升,从推特网友们的反馈来看,这玩意的建模和编程能力都挺拉跨的。


image.png

(图源:雷科技)


博主表示,输出的界面代码逻辑错乱,组件嵌套混乱,交互逻辑断裂,完全无法投入实际使用。


至于用它生成的FPS游戏,看起来根本没法玩,玩家手上没有生成武器,无法正常调整任务视觉,而且还出现了很多Gemini 3.5 Flash都不会出现的建模错误,不过这玩意倒是用两分钟就做好了。


image.png

(图源:雷科技)


嗯...只能说术业有专攻吧,不可能啥都做得又快又好的。


AI掉队,谷歌正在拼命赶作业了


在我看来,谷歌当然谈不上要凉。


目前Gemini应用月活已经超过7.5亿,Alphabet年收入超过4000亿美元,搜索、安卓、Chrome、YouTube,整套谷歌生态全握在自己手里。当别家还在想办法抢入口,谷歌已经掌握了西方互联网的大部分入口。


但在模型这条线上,它现在表现得确实有点菜。


在Gemini 3.6 Flash的发布公告中,谷歌明确提到,Gemini 3.5 Pro还没有完全准备好,而Gemini 4已开始“目前最雄心勃勃的预训练”,他们对目前取得的进展感到非常振奋。


image.png

(图源:雷科技)


步子这么大,谷歌倒是不怕扯着蛋。


与此同时,国产模型正在从两头包抄。DeepSeek V4 Flash支持百万上下文,API输出价格低至每百万Token 2元;Kimi K3则在Artificial Analysis基准测试上拿到57分,轻松超过Gemini 3.6 Flash的50分,仅次于Claude Fable 5和GPT-5.6 sol。


论便宜,Gemini怎么都便宜不过DeepSeek V4;论性能,Claude和ChatGPT都不说了,Gemini现在连Kimi都打不过了。


别人既在抬高模型能力上限,也在完善代码、Agent和办公产品,谷歌这边却忙着给Flash削减Token、提高速度,可以说他们的产品节奏已经开始跟不上模型行业的更新速度了。


要问谷歌还能在AGI竞赛中有一席之地吗?或许只有Gemini 4还剩一丝希望了。


微信图片_20260722142519_24244_1017.png