Gemini总算上新了。
没有发布会,官方发了条播客,三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite以及Gemini 3.5 Flash Cyber就这么直接挂上去了……
说实话,我都快忘记自己上次认真打开Gemini是什么时候了。
这倒不是说Gemini完全不能用,你要知道,我可是去年才整了一整年的Gemini Pro订阅,当时Gemini 3.1 Pro和Nano Banana2那叫一个意气风发,即便放到今天依然是中上水平的大语言模型和图片生成模型。
问题是最近几个月,外面的模型更新得实在太快。

(图源:Gemini)
Kimi K3冲进旗舰模型第一梯队;DeepSeek V4正式版预计本月上线;Anthropic接连推出Fable 5和Sonnet 5;OpenAI更是刚把GPT-5.6端上来;只有谷歌这边却还在循环播放同一句话:Gemini 3.5 Pro快来了。
5月说下个月发布,6月没来,7月还是没来,Gemini到头来只有Flash更新了,这多少让人有些失望。
Gemini三模齐发:更快,更便宜
言归正传,咱们来说说Gemini家族的新模型。
只看发布页和跑分,Gemini 3.6 Flash的卖点被官方概括成一句话:更快、更便宜、更聪明。
为啥?因为基础参数就没啥亮点能说的。
谷歌依然没有公开参数量,3.6 Flash整套架构、训练数据和硬件信息基本沿用前代,输入上下文还是104.8token,默认思考等级也是中等,支持文本、图片、音频、视频和PDF。
好消息是,谷歌更新知识库了,从原有的2025年1月推进到了2026年3月,现在不用联网也能获得很多新鲜知识。

(图源:谷歌)
至于具体卖点嘛,按照官方博客的说明,第三方基准测试机构Artificial Analysis Index的实测显示,该模型输出token使用量较前代降低了17%,在DeepSWE这类代码测试场景上甚至能减少了65%。

(图源:谷歌)
不仅如此,该模型完成多步工作流程所需的推理步骤和工具调用也更少,在OSWorld-Verified计算机使用测试中,3.6 Flash比3.5 Flash少用55.8%的token,推理步骤更少之余,得到的结果也更好。

(图源:谷歌)
众所周知,在大语言模型的设计中,输出token的数量直接关联到延迟和费用。
更短的思考链,更低的token消耗,带来了更快的响应速度。根据Artificial Analysis的任务时间测试,Gemini 3.6 Flash每项任务平均耗时约1.3分钟,相比上一代3.5 Flash约2.7分钟,减少了整整一半。

(图源:谷歌)
不过在成绩上,这俩却是50对50,完全没有提升可言。
只能说,虽然它没有更聪明,但是确实做到了能用更少的token、更短的时间完成同样水平的工作。
至于价格嘛...Gemini 3.6 Flash定价为每百万输入1.50美元,每百万输出7.50美元。相较于3.5 Flash每百万输出token9美元的价格,单次任务的总成本肯定是有所降低的,但依然比国产模型贵得多。

(图源:雷科技自制)
至于什么产品落地,客户追捧,那都属于互吹,建议大伙别当真了。
再来看看Gemini 3.5 Flash-Lite。
顾名思义,Flash-Lite是Flash系列中更轻量的版本,相比Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。
每百万输入0.3美元、每百万输出2.5美元,速度更是最高能达到前代的三倍。

(图源:谷歌)
不过能力就很弱了,虽然官方介绍各方面性能都有提升,例如代码和agent基准的 Terminal-Bench 2.1,从31%干到54%,但是横向对比起来,属于是远不如已经预览了两个月的DeepSeek v4 Flash,而且输出价格高了接近10倍。
就...很难想象为什么会有人专门去用它好吧。
至于最后一款模型,Gemini 3.5 Flash Cyber,是专门用来发现和修补网络安全漏洞的,不会公开提供,仅通过CodeMender平台向政府和可信合作伙伴开放,和咱们就没什么关系,所以直接按下不表。
新模实测:小有提升,未达预期
老样子,咱们过了一遍参数,接下来就该给大伙整点实测了。
目前Gemini 3.6 Flash已经正式上线Gemini网页版和客户端,不过由于个人的使用习惯,我这边还是用AI Studio和Antigravity做测试,毕竟这俩参数比较好调,而且也能直接切换模型进行对比。
我给3.6 Flash和3.5 Flash安排了逻辑、计算和网页制作几轮同题测试。两边都使用默认的中等思考,不额外进行任何提醒,主打一个让它释放天性。
先看逻辑题,我给了一个带多重条件的座位排列题,故意塞了两条很容易混淆的限制,要求它们确定五个人从1号到5号的唯一座位顺序。

(图源:雷科技)
Gemini 3.6 Flash回答得挺快,没有上来先复述题目,再用几百字告诉我“这是一个典型的约束满足问题”,而且直接列条件、逐步排除,最后给出答案,过程和结论也全部正确,最终消耗了2338tokens。
尽管Gemini 3.5 Flash也能完成啦,但是速度慢了约1/3,而且消耗了3707tokens。

(图源:雷科技)
这样看来,Gemini 3.6 Flash的速度更快应该不是token本身算得更快,主要还是靠思考链的优化来实现的。
整个问题的思考链就下面四段话,简单明了。

(图源:雷科技)
作为反面例子,我也拿这题问了一下DeepSeek v4 Flash,那叫一个停不下来,模型在那里反复穷举检查各种可能性,算出来之后,还要回头重新算一遍的,最终用了76秒才做完。
只能说,还好最后是算对了。

(图源:雷科技)
算数环节,我没拿什么竞赛题欺负模型,而是出了一个更贴近日常的问题,“满减、折扣、税费、优惠券不能叠加,最后四个人怎么AA”。
这次Gemini 3.6 Flash只用9.4s就思考出了答案,共消耗3505tokens,答案正确。

(图源:雷科技)
作为对比,Gemini 3.5 Flash用了12.4s思考答案,共消耗4081tokens,答案正确;DeepSeek v4 Flash则耗时113s,深度思考国产滑三次滚轮都看不完,理论上消耗的tokens差不多也是10倍。
我说思考优化是对的,你们聋了吗?
不过DeepSeek v4 Flash的输出价格只有Gemini 3.6 Flash的1/30,所以还是国产更省钱,同价格的API你甚至都能用上GPT-5.6 Luna了...
接下来,我准备不给设计稿,让它直接写一个能看的前端页面。
直接打开Google Canvas,选择Gemini 3.6 Flash,要求它制作一个“雷科技AI模型评测中心”网站,具体需求如下,主要是想看在没有明确设计参考的情况下,它到底能做出什么效果。
页面约一分钟生成完成,生成过程中,Canvas会实时显示当前阶段,例如定义样式变量、渲染指标卡等,而不是让用户一直面对空白等待。

(图源:雷科技)
你别说,这玩意的完成度还真不差,虽然这种设计模板我们在AI生成的网页里见得多了,但是Gemini 3.6 Flash做到了主标题、指标卡和按钮层级清楚;配色统一;首屏留白和视觉重心处理得比较成熟。
主题虽然不够Frutiger Aero,但也却是做到了三套设计的切换。

(图源:雷科技)
此外,各项测试内容都很完整,雷达图和指标卡能够正常渲染,确实挑不出什么大问题。
作为对比,这是目前GPT 5.5极速做出来的效果,差不多也是1分钟。

(图源:雷科技)
这是DeepSeek v4 Flash的效果,大部分功能都缺失了,用了3分钟左右。

(图源:雷科技)
然后,这是价格接近的GPT 5.6 Luna做出来的效果,前后用了10分钟,整体观感确实更丰富一些,但是很难说和Gemini 3.6 Flash做的网页有什么代差。

(图源:雷科技)
只能说,如果你和我一样对HTML一窍不通,用它做个可交互的网页原型,那完成度足够高;但是要上线的话,肯定还是需要设计师和前端工程师去对数据真实性、可访问性、移动端细节和交互状态进行一系列优化的。
这是我偷X上面的提示词做的行星发动机交互网页,全程不到两分钟,感兴趣的可以体验一下:https://share.gemini.google/NN5vQ7Vdw4ba。

(图源:雷科技)
当然,Gemini 3.6 Flash也不能说是全面提升,从推特网友们的反馈来看,这玩意的建模和编程能力都挺拉跨的。

(图源:雷科技)
博主表示,输出的界面代码逻辑错乱,组件嵌套混乱,交互逻辑断裂,完全无法投入实际使用。
至于用它生成的FPS游戏,看起来根本没法玩,玩家手上没有生成武器,无法正常调整任务视觉,而且还出现了很多Gemini 3.5 Flash都不会出现的建模错误,不过这玩意倒是用两分钟就做好了。

(图源:雷科技)
嗯...只能说术业有专攻吧,不可能啥都做得又快又好的。
AI掉队,谷歌正在拼命赶作业了
在我看来,谷歌当然谈不上要凉。
目前Gemini应用月活已经超过7.5亿,Alphabet年收入超过4000亿美元,搜索、安卓、Chrome、YouTube,整套谷歌生态全握在自己手里。当别家还在想办法抢入口,谷歌已经掌握了西方互联网的大部分入口。
但在模型这条线上,它现在表现得确实有点菜。
在Gemini 3.6 Flash的发布公告中,谷歌明确提到,Gemini 3.5 Pro还没有完全准备好,而Gemini 4已开始“目前最雄心勃勃的预训练”,他们对目前取得的进展感到非常振奋。

(图源:雷科技)
步子这么大,谷歌倒是不怕扯着蛋。
与此同时,国产模型正在从两头包抄。DeepSeek V4 Flash支持百万上下文,API输出价格低至每百万Token 2元;Kimi K3则在Artificial Analysis基准测试上拿到57分,轻松超过Gemini 3.6 Flash的50分,仅次于Claude Fable 5和GPT-5.6 sol。
论便宜,Gemini怎么都便宜不过DeepSeek V4;论性能,Claude和ChatGPT都不说了,Gemini现在连Kimi都打不过了。
别人既在抬高模型能力上限,也在完善代码、Agent和办公产品,谷歌这边却忙着给Flash削减Token、提高速度,可以说他们的产品节奏已经开始跟不上模型行业的更新速度了。
要问谷歌还能在AGI竞赛中有一席之地吗?或许只有Gemini 4还剩一丝希望了。


雷科技





































