十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

美版豆包G3.7Flash,快到飞起,超3分钟算我输!

美版豆包G3.7Flash,快到飞起,超3分钟算我输! 美版豆包又更新了还有人记得谷歌的 Gemini 系列么好像被极度边缘化了上次 Flash 更新的时候我其实专门写过一系列文章介绍 Antigravity 这个智能体以及测试了 3.5 Flash。当前的感觉是 Flash 的前端设计还是很屌的然后我就再也没关注过了看到 3.7 Flash 更新了我又打开了尘封已久的 Antigravity又折腾了一下网络。用了一下发现一种很神奇的感觉。先说一下我的第一感受Flash 真的是快到飞起好像完全不用思考也不需要纠错一个任务给它它刷的一下做完了。GLM 5.3 需要一小时完成一个任务Gemini 3.7 Flash 三分钟搞定。我测试了好多个例子大部分例子没有超过 3 分钟。唯一一个让它用了 4 分钟的是超级玛丽。没有过多思考没有大量调用工具没有什么功能验证也不搞截图验证没有疯狂的修改代码。 就是双手插兜一句话就帮你把事儿给办了。我严重怀疑它在敷衍我但是看了一下结果好像也还行比 DSP 强多了。这是一种什么样的存在啊谷歌是在什么平行时空发展么Gemini 3.7 的气质和当前主流的模型完全不一样。今天有必要来好好观摩观摩了基准数据按照惯例我们先要看一下官方的发布描述和基准信息我首先刷到的帖子是 DeepMind 发布的这个帖子帖子的内容也非常简洁Gemini 3.7 Flash 来了。 它在编码、知识工作和网页开发方面更强大。所以这次的重点是编码、知识工作、网页开发谷歌真的是与世隔绝了么它居然没有说 Agent 这个词只说了 Coding我也不知道它说的更强大是强大到什么程度了。赶紧来看一波基准数据吧关于基准它主要是发了 4 张截图。第一张是 FrontierCode这个基准是和生产代码质量相关的指标主要是评估模型产出可直接上线的生产级代码的能力看代码是否健壮、可部署不是玩具样例。这个指标比 3.6 高了很多也要强于 Sonnet 5 和 Terra。第二张是 DeepSWE长周期软件工程真实开源项目的 bug 修复任务长上下文、真实仓库代码复现真实工程师改 bug 场景考验长代码理解、项目级调试。这个指标仅比 Terra 低一些比其他选手都要高。第三张是AutomationBench企业工作流自动化企业办公自动化任务写脚本、API 调用、业务流程自动化偏向 RPA / 业务脚本场景。这个指标遥遥领先同台选手。第四张是 Code ArenaWeb 前端 / 全栈开发竞技场输出完整可运行网页应用分数是 Arena 得分数值越高 Web 开发能力越强。这个指标也是遥遥领先同台选手。看数据是不是也挺不错的这个主要是得益于它选择的对手。它这次选的对手都不是顶级版本而是二线版本。Claude 家的没有选 Opus 5而是选了 Sonnet 5GPT 5.6 家的没有选 Sol而是选了 Terra。从这里可以看出一个关键点。谷歌已经不想在技术上争第一了。它只希望能在二流队伍里就行了。这个多少有点让人失望但是如果它这个模型能力真的还可以然后又快又便宜那么也不错这也算是一种务实吧。今天重点是来看一下它的能力现在到底是什么水平七七八八的介绍差不多了终于可以进入正题了开始上手实测咯我已经把最近的几个例子全部测了一波了下面看详情赛博朋克版清明上河图我们还是从这个例子开始吧。为什么要测这个例子以及具体的提示词是什么这些我已经讲过很多次了。早上刚说过我就不重复了。测试工具我们就用谷歌官方的 Antigravity 然后创建一个 Gemini 3.7 Flash 目录然后在里面创建一个对话把我们的提示词扔给它接下来我就要开始准备进行漫长的等待了。没想到的是它两分钟就搞定了我直接惊掉下巴结果如下打开之后没有任何错误就是这个风格有点独特和抽象和以往的都不一样。我看了一下细节细节并不是很好。毕竟只用了 2 分钟。以往测过的模型一般是在十几分钟到几十分钟。这次测试最凸出的是它的速度这个速度实在是太快了天文机械表和 GLM 5.3 的测试顺序保持一致第二个例子是天文机械表。直接看结果吧这个配色和界面设计好像还不错。但是它少了两个指针我用黄色箭头补全了。另外就是画面里面一直有个东西在闪烁我也不知道是啥。效果大概就是这个样子时间嘛就是 1 分钟搞定。 太离谱了别人起码要消耗十几分钟才能完成。由于 G哥 写代码根本不存在过程所以我也没必要去分析什么了。复刻游戏按照惯例也让它复刻一下经典的《坦克大战》和《超级玛丽》坦克大战的 UI 做得还不错游戏界面也还可以这个界面是有一些细节问题的但是整体来说还可以玩起来也没啥问题。基本达到了中上水平。完成这个例子的时间依旧没有超过 3 分钟没有任何复杂的验证就是刷刷一下子就搞好了搞完之后没有任何基础错误超级玛丽除了色调有点独特之外完成度也很高第一个版本主要是存在跳跃高度问题导致游戏无法继续。然后花费 1 分钟让它修复了一下就全部 OK 了。游戏里下蹲水管、隐藏蘑菇、无敌和子弹全部都是有的。整体的效果已经是中上偏上水平了。这个例子很多选手花了几十分钟做得惨不忍睹而它只花了 4 分钟。这是它唯一一个超过 3 分钟的例子。到这里确实有点惊人了。我早上测试 GLM 5.3 的时候整整跑了一个多小时做了无数验证还错了一次。最后是花了两个小时做到了不错的效果。而 G3.7 Flash 只用了 41 分钟G3.7 Flash 到底是一个什么样的存在呢它为什么可以在极短的时间里完成这么多事情呢3D台球最后我们来一个开放题。不提供详细的提示词。直接跟它说“我想做一个 3D 台球你有什么想法”我看了一下它的想法还是挺到位你看它说的多好啊制作一款高品质的3D 网页端台球游戏3D Pool / Billiards是一个非常精彩且兼具技术挑战性的项目。它不仅要求精准的物理模拟还需要细腻的 3D 光影质感和直观流畅的击球操控。以下我从技术架构、核心物理、视觉与镜头、游戏模式、交互设计五个维度为你梳理的一套完整方案与创意构想这个例子的制作过程简直就是和许愿一样你说要什么它立马改不管你提多么复杂的需求二话不说给你改1 分钟给你效果。几轮对话之后已经做得比较完善了都包含了十几个功能菜单了。大部分改得还不错只是有一个问题它一直修复不了。就是球桌上的 6 个孔一直挖不好。你怎么说都挖不好这个 3 分钟成型、1 分钟改一次的版本的例子在以往的测试中已经属于上等水平了比 GLM 5.3 和 K3 要好。谷歌的模型太奇特了好像完全不用动脑子就是靠肌肉记忆做事情特别快。但是你也不要希望它自己反思什么反思这种事情不存在的。另外一个神奇之处是比如 DSP 和 GLM 写的代码如果不反复检测和修复基本没法用。但是谷歌这个模型不做任何复杂的校验生成的代码居然是可以跑的也没有出现基础的语法错误。鉴于它的速度实在是太快了首次生成的代码也不是不能用即便有问题改一下也极快。所以这个模型其实是有很大的实用性的效率真的太高太高太高了除了模型之外我必须要吐槽一下谷歌的Antigravity体验太糟糕了。这么大个公司做的编程智能体真的是一坨莫名其妙动不动就未知错误这个 agent error 我都看吐了大部分时间就浪费在这个上面了。另外要找生产的文件我还得自己去文件管理器里面找他都无法右键直达也无法在对话中预览结果。另外模型配额消耗方面好像还可以我这些个例子在其他模型上面跑基本能把基础套餐的周配额都跑完。但是 Gemini 这里看着好像还可以啊周配额只消耗了 5 个点只能说不内耗的模型做事就是快消耗就是少。谷歌真的是玩了一波与众不同我感觉它炼丹的方式和追求的目标已经和当前主流模型公司分道扬镳了。它就是练出了一个能力中等偏上但是速度极快的模型。当别人全部在搞 Agent 的时候感觉它是完全在硬练模型所以它的公告里只说了编程能力有很大的提升但是没有说 Agent 能力有很大的提升因为它在 Antigravity 中基本上不怎么调用工具也不做什么复杂的验证直接一把梭。我记得 3.5 的时候它还喜欢动不动就做个计划现在是计划都不做了。拿到需求立马开干干完立马收工绝对不浪费一秒钟我G哥可谓是大模型中的“闪电侠”
返回列表