
周五下午我把这周社区里刷屏的AI大模型和Agent相关讨论又翻了一遍挑出16个值得看一眼的新进展。它们从机器人推理一路铺到视频生成跨度不小但有一个共同点都在解决“从演示到能用”之间的那一段距离。不管是做算法、做产品还是做内容这篇文章能帮你快速确认哪些东西值得跟进、哪些只是热闹。下面的内容我会按四个方向展开机器人推理与具身智能、Agent开发工具链、视频生成与多模态、模型部署与垂直场景落地最后把这一周最容易踩的坑一起列出来。1. 一周值得关注的AI进展先看全景先说结论这一周的新东西里真正值得花时间动手试的其实没那么多。16个进展听起来很多但大部分是同一类能力的延伸真正算得上“方向级”变化的集中在三个地方。第一是机器人推理。过去我们谈机器人控制更多是“感知规划执行”的老三段现在大模型直接参与闭环推理让机器人能根据环境反馈调整动作这在以前是很难想象的。这不是概念这一周已经有开源项目把这一步跑通了后面我会展开讲。第二是Agent的工具链成熟度。上半年大家还在讨论Agent是不是炒作这周的开源框架、编排工具、调试手段明显上了一个台阶。最直观的表现是Agent执行出错的报错信息开始变得可读排查一套完整链路不再像大海捞针。这个变化是无声的但对做工程的人非常重要。第三是视频生成从“玩具”走向“生产力”。2K分辨率、多镜头一致性、可控帧生成这些词这周反复出现。免费入口和开源工具也越来越多了门槛在快速下降。我把这16个新进展按这四个方向做了归类下面每个方向挑几个重点展开每个进展我都会说明它解决什么问题、适合谁用、实际跑起来要注意什么。2. 机器人推理与智能体边界从环境感知到长期记忆2.1 Pi Agent机器人推理系统的“开箱”体验这一周机器人推理方向热度最高的是Pi Agent相关的一批项目。它做的事情说起来很简单让机器人不只会执行固定动作序列而是能拿着传感器数据、环境地图、任务描述在模型内部完成推理再输出控制指令。过去这类系统要自己拼视觉模块、控制模块、规划模块现在模型把这几步压缩进了端到端的推理过程。我看了几个复现帖普遍反馈是“第一次跑起来的感受很震撼”。机器人面对突然出现的障碍物不再需要预编程的避障逻辑而是靠多模态推理临时决定绕行路线。这种能力的价值在于它把“泛化”从实验室带到了真实场景。但这东西现阶段不是拿来就能用的。一个有代表性的坑实物机器人和仿真环境的动作空间差异很大同一个模型在MuJoCo里表现完美换到真机上会因为关节延迟出现累积误差。我的建议是先跑通官方Demo再逐步替换真实传感器数据不要一上来就指望它接管完整任务。2.2 VLA模型与通用Agent的配合方式Vision-Language-Action模型这段时间被讨论的频率明显上升。它本质上是把视觉、语言、动作三个模态整合进一个大模型机器人看到一个场景理解指令直接输出动作。VLA和通用Agent的配合方式这周讨论出的一个共识是不要让VLA什么都干而是让它作为“底层执行器”上层由Agent负责任务拆解和状态管理。例如一个清理桌面的任务上层Agent先判断“桌面有哪些物品、分别该放哪”VLA模型再负责“手怎么伸过去、握力怎么控制”。这种分层设计的好处是任务规划出错时只需要修上层逻辑不需要重新训练运动控制部分。实操时要注意动作空间的定义。不同机器人厂商的关节限位、速度上限都不一致跨平台迁移VLA时动作头的标准化比模型结构本身更影响复现效果。我见过有人换了机械臂型号之后模型输出动作直接打到关节限位排查了半天才发现是动作空间没做缩放。2.3 仿真到真机迁移机器人推理的训练与评测机器人推理方向的第三个新进展是仿真到真机迁移的工具链终于有了一套相对完整的评测体系。以前大家各自用不同的仿真环境结果没法横向对比。这周几个开源项目开始统一评测标准包括任务成功率、平均完成步数、真机部署耗时这些指标。这里我要多说一句仿真环境里的成绩要打折扣看。光照变化、物体材质差异、电机响应延迟这三个变量在sim里经常被忽略到了真机上却是致命的。我见过一个抓取任务仿真成功率98%真机只有67%差距基本都出在这三个地方。建议的做法是领域随机化。在仿真里随机改变物体位置、光照角度、纹理贴图让模型见过足够多的变化再上真机。这一周看到有团队把随机化参数调得特别激进真机成功率反而上去了因为模型学会了关注真正的关键特征而不是过拟合某个固定的场景。2.4 长期记忆与规划分离具身智能的架构取舍具身智能方向的最后一个重点是长期记忆和任务规划的架构分离。过去Agent的记忆都塞在context里长了就乱。这一周出现的方案开始把记忆模块外置变成独立的向量检索库机器人需要的时候才去查不需要的时候不占用推理空间。这套架构对机器人场景格外重要。一个清洁机器人如果要在办公楼里连续工作一周它需要记住“会议室周二下午通常没人”“茶水间门口有个台阶”这类长期信息但又不能每次做决策都把这些信息全过一遍。检索式记忆刚好解决这个问题。我试过类似思路把记忆按场景切片每个切片带时间戳检索时按“当前任务最近执行结果”做召回效果比全量塞context稳定得多。要注意的是记忆写入的时机很关键写早了信息不全写晚了又来不及影响决策这块需要结合任务节奏调。3. Agent开发工具链框架选择、微调与落地3.1 Harness与Agent的区别别再混为一谈这一周翻社区我发现“Harness和Agent区别”成了高频问题说明大家在选型时开始认真思考底层框架了。简单说Harness是承载Agent运行的框架负责工具调用、上下文管理、执行循环这些底层机制Agent是里面真正做决策的那个智能体它调用模型、解读结果、决定下一步动作。用生活类比的话Harness是厨房的操作台和水电气管道Agent是拿着菜谱做菜的厨师。管道不通厨师再厉害也没用厨师不会做菜管道再通畅也端不出菜来。工程上这俩经常被混在一起讨论导致排查问题时定位不准。实操建议是遇到Agent执行结果不对先分清楚是Harness层的问题还是Agent层的问题。工具调用参数传错了属于Harness层模型理解指令有偏差属于Agent层。这一周我看到的报错里有一大半其实是Harness层工具定义不严谨造成的跟模型本身没关系。3.2 开源Agent编排框架怎么选Agent编排框架这周又多了几个新选项加上之前的现在市面上的开源方案可以归成三类。第一类是轻量级编排适合快速验证想法配置简单但功能有限第二类是重量级框架带完整的记忆、规划、工具管理模块适合正式项目但有学习成本第三类是可视化编排拖拽节点就能串流程适合非工程师团队用。选择标准我给三条。第一看团队技术栈Python团队和TypeScript团队选型完全不同第二看工具生态你需要调用的服务和已有框架的适配程度第三看社区活跃度这个周更新的框架和三个月更新一次的框架坑的多少完全不是一个量级。我不建议一上来就上重量级框架。先用轻量级方案跑通一个最小流程确认Agent的行为逻辑符合预期再迁移到正式框架。这周有团队从重量级框架退回轻量级就是因为前期业务逻辑还没弄清楚框架的限制反而成了瓶颈。3.3 Hermes Agent轻量级Agent外壳的语义接口Hermes Agent这周在社区里的讨论度不低它主打的是“语义接口”这个概念。传统Agent工具调用靠函数签名参数名、类型、顺序都写死Hermes Agent的做法是用自然语言描述工具能力和参数含义让模型自己理解怎么调用。这个方向我比较看好。它解决的问题很实际工具多了之后模型经常把相似功能的工具搞混比如“发送邮件”和“发送消息”参数明明差不多但调用错一个就会出问题。语义接口相当于把工具的意图也喂给了模型匹配准确率会高不少。不过要注意语义接口对模型能力要求更高。像GPT-4级别的大模型用起来很顺换小参数模型就容易理解偏。如果你的Agent跑在7B、13B这类小模型上建议还是保留结构化工具定义别为了赶时髦全改成语义接口。3.4 OpenCodeAgent工作流里的代码与视频生成联动OpenCode这周的出现让我挺意外它把代码生成和视频生成结合起来形成了一个有趣的Agent工作流。具体来说它可以读取你的工程代码理解业务逻辑然后根据代码运行结果生成对应的可视化视频。对做数据分析、产品演示、算法讲解的人来说这个效率提升非常明显。我试用的感受是它能自动分析代码里的数据变化把每个阶段的输出转成一帧画面再串成视频。以前做算法效果展示要写一遍视频渲染代码现在直接让OpenCode从代码里理解上下文省掉大量重复劳动。但说句实话它生成的视频风格还是偏工程化艺术感就别奢求了。适合内部评审、技术汇报这类场景拿去做宣传片还差得远。如果你有二次开发能力可以改造它的渲染参数能做出更定制化的效果。3.5 大模型微调实战LoRA、QLoRA与全参微调怎么选这一周大模型微调的话题依然很热特别是LoRA、QLoRA和全参微调的选型。我结合实战感受说一下。数据量在几万条以内LoRA基本够用训练快、显存占用低效果和全参微调的差距也没有传说中那么大。数据量上了十万条还要追求更高效果全参微调的优势才能明显体现出来。QLoRA适合显卡不够的情况。简单说它先把模型量化到4bit再加一个低秩适配器训练一张16G显存的卡就能微调7B模型。我试过用QLoRA微调7B模型效果比LoRA稍好一点因为它在较低精度下保留了更多原始参数信息。这里有一个新手很容易犯的错误微调数据质量比数量重要得多。5000条高质量数据往往能打过5万条从网上爬来的数据。这周看到好几个案例数据量够了但没做清洗去重模型不仅没变聪明反而学到了重复样本里的偏见。数据预处理这一步该花的功夫一分都不能省。4. 视频生成与多模态从可玩到可用的关键几步4.1 ComfyUI生成视频节点式工作流为什么值得学ComfyUI这周的热度主要靠视频生成带起来的。以前大家用它做图现在视频工作流也成熟了。节点式工作流的优势在于它是可视化的管道思维加载模型、编码文本、采样、解码、保存视频每个环节都是一个节点你可以随时插一个节点进去观测中间结果。我第一次跑视频工作流时的感受是它和用Stable Diffusion WebUI的体验完全不同。WebUI是黑盒点一下按钮等结果ComfyUI是把整个流程摊开给你看哪里出了问题一眼就能定位。生成视频出现鬼影、闪烁检查采样器参数就能解决大半问题。上手建议先别急着下载几十个自定义节点用官方工作流跑通一遍理解每个节点的作用再逐步替换模型和调整参数。我见过太多人一上来就装一大堆节点结果依赖冲突、版本不匹配光排查环境就花了两天。4.2 MiniMax视频生成2K分辨率在不同显卡下的实测MiniMax这周的2K视频生成能力和显卡适配问题讨论得非常多。我在自己的机器上跑了测试也在群里对比了其他显卡的数据发现不同显卡的差距主要体现在两个地方编解码速度和采样速度。显存决定你能跑多大分辨率算力决定你跑多快。实测下来8G显存是2K视频的门槛低于这个配置基本不用想。16G显存可以在2K分辨率下流畅跑但长视频依然吃紧。同一条提示词生成20秒视频旗舰卡和入门卡的耗时差距能到三倍以上而且越高分辨率的差距越明显。如果你显卡不够但还想试我有两个建议一是降低帧率从30fps降到24fps生成速度能快不少二是分段生成再拼接这个方法特别适合没有大显存的用户用16段2秒的片段拼出32秒视频比一次生成32秒稳得多。4.3 免费视频生成入口整理先别急着付费免费视频生成入口这周冒出来不少我整理了一圈发现真正能稳定用的其实就几个方向。第一类是产品官方的免费额度注册就能用但次数有限且排队严重第二类是开源项目的在线Demo免费用但功能往往不完整第三类是社区分享的ComfyUI工作流加在线算力平台效果上限高但需要一点技术基础。我建议的顺序是先用官方免费额度体验当前视频生成的上限再玩开源模型本地跑最后再考虑付费。这周有朋友直接买了一年会员结果发现模型更新太快一个季度前的收费标准就不划算了。视频生成的核心成本在算力但模型快速迭代意味着你为算力支付的价格一直在变化。免费和开源的差距主要在执行细节上。开源模型拟合度、运动幅度、镜头控制都需要自己去调但效果天花板并不低只要能接受调试成本完全可以用免费方案做出不错的结果。4.4 视频帧生成与开源模型选型视频帧生成是本周多模态方向的一个亮点。它的思路是先抽关键帧让模型生成再用帧插值模型把中间帧补上这样能大幅减少生成计算量。同样生成一段10秒视频全帧生成和关键帧加插值相比耗时能减少一半以上但流畅度会略受影响。开源模型选型方面现在分成两条路线通用视频生成模型和专用帧插值模型。我做了一个简单对比。模型类型适用场景显存要求推荐程度通用视频生成模型一次性生成完整视频高起步推荐专用帧插值模型配合关键帧生成补帧中进阶推荐通用模型适合做整段视频一次性出片帧插值模型适合已有素材做补帧和关键帧生成配合能省大量算力。我现在的组合是关键帧用生成模型出中间帧用插值模型补成片质量兼顾了效率和效果。5. 大模型部署、端侧与垂类场景真正跑起来的经验5.1 Android端集成本地GGUF手机也能跑大模型这周Android App集成GGUF格式大模型的讨论很火。GGUF是把模型量化后打包的一种格式用llama.cpp调用可以在手机上跑7B甚至13B模型。我实际验证过7B模型量化到Q4_K_M在骁龙8系处理器上能流畅对话速度虽然比不上云端但胜在完全离线、隐私安全。集成步骤不复杂先把模型文件放到应用目录再通过llama.cpp的Android版本加载最后封装一个对话接口。要注意的是内存占用。7B模型Q4量化后文件约4G加载进内存还要多出运行开销低端手机会吃紧。建议先测你目标机型的可用内存再决定模型尺寸。另一个坑是模型文件的下载和版本管理。GGUF格式本身有版本兼容性同一个模型用不同版本的工具链转换推理结果可能有细微差异。我的建议是固定工具链版本别频繁升级否则用户端出现行为不一致时很难排查。5.2 AMD显卡RX 6750 GRE跑大模型和视频生成的实测感受AMD显卡在AI圈的待遇一直比较尴尬这周RX 6750 GRE跑大模型的相关讨论让我觉得情况在变好。实测下来用llama.cpp配合Vulkan后端跑7B模型的速度已经可用了虽然比同价位N卡慢一些但没到不能接受的地步。我自己的体感是日常对话完全没问题速度比CPU快很多。视频生成方面RX 6750 GRE的表现更复杂。ComfyUI配合AMD显卡需要额外配置很多工作流默认用CUDA你得手动换成Vulkan或者DirectML后端。一旦配置好生成速度还是可以的和N卡的主要差距在兼容性和生态支持。如果你正在用A卡做AI我给三个建议一是优先选择支持Vulkan的软件框架llama.cpp、ComfyUI都可以二是不要迷信某些转换层工具稳定性和性能提升没有宣传的那么大三是显存带宽对A卡更重要6750 GRE的显存配置决定了它在AI任务上的上限。5.3 科研写作与专利辅助垂直场景里的Prompt工程科研写作和专利辅助是这周被问到最多的垂直场景。用大模型辅助写论文、处理专利文档确实能大幅提升效率但前提是方法得当。我看到不少失败案例都是直接把摘要丢给模型让它写全文结果胡编乱造这种用法在科研场景里风险极大。正确的做法是分步骤用。检索文献用大模型做语义匹配初稿用大模型生成框架润色时用大模型改句子逻辑但每个环节都必须有人工审核。专利辅助更要注意合规专利涉及技术交底书撰写、对比文件检索、权利要求书描述这些都是有严格格式和质量要求的。我推荐的做法是把大模型当成聪明的实习生让它做前期的信息整理、格式规范、语言润色让人类的专业判断做最终决策。这周看到一个朋友用大模型生成技术交底书的初稿效率提升了一倍但他还是花了大量时间核对技术细节。这才是正确的使用姿态。5.4 免费API与本地部署的取舍清单免费大模型API和本地部署这两种方案的取舍这周被讨论得很充分。我列了一张对比清单帮大家选型。对比项免费API本地部署成本免费但有频率限制一次性硬件投入隐私数据经过云端数据完全本地性能取决于服务端取决于硬件可控性受平台限制完全可控我的建议是数据敏感程度决定选择。测试功能、玩一玩用免费API没问题但涉及隐私数据、业务数据的场景还是本地部署更稳妥。本地部署的成本没想象中高16G内存加一张8G显存的显卡跑7B量化模型就足够了。一个容易被忽略的细节是API的限流策略。有些平台免费额度看着多但并发限制非常严格调用稍频繁就报错。做产品之前一定要做好限流适配否则上线后总要给用户道歉。我见过一个团队上线第一天API就被限流原因是没看文档里的每分钟调用上限。6. 这周上手时最容易踩的坑6.1 显存不够量化、卸载与投机采样三板斧显存不够是这周被问得最多的问题尤其是想本地跑大模型但显卡只有8G、6G的用户。我总结下来就三板斧。第一板斧是量化Q4_K_M是品质和占用最平衡的选择比FP16直接少一半还多的显存占用第二板斧是层卸载把一部分模型层留到CPU算牺牲一点速度换容量第三板斧是投机采样小模型草拟大模型验证实际生成速度能提升不少。这三板斧的顺序很重要。先量化解决显存容量问题再层卸载解决稍大模型跑不动的问题最后投机采样解决速度问题。我看到很多人一上来就用投机采样结果显存不够直接报错。还有一个隐藏优化是上下文窗口。别一味追求长上下文它比想象中更吃显存。如果你的任务场景不需要一万个token的上下文调小一点能省下大量显存速度也能上去。6.2 Agent报错execution terminated due to error排查这周很多人遇到“Agent execution terminated due to error”这类报错其实是Agent执行循环被中断的通用提示。报错信息本身没给出具体原因需要逐层排查。我总结了一套排查顺序先看工具调用参数是否有误再看上下文是否超过模型限制最后看是不是外部服务超时。工具调用参数错误是最常见的原因。函数定义里的参数名和模型生成的不一致或者必填参数没填Agent就会终止执行。排查方法是在Harness层加日志把模型生成的工具调用原始输出打出来一眼就能看出问题。上下文超限和外部服务超时排在后面因为它们的报错信息更明确一些。这里有个实操技巧给Agent加上自动截断机制当上下文快到限制时自动压缩旧对话能减少很多无谓的执行终止。6.3 视频生成爆内存分辨率、帧数与显存管理视频生成爆内存几乎是每个玩过的人都会遇到的。这一天最常见的场景是明明跑图没问题视频一跑就崩。原因在于视频生成要同时在显存里放多个帧的隐空间张量占用是图片生成的几倍。控制方式有三个维度分辨率、帧数、批次大小。先降分辨率到512以下测试再降帧数最后调小批次三个都压到最低还爆就只能换量化版模型或者减少模型副件了。我见过最极端的情况是8G显存硬生生跑了1080P视频方法是逐帧生成加上CPU内存辅助速度很慢但确实能跑。这里有个经验之谈视频生成不像图片生成爆内存往往发生在采样的中期所以测试时不能只看加载模型阶段的显存占用要跑完一段短视频再判断。6.4 微调完没效果的检查清单微调完模型没效果是这周另一个高频问题。我整理了一张检查清单按顺序过一遍基本能找到原因。第一检查训练损失是否真的下降。如果训练集损失都没降问题出在训练设置如果训练集降了但验证集没降问题出在过拟合。第二检查数据格式和任务是否匹配。很多模型在微调时需要特定的指令格式格式错了模型学到的都是噪音。第三检查基座模型选择。同参数量的基座模型本身能力差异很大换一个能力更强的基座往往比微调更有用。第四检查评估方式。直接问“效果变好了吗”很难得到客观结论我建议设计几个固定的测试用例微调前后跑一遍对比才看得出真实变化。这周我看到的最典型失败案例是有人微调了一个7B模型花了整整两天最后发现损失曲线一直没降排查半天是学习率设置太高直接震荡了。先小规模跑几步确认训练流程正常再全量训练能救你很多时间。这周我盯着那台跑微调的机器时最深的感受是AI大模型和Agent的进展越来越快但真正能落到你工作流里的往往不是最热门的那一个。16个新进展里找到一个解决你当下问题的就值回这一周的时间。先跑通最小的例子再考虑扩展这个节奏不管在哪个方向都不会错。