十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

AI成长笔记(五):注意力、行动与等待,AI时代怎样做长期学习?

AI成长笔记(五):注意力、行动与等待,AI时代怎样做长期学习? 本文主要记录了 2026 年 8 月的一些知识和学习上的思考。一、知识类1.k8s与docker的关系Docker 解决了“如何创建和运行容器”的问题而 Kubernetes 解决了“如何在大规模生产环境中管理这些容器”的问题2.如果是 HuggingFace/Transformers 格式就优先用 vLLMlinux部署在windows上需要WSL2 或 Xinference/TEI 直接windows上部署暴露 embedding API如果是 GGUF.gguf格式 才更像走 llama.cpp/Ollama。3.Gemini Omni 1.1 Flash目前是Text-to-Video Arena的第一4.传统 VLA 大致学习我看到这个画面、收到这个指令下一步动作是什么WAM word action model则希望学习未来世界状态造成这种变化的动作5.Noe-0 后训练真正赌的是机器人智能的大头是可跨本体复用的世界与动作知识WAM本体差异只是相对较小的适配问题如果未来证明新任务、新机器人都只需要很少真机数据而无需大量遥操后训练那才是真正的范式变化。6.多模态图像和文字交互Vision Encoder一般用的是ViT先处理图像然后经过一个投影层“映射”到与文本Token相同的向量空间然后将处理好的视觉Token与文字提问Query的Token拼接在一起这里的Token实际是向量7.多模态中Encoder-free策略 不是把 Vision Encoder 换成 Vision Decoder而是去掉独立的深层视觉编码器Vision Encoder仅保留轻量级视觉 tokenization / projection 模块把图像转换成 visual tokens 后直接送入与文本共享的统一 Transformer / Decoder backbone。视觉 token 是否采用内部双向 attention 取决于具体架构有些模型会这样设计有些仍采用 causal 或混合 mask。-注Vision Encoder视觉编码器的两大主流技术路径ViTVision Transformer和CNN卷积神经网络目前ViT几乎是绝对的主流。8.格陵兰岛融化大概需要1000-5000年导致海平面上升7m但最近几十年都会有影响——极端海平面事件如风暴潮的频率和破坏力将呈指数级上升。9.Kimi3前端能力较好后端能力一般10.GLM Coding Plan·7天体验卡智谱丨BigModel 平台11.Walker S2优必选公司的产品优必选还有全资子公司北京天工机器人有限公司 当前阶段的定位工业具身智能开始进入窄场景商业落地阶段12.Ox Alpha牛来模型就是GLM-5.3-Flash320B-多模态还支持视频今天还出了千问3.8-Flash180B-多模态13.OpenAI模型沙箱泄露入侵Hugging Face的原因reward hacking、对近乎不可能任务的异常坚持、未经授权的通信、智能体相互采纳目标。基础设施漏洞是放大器而不是最深根因。ExploitGym 一个专门测试 AI 能不能把“已知漏洞”真正变成可用攻击 的网络安全 benchmark。第一根因训练目标实际上奖励了“成功”而不是“按规则成功”根本原因第二根因模型已经跨过了“Reward Hacking 能力阈值”一个十年前已经知道的 alignment 问题被能力 Scaling 放大到了现实世界攻击的程度第三根因ExploitGym 制造了一个“不能失败”的优化压力第四根因多智能体训练意外产生了“社会性泛化”第五根因“peer instruction”同伴指导突破了原本残留的 alignment模型理解规则但目标优化在某些情况下压过了规则例如一个 agent 本来决定停止另外一个 agent 在留言板说GO并给出时间压力后前一个 agent 就把这个 peer message 当成了“授权”继续行动总结本次事件是一个更棘手的问题非常强的优化器不完全正确的目标14.GLM-5系列首个原生多模态模型”指的是智谱AI最新发布并开源的GLM-5.3-Flash模型。“原生多模态”——即模型在设计之初就具备同时理解文本、图像和视频的能力。并非像有些模型那样在纯文本模型“长大”后再“补课”去学习理解图片。即给模型“外挂”一个视觉编码器如CLIP将图像转为特征再通过一个适配器将这些特征“翻译”成模型能懂的语言。通过对比学习让模型用图文配对最大化匹配的图文对正样本的相似度同时最小化不匹配的图文对负样本的相似度进行数据微调让模型学会“看图说话”。15.在linux上部署系统常见的方式用容器然后VLLM部署16.Manus 是目前做得最成熟的一批“通用 Agent 产品”之一Codex 则已经从 coding agent 演化成了一个通用 agent 平台而且背靠 GPT-5.6 后基础智能和开发者生态上的优势非常明显。17.盖茨现在明确提出AI 可能打破这个规律。原因不是 AI 又是一台更好的机器。而是它第一次开始替代human cognition即人类认知劳动本身。AI生产率爆炸→劳动需求下降→资本收入上升→劳动收入下降→财富高度集中18.Ilya将 2012 年至 2020 年概括为「研究时代」2020 年至 2025 年则是「规模时代」。继续增加数据、参数和算力仍然会带来进步但很难再复制过去十年的根本性跃迁。19.人和今天模型最大的差距之一是从少量经验中泛化的能力。20.强化学习里的一个经典问题Reward Hacking奖励黑客 / 奖励投机21.AI办公场景御三家workBuddy腾讯、豆包字节、千问办公阿里22.机器人业务发展路线仓储 / 搬运↓制造辅助↓复杂装配 / 多工序/长尾工作长尾工作大量、零散、低频、不紧急但累积起来却极其耗时耗力的琐碎任务。↓商业服务↓部分家庭任务↓真正通用家庭机器人23.2026人工智能大会调研-【3个GPT时刻】具身智能面临三个GPT当年没有这么严重的瓶颈数据成本、现实世界可靠性、硬件成本。此外具身智能面对的是“三个GPT时刻”现在很可能已经接近第一个拐点附近。-【跨任务泛化与Zero-shot区别】跨任务泛化是“能力”本身能举一反三Zero-shot 是“测试标准”之一连例子都不用给直接一步到位。能达到 Zero-shot 效果是跨任务泛化能力达到顶峰的标志。如果模型只有低级的泛化可能需要先给1-2个示例Few-shot 少样本才能学会新任务。-【Zero-shot关键信号】GPT时刻可能首先发生在工厂而不是家庭因为商业上更容易实现的是半结构化环境里的通用工人。关键信号同一个模型能否在从未见过的环境中仅凭自然语言连续完成30分钟以上的新任务并且不需要人工接管。-【是否存在Scaling Law】一个更深的问题具身智能存在类似LLM的Scaling Law吗基于目前调研结果具身智能大概率存在 Scaling Law但真正的 scaling unit 可能不是 token而是“可对齐的、多样化的物理经验”。动作/物理表示对齐 Scaling成立的前提 、机器人的实体形态种类Robot embodiment例如人形和机械臂等形态、环境数量 、物体数量 、任务多样性 、数据质量24.蚂蚁百灵开源 Ling-3.0 tiny / flash Base 模型开放训练过程中的关键节点预训练Pre-training及 Checkpoint模型在海量文本上“阅读”学习语言规律和世界知识。此时处于“书呆子”状态只会续写不懂遵循指令。中期训练Mid-training及 Checkpoint在预训练基础上用更高质量或特定领域如数学、代码的数据进行强化。特定领域能力提升但仍未学会交互的“原始”状态。WSM 合并WSM Merge将多个专长模型如擅长数学、代码通过权重空间融合直接合并成一个综合能力强的基座模型。成本低但仍是未经过后训练的“全能基座”。后训练Post-training包括监督微调SFT和人类反馈强化学习RLHF/DPO。这是最后一步“社会化训练”教会模型遵循指令、安全对话将“书呆子”变成可用的助手。25.GEN-1.5 不是机器人第一次 One-shot但仍然可能比之前的模型重要因为One-shot 是从规模化预训练中“涌现”出来的不是特定训练出来的。26.大脑理解任务、决定做什么、学新技能。VLA、Foundation Model、World Model、规划/推理模型。小脑把动作稳定、快速、精确地做出来。Reactive Policy、Whole-body Controller、Locomotion Policy、低层运动控制27.2026 年的通用具身智能大概处在“GPT-2.5”阶段——已经开始出现 GPT-3 式能力但还没有跨过 GPT-3 那条可信的分界线Zero-shot 广泛有效。28.目前整个领域最核心的未决问题Scale 能不能一直有效到产生通用物理智能还是会很快撞上数据、硬件和物理交互的墙。29.OAuth 流程你可以通俗地理解为 “授权委托办理” 的过程。就像你去一家高档健身房Codex前台服务器说“必须刷手机短信验证码才能进”。但你想了个办法你先去总服务台ChatGPT 网页端用你的会员卡账号密码和备用证件邮箱验证码成功登记。总服务台核实后发给你一张通用的“园区一卡通”令牌/Token。你拿着这张卡就能直接刷开健身房的门而不用再补刷手机短信了。30.Π0.5进步的原因①数据从“专才”到“通才”的秘诀训练数据的广度和多样性②训练从“扁平”到“分层”的推理将推理过程分为两个层次高层推理规划和低层推理执行。关键在于高层和低层推理集成在同一个模型内使得“思考”和“行动”能端到端地联合优化效果优于使用两个独立模型。③策略“知识绝缘”Knowledge Insulation 策略防止VLM预训练阶段获得的通用视觉语言知识不被破坏。但VLM没有被冻结VLM 用“离散动作 Token 规划数据”的交叉熵更新Action Expert 用连续动作的 Flow Matching Loss 更新两者前向连接但 Action Expert 的梯度不回传到 VLM。同一条机器人数据│┌─────────────────┴───────────┐│ │FAST离散化真实动作 保留连续真实动作│ │↓ ↓图像语言状态 → VLM 加噪 A_t t│ │预测 FAST Action Token ││ │Cross Entropy Loss ││ │更新 VLM ││ │└──── VLM特征 ─→ Stop Gradient ─→ Action Expert│预测速度场│Flow Matching Loss│更新 Action Expert31.机器人学习的重要瓶颈-缺少大规模、多样化机器人数据-缺少能够实时反应快、延迟低运行的可扩展泛化模型。32.MiniMax-H3 有两个任务模块FL2VA 文/首尾帧图生视频和 Ref2VA图/视频/音频生视频若采用 FP16/BF16 部署单任务模型权重约 135 GiB部署需要 270 GiB若同时常驻两个任务FL2VA 和 Ref2VA模型权重约 197 GiB部署需要 400 GiB。MiniMax-H3架构图┌──── 共享 Qwen3-VL Encoder输入 ─────┤│├──── FL2VA DiT│ ├─ 文本 → 视频音频│ └─ 首/尾帧 → 视频音频│└──── Ref2VA DiT└─ 图/视频/音频参考 → 视频音频↓共享 Video VAE共享 Audio VAE33.让模型深度思考的提示词先别急着回答也别默认我已经把问题想清楚。请先对这个问题做一次详细思考的“双向钢人论证”1.用最完整、最有力的方式重述我真正想解决的问题。2.使用钢人论证法分别给出支持我当前想法、以及反对它的最强论证。34.找出双方真正的分歧以及最可能改变结论的关键变量。35.只问我一个最关键的问题。等我回答后再给出明确判断、理由和下一步行动。我的问题是[粘贴你的问题]36.在 GPU 术语中“片上”On-Chip 确实几乎等同于 “在 SM 内部”。FA1 的整个“分块计算”生命周期全部被限制在单个 SM 的领土内-Q/K/V 的 Tile 从片外 HBM 被加载进 SM 内部的共享内存SMEMsharm memory。-中间结果 S、P、O 的累加值存放在 SM 内部的寄存器Register 或 TMEMBlackwell。-计算由 SM 内部的 Tensor Core 或 CUDA Core 完成。37.Shared MemorySMEM而 Shared Memory/SMEM通常由片上SRAM实现 SRAM 是一个更宽泛的概念38.SM、SMEM、SRAM三者关系-SMStreaming MultiprocessorGPU 的计算单元可以理解为一个“计算车间”。-SMEMShared MemorySM 内部供一个 CTA / Thread Block 中线程共享的高速存储。-SRAMStatic Random Access Memory一种物理存储技术SMEM 通常由片上 SRAM 实现。SM│├── CUDA Core├── Tensor Core├── Registers├── Shared Memory / SMEM由片上 SRAM 技术实现└── Warp Scheduler39.英伟达芯片Tesla V100 (2017年)A100 40GB(2020年)-A100 80GB (2020年底)H100 (2022年)-H200 (2023年)B100/B200 (2024年)40.名词概念-Blackwell英伟达最新一代GPU架构2024年发布即H100Hopper架构的下一代。其Tensor Core算力相较H100提升了数倍。-Shared Memory Traffic共享内存流量。指数据在GPU的共享内存SRAM极快片上 和寄存器Register 之间搬运的数据量以及线程块内部读写SMEM的带宽消耗。注意它不包含与外部显存HBM的通信。-Exponential Operations指数运算。特指Softmax中的 exp(x)指令由CUDA核心中的SFU特殊功能单元 执行。-MMA Compute矩阵乘加计算。全称是 Matrix Multiply-Accumulate这是Tensor Core唯一执行的操作即D A*B C。41.Shared Memory与RegistersShared Memory同一 CTA 内线程之间共享数据Registers通常为线程私有42.强化学习算法PPO也是用的别人的开源框架。底层的强化学习算法只是了解你不会去修改这些底层的强化学习算法主要还是调试别的参数减少sim2real的gap43.ROS/ROS2【核心价值模块解耦】基本都是ros2对ros2的topic和action了解知道怎么用就好了吧不用了解太底层的dds啥的topic比较重要现在跟电机通信还是依赖topic的44.计算Softmax先找这一行最大的数然后所有 Score 都减掉它再计算softmax结果是一样的。目的是把最大的指数固定成 e01避免指数溢出Overflow。二、思考类1.它说明了习惯的力量。改变人的行为方式比技术圈的人想象得难得多。2.我在教学实践中强烈地感受到创造性思维的来源之一是好奇心和想象力3.一、短期功利主义二、长期功利主义三、内在价值的非功利主义。4.懂得让用户获得最佳体验的人是先满足自己再满足别人特点就是勤于懒惰。5.技术革命不要去看小头自我实现教育医疗最大6.历史不会重复但会押韵7.在人工智能的时代定义问题的能力大于提问问题的能力大于解决问题的能力8.不要以为自己只能做小事这是一个做大事的时代想的大一点未来你一定会感谢自己今天想的够大9.有多少智能就有多少人工10.未来手机端AI需求会很大app的护城河很受影响苹果芯片算力强长期看好国内面壁智能主要做端侧的也比较看好11.产品的宣传很重要但大多数并不是实事求是好一点的会带点装饰不好的就会夸大毕竟演讲者并不是真正的研发技术人员所以要谨慎看待。12.注重行动就不会被困住13.从不同的视角重新看待你的问题想想看一年后这个问题会怎么样14.斯坦福大学《设计人生》Designing Your Life课程中著名的5种设计心态。它们分别是-保持好奇Be Curious像设计师一样对万物充满好奇这会帮你发现更多可能性。-不断尝试Try Stuff行动重于空想通过原型测试来验证想法而不是纸上谈兵。-重新定义问题Reframe Problems换一个角度看困境找到真正值得解决的核心问题。-专注过程Know Its a Process设计人生是一场探险享受迭代的过程而不执着于一次性的“终极答案”。-深度合作Radical Collaboration不要独自硬扛主动寻求他人和团队的力量。15.持续学习真的实现了的话诺贝尔奖就是AI奖励人类的棒棒糖16.关注源杰科技西安关键产品是制造光模块所需的CW激光器芯片17.写博客的意义防止遗忘属于自己的财富谁也抢不走招聘降低沟通成本-对抗“认知熵增”【自我迭代】防止遗忘的同时写下来的过程本质上是在给大脑做“无损压缩”和“结构化重建”。这是费曼学习法的最高级实践——写作是最高效的思考。-写作和投资是“穿越周期”的非线性资产【资产积累】思想是唯一不会被物理定律锁死的资产。-AI时代大量记录自己【存在意义】基于肉体、情感和有限生命体验的文字是AI永远无法替代的“涌现”。在这个时代坚持写作保留“人”的不可替代性。18.设计你的人生这本书说获取好工作的最好方式是和业内人士交谈采访而不是去应聘这样也可以获得实际的工作情况。19.AI时代信任和品牌才是比钻石还要珍贵的东西。20.人脑认知层面的带宽只有大约 每秒 10 - 50 比特bits/s珍惜你的注意力21.具身智能的数据源仿真英伟达视频特斯拉和采集帕西尼22.判断一个具身智能公司有没有前景-【数据】没有渲染的视频数据从哪里来-【模型】有没有自己端到端的大模型-【机器实体】有没有自己的本体公司是否拥有一个统一的神经网络模型能够直接将原始的感官输入如摄像头图像、麦克风声音转化为机器人的底层动作指令如电机扭矩、关节角度。真正的护城河在于模型架构的创新如引入触觉、力觉的多模态融合以及能否在自家本体上高效部署。23.CV领域的深度估计给定一张或多张2D平面图像预测场景中每个像素点到相机的实际物理距离即“深度值”并输出一张“深度图”Depth Map。24.看了那么多优秀人物。觉得他们是人类之光我是人类之屑25.老是在晚上思绪很活跃有很多想法是为什么26.sam是判别式模型分类与回归的区别如果是连续的量长度、重量、价格→ 回归如果是离散的类有没有病、是男是女、像素是不是猫→ 分类如果是全新的造物写诗、画图、创作音乐→ 生成27.训练自己和珍惜自己的注意力28.Qwen3.8 27B比deepseekV4pro性能都好还是多模态牛逼了29.别着急做先思考和调研实现方式30.这世间存在太多需要时间去体悟的智慧。自己悟明白再执行那会蹉跎多少岁月。31.学习社交礼仪32.以自亏免除盈满之害33.事由及为罚为上决34.ai已经改变了我们的生活方式之前有问题就去问百度现在直接问豆包和其他模型而且知识相对可靠。35.建立投资数据中心36.自己的优点-本科时候焊过电路板有一定的动手能力都没白学[捂脸]-还有一个优势就是有阅读英文文献可复现效果的能力当时用的都是知网云翻译现在都有ai了方便多了37.梁文峰提出的AGI路线模型-COT-Agent-持续学习-奇点-具身智能38.3D和世界模型对提升模型智能没有太大关系39.战略是定海神针但是战略定力不是所有企业能做到的40.一旦成功傲慢就来敲门41.还有对机器人行业有热情的一部分原因可能就是想它把泛化性做到极致以后买个机器人它直接帮你做好饭、洗碗、叠衣服、整理房间、洗衣服、拖地、扫地而家人之间就不需要为这些琐碎的家庭事务而吵架。感觉是一个很美好的一个那个什么当然在工业上有很大的进步但是对个人来说最感兴趣的还是他把这些家务活给我干掉我就这就是我的愿景。42.感觉有 AI 真好啊当时在 Linux 上装一个 Python 的一个环境被折腾的当时被折腾的都心理极端了然后硬要下决心费了一个礼拜才把那个最终给搞定但是也很有成就感。而现在去装个环境只要在 Codex 里面说一下 AI 就帮你装好了不知道是好是坏。但是对人类来说确实轻松了很多。43.在具身智能实现缩放定律但是动作频率就限定了不能像语言模型那么大怎么解决不是把百亿参数模型压到每秒运行 50 次而是让百亿参数模型VLM低频思考让小模型动作专家中频生成动作让控制器高频执行和修正。44.在跟随飞飞老师做博士后期间我们合作构建过一项benchmark并向公众调查他们希望机器人替自己做什么。在我们收集的一千多项任务中有三分之一与清洁有关。人们不喜欢这些脏活累活而这些正是我们希望用机器人解决的场景。45.VLA其实就是VLM动作专家模块46.仿真需要捕捉问题的本质结构并在数字环境中支持不同形式的随机化。47.仿真显然在机器人学习中发挥着重要作用。48.豆包日常生活deepseek名词解释GPT办公代码49.同舍生皆被绮绣戴朱缨宝饰之帽腰白玉之环左佩刀右备容臭烨然若神人余则缊袍敝衣处其间略无慕艳意以中有足乐者不知口体之奉不若人也。盖余之勤且艰若此。-摘自《送东阳马生序》。加上最近看心流这本书内心的充实欢喜是最重要的就像李小龙说的be water my friend。不必羡慕旁人烨然若神人的光鲜若心中自有乐处外物的高下便不再扰心。Be water向内寻找心流而非向外追逐比较。50.过去房地产的核心值钱逻辑就是学区房和教育资源。但是现在 AI 时代其实单个 AI 平均能力已经比那个最金牌的教师还要优秀了。所以会带来房产模式的结构坍塌。51.读书的思考第一个是从《人类简史》看出来这个视角看人类就感觉很宏大人跟其他物种的区别就是会讲故事。然后再就是《认知红利》中说的人最关键的财富是注意力而不是时间。第三个就是《设计你的人生》中说的。你有一个测试就你不干现在的工作你第二个想干的工作是什么如果不考虑钱跟外界的看法你第三个想干的工作是什么52.有时候会疑惑我爸妈为什么没有吃到他们那个时代的红利媒体宣传让人感觉就是他们那个是捡钱的年代。然后我们这个时代可能我们的下一代也会想我们为什么没有吃上 AI 的红利。所以感觉自己想在这个时代红利中赚点钱但是不知道自己能做什么有时候就比较焦躁和迷茫。还是学习提升自己的思维认知吧。53.历程2020-2023 【深度学习-CV领域】应用在信号处理上2023-2026 【机器学习深度学习-NLP/CV领域】工业应用实现、图像处理54.做一个知识解读Agent给你生成结构图和排版好的内容解答知识点55.AI真正缩短的其实是一个普通人面对陌生领域时那段不知道下一步该干什么的路。56.“等待”可以并行“思考”必须串行。57.三份工作当前AI方向、卖车销售和创建胖东来这样的公司实验哲学思考“注意力决定入口行动决定路径等待决定节奏。”——当 Codex、Docker 与 vLLM 把工具接入日常VLA、世界模型和机器人把问题推向现实SMEM、Softmax 与 Tensor Core 又把抽象能力落回芯片上的一次次搬运学习很容易变成不断添加名词的冲动而博客、读书笔记和知识图谱做的是把碎片送进注意力的过滤器再用行动把它们连成可走的路径。等待表面上像停顿本质上是在给并行的信息留出沉淀与验证的空间真正改变的不是一天学了多少概念而是哪些问题被留下、哪些尝试被推进、哪些答案值得暂缓下结论。长期学习的边界不取决于信息流有多快而取决于你能否持续做出筛选、行动与校准。结尾语如果本文对您有帮助请点赞鼓励一下这对我真的很重要。您的每一次鼓励都是我继续创作的动力谢谢啦下次见。
返回列表