
AI 服务网格抗突发流量入口准入比盲目扩容更重要1. 先算准入不急着扩容AI 请求的成本由输入 Token、输出 Token、工具调用次数和下游等待时间共同决定。网关只按 HTTP QPS 限流会把长请求和短请求当成同一种负载。更稳妥的做法是先估算在途 Token再给不同任务设置独立队列。2. 隔离三个故障域模型网关、业务工具和向量检索应该分别设置并发上限。模型变慢时不应占满业务线程池某个工具失败时也不能让整条 Agent 链路无限重试。每层都要返回可识别的超时、限流或业务拒绝。3. 降级顺序要提前写先停止非必要工具调用再缩短可丢弃的历史上下文最后才切换模型或拒绝请求。上下文不能机械截断系统指令和当前任务约束必须保留。是否允许模型切换则由任务对质量和一致性的要求决定。4. 验证时记录什么压测应记录队列等待、首字延迟、完成率、被拒绝原因和下游饱和点。阈值来自本系统基线不从文章里的示例数字复制。把拒绝请求也计入结果才能看见系统是在承载流量还是把失败藏到了队列里。