2026年9月2日
Codex 并没有全面放弃上下文压缩,只是把 Compaction 换成了硬切窗口 最近流传的说法称所有 Codex 都已经不再压缩上下文,这一判断并不准确。Codex 仍需把相关信息塞进固定长度的输入窗口,只是处理超长上下文的方式从生成摘要变成了直接截断。Context window 是大语言模型每次工作时的核心限制,模型必须把所有相关信……
阅读全文
2026年9月2日
代理的记忆层不会抛出错误,它返回三个看似合理的文本块,模型自信地基于它们给出回答,而一周内无人察觉。检索质量悄然漂移,所有仪表盘却始终保持绿灯,这是 LLM 记忆在生产中真正的失效模式。 生产环境中的 LLM 代理依赖记忆层来提供上下文,但这个层面的故障往往不发出任何警报。系统继续运行,用户得到回……
阅读全文
2026年9月2日
Cursor 或 Claude Code 新建会话时,每次都要重新拖入 UI 截图和架构图,直接导致 vision tokens 重复计费。 摘要显示这同时让上下文窗口被重复内容塞满,模型推理质量下降。MCP 设置正是针对这一流程的本地优化方案。 每次新会话重新上传截图的 token 消耗远超预期 开发者在使用 Cursor 或 Claude Code 时,常见操作是新建聊天窗口后一次性拖入多个 UI 截……
阅读全文
2026年9月2日
构建 LLM 应用后,你很快会发现模型并不知道你的应用数据。产品文档可能明天就更新,公司的私有 API 从未出现在训练集中,数据库里的信息也完全陌生。微调模型并非总是最佳选择,这正是 RAG 通过检索外部数据来解决的问题。 检索器先从外部知识库拉取相关片段 RAG 流程以用户查询开始。查询文本首先被送入检索器模块……
阅读全文
2026年9月2日
同一段对话里,用户说’我叫小明,家在杭州’,下一句问’我家在哪’,Agent 直接答’杭州’——这靠的不是模型记性,而是 saver 把这段会话上下文重新喂回去了。 Saver 把前轮用户自述直接注入下一轮 prompt Saver 的核心作用是把上一轮的用……
阅读全文
2026年9月2日
THE LAST TERMINAL逃脱室用WebMCP协议让AI代理直接调用网页功能,彻底跳过DOM抓取。 GitHub仓库scha54/WebMCP和Vercel演示站已上线,项目标题明确指向超越DOM的终端形态。过去几年自主浏览器代理主要通过DOM与网页交互,这种方式正成为瓶颈。 WebMCP……
阅读全文
2026年9月2日
一位程序员使用Cursor一年后,创下了62天的最长连续 streak。在办公室和个人项目中,他确认生产力确实提升,也学会了高效指挥 AI 写代码。但他总结出两条核心规则:改动前必须先彻底读懂现有代码,把需求表述得足够清晰后再让 AI 执行。 这个 streak 数据不是营销数字,而是真实工作日志的体现。作者……
阅读全文
2026年9月2日
本周三家实验室发布模型全部打价格牌:Anthropic 把缓存读取费用下调 75%,Z.ai 以 0.15 美元/百万输入 token 推出原生多模态 320B 模型,阿里巴巴则展示每 token 计算六亿参数的新架构。与此同时 AWS 和 NVIDIA 却同时锁定两百万张 GPU 新订单。 三家模型输入价格集体跳水,token 成本进入新低区间 Anthropic 将缓存读取费用……
阅读全文
2026年9月2日
倒计时21天后,GOAI决赛月将开启,120强队伍已进入全力冲刺阶段。这一数字直接指向中国AI竞赛当前最顶尖的选拔结果,也预示着接下来三周将成为算法、工程与落地能力集中检验的窗口。 120强冲刺暴露中国AI人才选拔的真实门槛 从海选到120强,GOAI的淘汰率已经把选拔门槛拉到极高位……
阅读全文
2026年9月2日
8月30日博主@白饭炒白米饭通过A20 Pro芯片焊点图反推其内部结构,推测GPU升级至7核,这一分析已被NotebookCheck及@VadimYuryev等海外账号转发。 这一推测直接指向苹果下一代移动芯片在图形单元上的具体变化。博主发布的微博内容显示,他通过观察芯片封装后的焊点……
阅读全文