模型宣称支持一百万token上下文窗口,但真实工作记忆远小于此。长上下文基准测试中,模型在远低于标称数字时就开始失效。更关键的是,超过某一临界点后,添加更多上下文会让答案质量下降而非改善。这一现象直接源于注意力机制限制,视频中的注意力成本动画已直观展示计算资源如何被无效分散。 大模……

阅读全文