Berkeley AI Research·· 2026-07-26AI 评分43
教大语言模型更新信念以实现高效长周期交互
Teaching LLMs to Update Beliefs for Efficient Long-Horizon Interaction
AI 导读
ABBEL 框架通过将交互摘要形式化为自然语言信念状态并引入监督评分,解决了大语言模型长周期交互中递归摘要导致的性能损耗问题。在 CollabBench 协同编程测试中,带重构评分的 ABBEL 将与全上下文模型的性能差距缩小约 50%,训练步数从 100 步减半至 50 步。同时该方案大幅削减了峰值上下文 token 长度,兼顾了推理内存效率。
来源:Berkeley AI Research · bair.berkeley.edu