知乎热榜今天挂着一个问题,问到了所有天天用AI的人心坎里:AI Agent的"长程任务能力",究竟是靠更强的模型,还是靠更好的记忆、规划和反馈机制?底下两派各执一词。为了搞懂他们到底在争什么,我把这几天凤凰网、腾讯新闻关于Agent Memory的报道和中科院软件所团队的论文挨个翻了一遍,越翻越觉得:这不光是工程师的争论,它直接决定你该怎么用AI。
窗口再大,也不是记忆
第一派说:模型够强就行,窗口不是越来越大吗?Claude支持200K token,Gemini已经到了100万,把背景全塞进去不就"记住"了?
凤凰网9月初一篇关于AI编程工具的报道泼了盆冷水:上下文窗口解决的是"这次对话能看多少信息",Agent Memory解决的是"上次任务学到的东西,下次还在不在"。会话一结束,窗口清零——再大也没用。
报道把AI的"失忆"归成三层:跨会话,新开一个对话,昨天辛苦讲清的项目背景要重新解释一遍;跨工具,从一个AI助手换到另一个,踩过的坑要重新教;跨压缩,对话太长触发自动压缩后,"必须兼容旧版本数据库"这类早期关键约束可能被悄悄丢掉。
这跟人记性好但没有工作笔记是一个道理:脑子再好使,不落到外部记录上,换个天、换个项目就归零。
长任务翻车,翻在你看不见的地方
第二派说:机制比模型重要。最有说服力的证据来自中科院软件所团队的一篇论文,腾讯新闻8月底报道过。
他们研究AI智能体执行多步任务——订机票、修代码、跑客服这类场景。报道里描述了一个很熟悉的翻车现场:AI帮你订票,前五步查航班、比价格、确认时间都正常,第六步突然把出发城市和目的地弄反了,接下来十几步全建立在这个错误上,越走越偏。
最诡异的是:真正出错的第六步,AI自己的"自信程度"很高,它一点都不慌;露出马脚的反而是第十五步——那时它已经开始反复重试、自我怀疑。只盯着AI说话的语气,你永远抓不住病灶。
这就是反馈机制的价值:别指望AI不犯错,而是每隔几步设一个"验收点",让第六步的错误在第七步就暴露,而不是跑到第十五步才崩盘。
还有一笔账:记性越大,越贵
为什么不能全靠"把窗口塞满"?还有一层现实原因。近期一篇技术分析说得直白:长上下文不是免费午餐。同一块GPU,在4K上下文下能服务很多并发请求;到了128K甚至更长,缓存占用会挤压批处理空间,单位输出成本显著上升。翻译成大白话:塞得越多,越贵、越慢。
所以那篇分析的结论很精彩:长上下文的本质不是无限记忆,而是决定什么值得保留——AI最需要的能力不是"看得多",而是"筛得准"。
答案到底是什么
回到知乎那个问题。我扒完资料的回答是:模型是发动机,记忆、规划、反馈是底盘、方向盘和导航。没有发动机跑不起来,但只有发动机、没有方向盘的车,跑得越快翻得越狠。现阶段各家模型能力在趋同,智能体产品拉开差距的,越来越是机制那一侧。
这套逻辑你日常用AI就能直接抄作业:
一、长对话主动"翻页"。 聊得太长时,让AI把当前结论和约束总结成一段话,新开对话贴在开头——等于手动做了跨会话记忆。
二、复杂任务先要计划。 让AI动手前,先说一句"别急着做,先列步骤计划"。计划确认了再执行,把错误从"做完才发现"提前到"做之前就拦住"。
三、每小段验收一次。 任务跑几步就抽查一次中间结果,别等全部做完再总检查——第六步的错误,第七步抓最省力。
想看这三个习惯被做成现成流程是什么样子,spark1.cn/toolchains 里有一套按场景整理好的完整工作流,看看别人怎么设节点,你就知道自己该怎么下指令了。
工具会一直变强,但懂得"怎么让AI稳定干活"的人,永远更从容一步。
💬 评论