买了 Coding Plan 以后,我出现了一种新的 Token 焦虑。
所谓 Coding Plan,就是厂商推出的 Token 套餐:用户提前支付一笔费用,换取一定周期内的使用额度。额度用完了,只能等它恢复;额度没用完,也不会自动替你创造价值。

GLM Coding Plan 官方说明:它是一种面向 AI 编码的订阅套餐。截图来源:智谱 AI 官方文档。
额度少的时候,怕任务还没做完,Token 就用光了。额度多起来以后,又怕一个周期结束,钱已经付了,Token 却白白过期。于是很自然地会想:我睡觉的 8 个小时,能不能让 Agent 一直干活?
可我实际用下来,即使碰到比较复杂的任务,一周里让 Agent 集中工作的时间,通常也就 3 到 4 个小时。很多事情看起来很大,交给 Agent 搜资料、改文件、跑检查,很快就做完了。
这时连“把 Token 烧掉”都成了一件费神的事。有时我坐在电脑前,甚至想不到还可以给 AI 下什么任务。
Token 多了以后,目标不够多的问题就露出来了。想让 Agent 在自己睡觉时继续工作,先要找到一件值得长时间执行、并且有足够工作量的事。无限循环只是最后那层开关。
后来我干脆把这一步也交给 AI:先别急着执行,先帮我判断这个想法值不值得长时间做,再把它设计成一项能持续推进的任务。文章后面那段 Prompt,就是我为这个问题整理的。
这里的“一直跑下去”,指的是人在不在线时,Agent 都能找到下一步,直到任务完成或触发停止条件。
Agent 对我最大的帮助,是我休息时它还能继续工作
我一开始想把这种变化概括成“生产力大幅提升”,后来觉得还不够准确。至少有一件事很具体:Agent 把一天里可以用于执行任务的时间拉长了。
人每天总要停下来吃饭、睡觉,也会被会议和杂事打断。只要执行器支持持续运行,目标清楚,权限和环境也没有卡住,Agent 就能继续搜资料、改文件、跑测试、检查结果。8 小时、12 小时、24 小时,甚至更长,都可能成为它的工作窗口,但不是必须跑满的指标。
这种工作方式以前有很高的成本。模型贵的时候,让 Agent 多跑几十轮,意味着一笔很容易失控的费用。现在低价 API 和各种 Coding Plan 把门槛压了下来,我们可以把更多时间交给 Agent,让它多试几个方向,失败以后重新来过。
这也是 Agent 让我第一次感到“劳动力被释放”的地方。它接走了人原本必须守在电脑前、反复推动的那段执行时间。人去睡觉,任务还能往前走;第二天回来,可以直接检查阶段性结果,再做方向判断。

人离开电脑以后,Agent 仍可以继续执行已经定义清楚的任务。摄影:Luca Bravo,CC0。
长时间运行只有在任务持续产生新工作和新证据时才有价值。一个空目标跑上 24 小时,只会留下更多需要人收拾的东西。
所以我开始关心另一个问题:什么样的目标,真的能让 Agent 连续跑下去?在使用那段 Prompt 之前,陈德里的个人项目刚好可以让我们看清这种任务长什么样。
陈德里的 Agent 为什么能连续研究六天?
有个案例很能说明什么样的任务撑得起长时间运行的 Loop。
陈德里是 DeepSeek 高级研究员,也是 DeepSeek V1 至 V4、R1 等模型的核心贡献者之一。他业余做过一个名为 AutoResearch 的个人项目,希望让 Agent 像研究团队一样,提出问题、做实验、接受审稿,再根据结果继续修改。

陈德里的个人主页,他在这里列出了 DeepSeek 研究经历和代表工作。
AutoResearch 是一套工作协议。它让 Agent 把目标和进展写在聊天窗口之外,每一轮重新读取当前状态,做完后再由检查环节决定下一步。
其中一项自我博弈研究连续推进了六天。Agent 围绕 18,953 个数学推理问题,用 285B 的 DeepSeek-V4 做了 12 次强化学习训练,累计约 3,570 GPU 小时;论文经过 16 轮模拟审稿,还要查引用、补实验、改论证。
中间有一次外部引用核查发现 3 条参考文献存在问题,内部评分从 8.5 降到 8.2。最后一轮的理论证明,则由一个串行 Agent 在夜间继续推导。此前两个并行方案已经卡住,还消耗了当轮大部分 Token。
这项研究里本来就塞着大量工作:近两万个问题要处理,训练要反复运行,结果要分析,引用要核对,论文还会被打回重写。每一轮也有东西可以检查。任务自然能连续推进。
陈德里公开的最长连续运行记录是 72 小时,期间仍有 6 次来自人的方向性输入。人减少了日常操作,方向判断仍然留在手里。

AutoResearch 公开的迭代记录:每一轮都增加新的实验、文献或验证工作,而不是重复润色同一份结果。
这种工作方式就是 Agent Loop:Agent 做一步、检查一步,再根据结果继续下一步。围绕它设计状态记录、验收和停止条件,可以叫作 Loop 工程。
把这个案例换成普通人的任务,Prompt 至少要帮我们判断三件事。
什么任务值得让 Agent 长时间跑下去?
我现在只看三个问题。这三个问题也会原样进入后面的 Prompt。
一、里面真的有足够多的活吗?
一篇文章改几个段落、做一张封面、整理一份会议记录,通常很快就结束了。要求 Agent 在完成后继续“深度优化”,多半只会让它反复改措辞,把已经合格的东西越改越怪。
更适合跑一夜的任务,内部往往有一批可以逐项处理的对象。比如检查一个较大的代码项目,逐个修复能稳定复现的问题;整理几万条历史数据,找重复、缺失和异常记录;研究一个陌生行业,把来源、公司、产品和争议逐条核实。
对象越多,工作越容易拆开,Agent 才有真实的下一步。一个两小时能完成的任务,就按两小时设计。8 小时、24 小时或 72 小时,应该由任务本身决定。

长任务首先要有一批可以逐项处理的真实对象。摄影:Beatriz Pérez Moya,CC0。
二、每走一步,它能证明自己做过吗?
长任务最怕“看起来一直在忙”。Agent 写了几十页日志,结果既没有新增事实,也没有修好问题,只是在换一种说法重复自己。
证明进展的方法应该非常朴素。代码改动要通过测试;资料核实要留下原始来源;数据清理要给出处理前后的数量和抽样结果;内容工作要列出具体删改和事实依据。
只靠 Agent 给自己打分,跑得越久风险越大。外部证据会让结果后退,也会迫使它换方向。陈德里项目里那次从 8.5 降到 8.2 的引用检查,恰恰比一路涨分更有说服力。
三、我睡着以后,它知道什么时候停吗?
Agent 夜里遇到小问题,可以重试一次,或者换一个不依赖原路线的任务。碰到付款、公开发布、删除原文件、修改生产系统,或者连续几轮没有新进展,就应该停下来等人。
这会直接决定一项任务能否无人值守。一个每十分钟都要问“这个方案你选 A 还是 B”的任务,天然不适合跑一夜。一个有待办清单、能独立验证、遇到高风险动作会停下来的任务,才有机会安全地继续。
先用“任务体检 Prompt”判断它能不能持续推进
很多时候,我只有一句模糊的想法,还写不出一份可以直接执行的任务书。“任务体检 Prompt”先替我审题:它会判断这是一项很快就能交付的开发任务,还是一个会不断产生新问题和新证据的研究方向,再给出交付物、进展证据和停止条件。
你只需要在“我的方向”后面补一句话,然后把整段交给 AI:
你是我的长任务设计师。先做任务体检,不执行,也不新建任务。
我的方向是:【在这里写下一句话】。
如果现有信息还不足以判断任务类型,最多问我 3 个会改变任务类型、研究方向或证据标准的问题;这一轮只提问,不给方案,也不要自行补齐关键假设。
先把它判为三类之一:A. 有明确终点的交付或开发任务;B. 需要检索、比较、实验和复核的研究任务;C. 两者混合。
如果是 A,输出不超过 300 个中文字符,只写最终交付物、验收条件和停止条件,各不超过 3 条。满足验收就停止,不要凑成长任务。
如果是 B 或 C,输出不超过 500 个中文字符,固定为三部分:
判断:任务类型、是否适合多轮持续推进,以及一个理由。
任务卡:最终交付物、进展证据、停止条件,各不超过 3 条。
下一轮队列:列出 3 至 5 个彼此独立的研究块,每块只写一行,而且必须产生可核查的新证据。
不要承诺运行 8 小时、24 小时或任何固定时长。找不到至少 3 个独立问题或实验,就直接判为短任务。不要把研究方向改成产品功能清单,也不要为了凑时长增加范围。输出后停下来等我确认。
例如,我把自己的 3DGS 与 GIS 方向交给它:用无人机照片或视频重建 3D Gaussian Splatting 场景,再让场景带着正确的位置、方向和尺度进入 GIS。它会把这类任务判成“研究 + 实验开发”,并列出下一轮真正要验证的内容。

任务体检 Prompt 的精简输出示例:它给出任务类型、交付证据、停止条件和下一轮队列,不估算固定小时数。
同样的 Prompt 遇到“做一个极简健身记录小程序”,应该直接判为有明确终点的开发任务,完成验收就停止。它不会为了配合“24 小时”硬加功能。
这段 Prompt 只负责设计任务,不会自动开始执行。确认任务卡以后,再新建一个执行任务,把任务卡和下面这句话一起交给 Agent:
按这份已经确认的任务卡开始执行。目标是完成交付,不是跑满预计时长。每完成一块先验证,把结果写进进度记录;没有触发停止条件,就读取任务卡和进度记录,继续下一块。任务完成或触发停止条件时停下。
Agent 如果 3 小时就完成并通过验收,任务就应该在 3 小时结束。24 小时是可能出现的工作窗口,不是这段 Prompt 承诺的结果。
任务设计好以后,Agent 怎样一直跑?
任务卡解决了“做什么”,启动语让执行开始,Loop 再一轮一轮往前推。每一轮只需要完成三个动作:

AutoResearch 把目标、进度、发现、尝试过的方向和每轮日志写进外部文件;会话中断或更换以后,Agent 仍能继续工作。
- 从剩余工作里选出当前最有价值的一小步;
- 做完这一步,用测试、来源、数量或抽样结果检查;
- 把结果记下来,再决定继续、换方向,还是停止等人。
记录最好放在文件、任务清单或数据库里。这样 Agent 中途断开、上下文装满,甚至换了一个会话,也能知道前面完成了什么、哪些路已经失败。
连续几轮只有“继续研究”“进一步优化”,却拿不出新证据,Loop 就已经停滞了。此时应该换路或停止。强行多跑几十轮,只会把 Token 焦虑变成一堆难以验收的产物。
这个 Prompt 也可能告诉你:两小时就够了
这段 Prompt 的价值,也包括劝你别跑。有些想法看起来很大,判完只是一个终点清楚的开发任务,那就做完、验收、停止。两小时完成不是 Prompt 失效,反而说明 Agent 没有为了配合标题而注水。
研究任务也不保证一定能跑过夜。来源已经查完、实验结果开始重复、连续几轮拿不出新证据,任务同样应该停止。长任务需要的是足够长的真实问题队列,不是一只计时器。
我现在更愿意把 Coding Plan 看成一箱已经买好的燃料。燃料放在那里,不代表每晚都得找一段路把它开完。硬给 Agent 安排工作,最后还要花更多时间检查和收拾。

额度像已经买下的燃料,放在那里不等于每个周期都必须用光。摄影:Raysonho,CC0。
下次想让 Agent 一直跑下去,可以先把模糊想法交给设计 Prompt,看它把任务判成开发、研究还是两者混合。确认任务卡以后,再新建执行任务。只要还有真实问题和新的验证结果,Loop 就继续;任务完成、证据已经够用,或者触发停止条件,它就停下。
Token 越来越便宜以后,最稀缺的东西可能会变成一张清楚的任务清单,以及一个你确实想完成的目标。
以上就是这次的侦察。
如果对你有用,顺手点个赞 +「♥️」。
想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。
