← 返回我的文章

S01 / ARTICLE FILE

想让 Agent 连续工作 24 小时?先用这个 Prompt 设计一个能在 Loop 里持续推进的长任务

硅基斥候S01

把长任务拆成可持续推进、可恢复、可检查的 Agent Loop,并给出可复用的任务体检 Prompt。

想让 Agent 连续工作 24 小时?先用这个 Prompt 设计一个能在 Loop 里持续推进的长任务

买了 Coding Plan 以后,我出现了一种新的 Token 焦虑。

所谓 Coding Plan,就是厂商推出的 Token 套餐:用户提前支付一笔费用,换取一定周期内的使用额度。额度用完了,只能等它恢复;额度没用完,也不会自动替你创造价值。

GLM Coding Plan 官方套餐概览截图

GLM Coding Plan 官方说明:它是一种面向 AI 编码的订阅套餐。截图来源:智谱 AI 官方文档。

额度少的时候,怕任务还没做完,Token 就用光了。额度多起来以后,又怕一个周期结束,钱已经付了,Token 却白白过期。于是很自然地会想:我睡觉的 8 个小时,能不能让 Agent 一直干活?

可我实际用下来,即使碰到比较复杂的任务,一周里让 Agent 集中工作的时间,通常也就 3 到 4 个小时。很多事情看起来很大,交给 Agent 搜资料、改文件、跑检查,很快就做完了。

这时连“把 Token 烧掉”都成了一件费神的事。有时我坐在电脑前,甚至想不到还可以给 AI 下什么任务。

Token 多了以后,目标不够多的问题就露出来了。想让 Agent 在自己睡觉时继续工作,先要找到一件值得长时间执行、并且有足够工作量的事。无限循环只是最后那层开关。

后来我干脆把这一步也交给 AI:先别急着执行,先帮我判断这个想法值不值得长时间做,再把它设计成一项能持续推进的任务。文章后面那段 Prompt,就是我为这个问题整理的。

这里的“一直跑下去”,指的是人在不在线时,Agent 都能找到下一步,直到任务完成或触发停止条件。

Agent 对我最大的帮助,是我休息时它还能继续工作

我一开始想把这种变化概括成“生产力大幅提升”,后来觉得还不够准确。至少有一件事很具体:Agent 把一天里可以用于执行任务的时间拉长了。

人每天总要停下来吃饭、睡觉,也会被会议和杂事打断。只要执行器支持持续运行,目标清楚,权限和环境也没有卡住,Agent 就能继续搜资料、改文件、跑测试、检查结果。8 小时、12 小时、24 小时,甚至更长,都可能成为它的工作窗口,但不是必须跑满的指标。

这种工作方式以前有很高的成本。模型贵的时候,让 Agent 多跑几十轮,意味着一笔很容易失控的费用。现在低价 API 和各种 Coding Plan 把门槛压了下来,我们可以把更多时间交给 Agent,让它多试几个方向,失败以后重新来过。

这也是 Agent 让我第一次感到“劳动力被释放”的地方。它接走了人原本必须守在电脑前、反复推动的那段执行时间。人去睡觉,任务还能往前走;第二天回来,可以直接检查阶段性结果,再做方向判断。

空椅子和办公桌上的笔记本电脑实拍

人离开电脑以后,Agent 仍可以继续执行已经定义清楚的任务。摄影:Luca Bravo,CC0。

长时间运行只有在任务持续产生新工作和新证据时才有价值。一个空目标跑上 24 小时,只会留下更多需要人收拾的东西。

所以我开始关心另一个问题:什么样的目标,真的能让 Agent 连续跑下去?在使用那段 Prompt 之前,陈德里的个人项目刚好可以让我们看清这种任务长什么样。

陈德里的 Agent 为什么能连续研究六天?

有个案例很能说明什么样的任务撑得起长时间运行的 Loop。

陈德里是 DeepSeek 高级研究员,也是 DeepSeek V1 至 V4、R1 等模型的核心贡献者之一。他业余做过一个名为 AutoResearch 的个人项目,希望让 Agent 像研究团队一样,提出问题、做实验、接受审稿,再根据结果继续修改。

陈德里个人主页截图

陈德里的个人主页,他在这里列出了 DeepSeek 研究经历和代表工作。

AutoResearch 是一套工作协议。它让 Agent 把目标和进展写在聊天窗口之外,每一轮重新读取当前状态,做完后再由检查环节决定下一步。

其中一项自我博弈研究连续推进了六天。Agent 围绕 18,953 个数学推理问题,用 285B 的 DeepSeek-V4 做了 12 次强化学习训练,累计约 3,570 GPU 小时;论文经过 16 轮模拟审稿,还要查引用、补实验、改论证。

中间有一次外部引用核查发现 3 条参考文献存在问题,内部评分从 8.5 降到 8.2。最后一轮的理论证明,则由一个串行 Agent 在夜间继续推导。此前两个并行方案已经卡住,还消耗了当轮大部分 Token。

这项研究里本来就塞着大量工作:近两万个问题要处理,训练要反复运行,结果要分析,引用要核对,论文还会被打回重写。每一轮也有东西可以检查。任务自然能连续推进。

陈德里公开的最长连续运行记录是 72 小时,期间仍有 6 次来自人的方向性输入。人减少了日常操作,方向判断仍然留在手里。

AutoResearch 多轮自主迭代记录截图

AutoResearch 公开的迭代记录:每一轮都增加新的实验、文献或验证工作,而不是重复润色同一份结果。

这种工作方式就是 Agent Loop:Agent 做一步、检查一步,再根据结果继续下一步。围绕它设计状态记录、验收和停止条件,可以叫作 Loop 工程。

把这个案例换成普通人的任务,Prompt 至少要帮我们判断三件事。

什么任务值得让 Agent 长时间跑下去?

我现在只看三个问题。这三个问题也会原样进入后面的 Prompt。

一、里面真的有足够多的活吗?

一篇文章改几个段落、做一张封面、整理一份会议记录,通常很快就结束了。要求 Agent 在完成后继续“深度优化”,多半只会让它反复改措辞,把已经合格的东西越改越怪。

更适合跑一夜的任务,内部往往有一批可以逐项处理的对象。比如检查一个较大的代码项目,逐个修复能稳定复现的问题;整理几万条历史数据,找重复、缺失和异常记录;研究一个陌生行业,把来源、公司、产品和争议逐条核实。

对象越多,工作越容易拆开,Agent 才有真实的下一步。一个两小时能完成的任务,就按两小时设计。8 小时、24 小时或 72 小时,应该由任务本身决定。

一叠厚文件夹和资料实拍

长任务首先要有一批可以逐项处理的真实对象。摄影:Beatriz Pérez Moya,CC0。

二、每走一步,它能证明自己做过吗?

长任务最怕“看起来一直在忙”。Agent 写了几十页日志,结果既没有新增事实,也没有修好问题,只是在换一种说法重复自己。

证明进展的方法应该非常朴素。代码改动要通过测试;资料核实要留下原始来源;数据清理要给出处理前后的数量和抽样结果;内容工作要列出具体删改和事实依据。

只靠 Agent 给自己打分,跑得越久风险越大。外部证据会让结果后退,也会迫使它换方向。陈德里项目里那次从 8.5 降到 8.2 的引用检查,恰恰比一路涨分更有说服力。

三、我睡着以后,它知道什么时候停吗?

Agent 夜里遇到小问题,可以重试一次,或者换一个不依赖原路线的任务。碰到付款、公开发布、删除原文件、修改生产系统,或者连续几轮没有新进展,就应该停下来等人。

这会直接决定一项任务能否无人值守。一个每十分钟都要问“这个方案你选 A 还是 B”的任务,天然不适合跑一夜。一个有待办清单、能独立验证、遇到高风险动作会停下来的任务,才有机会安全地继续。

先用“任务体检 Prompt”判断它能不能持续推进

很多时候,我只有一句模糊的想法,还写不出一份可以直接执行的任务书。“任务体检 Prompt”先替我审题:它会判断这是一项很快就能交付的开发任务,还是一个会不断产生新问题和新证据的研究方向,再给出交付物、进展证据和停止条件。

你只需要在“我的方向”后面补一句话,然后把整段交给 AI:

你是我的长任务设计师。先做任务体检,不执行,也不新建任务。

我的方向是:【在这里写下一句话】。

如果现有信息还不足以判断任务类型,最多问我 3 个会改变任务类型、研究方向或证据标准的问题;这一轮只提问,不给方案,也不要自行补齐关键假设。

先把它判为三类之一:A. 有明确终点的交付或开发任务;B. 需要检索、比较、实验和复核的研究任务;C. 两者混合。

如果是 A,输出不超过 300 个中文字符,只写最终交付物、验收条件和停止条件,各不超过 3 条。满足验收就停止,不要凑成长任务。

如果是 B 或 C,输出不超过 500 个中文字符,固定为三部分:

  1. 判断:任务类型、是否适合多轮持续推进,以及一个理由。

  2. 任务卡:最终交付物、进展证据、停止条件,各不超过 3 条。

  3. 下一轮队列:列出 3 至 5 个彼此独立的研究块,每块只写一行,而且必须产生可核查的新证据。

不要承诺运行 8 小时、24 小时或任何固定时长。找不到至少 3 个独立问题或实验,就直接判为短任务。不要把研究方向改成产品功能清单,也不要为了凑时长增加范围。输出后停下来等我确认。

例如,我把自己的 3DGS 与 GIS 方向交给它:用无人机照片或视频重建 3D Gaussian Splatting 场景,再让场景带着正确的位置、方向和尺度进入 GIS。它会把这类任务判成“研究 + 实验开发”,并列出下一轮真正要验证的内容。

任务体检 Prompt 对 3DGS 与 GIS 方向的输出示例

任务体检 Prompt 的精简输出示例:它给出任务类型、交付证据、停止条件和下一轮队列,不估算固定小时数。

同样的 Prompt 遇到“做一个极简健身记录小程序”,应该直接判为有明确终点的开发任务,完成验收就停止。它不会为了配合“24 小时”硬加功能。

这段 Prompt 只负责设计任务,不会自动开始执行。确认任务卡以后,再新建一个执行任务,把任务卡和下面这句话一起交给 Agent:

按这份已经确认的任务卡开始执行。目标是完成交付,不是跑满预计时长。每完成一块先验证,把结果写进进度记录;没有触发停止条件,就读取任务卡和进度记录,继续下一块。任务完成或触发停止条件时停下。

Agent 如果 3 小时就完成并通过验收,任务就应该在 3 小时结束。24 小时是可能出现的工作窗口,不是这段 Prompt 承诺的结果。

任务设计好以后,Agent 怎样一直跑?

任务卡解决了“做什么”,启动语让执行开始,Loop 再一轮一轮往前推。每一轮只需要完成三个动作:

AutoResearch 状态文件系统官方截图

AutoResearch 把目标、进度、发现、尝试过的方向和每轮日志写进外部文件;会话中断或更换以后,Agent 仍能继续工作。

  1. 从剩余工作里选出当前最有价值的一小步;
  2. 做完这一步,用测试、来源、数量或抽样结果检查;
  3. 把结果记下来,再决定继续、换方向,还是停止等人。

记录最好放在文件、任务清单或数据库里。这样 Agent 中途断开、上下文装满,甚至换了一个会话,也能知道前面完成了什么、哪些路已经失败。

连续几轮只有“继续研究”“进一步优化”,却拿不出新证据,Loop 就已经停滞了。此时应该换路或停止。强行多跑几十轮,只会把 Token 焦虑变成一堆难以验收的产物。

这个 Prompt 也可能告诉你:两小时就够了

这段 Prompt 的价值,也包括劝你别跑。有些想法看起来很大,判完只是一个终点清楚的开发任务,那就做完、验收、停止。两小时完成不是 Prompt 失效,反而说明 Agent 没有为了配合标题而注水。

研究任务也不保证一定能跑过夜。来源已经查完、实验结果开始重复、连续几轮拿不出新证据,任务同样应该停止。长任务需要的是足够长的真实问题队列,不是一只计时器。

我现在更愿意把 Coding Plan 看成一箱已经买好的燃料。燃料放在那里,不代表每晚都得找一段路把它开完。硬给 Agent 安排工作,最后还要花更多时间检查和收拾。

真实加油机照片

额度像已经买下的燃料,放在那里不等于每个周期都必须用光。摄影:Raysonho,CC0。

下次想让 Agent 一直跑下去,可以先把模糊想法交给设计 Prompt,看它把任务判成开发、研究还是两者混合。确认任务卡以后,再新建执行任务。只要还有真实问题和新的验证结果,Loop 就继续;任务完成、证据已经够用,或者触发停止条件,它就停下。

Token 越来越便宜以后,最稀缺的东西可能会变成一张清楚的任务清单,以及一个你确实想完成的目标。


以上就是这次的侦察。

如果对你有用,顺手点个赞 +「♥️」。

想第一时间收到前线情报,关注「硅基斥候S01」。我们,下次侦察见。