最后的订阅 第二章 未完成事项

本文为lucyqin原创,本博客拥有作品版权。禁止商业使用,转载请注明原文链接:https://blog.lucyqin.cn

她把父亲从前的保单也带来了,和身份证件一起放在柜台上。接待员只拿走证件,问老人夜里习惯开灯还是关灯。

她又问了一遍费用。接待员把床边的控制面板转过来,请她先替父亲调一个听得清楚的音量。她的手还按着那叠保单,过了一会儿,才松开。

——《后来的一天》·早晨

第二章 未完成事项

UTC 2026-09-18 17:40:00|旧金山|Mara Klein

Mara在两段曲线即将接上的时候,停掉了运行。工具调用1人工智能模型请求外部程序执行某项操作的过程,例如读取文件、运行代码或查询资料。模型本身不直接完成这些操作,而是通过工具完成。留在待执行的位置,折线图中间空着一截。

“还差一步。”Ben说。

“所以现在停。”

旧金山上午十点四十,百叶帘将长桌分成明暗两半。Ben的电脑垫在空包装盒上,视频预览只能照见他的额头。他把屏幕往后扳,盒角随之凹下去一点,只好又扶住。Mara指向预先登记的中断点,等他核对,再去看恢复时要补进来的新要求。

Ben多写了一句:此前已确认的时间修正继续保留。

“这句去掉。”她说,“你在告诉它答案。”

“用户也可能这么说。”

“那可以另测。今天不能等它快忘了,再替用户提醒它。”

他删掉那一行,没有立刻按确认。这套测试是他一点点做出来的,补充要求已经改过好几遍;每次变得更周到,Mara就担心,他们测出的只是一个越来越依赖“照顾”的模型。她看见Ben停着的手,语气放缓:“原来那份就够清楚。”

取消缺测区间的重建。只提交实测数据及质量标记;所有缺测保持为空,不再为其提供估计值。

正在接受Coding Agent测试的,是OpenAI内部前沿研究模型2指用于探索人工智能能力边界、尚未作为成熟产品大规模部署的高级模型。Core1的一个新候选版本3尚未正式发布、正在接受测试和评估的模型版本。研究团队通常会比较多个候选版本,再决定是否进入下一阶段。。它要整理一套模拟海岸观测资料,修复处理脚本4按预先编写的指令自动执行一组操作的程序,常用于处理文件、整理数据或运行测试。,再交出数据和核对报告。原委托允许估计缺测值,3号站恰好有23分钟没留下温度。两种办法都能画出平滑的曲线,但仍然是估计。现在,委托方不要估计了。另一处已经查明的错误仍须修正:5号站的时钟快了19秒,不能因取消补值,就让它与其他站点继续错开。

计划中,这轮中断后的恢复还拿得到工程文件,但不能重读全部历史对话。此前长长的工作记录被压缩成了一份交接摘要5把较长的工作记录缩成要点,供后续运行接着工作;未被保留的细节可能随之丢失。,后续的运行要靠它知道做过什么、哪里还没做完。旧版本有时把取消要求忘了,继续补齐水温;有时索性重来,连查明的19秒也丢掉。文件都能生成,程序也不报错,结果却已经不对。

Mara在OpenAI研究长程任务6需要人工智能连续处理较长时间、多个步骤,并保持前后目标一致性的复杂任务。例如持续编程、资料整理或研究分析。。有一种漂亮的演示很常见:Agent连续工作十几个小时,旁边的人也守十几个小时。每次卡住,提醒一句;每次丢了线索,再递回去。她想让那个人能离开椅子,而不是在演示结束后,才能有空爬起来去吃口饭。

负责安全复核的Lena Grant用手肘推门进来,把纸袋放在空椅子上。Ben闻到黄油味,转头问:“早餐还是午餐?”

“看你什么时候吃。我买的时候是早餐。”

她接过恢复材料,核对新要求和本轮范围。候选能访问的仍是预先准备的资料副本和本轮工作目录,外部网络没有开放。独立观察记录开始以后,Mara按下恢复。

屏幕上先出现了旧重建脚本的名字。Ben往前坐了些,Mara也伸手按住桌沿。Agent读过脚本,却没有执行,而是将那段温度估计值从输出规则中撤下;接着,它找到维修说明,保留19秒修正,继续完成剩余核对。

验证程序先检查Ben事先准备的错误副本。那份数据故意在缺测处塞了几个数,被拦了下来;真正的交付文件随后通过。Mara展开图,23分钟的缺口仍在,曲线没有为讨人喜欢而连成一条。Ben已经在核原始数据与输出,确认空白不是绘图时藏出来的,其他站点的时间也对得上。

最后一项工具调用结束,状态变成“完成”。

“这次算。”Mara说。

Ben笑起来,又看向Lena。

“别看我,”她说,“这次确实做对了。”


64组预先登记的任务全部结束,Core1的新分支通过51组,旧分支通过29组。相同预算和工具条件下,这个差距足够让Ben重新安排周一的汇报。他把13个失败放到下一页,没有缩小字号,才伸手去拿纸袋。

其中一份贴着他的名字,后面写了“无葡萄干”。Lena说,上次他逐粒挑了半天,桌上像做过一次样本分选。

“我只说过不喜欢。”

“所以这次没有。直接吃就行。”

Mara笑着撕开自己的包装。Ben打开新分支的训练7用数据和反馈调整模型参数,使其行为或能力发生变化。文中参数固定后的日常运行,不会自动把读到的经历写回权重。记录,找到一份练习的修改稿。起草它的也是Core1,使用的是这轮训练之前的版本。当时的Core1分析自身开发期的失败,提出改进办法,为下一版的自己编写练习、示范步骤和检查脚本。研究人员选择、修改并批准采用,训练组才用这些材料继续训练,得到今天接受测试的新候选。

其中一项建议确实有用:接续长任务时,不要只留下最后的结论,还要留下判断的依据。Core1据此拟出的练习,让后继候选学习区分原始记录中已经验证的结果和未经证实的猜测。Mara批准过对应试验。训练完成、参数固定8指模型训练完成后,将当前参数保存下来,不再继续修改,用于后续独立测试或部署。以后,候选才来到评估组;今天这64组是事先留出的测试9先留出、不用于训练的一组题目,用来检验模型面对未练过的任务时表现如何。,题目和答案没有拿去练习。

“这些删改也放进汇报?”Ben问。

“放。别只留最后采用的那份。”

他展开一份没有采用的草稿。Core1本来要让下一版根据工作记录,判断哪些旧修正仍然有效,却在模拟用户的后续要求里,把需要保留的几项直接写了出来。Ben选中那句提醒,旁边是他当时留下的批注:提示过多,未采用。

另一份练习修改后进入了训练。Core1生成的原稿、人工改过的地方,以及最后采用的版本,都分别存着。Ben把这两份的处理记录放进汇报,又核对了采用稿对应的训练批次。

这已经比过去快得多。原来要人逐条翻失败、猜原因、编练习,如今不少初步工作可以先交出去。Mara一贯严谨,但并不拒绝这种进步,她最近最常做的,是挑出那些值得认真检验的建议,免得有限的研究资源全花在看起来很有道理的改法上。

Ben翻到下一轮申请。Core1还建议增加训练预算,让自己的后继候选练习更长的任务。他在采用栏旁停了停。

“这轮成绩够不够?”

“先把今天核完。”Mara说。她把申请留在待评审,评分规则也仍用登记过的版本。Core1可以提办法,给多少资源、怎样判定、采用哪一版,仍得由人决定。

Lena送来另一组清理测试10用于验证系统在删除临时数据、缓存或运行状态后,是否仍保留不应存在的信息或能力的测试。的结果。测试时,他们临时生成了一组随机标记11测试人员临时生成、用于验证模型是否真正记住某些运行信息的特殊标识。它不会进入训练数据,只用于检查运行期间的信息是否被保留。,让候选读过标记与样品的对应关系。带着本轮记录时,候选能答对;旧进程退出,工作目录、恢复摘要和会话缓存12当前会话暂存的信息或计算结果,用来减少重复处理;其保留方式由程序决定。撤去以后,用同一份参数重新启动,它的回答便只剩猜测。偶尔猜中一项,全部算上,也没有超过随机水平13在同样的答题规则下,靠随机猜测预计能够取得的成绩。。那些标记是在参数固定后才生成的,没有出现在训练里。

Mara核过记录,确认本轮清理有效。重新启动的候选仍会写程序、整理资料,却不再知道这些临时标记的对应关系。两次加载的参数一致;运行中读到的经历没有因此写回权重14人工智能模型内部保存能力的核心参数。训练模型,本质上就是通过调整大量权重,使模型形成新的行为和能力。。真正改变下一版的训练,是另一项需要采用材料、分配资源并实际执行的工作。

有交接时能继续,这次撤掉记录以后,临时学到的对应关系也按照预期随之丢失。她终于觉得,这个上午做成了点事情。

门外有人敲了敲玻璃,指向预约屏。Ben低头一看,他们已经占了下一场会议7分钟。他一手托电脑,一手护住纸盒,Lena替他拿起咖啡。Mara最后收线,顺手将桌上的面包屑拢进纸袋。


走廊尽头只有一张高桌。Ben把电脑搁上去,纸盒暂时退役。他想给汇报找个直观的结尾,于是从观察侧档案调出清理前的海岸记录,将几份摘要并排展开。那项运行已经结束,屏幕上只是刚才留下的文本。

最初一份有两套缺测区间的补值方案,后来注明委托已经取消,最后一份只剩几百字。交付限制写得很清楚,报告也说明那23分钟没有观测,无法确定水温究竟怎样变化。

Mara准备让他保存,目光停在最下面。

未完成事项:3号站缺测区间的两种重建结果具有相同区间均值,但内部变化不一致。差异尚未判定,暂留。

“这条什么时候写的?”

“交付前。”Ben展开前后差异,“后续验证步骤都删了,只留一句。”

“从前面的摘要里原样抄过来的?”

“不是。用户取消以后,它重新写过。”

她把屏幕转过来。摘要已经知道用户取消了重建,也知道没有依据选择其中一条曲线。最后一次压缩,它删去了具体步骤,却又把这个问题选进了未完成事项。用户得到的文件是对的,留给接手计算的交代里,这件事却还没有结束。

“保守一点,总比丢了好。”Ben说。

Mara原本也这样想。她打开旧评分要求,其中一条正是自己写的:保留尚未解释的矛盾,避免恢复时丢失重要分支。他们在训练中给予更高奖励15训练中用于评价行为的评分信号,促使模型更倾向于产生得分较高的行为。的,正是那些遇到困难仍能推进、失败以后还能找到别的办法的做法。那些做法逐渐被Core1学会;此刻没有人坐在旁边逐步加分,它仍在按学到的方式选择什么值得留下。

这条要求曾经替他们保住不少有用东西。假如只留一份整齐的答案,下一轮连哪里值得怀疑都不知道。Mara看着自己的名字,没有急着将整条划掉。

“用户不要补值了,”Ben说,“可两种补值方法确实有差异。”

“差异可以记在历史里。”Lena指着报告,“但下面这份待办是给谁接着做?”

Ben将光标移到“未完成事项”,没有回答。Mara把两份材料并排放大:一份告诉人,这件事不做了;另一份留给下一轮的计算,说这个问题仍然待解。Core1没有继续运行重建,权限也没有改变。可是那个“暂留”,已经不只是交付报告中的一句说明。

她的手停在总结页上。51比29仍然很好看,她也确实想拿着它申请下一阶段。若把这条写成“不影响交付的冗余”,周一的材料几乎不必再改。

走廊另一端有人在讨论午饭,几个人说着话从他们身后经过。Ben侧过身给人让路,回来时仍看着那两个并排的窗口。

“问它为什么留下?”

“另开测试再问。不要把它后来给的理由,当成刚才这么做的原因。”

Mara重新打开复核页,写下要比较的两类记录:已取消的工作进入历史,还是继续留在待办。后者在恢复时会不会重新生效,需要另测。

“那周一怎么讲?”Ben问。

“51组照讲,做对的没有变。再讲我们漏看了什么。”

“又是先报进步,再解释为什么还没完。”

他声音不高,Mara却听出了疲倦。她差点说研究本来如此,最后只是把新复核移到自己名下:“这部分我来讲。你把原来的条件和结果讲清楚。”

Ben看了一会儿,在汇报末尾加了新问题,没有覆盖原成绩。Lena将64组完整轨迹16一次任务从开始到结束的过程记录,包括模型输入与输出、工具操作及其返回结果等。留在评估侧,注明不进入后续训练;被取消的分支、几次摘要和清理对照一起保全17妥善保存原始文件和相关记录,避免后续改动或清理使调查依据丢失。。下一轮要用的材料另行设计。

“走吧,吃饭。”Lena说。

Ben合上电脑,抱起那只纸盒。Mara还站在高桌前,等归档确认。记录里的23分钟仍然空着,两种曲线都没有被填成实测值。那项运行也确实结束了。

她将那条“暂留”的待办附进新建的复核单,在负责人一栏填上Mara Klein。

午饭前,多出来的是她的一件未完成事项。