控制室与人工介入
Research Control Room 是单个任务的操作与审计中心。页面通过 SSE 接收更新提示,再重新读取 Runtime 的权威视图;断线后可自动重连,也始终保留手动刷新按钮。
运行状态与顶部操作
常见状态如下:
| 状态 | 含义 | 常用操作 |
|---|---|---|
CREATED |
已有契约,尚未执行 | Start |
RUNNING |
正在研究或等待下一动作 | Pause、Adjust budget、Cancel |
PAUSED |
用户暂停 | Resume、调整条件或预算 |
BLOCKED |
外部服务或可恢复错误阻塞 | 检查失败后 Resume |
CAPABILITY_MISSING |
契约依赖能力不可用 | 启用插件后 Resume |
BUDGET_EXHAUSTED |
某个硬限额已用完 | Increase and resume |
INTERRUPTED |
进程退出或活动作业失联 | Recover |
RECOVERING |
正在从已提交 checkpoint 恢复 | 等待完成 |
CANCELLING |
正在停止活动执行器 | 等待 CANCELLED |
SUCCESS |
验收与额外完成条件已满足 | 导出科学包 |
FAILED |
不可恢复失败 | 检查记录,通常新建任务 |
CANCELLED |
用户明确取消 | 保留已提交记录,不可继续 |
按钮只在 Runtime 允许时启用。Cancel 会终止当前执行器进程组、保留已提交事件与产物,并进入 CANCELLED;它不是 FAILED。Recover 会先重放确定性 checkpoint,再继续运行。
Research Timeline
时间线由真实事件投影生成,支持四个筛选:
- All:全部可读事件;
- Evidence:数据集、模型、评价、指标、实验、分析、知识对象、验证和报告;
- Decisions:科学决策、用户介入和验证请求;
- Failures:warning/error 事件。
展开卡片可看到简短 reasoning summary、duration、metric、action/job/artifact ID 和经过清理的附加详情。这里不会展示隐藏 chain-of-thought,也不会用动画状态代替 Runtime 事实。
Inspector 九个页签
State
显示当前步骤、失败或恢复次数、生命周期原因、事件/科学对象计数、Runtime contract 版本、当前 action、Criteria progress、可信指标、活动模型、执行器、已授权能力和介入次数。
任务不在 RUNNING 时,可以点 Edit acceptance criteria。保存会产生审计 revision,并用现有指标重新评估;不会删除原条件的历史。
Knowledge
显示工作流开关和产物完成情况,以及 Evidence、Claims、Active/Tested Hypotheses、Verification plans/results。每项保留置信度、限制、版本或来源 action。详情关系可继续在 Lineage 中查看。
Verification
列出假设、目标、实验类型、参数、成功条件、已有结果、条件通过情况和版本链。状态为 PLANNED 时可以 Approve verification plan;状态为 APPROVED 时可以 Request verification。命令仍会经过契约、策略、预算和谱系校验。
Reports
列出报告产物、大小和 Artifact ID。桌面端可打开包含目录;要读取不可变 Markdown 内容或检查 figure/manifest 来源,可以进入 Lineage 选择报告节点。完整结构化 report read model 也可由 Control API 查询。
Model calls
显示每次真实模型调用的角色、provider/model、route/fallback、延迟、token、重试、schema/code repair、失败代码、父 action 和产生产物。不返回原始 prompt 或隐藏推理。
Metrics
按 metric 显示当前值与时间序列,并区分 reported/trusted。只有一个数据点时显示首个 observation;多个点时绘制曲线。
Resources
显示 wall time、CPU/GPU hours、memory、training samples、模型/Reasoner/代码生成/修复调用、token、repair attempts、jobs 和 active jobs。观测不到的值显示 —。
Budget
对每种资源显示 used / limit、剩余比例以及是否由当前 Runtime 强制执行;另外按 provider/model 汇总输入、输出和总 token。Runtime 不猜测货币价格。
Jobs
显示 executor、命令摘要、状态、duration、exit code、failure、source/output artifact,以及 stdout/stderr 日志链接。stdout/stderr 仅用于诊断,不是科学指标通道。
Ask:只读提问
可直接问:
Which evidence supports the current decision?
Why is the run blocked?
Which metric satisfied the criterion?
回答会带 timeline、artifact、metric、job 或 model-call 引用。问答写入独立 interactions.jsonl,刷新或重启后仍可读取,但不会消耗 action budget、触发 capability、改变 Criteria 或写入 ResearchState。
Intervene:有限写操作
Intervene 只接受四类结构化指令:
- Adjust budget:更新一项上限;Experiments 可设为 unlimited。
BUDGET_EXHAUSTED时界面会建议已经耗尽的字段,并执行“增加后继续”。 - Add research note:增加最长 4000 字符的可见研究备注。
- Pause run:仅
RUNNING可用。 - Resume run:用于
PAUSED、BLOCKED或CAPABILITY_MISSING。
每次操作都由 Runtime 校验并作为 local_user 介入事件永久记录。自由文本不会被偷偷解释成命令。
修改预算的注意事项
- 新值必须与当前值不同;从预算耗尽状态恢复时只能提高上限或移除该上限。
- 可以在非耗尽状态收紧预算;若已经使用量超过新限额,下一次预算检查会生效。
- 调整
max_experiments为 unlimited 等于 JSONnull,不是一个很大的数字。 - 调预算不能授权新 capability、改变可信评价权或修改历史 metric。
导出科学包
SUCCESS 后点击 Export Scientific Package。它生成便于分享的目录,通常包含:
<name>_export/
├── README.md
├── report.md
├── model/ # 模型、inference.py、metadata(若存在)
├── examples/ # 示例输入与调用脚本
├── figures/ # 可分享图形
└── docs/ # 限制等补充说明
科学包面向人类使用,可能不含完整事件流、内部 checkpoint 和全部 provenance。需要灾难恢复时使用 Settings → Storage → Export Backup,而不是科学包。