控制室与人工介入

Research Control Room 是单个任务的操作与审计中心。页面通过 SSE 接收更新提示,再重新读取 Runtime 的权威视图;断线后可自动重连,也始终保留手动刷新按钮。

运行状态与顶部操作

常见状态如下:

状态 含义 常用操作
CREATED 已有契约,尚未执行 Start
RUNNING 正在研究或等待下一动作 Pause、Adjust budget、Cancel
PAUSED 用户暂停 Resume、调整条件或预算
BLOCKED 外部服务或可恢复错误阻塞 检查失败后 Resume
CAPABILITY_MISSING 契约依赖能力不可用 启用插件后 Resume
BUDGET_EXHAUSTED 某个硬限额已用完 Increase and resume
INTERRUPTED 进程退出或活动作业失联 Recover
RECOVERING 正在从已提交 checkpoint 恢复 等待完成
CANCELLING 正在停止活动执行器 等待 CANCELLED
SUCCESS 验收与额外完成条件已满足 导出科学包
FAILED 不可恢复失败 检查记录,通常新建任务
CANCELLED 用户明确取消 保留已提交记录,不可继续

按钮只在 Runtime 允许时启用。Cancel 会终止当前执行器进程组、保留已提交事件与产物,并进入 CANCELLED;它不是 FAILED。Recover 会先重放确定性 checkpoint,再继续运行。

Research Timeline

时间线由真实事件投影生成,支持四个筛选:

  • All:全部可读事件;
  • Evidence:数据集、模型、评价、指标、实验、分析、知识对象、验证和报告;
  • Decisions:科学决策、用户介入和验证请求;
  • Failures:warning/error 事件。

展开卡片可看到简短 reasoning summary、duration、metric、action/job/artifact ID 和经过清理的附加详情。这里不会展示隐藏 chain-of-thought,也不会用动画状态代替 Runtime 事实。

Inspector 九个页签

State

显示当前步骤、失败或恢复次数、生命周期原因、事件/科学对象计数、Runtime contract 版本、当前 action、Criteria progress、可信指标、活动模型、执行器、已授权能力和介入次数。

任务不在 RUNNING 时,可以点 Edit acceptance criteria。保存会产生审计 revision,并用现有指标重新评估;不会删除原条件的历史。

Knowledge

显示工作流开关和产物完成情况,以及 Evidence、Claims、Active/Tested Hypotheses、Verification plans/results。每项保留置信度、限制、版本或来源 action。详情关系可继续在 Lineage 中查看。

Verification

列出假设、目标、实验类型、参数、成功条件、已有结果、条件通过情况和版本链。状态为 PLANNED 时可以 Approve verification plan;状态为 APPROVED 时可以 Request verification。命令仍会经过契约、策略、预算和谱系校验。

Reports

列出报告产物、大小和 Artifact ID。桌面端可打开包含目录;要读取不可变 Markdown 内容或检查 figure/manifest 来源,可以进入 Lineage 选择报告节点。完整结构化 report read model 也可由 Control API 查询。

Model calls

显示每次真实模型调用的角色、provider/model、route/fallback、延迟、token、重试、schema/code repair、失败代码、父 action 和产生产物。不返回原始 prompt 或隐藏推理。

Metrics

按 metric 显示当前值与时间序列,并区分 reported/trusted。只有一个数据点时显示首个 observation;多个点时绘制曲线。

Resources

显示 wall time、CPU/GPU hours、memory、training samples、模型/Reasoner/代码生成/修复调用、token、repair attempts、jobs 和 active jobs。观测不到的值显示

Budget

对每种资源显示 used / limit、剩余比例以及是否由当前 Runtime 强制执行;另外按 provider/model 汇总输入、输出和总 token。Runtime 不猜测货币价格。

Jobs

显示 executor、命令摘要、状态、duration、exit code、failure、source/output artifact,以及 stdout/stderr 日志链接。stdout/stderr 仅用于诊断,不是科学指标通道。

Ask:只读提问

可直接问:

Which evidence supports the current decision?
Why is the run blocked?
Which metric satisfied the criterion?

回答会带 timeline、artifact、metric、job 或 model-call 引用。问答写入独立 interactions.jsonl,刷新或重启后仍可读取,但不会消耗 action budget、触发 capability、改变 Criteria 或写入 ResearchState。

Intervene:有限写操作

Intervene 只接受四类结构化指令:

  • Adjust budget:更新一项上限;Experiments 可设为 unlimited。BUDGET_EXHAUSTED 时界面会建议已经耗尽的字段,并执行“增加后继续”。
  • Add research note:增加最长 4000 字符的可见研究备注。
  • Pause run:仅 RUNNING 可用。
  • Resume run:用于 PAUSEDBLOCKEDCAPABILITY_MISSING

每次操作都由 Runtime 校验并作为 local_user 介入事件永久记录。自由文本不会被偷偷解释成命令。

修改预算的注意事项

  • 新值必须与当前值不同;从预算耗尽状态恢复时只能提高上限或移除该上限。
  • 可以在非耗尽状态收紧预算;若已经使用量超过新限额,下一次预算检查会生效。
  • 调整 max_experiments 为 unlimited 等于 JSON null,不是一个很大的数字。
  • 调预算不能授权新 capability、改变可信评价权或修改历史 metric。

导出科学包

SUCCESS 后点击 Export Scientific Package。它生成便于分享的目录,通常包含:

<name>_export/
├── README.md
├── report.md
├── model/          # 模型、inference.py、metadata(若存在)
├── examples/       # 示例输入与调用脚本
├── figures/        # 可分享图形
└── docs/           # 限制等补充说明

科学包面向人类使用,可能不含完整事件流、内部 checkpoint 和全部 provenance。需要灾难恢复时使用 Settings → Storage → Export Backup,而不是科学包。

找到 条结果:“

    没有找到匹配结果:“