AI 生成的结果只有在被执行并通过可观察检查后,才有资格从“候选输出”进入交付判断。
AI 说“完成了”,我怎么确认它真的可以交付?
不要把“代理停止输出”当成交付状态。先写清完成条件,再监督执行边界,最后用分层证据把代码、运行结果、目标环境与版本对应起来。
适合:使用 AI 编写代码、搭建产品或完成技术研究的独立开发者与小团队
这页会带你完成
- 1理解问题
- 2比较解法
- 3查看证据
- 4完成核验卡
- 5参考 BitShovel 实践
- 解法路径
- 3
- 产品映射
- 8
- 开发者实践
- 4
- 证据来源
- 11
- 核验卡
- 5 min
01 / 理解问题
“完成”是代理的对话状态,不是你的验收结论
真正的交付至少需要四件事同时成立:交付物边界明确、验收条件可观察、变更已经运行、证据能指向正确环境与版本。缺少任何一层,都只能说“产出了候选结果”,不能说“已经交付”。
在同一计算与执行环境中固定范围、预算与评估指标,能让连续代理实验的结果可比较,并支持保留或回退决策。
关键工具调用不能只依赖模型自觉遵守格式;验证、严格约束与可重复反馈应由执行环境承担。
specgit 官方页面把可视化文档编辑、差异、评论、审批与 GitHub 提交和 PR 流程联系起来。
02 / 比较解法
三条路径,不是一个万能工具
先比较方法,再看产品承担其中哪一段。下面 6 份档案都只完成了部分核验,不能当作 BitShovel 已完成核心流程实测。
路径 1
先定义什么叫完成
把需求变成可评审的规格、明确的变更范围和能重复运行的验收条件;让代理在动手前就知道终点,而不是完成后再为结果找解释。
- 适合何时使用
- 需求仍然模糊、多人要共同确认范围,或错误的“完成”会带来返工与发布风险时
- 主要取舍
- 前置定义会增加几分钟准备时间;如果验收条件写成抽象口号,它只会制造新的文档负担。

specgit
部分核验规格与评审记录
把规格、差异、评论与审批放回 commit 和 PR 语境,适合在执行前固定范围、在执行后对照变更;本站未独立测试其仓库权限与合并行为。
仍需核对
“文档留在 GitHub”不等于零数据处理。GitHub App 对获授权仓库需要 contents 与 pull requests 读写权限;实时协作状态可临时保留至最多 7 天。用户主动调用 AI 时,文档和相关评论会发送给 xAI,其 API 数据可为滥用监测保留最多 30 天;明确选择分享 AI 对话时,内容可保留最多 90 天。当前隐私页还披露 PostHog Cloud EU 的白名单、无内容产品分析:受区域与同意控制,原始事件最多保留 12 个月,运维日志最多 30 天。这些边界比旧页面或目录里“无分析”的概括更具体,也应成为采用前的审查对象。

JetBrains Air
部分核验计划、并行执行与人工审阅界面
官方材料把计划、多个代理任务和差异审阅放在同一工作台,可作为“先看计划、再执行、最后审阅”的实现参考;当前仍按产品方说明记录。
仍需核对
Air 仍是公开预览,实际可用模型、代理权限、运行位置和费用取决于 JetBrains AI、BYOK 或外部 agent provider;隔离 worktree 不等于代码或提示词永不离开设备。代理可能修改文件、运行命令或消耗额度,必须逐次审查 diff、权限和网络路径。官网当前应以实际下载页为准,不能把早期公告中的平台计划当作所有平台已经可用;本次也没有独立验证稳定性、隐私、速度或代理兼容性。
路径 2
让执行可见、可停、可回退
需要看到代理在做什么、改了哪些文件、正等待什么权限,并在它越界前停止。并行数量不是核心,清楚的任务归属、状态、差异与恢复点才是。
- 适合何时使用
- 任务会修改仓库、调用外部系统、操作浏览器账号,或同时运行多个代理时
- 主要取舍
- 控制面会带来额外操作成本;自动批准虽快,却会把可见性误当成安全隔离。

JetBrains Air
部分核验集中查看计划、任务状态与代码差异
适合参考如何把多个代理的执行与最终审阅放在一个界面;它不能替代项目自己的权限、测试和发布门禁。
仍需核对
Air 仍是公开预览,实际可用模型、代理权限、运行位置和费用取决于 JetBrains AI、BYOK 或外部 agent provider;隔离 worktree 不等于代码或提示词永不离开设备。代理可能修改文件、运行命令或消耗额度,必须逐次审查 diff、权限和网络路径。官网当前应以实际下载页为准,不能把早期公告中的平台计划当作所有平台已经可用;本次也没有独立验证稳定性、隐私、速度或代理兼容性。

CodeAgentSwarm
部分核验多代理任务、终端状态与差异控制面
官方页面展示任务板、终端状态、文件差异、历史与权限入口,适合研究并行代理的监督界面;Turbo Mode 仍不应被当作安全沙箱。
仍需核对
“代码和提示词不经过 CodeAgentSwarm 后端”不等于产品没有数据流。当前隐私页说明:桌面操作分析会发送到自有后端;崩溃报告会转发给 Sentry,技术栈可能包含本机文件路径;可选登录会保存 OAuth 资料、令牌、IP 和设备信息;内置帮助助手 Swarmi 会把问题和近期历史发到后端并保存问答。公开政策没有给分析、错误、支持消息一个明确删除期限,也没有说明本地完整会话历史的保存位置、加密、迁移和删除机制。Turbo Mode 文档还明确写到跳过确认时 Ask 实际等同 Allow,真正不能自动执行的动作必须设为 Deny。多代理同时修改同一仓库的冲突、保护规则覆盖率和绕过路径均未独立测试。

AgentLimb
部分核验在真实浏览器中观察动作与权限边界
官方仓库演示代理通过扩展与本地桥接在真实页面执行任务,可用于思考逐步确认、账号副作用和浏览器权限;BitShovel 尚未安装或实测。
仍需核对
官方页面同时出现“90% 更少 token”“85% 更少 token”和一次 Reddit 发帖任务的 85.7% 估算,不能当作通用基准;Chrome 商店当前没有评分,产品仍属早期版本。隐私页披露了 activeTab、scripting、debugger、nativeMessaging、clipboardWrite 与 <all_urls> 等权限,并允许本地代理把短 JavaScript 表达式注入页面;本地运行不等于低风险。仓库使用 Business Source License 1.1,个人使用免费,商业使用需按许可证处理。
路径 3
用分层证据确认结果
把“代码有变化”“测试通过”“目标环境可用”“风险受控”“真实用户获益”分开记录。上一层成立,不能自动证明下一层成立。
- 适合何时使用
- 准备发布、接触真实数据、需要比较多个候选解法,或必须向别人解释为什么可以放行时
- 主要取舍
- 证据越接近真实环境,成本与风险越高;应从低风险检查开始,逐层推进,而不是一上来操作生产账号。

traceAI
部分核验记录、评估和比较 AI 系统运行
官方开源仓库将 tracing 与 evaluation 放在同一工具链,适合补齐“代理实际运行了什么、结果如何比较”这一证据层;性能与覆盖能力仍需在自己的系统中复现。
仍需核对
公开文档明确写着默认采集完整 prompts、completions、tool arguments/results 和 error context;所有输入、输出、消息、图片、embedding 与模型参数的隐藏选项默认均为 false。即使最大化脱敏,模型名、token 数、时间、span 类型和错误消息仍会保留,错误文本也可能带出敏感内容。默认环境文档要求 Future AGI API/secret key,并把 HTTP 与 gRPC collector 指向其云端;自定义 collector 和自带 TracerProvider 虽有文档,本次未实际验证。Uneed 文案与第一张配图写 MIT,当前仓库 LICENSE、README badge 与 NOTICE 则都是 Apache-2.0;Uneed 称四语言 full parity 和 35+ frameworks,配图与 README 又写 50+,而仓库自己的矩阵存在大量空白,定价页只写 30+ libs。云端免费层当前称含每月 50 GB tracing、30 天保留,超额从每 GB 2 美元起;安全页的地区说明称美国区面向全部方案、欧盟法兰克福只面向 Enterprise,但定价卡又把 US / EU 并列展示。安全与合规页面自述 SOC 2 Type II 和 ISO 27001 已认证、HIPAA 可在 Scale / Enterprise 签 BAA,并列出 AWS、ClickHouse Cloud、Cloudflare、Stripe 以及平台侧的 HubSpot、PostHog、Sentry、Intercom;公开页没有可下载证书、审计报告或渗透测试摘要,需在真实采购中索取。开源 instrumentation、Future AGI 托管平台和其“Self-host it”主张是三个不同边界,不能互相替代。

HeimWall
部分核验在放行前查看 AI 生成代码的风险
官方页面将安全检查定位在 AI 代码进入交付流程之前,可补充功能测试之外的风险证据;本站未独立审计其检测覆盖率或误报率。
仍需核对
这是早期版本而不是已完成的企业控制面。官网把团队产品标为 early access,Individual 页下载文案仍写 v0.0.5、3.9 MB,下载 API 却指向 v0.0.6;发布者截图也是 v0.0.6。没有公开变更日志、安装包 SHA-256、可复现构建或源代码可用于核对二进制。功能口径也在漂移:Uneed 作者文案写 47 条手写规则,当前官网写 25+;Individual 页称预训练分类器已经本地运行,架构页又标为 architecture shipped · model pending;FAQ 写 no browser extension, no proxy,首页和架构页却列出 local TLS proxy;不同页面与截图对 Cursor、Claude Code、Copilot、Windsurf 和 ChatGPT 的覆盖也不一致。隐私边界需要更精确:个人版宣称不建账号、无后端、零网络,团队版会上行工具、类别、严重度、规则、时间、≤500 字符脱敏片段与可关联哈希;Privacy 又把 Investigation Mode 列为 raw prompt 不上传的唯一例外,并为调查记录保留合同约定的 legal hold,架构页则称服务器保存不可解析的 sealed payload。公开材料没有解释密封载荷是否含原始提示词、何时在端点生成、谁持有解密密钥、员工能否拒绝或撤销、通知失败如何处理,以及确定性哈希面对低熵秘密的猜测风险。团队事件全精度保留 90 天、冷存 180 天,之后保留组织聚合;公开子处理者页仍在准备中,Privacy 草案列出 Supabase、ClickHouse Cloud、Clerk、Vercel、Fly.io、Resend 和 Anthropic。网站公开 bundle 还包含仅内存持久化、关闭自动捕获与录屏的 PostHog 页面浏览提供器,但当前 Privacy 草案没有单独说明网站分析。合规与合同也未完成:Privacy 和 Terms 都标为 2026-04-22 draft,正式条款和 MSA 仍在律师准备中;FAQ 写 SOC 2 Type II 审计中、HIPAA eligibility 随未来 v1.5 上线,Pricing 却在 Enterprise 功能中直接列出 SOC 2 report、HIPAA eligibility、BYOK 与 on-prem,并同时在比较表把部分项目写成 soon。GDPR、签名公证、<50ms p95、95% 软提示、99.9% SLA、博客中的 3 个团队 / 312 位工程师和“不用于绩效”的合同执行均为团队自述,本次没有审计报告、测试语料、误报漏报、签名票据、客户引用或正式合同可独立核对。Team / Business 为年付每席位订阅,FAQ 还写 30 天付费 POC 需 $15K 押金;生产采购前应确认可用版本、最低席位、退款、法定实体与地址、员工监控合法基础、DPA、地区、子处理者、密钥与删除流程。

AgentLimb
部分核验观察目标网页上的真实动作结果
浏览器任务不能只看代理自述;页面状态、权限提示和账号副作用都是目标环境证据。AgentLimb 展示了这种工作面,但本站尚无实测结论。
仍需核对
官方页面同时出现“90% 更少 token”“85% 更少 token”和一次 Reddit 发帖任务的 85.7% 估算,不能当作通用基准;Chrome 商店当前没有评分,产品仍属早期版本。隐私页披露了 activeTab、scripting、debugger、nativeMessaging、clipboardWrite 与 <all_urls> 等权限,并允许本地代理把短 JavaScript 表达式注入页面;本地运行不等于低风险。仓库使用 Business Source License 1.1,个人使用免费,商业使用需按许可证处理。
03 / 开发者公开实践
顶级开发者具体做了什么
这里只记录他们公开做过的动作和一手来源。BitShovel 的解释单独标注,不把个人实践包装成普遍结论。
Simon Willison
每次让代理接手已有项目时,先让它运行测试。
BitShovel 判断
测试不仅给最终结果打勾,也让代理先学会项目的验证方式,并更可能在修改后主动复跑。
Mitchell Hashimoto
把代理犯过的错误转成快速、自动、可重复的验证工具和项目说明。
BitShovel 判断
一次人工纠错只能修当前结果;把反馈写进 harness,才会改变下一次交付的默认质量。
Armin Ronacher
复现工具调用失败并比较严格约束与宽松修复的结果。
BitShovel 判断
模型更强不代表每个工具调用都更可靠;关键参数和不可逆动作需要由 harness 强制约束。
Andrej Karpathy
固定可修改文件、时间预算与单一评估指标;每轮实验记录结果,只保留改善。
BitShovel 判断
代理可以自主迭代,但“能改什么、如何判断、何时回退”必须先成为可执行规则。
04 / 主张与证据
每个结论站在哪一层
来源声称、已核对事实、编辑判断和未知项分开呈现;点击可以回到一手来源。
AI 生成的结果只有在被执行并通过可观察检查后,才有资格从“候选输出”进入交付判断。
- My AI Adoption Journey
- 来源:
- Mitchell Hashimoto 本人网站
- 类型:
- 开发者一手来源
- 核验:
一手经验:把清晰任务、可验证结果与 harness engineering 作为提高代理结果质量的方法。
在同一计算与执行环境中固定范围、预算与评估指标,能让连续代理实验的结果可比较,并支持保留或回退决策。
- autoresearch 项目说明
- 来源:
- Andrej Karpathy 官方 GitHub 仓库
- 类型:
- 开发者一手来源
- 核验:
项目方一手说明:限定代理修改范围、固定五分钟实验预算,并用 val_bpb 比较每轮结果。
- autoresearch 代理运行规则
- 来源:
- Andrej Karpathy 官方 GitHub 仓库
- 类型:
- 开发者一手来源
- 核验:
一手运行规则:先建立基线,每轮记录指标,改善则保留,持平、变差或崩溃则放弃或回退。
关键工具调用不能只依赖模型自觉遵守格式;验证、严格约束与可重复反馈应由执行环境承担。
- Better Models: Worse Tools
- 来源:
- Armin Ronacher 本人博客
- 类型:
- 开发者一手来源
- 核验:
一手复现实验:记录新模型在特定工具 schema 上的失败,以及严格调用约束在其测试中的效果。
- My AI Adoption Journey
- 来源:
- Mitchell Hashimoto 本人网站
- 类型:
- 开发者一手来源
- 核验:
一手经验:把清晰任务、可验证结果与 harness engineering 作为提高代理结果质量的方法。
specgit 官方页面把可视化文档编辑、差异、评论、审批与 GitHub 提交和 PR 流程联系起来。
JetBrains Air 官方材料展示计划、并行代理任务与代码审阅工作流。
CodeAgentSwarm 官方页面展示多终端状态、任务板、文件差异、历史和权限功能。
- CodeAgentSwarm 官方产品页面
- 来源:
- CodeAgentSwarm
- 类型:
- 产品方一手来源
- 核验:
产品方材料;用于确认公开功能与界面,不把 Turbo Mode 或权限功能视为经独立验证的安全边界。
AgentLimb 官方仓库展示 Chrome 扩展与本地 Bridge 配合,让代理在真实浏览器页面执行任务。
- AgentLimb 官方开源仓库
- 来源:
- AgentLimb
- 类型:
- 产品方一手来源
- 核验:
项目方 README 与演示;证明其公开的架构和演示流程,不证明 BitShovel 已安装扩展、运行 Bridge 或复现效果。
traceAI 官方开源仓库将 AI 应用的 tracing、evaluation 与监控放在同一工具链中。
- traceAI 官方开源仓库
- 来源:
- Future AGI / traceAI
- 类型:
- 产品方一手来源
- 核验:
项目方材料;用于确认公开的 tracing 与 evaluation 能力,不代表 BitShovel 已复现性能或覆盖范围。
HeimWall 官方页面将产品定位为 AI 生成代码进入交付前的安全检查层。
05 / 变更记录
这份问题档案如何随证据演进
公开动态记录新增来源、边界修订和已采纳补丁;时间顺序不代表质量排名。
首个问题档案与 5 分钟核验路径公开
BitShovel 把“AI 说完成了,如何确认可以交付”整理为理解、比较、证据、核验卡与实践五段路径。
06 / 轮到你核验
把阅读变成一次可复用的交付判断
填写内容只保存在当前浏览器。完成后得到“可交付、需补验证、暂停”三种结论之一。
在本设备完成
5 分钟交付核验卡
逐项回答并留下可以复查的证据。任何关键项不清楚,都不要把“代理完成”升级成“可以交付”。
07 / BitShovel 实践
看我们如何区分“写完、上线和产生影响”
同一项工作可以在发布层完成、在产品实测层未完成、在用户影响层仍无证据。
BitShovel 如何核验并发布 AgentLimb 档案
这次实践完成了双语内容核验与公开发布,但没有安装 AgentLimb、没有完成真实产品任务,也没有证明新增用户影响。三个结论分别记录,避免把“文章上线”写成“产品已验证”。
- 内容发布:已完成
- AgentLimb 双语档案已在 BitShovel 公开页面发布,并进入公开内容分发记录。
- 产品实测:未完成
- 本次只读核验公开材料;未安装 Chrome 扩展、未启动本地 Bridge、未授权浏览器权限,也未在真实账号中执行任务。
- 用户影响:未完成
- 目前没有证据能把新增访问、外链点击、反馈或留存归因到这篇 AgentLimb 档案。