跳到主要内容
问题档案 / v12026-07-26

AI 说“完成了”,我怎么确认它真的可以交付?

不要把“代理停止输出”当成交付状态。先写清完成条件,再监督执行边界,最后用分层证据把代码、运行结果、目标环境与版本对应起来。

适合:使用 AI 编写代码、搭建产品或完成技术研究的独立开发者与小团队

这页会带你完成

  1. 1理解问题
  2. 2比较解法
  3. 3查看证据
  4. 4完成核验卡
  5. 5参考 BitShovel 实践
解法路径
3
产品映射
8
开发者实践
4
证据来源
11
核验卡
5 min

01 / 理解问题

“完成”是代理的对话状态,不是你的验收结论

真正的交付至少需要四件事同时成立:交付物边界明确、验收条件可观察、变更已经运行、证据能指向正确环境与版本。缺少任何一层,都只能说“产出了候选结果”,不能说“已经交付”。

01编辑判断

AI 生成的结果只有在被执行并通过可观察检查后,才有资格从“候选输出”进入交付判断。

02已核对事实

在同一计算与执行环境中固定范围、预算与评估指标,能让连续代理实验的结果可比较,并支持保留或回退决策。

03编辑判断

关键工具调用不能只依赖模型自觉遵守格式;验证、严格约束与可重复反馈应由执行环境承担。

04来源声称

specgit 官方页面把可视化文档编辑、差异、评论、审批与 GitHub 提交和 PR 流程联系起来。

02 / 比较解法

三条路径,不是一个万能工具

先比较方法,再看产品承担其中哪一段。下面 6 份档案都只完成了部分核验,不能当作 BitShovel 已完成核心流程实测。

路径 1

先定义什么叫完成

把需求变成可评审的规格、明确的变更范围和能重复运行的验收条件;让代理在动手前就知道终点,而不是完成后再为结果找解释。

适合何时使用
需求仍然模糊、多人要共同确认范围,或错误的“完成”会带来返工与发布风险时
主要取舍
前置定义会增加几分钟准备时间;如果验收条件写成抽象口号,它只会制造新的文档负担。

specgit

部分核验

规格与评审记录

把规格、差异、评论与审批放回 commit 和 PR 语境,适合在执行前固定范围、在执行后对照变更;本站未独立测试其仓库权限与合并行为。

仍需核对

“文档留在 GitHub”不等于零数据处理。GitHub App 对获授权仓库需要 contents 与 pull requests 读写权限;实时协作状态可临时保留至最多 7 天。用户主动调用 AI 时,文档和相关评论会发送给 xAI,其 API 数据可为滥用监测保留最多 30 天;明确选择分享 AI 对话时,内容可保留最多 90 天。当前隐私页还披露 PostHog Cloud EU 的白名单、无内容产品分析:受区域与同意控制,原始事件最多保留 12 个月,运维日志最多 30 天。这些边界比旧页面或目录里“无分析”的概括更具体,也应成为采用前的审查对象。

查看来源、界面与完整边界

JetBrains Air

部分核验

计划、并行执行与人工审阅界面

官方材料把计划、多个代理任务和差异审阅放在同一工作台,可作为“先看计划、再执行、最后审阅”的实现参考;当前仍按产品方说明记录。

仍需核对

Air 仍是公开预览,实际可用模型、代理权限、运行位置和费用取决于 JetBrains AI、BYOK 或外部 agent provider;隔离 worktree 不等于代码或提示词永不离开设备。代理可能修改文件、运行命令或消耗额度,必须逐次审查 diff、权限和网络路径。官网当前应以实际下载页为准,不能把早期公告中的平台计划当作所有平台已经可用;本次也没有独立验证稳定性、隐私、速度或代理兼容性。

查看来源、界面与完整边界

路径 2

让执行可见、可停、可回退

需要看到代理在做什么、改了哪些文件、正等待什么权限,并在它越界前停止。并行数量不是核心,清楚的任务归属、状态、差异与恢复点才是。

适合何时使用
任务会修改仓库、调用外部系统、操作浏览器账号,或同时运行多个代理时
主要取舍
控制面会带来额外操作成本;自动批准虽快,却会把可见性误当成安全隔离。

JetBrains Air

部分核验

集中查看计划、任务状态与代码差异

适合参考如何把多个代理的执行与最终审阅放在一个界面;它不能替代项目自己的权限、测试和发布门禁。

仍需核对

Air 仍是公开预览,实际可用模型、代理权限、运行位置和费用取决于 JetBrains AI、BYOK 或外部 agent provider;隔离 worktree 不等于代码或提示词永不离开设备。代理可能修改文件、运行命令或消耗额度,必须逐次审查 diff、权限和网络路径。官网当前应以实际下载页为准,不能把早期公告中的平台计划当作所有平台已经可用;本次也没有独立验证稳定性、隐私、速度或代理兼容性。

查看来源、界面与完整边界

CodeAgentSwarm

部分核验

多代理任务、终端状态与差异控制面

官方页面展示任务板、终端状态、文件差异、历史与权限入口,适合研究并行代理的监督界面;Turbo Mode 仍不应被当作安全沙箱。

仍需核对

“代码和提示词不经过 CodeAgentSwarm 后端”不等于产品没有数据流。当前隐私页说明:桌面操作分析会发送到自有后端;崩溃报告会转发给 Sentry,技术栈可能包含本机文件路径;可选登录会保存 OAuth 资料、令牌、IP 和设备信息;内置帮助助手 Swarmi 会把问题和近期历史发到后端并保存问答。公开政策没有给分析、错误、支持消息一个明确删除期限,也没有说明本地完整会话历史的保存位置、加密、迁移和删除机制。Turbo Mode 文档还明确写到跳过确认时 Ask 实际等同 Allow,真正不能自动执行的动作必须设为 Deny。多代理同时修改同一仓库的冲突、保护规则覆盖率和绕过路径均未独立测试。

查看来源、界面与完整边界

AgentLimb

部分核验

在真实浏览器中观察动作与权限边界

官方仓库演示代理通过扩展与本地桥接在真实页面执行任务,可用于思考逐步确认、账号副作用和浏览器权限;BitShovel 尚未安装或实测。

仍需核对

官方页面同时出现“90% 更少 token”“85% 更少 token”和一次 Reddit 发帖任务的 85.7% 估算,不能当作通用基准;Chrome 商店当前没有评分,产品仍属早期版本。隐私页披露了 activeTab、scripting、debugger、nativeMessaging、clipboardWrite 与 <all_urls> 等权限,并允许本地代理把短 JavaScript 表达式注入页面;本地运行不等于低风险。仓库使用 Business Source License 1.1,个人使用免费,商业使用需按许可证处理。

查看来源、界面与完整边界

路径 3

用分层证据确认结果

把“代码有变化”“测试通过”“目标环境可用”“风险受控”“真实用户获益”分开记录。上一层成立,不能自动证明下一层成立。

适合何时使用
准备发布、接触真实数据、需要比较多个候选解法,或必须向别人解释为什么可以放行时
主要取舍
证据越接近真实环境,成本与风险越高;应从低风险检查开始,逐层推进,而不是一上来操作生产账号。

traceAI

部分核验

记录、评估和比较 AI 系统运行

官方开源仓库将 tracing 与 evaluation 放在同一工具链,适合补齐“代理实际运行了什么、结果如何比较”这一证据层;性能与覆盖能力仍需在自己的系统中复现。

仍需核对

公开文档明确写着默认采集完整 prompts、completions、tool arguments/results 和 error context;所有输入、输出、消息、图片、embedding 与模型参数的隐藏选项默认均为 false。即使最大化脱敏,模型名、token 数、时间、span 类型和错误消息仍会保留,错误文本也可能带出敏感内容。默认环境文档要求 Future AGI API/secret key,并把 HTTP 与 gRPC collector 指向其云端;自定义 collector 和自带 TracerProvider 虽有文档,本次未实际验证。Uneed 文案与第一张配图写 MIT,当前仓库 LICENSE、README badge 与 NOTICE 则都是 Apache-2.0;Uneed 称四语言 full parity 和 35+ frameworks,配图与 README 又写 50+,而仓库自己的矩阵存在大量空白,定价页只写 30+ libs。云端免费层当前称含每月 50 GB tracing、30 天保留,超额从每 GB 2 美元起;安全页的地区说明称美国区面向全部方案、欧盟法兰克福只面向 Enterprise,但定价卡又把 US / EU 并列展示。安全与合规页面自述 SOC 2 Type II 和 ISO 27001 已认证、HIPAA 可在 Scale / Enterprise 签 BAA,并列出 AWS、ClickHouse Cloud、Cloudflare、Stripe 以及平台侧的 HubSpot、PostHog、Sentry、Intercom;公开页没有可下载证书、审计报告或渗透测试摘要,需在真实采购中索取。开源 instrumentation、Future AGI 托管平台和其“Self-host it”主张是三个不同边界,不能互相替代。

查看来源、界面与完整边界

HeimWall

部分核验

在放行前查看 AI 生成代码的风险

官方页面将安全检查定位在 AI 代码进入交付流程之前,可补充功能测试之外的风险证据;本站未独立审计其检测覆盖率或误报率。

仍需核对

这是早期版本而不是已完成的企业控制面。官网把团队产品标为 early access,Individual 页下载文案仍写 v0.0.5、3.9 MB,下载 API 却指向 v0.0.6;发布者截图也是 v0.0.6。没有公开变更日志、安装包 SHA-256、可复现构建或源代码可用于核对二进制。功能口径也在漂移:Uneed 作者文案写 47 条手写规则,当前官网写 25+;Individual 页称预训练分类器已经本地运行,架构页又标为 architecture shipped · model pending;FAQ 写 no browser extension, no proxy,首页和架构页却列出 local TLS proxy;不同页面与截图对 Cursor、Claude Code、Copilot、Windsurf 和 ChatGPT 的覆盖也不一致。隐私边界需要更精确:个人版宣称不建账号、无后端、零网络,团队版会上行工具、类别、严重度、规则、时间、≤500 字符脱敏片段与可关联哈希;Privacy 又把 Investigation Mode 列为 raw prompt 不上传的唯一例外,并为调查记录保留合同约定的 legal hold,架构页则称服务器保存不可解析的 sealed payload。公开材料没有解释密封载荷是否含原始提示词、何时在端点生成、谁持有解密密钥、员工能否拒绝或撤销、通知失败如何处理,以及确定性哈希面对低熵秘密的猜测风险。团队事件全精度保留 90 天、冷存 180 天,之后保留组织聚合;公开子处理者页仍在准备中,Privacy 草案列出 Supabase、ClickHouse Cloud、Clerk、Vercel、Fly.io、Resend 和 Anthropic。网站公开 bundle 还包含仅内存持久化、关闭自动捕获与录屏的 PostHog 页面浏览提供器,但当前 Privacy 草案没有单独说明网站分析。合规与合同也未完成:Privacy 和 Terms 都标为 2026-04-22 draft,正式条款和 MSA 仍在律师准备中;FAQ 写 SOC 2 Type II 审计中、HIPAA eligibility 随未来 v1.5 上线,Pricing 却在 Enterprise 功能中直接列出 SOC 2 report、HIPAA eligibility、BYOK 与 on-prem,并同时在比较表把部分项目写成 soon。GDPR、签名公证、<50ms p95、95% 软提示、99.9% SLA、博客中的 3 个团队 / 312 位工程师和“不用于绩效”的合同执行均为团队自述,本次没有审计报告、测试语料、误报漏报、签名票据、客户引用或正式合同可独立核对。Team / Business 为年付每席位订阅,FAQ 还写 30 天付费 POC 需 $15K 押金;生产采购前应确认可用版本、最低席位、退款、法定实体与地址、员工监控合法基础、DPA、地区、子处理者、密钥与删除流程。

查看来源、界面与完整边界

AgentLimb

部分核验

观察目标网页上的真实动作结果

浏览器任务不能只看代理自述;页面状态、权限提示和账号副作用都是目标环境证据。AgentLimb 展示了这种工作面,但本站尚无实测结论。

仍需核对

官方页面同时出现“90% 更少 token”“85% 更少 token”和一次 Reddit 发帖任务的 85.7% 估算,不能当作通用基准;Chrome 商店当前没有评分,产品仍属早期版本。隐私页披露了 activeTab、scripting、debugger、nativeMessaging、clipboardWrite 与 <all_urls> 等权限,并允许本地代理把短 JavaScript 表达式注入页面;本地运行不等于低风险。仓库使用 Business Source License 1.1,个人使用免费,商业使用需按许可证处理。

查看来源、界面与完整边界

03 / 开发者公开实践

顶级开发者具体做了什么

这里只记录他们公开做过的动作和一手来源。BitShovel 的解释单独标注,不把个人实践包装成普遍结论。

开发者公开实践2026-07-26

Simon Willison

每次让代理接手已有项目时,先让它运行测试。

BitShovel 判断

测试不仅给最终结果打勾,也让代理先学会项目的验证方式,并更可能在修改后主动复跑。

First run the tests
开发者公开实践2026-07-26

Mitchell Hashimoto

把代理犯过的错误转成快速、自动、可重复的验证工具和项目说明。

BitShovel 判断

一次人工纠错只能修当前结果;把反馈写进 harness,才会改变下一次交付的默认质量。

My AI Adoption Journey
开发者公开实践2026-07-26

Armin Ronacher

复现工具调用失败并比较严格约束与宽松修复的结果。

BitShovel 判断

模型更强不代表每个工具调用都更可靠;关键参数和不可逆动作需要由 harness 强制约束。

Better Models: Worse Tools
开发者公开实践2026-07-26

Andrej Karpathy

固定可修改文件、时间预算与单一评估指标;每轮实验记录结果,只保留改善。

BitShovel 判断

代理可以自主迭代,但“能改什么、如何判断、何时回退”必须先成为可执行规则。

autoresearch 代理运行规则

04 / 主张与证据

每个结论站在哪一层

来源声称、已核对事实、编辑判断和未知项分开呈现;点击可以回到一手来源。

01编辑判断
置信度 高

AI 生成的结果只有在被执行并通过可观察检查后,才有资格从“候选输出”进入交付判断。

  • First run the tests
    来源:
    Simon Willison 本人博客
    类型:
    开发者一手来源
    核验:

    一手实践文章:说明自动化测试对核验 AI 代码和帮助代理理解既有项目的作用。

  • My AI Adoption Journey
    来源:
    Mitchell Hashimoto 本人网站
    类型:
    开发者一手来源
    核验:

    一手经验:把清晰任务、可验证结果与 harness engineering 作为提高代理结果质量的方法。

02已核对事实
置信度 高

在同一计算与执行环境中固定范围、预算与评估指标,能让连续代理实验的结果可比较,并支持保留或回退决策。

  • autoresearch 项目说明
    来源:
    Andrej Karpathy 官方 GitHub 仓库
    类型:
    开发者一手来源
    核验:

    项目方一手说明:限定代理修改范围、固定五分钟实验预算,并用 val_bpb 比较每轮结果。

  • autoresearch 代理运行规则
    来源:
    Andrej Karpathy 官方 GitHub 仓库
    类型:
    开发者一手来源
    核验:

    一手运行规则:先建立基线,每轮记录指标,改善则保留,持平、变差或崩溃则放弃或回退。

03编辑判断
置信度 高

关键工具调用不能只依赖模型自觉遵守格式;验证、严格约束与可重复反馈应由执行环境承担。

  • Better Models: Worse Tools
    来源:
    Armin Ronacher 本人博客
    类型:
    开发者一手来源
    核验:

    一手复现实验:记录新模型在特定工具 schema 上的失败,以及严格调用约束在其测试中的效果。

  • My AI Adoption Journey
    来源:
    Mitchell Hashimoto 本人网站
    类型:
    开发者一手来源
    核验:

    一手经验:把清晰任务、可验证结果与 harness engineering 作为提高代理结果质量的方法。

04来源声称
置信度 中

specgit 官方页面把可视化文档编辑、差异、评论、审批与 GitHub 提交和 PR 流程联系起来。

  • specgit 官方产品页面
    来源:
    specgit
    类型:
    产品方一手来源
    核验:

    产品方材料;用于确认其公开展示的工作流,不代表 BitShovel 已测试权限、保存、审批或合并。

05来源声称
置信度 中

JetBrains Air 官方材料展示计划、并行代理任务与代码审阅工作流。

  • JetBrains Air 官方产品页面
    来源:
    JetBrains Air
    类型:
    产品方一手来源
    核验:

    产品方材料;用于确认其公开展示的计划、并行任务与审阅界面,不等于独立产品实测。

06来源声称
置信度 中

CodeAgentSwarm 官方页面展示多终端状态、任务板、文件差异、历史和权限功能。

  • CodeAgentSwarm 官方产品页面
    来源:
    CodeAgentSwarm
    类型:
    产品方一手来源
    核验:

    产品方材料;用于确认公开功能与界面,不把 Turbo Mode 或权限功能视为经独立验证的安全边界。

07来源声称
置信度 中

AgentLimb 官方仓库展示 Chrome 扩展与本地 Bridge 配合,让代理在真实浏览器页面执行任务。

  • AgentLimb 官方开源仓库
    来源:
    AgentLimb
    类型:
    产品方一手来源
    核验:

    项目方 README 与演示;证明其公开的架构和演示流程,不证明 BitShovel 已安装扩展、运行 Bridge 或复现效果。

08来源声称
置信度 中

traceAI 官方开源仓库将 AI 应用的 tracing、evaluation 与监控放在同一工具链中。

  • traceAI 官方开源仓库
    来源:
    Future AGI / traceAI
    类型:
    产品方一手来源
    核验:

    项目方材料;用于确认公开的 tracing 与 evaluation 能力,不代表 BitShovel 已复现性能或覆盖范围。

09来源声称
置信度 中

HeimWall 官方页面将产品定位为 AI 生成代码进入交付前的安全检查层。

  • HeimWall 官方产品页面
    来源:
    HeimWall
    类型:
    产品方一手来源
    核验:

    产品方材料;用于确认其公开定位,不代表 BitShovel 已独立审计检测覆盖率、误报率或安全结论。

05 / 变更记录

这份问题档案如何随证据演进

公开动态记录新增来源、边界修订和已采纳补丁;时间顺序不代表质量排名。

浏览全部核验动态

06 / 轮到你核验

把阅读变成一次可复用的交付判断

填写内容只保存在当前浏览器。完成后得到“可交付、需补验证、暂停”三种结论之一。

在本设备完成

5 分钟交付核验卡

0/9 · 0%

逐项回答并留下可以复查的证据。任何关键项不清楚,都不要把“代理完成”升级成“可以交付”。

01交付物

准确写出这次交付包含哪些文件、页面、接口、文档或外部状态。

停止条件:只有一段“已完成”的对话,没有可定位的交付物。

02可观察验收条件

用别人可以重复的方式写出成功与失败分别会看到什么。

停止条件:标准仍是“看起来不错”“应该能用”或代理自己的总结。

03变更差异

确认差异只包含预期范围,并标出新增依赖、配置、迁移和删除项。

停止条件:出现无法解释的改动、生成物混入或无边界的大规模重写。

04真实执行

记录已经运行的检查、测试或任务,以及原始结果和失败项。

停止条件:代码从未运行,或只根据静态阅读推断可以工作。

05目标环境

说明结果在哪个设备、浏览器、系统、账号层级或部署环境中得到验证。

停止条件:只有本地或模拟结果,却把它描述成生产或真实用户结果。

06版本证据

把测试结果、构建产物和部署状态对应到同一个提交、版本号或内容记录。

停止条件:无法证明被测试的内容就是被交付或部署的内容。

07权限与副作用

列出账号权限、外部写入、消息发送、数据处理、费用与不可逆动作。

停止条件:代理可以使用高风险权限,但没有逐步确认、最小授权或结果审计。

08回退点

指出出错时恢复到哪里、由谁执行、需要多长时间。

停止条件:变更不可逆,或恢复方案从未在相似环境中验证。

09未知项

明确列出没有验证、只来自产品方说明、或需要真实用户数据才能回答的内容。

停止条件:未知项被省略,或用“完成”掩盖证据缺口。

证据原文只在当前浏览器保存 7 天;请勿填写密钥或个人信息,共享设备用后请重置。匿名统计会记录结论与页面、会话、来源等技术上下文,不上传原文。

结论只依据你记录的状态和证据生成,是本地自查,不代表 BitShovel 已审核证据真实性或为交付担保。

07 / BitShovel 实践

看我们如何区分“写完、上线和产生影响”

同一项工作可以在发布层完成、在产品实测层未完成、在用户影响层仍无证据。

BitShovel Practice2026-07-26

BitShovel 如何核验并发布 AgentLimb 档案

这次实践完成了双语内容核验与公开发布,但没有安装 AgentLimb、没有完成真实产品任务,也没有证明新增用户影响。三个结论分别记录,避免把“文章上线”写成“产品已验证”。

内容发布:已完成
AgentLimb 双语档案已在 BitShovel 公开页面发布,并进入公开内容分发记录。
产品实测:未完成
本次只读核验公开材料;未安装 Chrome 扩展、未启动本地 Bridge、未授权浏览器权限,也未在真实账号中执行任务。
用户影响:未完成
目前没有证据能把新增访问、外链点击、反馈或留存归因到这篇 AgentLimb 档案。
查看完整实践证据
浏览全部 BitShovel 实践