历史 Dig · 2026 年 7 月—8 月

这个任务该在编辑器、终端还是办公 Agent 里完成?

这些名字看起来都像“Agent”,实际入口却不同:编辑器内改代码、终端接手仓库、多任务工作台和办公文件操作需要的上下文与权限并不一样。

首次记录 · 最后一次公开修订 · 修订 3
CodexClaude CodeCursorTRAE腾讯 WorkBuddy
Promptfoo 固定版本开源界面固定日期的来源截图
Promptfoo 创建评测界面:先选择模型、接口、脚本或本地 provider,再依次填写提示词、测试用例和运行选项

这张空白设置页只说明一种比较顺序:先列候选和测试条件,再看结果。它不证明数据留在本机、权限受控或已经完成测试。

图片来源与说明

Promptfoo 仓库评测设置界面,© Promptfoo 2025,MIT;可见图标另按 Lucide ISC/MIT 许可。BitShovel 仅等比缩放并转为 WebP。画面是空白设置页,只说明候选、提示词和测试用例先于比较,不证明数据留在本机、权限受控或已经跑出结果。Promptfoo 未参与或背书本站。

打开来源页面

WORKFLOW 001 · 节点定位

当前节点 01共 7 个节点

先定交付物,再选入口

  1. 00主题契约 · 已整理
  2. 01入口 · 历史记录
  3. 02控制 · 历史记录
  4. 03运行边界 · 历史记录
  5. 04交付检查 · 历史记录
  6. 05恢复 · 历史记录
  7. 06编辑焦点 · 产品实验

它和 Workflow 001 的关系

与当前主题的关系

这是问题收窄过程中的前一铲。

这条记录先把“哪个 Agent 更好”收窄成“要什么结果、准备在哪里完成”;Workflow 001 再往后追问,工具、会话和插件变多后,怎样把项目做完、过几天还能接着用。两条记录保留各自的日期和证据状态,不合并成一条看似连续的结论。

当时的记录状态

  • 编程与 Agent
  • AI Agent 协作
  • 深入指南
  • 继续调查
  • 来源已交叉核对 · 未做同题实测

当时的建议

当时的判断

先定结果和工作环境,再看工具名字。

展开完整判断与退回规则
先写清要拿到什么结果、准备在哪里完成:要在编辑器里边看边改,可先比较 Cursor / TRAE;要从终端理解并改整个仓库,可比较 Codex / Claude Code;要处理办公文件与浏览器任务,再单独检查腾讯 WorkBuddy 的文件、模型与外部服务权限。
适合谁
能接触 AI,却被工具、套餐和技术名词淹没,希望先拿到一个具体结果的人
为什么当时值得看
展开说明

从工具名开始,往往会先付出学习、授权和订阅成本,却还不知道它能否更快交付结果。

这份判断到哪里为止
展开说明

官方页面只能说明当前产品入口和声明,不能证明同题效果、稳定性或性价比;补充的 Promptfoo 开源界面只展示先写测试条件、再并列结果的比较方法,不是这些代理工具的真实跑分。功能、套餐和数据路径会更新,试用前要重新核对。

读之前先对一下

是否适用

先看它是否适用于你当时要做的事。

这条记录可能帮得上

  • 已经接触 AI,却被工具、套餐和技术名词淹没,希望先拿到一个具体结果。
  • 可以先说明最终结果和工作环境,再比较两类真正可能完成任务的工具。

这些情况先不要照着做

  • 还说不清最终要拿到什么结果。
  • 第一次试用就需要高风险权限、长期付款或迁移大量数据。
  • 决策必须依赖本站同题实测或独立用户完成率——这份记录还没有这些证据。

当时留下的 20 分钟试法

当时的试法

只比较两类工具,最后必须有一个能打开的结果。

大概用时
约 20 分钟
可能花费
先用免费层或本地样例;暂不年付
权限边界
不接真实账号,不给生产环境写权限
  1. 01

    先做什么

    展开这一步

    写下一个必须拿到的结果、输入材料和截止时间,只比较能完成它的 2 类工具。

  2. 02

    手里应该多出什么

    展开这一步

    一个类别选择和一项不超过 20 分钟的最小测试。

  3. 03

    怎样算成功

    展开这一步

    测试结束时有可打开的结果,而不只是聊天记录或演示。

  4. 04

    遇到什么就停

    展开这一步

    说不清要拿到什么结果,或试用前就要求高风险权限、长期付款或迁移大量数据。

  5. 05

    怎么恢复原状

    展开这一步

    导出结果、撤销授权、取消试用,并记录为什么没有完成。

比较方法,不是跑分

方法与界面

先写测试条件,再把同一组输入的结果放在一起看。

展开方法边界

两张来自 Promptfoo 文档的界面只帮助看清比较顺序。它们不是 Codex、Claude Code、Cursor、TRAE 或 WorkBuddy 的同题测试。

Promptfoo 固定版本结果界面固定日期的来源截图
Promptfoo 结果表在相同 yes/no 输入旁并列三个提示词版本,显示通过率、断言结果、失败原因和延迟

三个列都是 Model A 的提示词版本,不是不同代理工具,也不是 BitShovel 或市场跑分;它只示范怎样把同一组输入的结果并排比较。

图片来源与说明

Promptfoo 仓库 Web Viewer 文档图,© Promptfoo 2025,MIT;可见图标另按 Lucide ISC/MIT、MUI MIT 与 Google Material Icons Apache-2.0 许可。BitShovel 只裁掉含项目作者邮箱和评测 ID 的顶部元数据区并转为 WebP。三个列都是 Model A 的提示词版本,不是不同代理工具,也不是本站或市场跑分。Promptfoo、MUI、Lucide 与 Google 未参与或背书本站。

打开来源页面

依据和来源

依据和来源

截至 2026-08-08,这些材料只能确认各产品当时如何描述自己的入口和能力,还没有同题实测。

展开证据边界

已交叉核对五个工具的官方入口、社区选择信号和发布机制;尚未拿同一个任务实际比较这些工具,也没有独立用户的使用结果。

  1. 01
    社区信号 · 当时核对

    用户信号:订阅很多,但看不清每天的回报

    展开来源边界

    讨论把选择标准拉回“是否解决核心问题、是否产生可见影响”。

    打开原始来源
  2. 02
    社区信号 · 当时核对

    用户信号:工具太多,基础路线不清楚

    展开来源边界

    讨论中的实用建议集中在一个小项目和一条可完成工作流。

    打开原始来源
  3. 03
    方法参考 · 当时核对

    Product Hunt 的发布与排序机制

    展开来源边界

    用于把发布热度降级为发现信号,而不是用户结果。

    打开原始来源
  4. 04
    产品方来源 · 当时核对

    OpenAI Codex App 官方说明

    展开来源边界

    核对多代理、工作区、审查与自动化的产品方表述。

    打开原始来源
  5. 05
    产品方来源 · 当时核对

    Anthropic Claude Code 官方说明

    展开来源边界

    核对终端、仓库理解、编辑与命令执行的产品方表述。

    打开原始来源
  6. 06
    产品方来源 · 当时核对

    Cursor Agent 模式官方文档

    展开来源边界

    核对 Agent、Ask 与手动模式的权限差异。

    打开原始来源
  7. 07
    产品方来源 · 当时核对

    TRAE 官方产品入口

    展开来源边界

    核对当前编辑器与 Agent 产品定位;未做同题运行。

    打开原始来源
  8. 08
    产品方来源 · 当时核对

    腾讯 WorkBuddy 服务条款与风险边界

    展开来源边界

    明确这里指腾讯桌面办公 Agent,并核对第三方模型、工具调用和人工防护说明。

    打开原始来源

修订记录

修订记录

每次改口,都留下日期和理由。

展开 2 次修订
  1. 第 3 次

    补齐 Codex、Claude Code、Cursor、TRAE 与腾讯 WorkBuddy,并按编辑器、终端和办公任务重新整理选择方法。

  2. 第 2 次

    不再泛泛比较工具,改为根据一个具体结果、成本和权限挑最简单的可行办法。

这条记录留下什么

这条记录留下什么

保留旧判断,也保留它和今天之间的距离。

当前 Workflow 继续追踪项目完成、上下文恢复、复杂度和权限;这条历史记录保留当时的日期和证据状态,供人回看问题是怎样一步步变窄的。

回到 Dig 索引