历史 Dig · 2026 年 7 月—8 月
这个任务该在编辑器、终端还是办公 Agent 里完成?
这些名字看起来都像“Agent”,实际入口却不同:编辑器内改代码、终端接手仓库、多任务工作台和办公文件操作需要的上下文与权限并不一样。

这张空白设置页只说明一种比较顺序:先列候选和测试条件,再看结果。它不证明数据留在本机、权限受控或已经完成测试。
图片来源与说明
Promptfoo 仓库评测设置界面,© Promptfoo 2025,MIT;可见图标另按 Lucide ISC/MIT 许可。BitShovel 仅等比缩放并转为 WebP。画面是空白设置页,只说明候选、提示词和测试用例先于比较,不证明数据留在本机、权限受控或已经跑出结果。Promptfoo 未参与或背书本站。
打开来源页面 ↗WORKFLOW 001 · 节点定位
当前节点 01共 7 个节点
先定交付物,再选入口
它和 Workflow 001 的关系
与当前主题的关系
这是问题收窄过程中的前一铲。
这条记录先把“哪个 Agent 更好”收窄成“要什么结果、准备在哪里完成”;Workflow 001 再往后追问,工具、会话和插件变多后,怎样把项目做完、过几天还能接着用。两条记录保留各自的日期和证据状态,不合并成一条看似连续的结论。
当时的记录状态
- 编程与 Agent
- AI Agent 协作
- 深入指南
- 继续调查
- 来源已交叉核对 · 未做同题实测
当时的建议
当时的判断
先定结果和工作环境,再看工具名字。
展开完整判断与退回规则
先写清要拿到什么结果、准备在哪里完成:要在编辑器里边看边改,可先比较 Cursor / TRAE;要从终端理解并改整个仓库,可比较 Codex / Claude Code;要处理办公文件与浏览器任务,再单独检查腾讯 WorkBuddy 的文件、模型与外部服务权限。
- 适合谁
- 能接触 AI,却被工具、套餐和技术名词淹没,希望先拿到一个具体结果的人
- 为什么当时值得看
展开说明
从工具名开始,往往会先付出学习、授权和订阅成本,却还不知道它能否更快交付结果。
- 这份判断到哪里为止
展开说明
官方页面只能说明当前产品入口和声明,不能证明同题效果、稳定性或性价比;补充的 Promptfoo 开源界面只展示先写测试条件、再并列结果的比较方法,不是这些代理工具的真实跑分。功能、套餐和数据路径会更新,试用前要重新核对。
读之前先对一下
是否适用
先看它是否适用于你当时要做的事。
这条记录可能帮得上
- 已经接触 AI,却被工具、套餐和技术名词淹没,希望先拿到一个具体结果。
- 可以先说明最终结果和工作环境,再比较两类真正可能完成任务的工具。
这些情况先不要照着做
- 还说不清最终要拿到什么结果。
- 第一次试用就需要高风险权限、长期付款或迁移大量数据。
- 决策必须依赖本站同题实测或独立用户完成率——这份记录还没有这些证据。
当时留下的 20 分钟试法
当时的试法
只比较两类工具,最后必须有一个能打开的结果。
- 大概用时
- 约 20 分钟
- 可能花费
- 先用免费层或本地样例;暂不年付
- 权限边界
- 不接真实账号,不给生产环境写权限
- 01
先做什么
展开这一步
写下一个必须拿到的结果、输入材料和截止时间,只比较能完成它的 2 类工具。
- 02
手里应该多出什么
展开这一步
一个类别选择和一项不超过 20 分钟的最小测试。
- 03
怎样算成功
展开这一步
测试结束时有可打开的结果,而不只是聊天记录或演示。
- 04
遇到什么就停
展开这一步
说不清要拿到什么结果,或试用前就要求高风险权限、长期付款或迁移大量数据。
- 05
怎么恢复原状
展开这一步
导出结果、撤销授权、取消试用,并记录为什么没有完成。
比较方法,不是跑分
方法与界面
先写测试条件,再把同一组输入的结果放在一起看。
展开方法边界
两张来自 Promptfoo 文档的界面只帮助看清比较顺序。它们不是 Codex、Claude Code、Cursor、TRAE 或 WorkBuddy 的同题测试。

三个列都是 Model A 的提示词版本,不是不同代理工具,也不是 BitShovel 或市场跑分;它只示范怎样把同一组输入的结果并排比较。
图片来源与说明
Promptfoo 仓库 Web Viewer 文档图,© Promptfoo 2025,MIT;可见图标另按 Lucide ISC/MIT、MUI MIT 与 Google Material Icons Apache-2.0 许可。BitShovel 只裁掉含项目作者邮箱和评测 ID 的顶部元数据区并转为 WebP。三个列都是 Model A 的提示词版本,不是不同代理工具,也不是本站或市场跑分。Promptfoo、MUI、Lucide 与 Google 未参与或背书本站。
打开来源页面 ↗依据和来源
依据和来源
截至 2026-08-08,这些材料只能确认各产品当时如何描述自己的入口和能力,还没有同题实测。
展开证据边界
已交叉核对五个工具的官方入口、社区选择信号和发布机制;尚未拿同一个任务实际比较这些工具,也没有独立用户的使用结果。
- 01社区信号 · 当时核对
用户信号:订阅很多,但看不清每天的回报
- 02社区信号 · 当时核对
用户信号:工具太多,基础路线不清楚
- 03方法参考 · 当时核对
Product Hunt 的发布与排序机制
- 04产品方来源 · 当时核对
OpenAI Codex App 官方说明
- 05产品方来源 · 当时核对
Anthropic Claude Code 官方说明
- 06产品方来源 · 当时核对
Cursor Agent 模式官方文档
- 07产品方来源 · 当时核对
TRAE 官方产品入口
- 08产品方来源 · 当时核对
腾讯 WorkBuddy 服务条款与风险边界
修订记录
修订记录
每次改口,都留下日期和理由。
展开 2 次修订
- 第 3 次
补齐 Codex、Claude Code、Cursor、TRAE 与腾讯 WorkBuddy,并按编辑器、终端和办公任务重新整理选择方法。
- 第 2 次
不再泛泛比较工具,改为根据一个具体结果、成本和权限挑最简单的可行办法。
这条记录留下什么
这条记录留下什么
保留旧判断,也保留它和今天之间的距离。
当前 Workflow 继续追踪项目完成、上下文恢复、复杂度和权限;这条历史记录保留当时的日期和证据状态,供人回看问题是怎样一步步变窄的。
回到 Dig 索引