持续专题 · 2026年9月7日整理
Astra 发布之后:作品、方法与新的问题
从可编辑作品、文档批注到机械臂动作,沿具体任务理解 Astra,持续补充方法、反馈与争议。
专题整理日期与产品发布日期分别记录。 补充线索或反馈
01
先看产物
发布之后,值得看的是人们做出了什么
一个模型发布时,最容易看到的是能力列表与成绩。几天后,更值得追问的是:有人拿它完成了什么,留下了哪些可以查看、修改或继续使用的东西?这份专题从作品进入,再看方法、工作方式与争议。
下面的三维场景、科普网站和博客,分别提出了三个问题:生成结果能否继续编辑,动态展示能否帮助解释,个人网站能否表达一个具体的人。它们不是同题评测,不能排成模型能力榜;它们让不同的可能性变得可以观察。
- Astra 发布记录本站已有资料先了解官方定位、开放与使用条件,再进入下面的作品。
02
三维创作
交付一个能继续修改的场景
Simon Willison 在 9 月 5 日的操作记录中,让 Astra 调用 Mac 上的 Blender,制作骑自行车的鹈鹕。他公开了三个阶段的 .blend 场景文件、Python 脚本与会话记录。这里最有意思的是交付形式:场景保留了三维结构,可以在 Blender 中继续改,而不只剩一张渲染图片。
作者后来继续要求增加背景与细节,留下前后版本。对想做产品展示或教学场景的人,这提供了一条可参考的路径:先描述场景,让助手调用实际工具,再把对象、材质、灯光和相机留在可编辑文件中。要判断是否适合自己的用途,应看对象关系、画面和后续修改是否正确,而不是只看第一眼的精致程度。
这是作者的实例,本站阅读了过程与文件入口,未在本轮复做 Blender 场景。单个实例不说明复杂建模都能完成,也不能用作者记录的耗时预测其他设备与任务。
- Using Blender with coding agents on macOS作者操作记录 · 9 月 5 日含场景、代码与完整会话入口,可比较各轮交付。
03
交互科普
把过程画出来,还要让因果说得清楚
V2EX 作者 int64ago 分享了用 Astra 制作科普网站的经历,并公开 vistep 源码。作者把目标描述为用可视化解释生活中的机制。公开仓库介绍了短篇视觉叙述、可调参数的实验,以及中英文讲解;这些提供了可以继续检查的实际材料。
一个值得学习的方向,是让图中的运动、数值和文字指向同一个解释。例如讲齿轮时,改变齿数后,转速与旋转关系也应跟着改变;讲压缩时,参数改变应对应可观察的图像与信息损失。这是本站提出的阅读与制作标准,不是对该站全部作品已经通过核验的结论。
作者帖提到使用了大量额度,但没有提供可用于统一比较的完整成本实验。当前可以介绍作品与方法;是否适合青少年、是否比静态解释更容易理解,需要具体观看和学习观察,不能由动画数量或代码规模推出。
- 作者的制作分享V2EX · 9 月 6 日作者对工具使用和制作目标的自述。
- vistep 公开源码作者仓库查看作品入口、解释模型与制作资料;仓库描述不等于学习效果证明。
04
个人网站
审美最终要服务于一个具体的人
Justin3go 在 V2EX 分享了用 Astra 重构博客首页的结果。本站打开成品看到,首页用纸张拼贴、手绘人物和蓝色重点字形成统一表达,随后进入作品、关于、经历与联系。点开“看看我的作品”,能到达实际项目区,继续访问作品。
它提供的启发不只是某种视觉风格:创作者把作品与生活放在同一叙述中,访问者可以顺着具体内容认识这个人。准备让 AI 做个人网站时,先提供真实作品、经历和希望别人记住的特点,会比只要求“高级”“有设计感”更有落点。
我们检查了首页与作品入口,没有审计全站或完成手机、读屏与长期性能测试;作者也没有在帖子中拆分模型生成与人工调整的各自贡献。这个案例适合讨论表达与交互,不能证明 Astra 自动完成了所有设计工作。
- 作者原帖V2EX · 9 月 6 日说明重构所用工具;具体成品另行查看。
- Justin3go 的个人网站成品 · 本站查看于 9 月 7 日查看首页表达与作品入口。
05
实体动作
放进碗里,与嵌进凹槽,是两道题
Robocurve 9 月 4 日的报告让 Astra 操作 YAM 机械臂,分别做方块入碗和拼图入槽。下图重画了报告公布的 Astra 完成次数。实验只有两个任务;物体由人复位,评分者知道所用模型,不能据此推成通用机器人能力。
可以打开下方两份原始记录,比较“发出了动作”与“做对了事情”。入碗实例由人工评为完成;拼图实例虽然以 done 结束,人工却记录为 partial、阶段 3。模型对结果的描述与最后的物体状态,需要分开检查。本站阅读了记录,未操作机械臂或重做实验。
把这个区别带回自己的项目:先定义最终状态,再看哪一步反复失败。拿起物体、移到目标上方、正确放下,各自需要观察;一段漂亮动作不能替代整项任务的完成。
- Robocurve 实验报告第三方实验 · 9 月 4 日含任务条件、结果与限制。
- 方块入碗原始记录作者公开记录人工判断为完成的实例。
- 拼图未完成记录作者公开记录结束信号与人工判断存在差别。
方块放进碗里 · 19 / 20
拼图嵌进凹槽 · 2 / 20
实心格表示完成次数;每行共 20 次。来源:Robocurve 报告,2026-09-04。两项任务使用不同实验台,不作严格因果比较。
06
文档修订
看见手写批注,还要读懂怎样改
Little Dorrit Editor 用带手写修改的书页评估模型:它要找出哪里发生了修改,以及原文应变成什么。9 月 7 日读取的榜单中,Astra 的 OpenRouter 条目 F1 为 0.7778,Fable 5.1 为 0.7316;两者公布的 95% 区间重叠,Claude 图片另有缩放压缩,不能只凭这两个分数概括所有文档任务。
例如,把“周五”划掉并写上“周四”,需要识别删除与替换的关系,而不只是把两个词都抄下来。这个例子是本站的说明,并非模型实测结果。实际整理批注时,可以要求按位置列出“原文、修改后、待确认处”,再对照原图逐项接受修改。
F1 综合考虑识别结果中有多少是对的、原有修改找回了多少,不等于字符识别准确率。技术报告也提醒样本较少。这项工作值得跟踪的后续,是更复杂版式、不同语言与真实修订流程中的表现。
- Little Dorrit Editor 榜单与示例项目页面 · 9 月 7 日读取查看各项指标和输入处理说明。
- 评测技术报告作者方法说明解释评分、样本和区间估计。
07
研究工作方式
把任务交出去之后,人还负责什么
OpenAI 9 月 6 日的内部研究报告描述了研究人员同时使用多个编码 Agent、生成更多代码和运行更多实验的变化。报告也指出,研究进展还有其他瓶颈,代码量与实验量不能直接当成科研进步。
对个人和小团队,可借鉴的是职责的划分:把明确任务交给 Agent,人继续决定研究重点、判断结果是否值得追下去,以及何时扩大、暂停或结束工作。自动执行范围扩大时,验收问题需要更清楚,而不只是同时开更多会话。
这些是公司内部跨一段时间的观察,涉及不同模型和不断变化的工具。它与 Astra 相关,但不能把全部变化归功于 Astra,也不能直接推成外部团队的效率提升幅度。
- Research acceleration: The view inside OpenAIOpenAI 内部观察 · 9 月 6 日包含方法说明及度量限制,适合连同图表一起阅读。
08
观点与争议
能力进步之后,为什么还要讨论节奏
同日发布的 An Alien Mind 是 Jakub Pachocki 的署名文章。他讨论对能力泛化和监测的理解为何仍不充分,并主张对快速进步保持谨慎。这类当事人的判断也是值得阅读的内容,不需要等到又一次模型发布才讨论。
阅读时可以分开看:作者依据了哪些观察,由此作出了什么推论,又提出了什么行动主张。本文是观点导读,未独立核实其全部内部事件,也不把作者的预测当成已发生事实。
- An Alien MindJakub Pachocki 署名文章 · 9 月 6 日原文解释能力、监测与发展节奏的联系。
09
继续关注
下一次值得补充什么
这份专题从已有材料开始,后续按问题补充作品、解释和使用反馈。下列问题尚未得到完整回答;没有新公告时,也会检查是否有值得读的新方法或新观点。
- 同一任务下,成品质量、修改次数与总成本怎样比较?
- 这些作品在手机上、面对初次接触的读者时是否仍然好用?
- 官方说明之外,持续使用者遇到了哪些重复问题?