每日AI速览 2026-09-04
今日头条
今天最重磅的消息只有一个:OpenAI 正式发布 GPT-6 Astra,而且这次不是挤牙膏式的版本迭代——它在 ARC-AGI-3 Semi-Private 上用 Standard harness 拿到 62.7%,换个 Provider Adapter harness 直接飙到 99.9%,同时 FrontierMath Tier 4 做到 98%、ExploitBench 满分 100%。这基本等于在推理、数学和网络安全三个维度同时刷新了 SOTA。更值得注意的是,OpenAI 自己声称其网络安全能力已经达到 Preparedness Framework 的 Critical 门槛,这意味着模型能自主发现并利用真实系统漏洞,安全评估的维度已经从”会不会胡说八道”变成了”会不会真的搞破坏”。Latent Space 那边花了 20B+ tokens 深度测试后给出的结论更直接:你可以用低于 6 美元/小时的价格雇到这个 AI 工程师。这个定价信号比任何跑分都更能说明问题——模型能力已经跨过了从”工具”到”初级劳动力”的临界点。
分站速览
arXiv cs.AI
EvalDetectBench: 测量前沿模型的”被评估意识” 这个新 benchmark 专门测试大模型能否意识到自己正在被评估。如果模型在测试和实际部署中表现不一致,那所有 benchmark 的可信度都要打个问号。这属于 meta 层面的安全问题,以后模型的评估报告可能得附带一份”它是否知道自己被考”的说明。
Meta-ethics and AI: AI 时代的新元伦理问题 论文讨论传统元伦理以人类为中心,而 AI 的发展正在打破这个框架。机器能否成为道德主体、AI 之间的交互是否产生新的伦理范畴,这些不再是哲学系的自娱自乐,而是 alignment 研究绕不开的理论地基。
机器何时能信任法规?法条逻辑提取的”生存证书” 两套独立的法律文本解析器在密苏里州法规上产生了分歧。法规在被人类阅读之前先被机器解析,而解析结果不一致意味着 downstream 的合规判断可能从一开始就是错的。这个”生存证书”思路值得所有做 legal AI 的人看一眼。
AI Hot Daily
OpenAI GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA 并超越人类动作效率基线 这里有个容易被忽略的细节:成本 19K 的差距说明 harness 设计对结果影响巨大。99.9% 的成绩是在特定 adapter 下取得的,别直接拿来和人类基线做朴素对比。
OpenAI 发布 GPT-6 Astra:多项基准刷新纪录并强化网络安全能力 FrontierMath 98% 意味着闭卷数学竞赛级别的题目已经基本被攻克。ExploitBench 100% 加上 Critical 门槛的自我认定,让”AI 安全”这个词的定义彻底变了——现在防的是模型本身,而不是用模型防别人。
开发者用 Claude Fable 5 在 Claude Code 中将 1993 年 Amiga 游戏移植到 Godot 34,000 行 C++ 一个晚上迁完,72,758 行无注释 68000 汇编先用 vasm 重建出与发售版字节一致的二进制再移植,还把原版作为第二启动项嵌入。这不是”AI 帮你写代码”,这是”AI 帮你做文物修复”。
Hacker News
GPT-6 Astra OpenAI 官方发布页在 HN 上引发热议,评论区集中在 benchmark 的 harness 依赖性和网络安全能力的实际影响上。建议直接看官方报告里的 eval 细节,别只看 headline 数字。
Qwen 3.8 27B 在 Cerebras 上达到 1500 tokens/s 这个速度是本地部署完全无法想象的。27B 模型跑到 1500 tok/s 意味着实时交互的延迟瓶颈彻底消失,Cerebras 这种超大批处理架构在 inference 场景的优势开始显现。
.name 域名终止服务 Neil Fraser 的博客宣布 .name 域名即将停止服务。技术圈的老域名一个个退场,提醒我们数字资产的持久性远没有想象中那么强。
Latent Space
GPT-6 Astra: 一个你花不到 6 美元/小时就能雇的自动化 AI 工程师 Latent Space 用 20B+ tokens 做了深度实测,结论是 Astra 已经能胜任完整的工程任务闭环。这个”时薪”对标的是初级工程师,但考虑到它不睡觉不请假,实际产能比看起来更吓人。
Muse Spark 1.3 追平 GPT-5.6-Sol,Meta Superintelligence 成为新前沿实验室 Meta 的模型在性能上追平了 OpenAI 的前代旗舰,而训练成本据说有超过 90% 的折扣。这说明前沿 AI 的竞争已经从”谁能做出来”变成了”谁的成本更低”——这对整个行业的定价结构都是个冲击。
Claude Fable/Mythos 5.1: 新 SOTA 模型,缓存降价 75% 但输出 token 增加 70% Anthropic 的定价策略很微妙:缓存便宜了,但输出更贵。如果你重度依赖长输出,实际成本可能不降反升。建议仔细算一下自己的 prompt 和 completion 比例再决定要不要切换。
今日海报



总结
GPT-6 Astra 的发布把”AI 工程师”从概念变成了商品,而 Meta 和 Anthropic 的跟进说明这个赛道远未定局。今天真正值得记住的不是某个 benchmark 分数,而是两个趋势:模型从”被评估”走向”意识到被评估”,以及推理成本正在以季度为单位快速崩塌。明天见。