AI 的边界与人的判断

AI 的边界与人的判断

AI 做不到的事,以及经验和判断力值钱的地方

OpenAI 研究组织每一个人类工作日,对应 3.1 个智能体工作日

In terms of a standard 8 hour workday, as of mid-August, in total, the research organization uses 3.1 agent-workdays of effort for every workday of human labor.

OpenAI 披露内部数据:8 月中旬中位研究员每天用超过 600 美元推理(按 API 价),研究组织每个人类工作日对应 3.1 个智能体工作日;并称已达到「自动研究实习生」目标。

对你意味着什么同一篇里写明人仍然定优先级、判结果、决定放大还是暂停。倍数长在执行侧,判断侧没动。设计师能守住的位置也在这里:不是画得更多,是说得清为什么否掉这一版。

FrontierMath Erdős:五个顶尖模型,68 道题最好成绩 2 道

Thomas Bloom selected 68 important open Erdős problems. With a budget of $300 and 72 hours per problem, GPT-6 Astra solved 2 of 68; the other four models solved none.

Epoch AI 的 FrontierMath Erdős 基准选出 68 道仍未解决的重要 Erdős 问题,五个顶尖模型中 GPT-6 Astra 做对 2 道,其余四个一道未解,约 3%。

对你意味着什么人类走过的路 AI 能走得又快又便宜,没人走过的地方它还站在门口。设计师这些年跑工地跑出来的判断力,正好落在 AI 进不去的那一侧。

与 2026-09-05-frontiermath 为同一基准,本集从”AI 边界”角度再次引用。

FrontierMath Erdős 68 道开放难题,最强模型只做对 2 道

Thomas Bloom selected 68 important open Erdős problems. With a budget of $300 and 72 hours per problem, GPT-6 Astra solved 2 of 68; the other four models solved none.

Epoch AI 发布 FrontierMath Erdős 基准,选出 68 道数学界仍未解决的重要 Erdős 问题,每题预算 300 美元、72 小时,GPT-6 Astra 做对 2 道,其余四个模型一道未解。

对你意味着什么需要开创性推理的任务仍是 AI 的短板。结构安全复核、规范交叉判断这类没有现成答案的工序,经验和判断力短期内不会被替代,反而更值钱。

这个方向还没有灵感条目。

集页

全部集页

这个方向还没有以它为主的集页。