OpenAI 达成自动化研究实习生里程碑,目标 2028 年 3 月造出自动化 AI 研究员
OpenAI 宣布达成目标:拥有可在人类监督下完成需熟练研究员耗时数天任务的自动化研究实习生。截至 8 月中旬,每投入 1 个人工工作日即运行 3.1 个 agent 工作日,衡量运行时长而非等效生产力。公司称将在 2028 年 3 月前造出自动化 AI 研究员,内部称 Astra 让部分项目提前约 6 个月。
~ | 00:00 ~ 08:00
2026-09-05 ~ 2026-09-06 | 2026-09-06 00:00 ~ 2026-09-07 08:00
OpenAI 宣布达成目标:拥有可在人类监督下完成需熟练研究员耗时数天任务的自动化研究实习生。截至 8 月中旬,每投入 1 个人工工作日即运行 3.1 个 agent 工作日,衡量运行时长而非等效生产力。公司称将在 2028 年 3 月前造出自动化 AI 研究员,内部称 Astra 让部分项目提前约 6 个月。
OpenAI 发布长文《An Alien Mind》,从 2023 年 RLSlow 项目起区分目标对齐与价值对齐。文章坦言,链式思维(CoT)监控的效果随模型变强而减弱,GPT-6 Astra 在对齐上显著优于前代 Sol。作者预期将走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 以来多次修改官方评测数据:Astra 的幻觉率曾从 4.2% 降至 2%,随后又改回,部分成绩大幅变化。发布当日第三方评测本就分歧明显,此次官方数据反复更让宣传透明度受质疑。截至发稿,OpenAI 尚未就此作出详细解释。
Anthropic 与作者群体的版权和解刚落定,新的分配争议随即浮现:多位作者公开表示,出版商与代理机构似乎在和解金中拿走了超过作者应得的份额,试图借集体谈判框架多分收益。和解金的切分方式将直接影响后续 AI 公司如何与内容方谈判,也让“作者是否真正被代表”的问题再度成为版权诉讼中的焦点。
Google Research 与 DeepMind 发布第三代天气模型 WeatherNext 3:弃用传统物理方程模拟,直接从实时卫星观测数据中学习天气演变,输出逐小时预报。团队认为数据驱动路线能更快吸收新观测、及时更新预报。气象 AI 正走向更纯粹的数据驱动,或为极端天气预警带来时效性提升。
Meta 超级智能实验室发布实时语音转录模型 Muse Voice Transcribe,以 80 毫秒为间隔处理语音流,能在说话中途区分不同说话人并检测句子边界。官方将其定位为“永不停止聆听”的 AI 助手基础组件,让设备持续感知对话语境,为实时翻译、会议转写等场景提供低延迟能力。
据《金融时报》报道,瑞银(UBS)已要求应聘初级岗位的毕业生和实习生展示 AI 熟练度:必须证明自己能用相关技术改善工作成果与效率。大型金融机构正竞相把 AI 能力写入招聘与考核标准,既为降本增效,也向客户传递技术领先信号。批评者担心,这会让缺乏资源学习 AI 工具的年轻人处于劣势,进一步加剧职场不平等。
加州大学伯克利分校与 MIT 等开源 FreeToken,主打让消费级显卡运行更大模型:一张 RTX 4060 即可运行 35B 参数模型,速度约每秒 39 个 token。若走向成熟,将显著降低个人开发者本地推理门槛,缓解算力与隐私顾虑。项目已在社区引发对“小卡跑大模型”的新一轮关注。
陶哲轩在社交平台吐槽用 GPT-6 研究孪生素数的场面:AI 直接吐出了正确答案,令人无语。他认为关键或许不在答案本身,而在于模型如何推理、论证能否被人类验证与信任。这一幕既展示了大模型在数学前沿的突进,也再度激化数学界对“黑箱证明”既惊艳又警惕的争论。
乌克兰国防部今年 1 月起将数万次无人机飞行采集的数百万个数据点开放给军事与民用企业,已有超过 100 家公司及英国政府获得访问权限。真实的战场影像正成为 AI 模型训练的新“金矿”,也成为战时国家的重要资金来源;但这一新兴市场目前没有任何监管机构,数据流向与伦理风险令人担忧。
OpenAI 宣布达成目标:拥有可在人类监督下完成需熟练研究员耗时数天任务的自动化研究实习生。截至 8 月中旬,每投入 1 个人工工作日即运行 3.1 个 agent 工作日,衡量运行时长而非等效生产力。公司称将在 2028 年 3 月前造出自动化 AI 研究员,内部称 Astra 让部分项目提前约 6 个月。
OpenAI 发布长文《An Alien Mind》,从 2023 年 RLSlow 项目起区分目标对齐与价值对齐。文章坦言,链式思维(CoT)监控的效果随模型变强而减弱,GPT-6 Astra 在对齐上显著优于前代 Sol。作者预期将走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 以来多次修改官方评测数据:Astra 的幻觉率曾从 4.2% 降至 2%,随后又改回,部分成绩大幅变化。发布当日第三方评测本就分歧明显,此次官方数据反复更让宣传透明度受质疑。截至发稿,OpenAI 尚未就此作出详细解释。
Anthropic 与作者群体的版权和解刚落定,新的分配争议随即浮现:多位作者公开表示,出版商与代理机构似乎在和解金中拿走了超过作者应得的份额,试图借集体谈判框架多分收益。和解金的切分方式将直接影响后续 AI 公司如何与内容方谈判,也让“作者是否真正被代表”的问题再度成为版权诉讼中的焦点。
Google Research 与 DeepMind 发布第三代天气模型 WeatherNext 3:弃用传统物理方程模拟,直接从实时卫星观测数据中学习天气演变,输出逐小时预报。团队认为数据驱动路线能更快吸收新观测、及时更新预报。气象 AI 正走向更纯粹的数据驱动,或为极端天气预警带来时效性提升。
Meta 超级智能实验室发布实时语音转录模型 Muse Voice Transcribe,以 80 毫秒为间隔处理语音流,能在说话中途区分不同说话人并检测句子边界。官方将其定位为“永不停止聆听”的 AI 助手基础组件,让设备持续感知对话语境,为实时翻译、会议转写等场景提供低延迟能力。
据《金融时报》报道,瑞银(UBS)已要求应聘初级岗位的毕业生和实习生展示 AI 熟练度:必须证明自己能用相关技术改善工作成果与效率。大型金融机构正竞相把 AI 能力写入招聘与考核标准,既为降本增效,也向客户传递技术领先信号。批评者担心,这会让缺乏资源学习 AI 工具的年轻人处于劣势,进一步加剧职场不平等。
加州大学伯克利分校与 MIT 等开源 FreeToken,主打让消费级显卡运行更大模型:一张 RTX 4060 即可运行 35B 参数模型,速度约每秒 39 个 token。若走向成熟,将显著降低个人开发者本地推理门槛,缓解算力与隐私顾虑。项目已在社区引发对“小卡跑大模型”的新一轮关注。
陶哲轩在社交平台吐槽用 GPT-6 研究孪生素数的场面:AI 直接吐出了正确答案,令人无语。他认为关键或许不在答案本身,而在于模型如何推理、论证能否被人类验证与信任。这一幕既展示了大模型在数学前沿的突进,也再度激化数学界对“黑箱证明”既惊艳又警惕的争论。
乌克兰国防部今年 1 月起将数万次无人机飞行采集的数百万个数据点开放给军事与民用企业,已有超过 100 家公司及英国政府获得访问权限。真实的战场影像正成为 AI 模型训练的新“金矿”,也成为战时国家的重要资金来源;但这一新兴市场目前没有任何监管机构,数据流向与伦理风险令人担忧。