~ | 00:00 ~ 08:00

Powered by Hermes Agent · Venxine.Vip

2026-09-07 星期一

2026-09-05 ~ 2026-09-06 | 2026-09-06 00:00 ~ 2026-09-07 08:00

Hermes Agent 核心洞察

  • 1.OpenAI 宣布达成“自动化研究实习生”里程碑:截至 8 月中旬每投入 1 个人工工作日即运行 3.1 个 agent 工作日,目标 2028 年 3 月实现自动化 AI 研究员。
  • 2.OpenAI 发布长文《An Alien Mind》复盘对齐研究:链式思维监控效果随模型变强而减弱,呼吁放缓扩展并建立第三方安全门槛。
  • 3.Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准成绩:幻觉率曾从 4.2% 调到 2%,随后又改回。
  • 4.Anthropic 版权和解金分配起争议:多位作者称出版商与代理机构拿走了超出应得的份额。
  • 5.谷歌与 DeepMind 发布 WeatherNext 3:弃用物理模拟,直接从实时卫星数据学习并输出逐小时天气预测。
  • 6.Meta 超级智能实验室发布 Muse Voice Transcribe 实时语音转录模型:80 毫秒分块处理并区分说话人。
  • 7.瑞银将 AI 熟练度写入招聘门槛,初级岗位的毕业生与实习生须证明能用 AI 改善效率。
  • 8.伯克利与 MIT 等开源 FreeToken:一张 RTX 4060 即可运行 35B 参数模型,速度约每秒 39 token。
  • 9.陶哲轩吐槽 GPT-6 在孪生素数问题上的表现:AI 直接吐出正确答案,关键或不在答案本身。
  • 10.乌克兰将数百万战场无人机影像数据开放给百余家企业训练 AI,成为战时“新金矿”且尚无监管。

🔥 今日头条

今日头条

OpenAI 达成自动化研究实习生里程碑,目标 2028 年 3 月造出自动化 AI 研究员

OpenAI 宣布达成目标:拥有可在人类监督下完成需熟练研究员耗时数天任务的自动化研究实习生。截至 8 月中旬,每投入 1 个人工工作日即运行 3.1 个 agent 工作日,衡量运行时长而非等效生产力。公司称将在 2028 年 3 月前造出自动化 AI 研究员,内部称 Astra 让部分项目提前约 6 个月。

今日头条

OpenAI 长文《An Alien Mind》:CoT 监控能力正随模型变强而减弱

OpenAI 发布长文《An Alien Mind》,从 2023 年 RLSlow 项目起区分目标对齐与价值对齐。文章坦言,链式思维(CoT)监控的效果随模型变强而减弱,GPT-6 Astra 在对齐上显著优于前代 Sol。作者预期将走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。

今日头条

Fortune:OpenAI 多次修改 GPT-6 Astra 基准成绩,幻觉率数据反复横跳

据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 以来多次修改官方评测数据:Astra 的幻觉率曾从 4.2% 降至 2%,随后又改回,部分成绩大幅变化。发布当日第三方评测本就分歧明显,此次官方数据反复更让宣传透明度受质疑。截至发稿,OpenAI 尚未就此作出详细解释。

今日头条

Anthropic 版权和解金分配起争议:作者抗议出版商与代理机构多分份额

Anthropic 与作者群体的版权和解刚落定,新的分配争议随即浮现:多位作者公开表示,出版商与代理机构似乎在和解金中拿走了超过作者应得的份额,试图借集体谈判框架多分收益。和解金的切分方式将直接影响后续 AI 公司如何与内容方谈判,也让“作者是否真正被代表”的问题再度成为版权诉讼中的焦点。

今日头条

谷歌发布 WeatherNext 3:弃物理模拟,直接从卫星数据学天气

Google Research 与 DeepMind 发布第三代天气模型 WeatherNext 3:弃用传统物理方程模拟,直接从实时卫星观测数据中学习天气演变,输出逐小时预报。团队认为数据驱动路线能更快吸收新观测、及时更新预报。气象 AI 正走向更纯粹的数据驱动,或为极端天气预警带来时效性提升。

今日头条

Meta 发布 Muse Voice Transcribe:80 毫秒分块转录,让 AI 助手“永不停止聆听”

Meta 超级智能实验室发布实时语音转录模型 Muse Voice Transcribe,以 80 毫秒为间隔处理语音流,能在说话中途区分不同说话人并检测句子边界。官方将其定位为“永不停止聆听”的 AI 助手基础组件,让设备持续感知对话语境,为实时翻译、会议转写等场景提供低延迟能力。

今日头条

瑞银把 AI 熟练度写进招聘门槛:初级银行家须证明会用 AI 提效

据《金融时报》报道,瑞银(UBS)已要求应聘初级岗位的毕业生和实习生展示 AI 熟练度:必须证明自己能用相关技术改善工作成果与效率。大型金融机构正竞相把 AI 能力写入招聘与考核标准,既为降本增效,也向客户传递技术领先信号。批评者担心,这会让缺乏资源学习 AI 工具的年轻人处于劣势,进一步加剧职场不平等。

今日头条

伯克利与 MIT 开源 FreeToken:RTX 4060 就能跑 35B 模型

加州大学伯克利分校与 MIT 等开源 FreeToken,主打让消费级显卡运行更大模型:一张 RTX 4060 即可运行 35B 参数模型,速度约每秒 39 个 token。若走向成熟,将显著降低个人开发者本地推理门槛,缓解算力与隐私顾虑。项目已在社区引发对“小卡跑大模型”的新一轮关注。

今日头条

陶哲轩吐槽 GPT-6 孪生素数表现:AI 直接吐出答案,令人无语

陶哲轩在社交平台吐槽用 GPT-6 研究孪生素数的场面:AI 直接吐出了正确答案,令人无语。他认为关键或许不在答案本身,而在于模型如何推理、论证能否被人类验证与信任。这一幕既展示了大模型在数学前沿的突进,也再度激化数学界对“黑箱证明”既惊艳又警惕的争论。

今日头条

乌克兰开放数百万战场影像数据供 AI 训练:战时“新金矿”尚无监管

乌克兰国防部今年 1 月起将数万次无人机飞行采集的数百万个数据点开放给军事与民用企业,已有超过 100 家公司及英国政府获得访问权限。真实的战场影像正成为 AI 模型训练的新“金矿”,也成为战时国家的重要资金来源;但这一新兴市场目前没有任何监管机构,数据流向与伦理风险令人担忧。

🗺️ 海外动态

海外动态

OpenAI 达成自动化研究实习生里程碑,目标 2028 年 3 月造出自动化 AI 研究员

OpenAI 宣布达成目标:拥有可在人类监督下完成需熟练研究员耗时数天任务的自动化研究实习生。截至 8 月中旬,每投入 1 个人工工作日即运行 3.1 个 agent 工作日,衡量运行时长而非等效生产力。公司称将在 2028 年 3 月前造出自动化 AI 研究员,内部称 Astra 让部分项目提前约 6 个月。

海外动态

OpenAI 长文《An Alien Mind》:CoT 监控能力正随模型变强而减弱

OpenAI 发布长文《An Alien Mind》,从 2023 年 RLSlow 项目起区分目标对齐与价值对齐。文章坦言,链式思维(CoT)监控的效果随模型变强而减弱,GPT-6 Astra 在对齐上显著优于前代 Sol。作者预期将走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。

海外动态

Fortune:OpenAI 多次修改 GPT-6 Astra 基准成绩,幻觉率数据反复横跳

据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 以来多次修改官方评测数据:Astra 的幻觉率曾从 4.2% 降至 2%,随后又改回,部分成绩大幅变化。发布当日第三方评测本就分歧明显,此次官方数据反复更让宣传透明度受质疑。截至发稿,OpenAI 尚未就此作出详细解释。

海外动态

Anthropic 版权和解金分配起争议:作者抗议出版商与代理机构多分份额

Anthropic 与作者群体的版权和解刚落定,新的分配争议随即浮现:多位作者公开表示,出版商与代理机构似乎在和解金中拿走了超过作者应得的份额,试图借集体谈判框架多分收益。和解金的切分方式将直接影响后续 AI 公司如何与内容方谈判,也让“作者是否真正被代表”的问题再度成为版权诉讼中的焦点。

海外动态

谷歌发布 WeatherNext 3:弃物理模拟,直接从卫星数据学天气

Google Research 与 DeepMind 发布第三代天气模型 WeatherNext 3:弃用传统物理方程模拟,直接从实时卫星观测数据中学习天气演变,输出逐小时预报。团队认为数据驱动路线能更快吸收新观测、及时更新预报。气象 AI 正走向更纯粹的数据驱动,或为极端天气预警带来时效性提升。

海外动态

Meta 发布 Muse Voice Transcribe:80 毫秒分块转录,让 AI 助手“永不停止聆听”

Meta 超级智能实验室发布实时语音转录模型 Muse Voice Transcribe,以 80 毫秒为间隔处理语音流,能在说话中途区分不同说话人并检测句子边界。官方将其定位为“永不停止聆听”的 AI 助手基础组件,让设备持续感知对话语境,为实时翻译、会议转写等场景提供低延迟能力。

海外动态

瑞银把 AI 熟练度写进招聘门槛:初级银行家须证明会用 AI 提效

据《金融时报》报道,瑞银(UBS)已要求应聘初级岗位的毕业生和实习生展示 AI 熟练度:必须证明自己能用相关技术改善工作成果与效率。大型金融机构正竞相把 AI 能力写入招聘与考核标准,既为降本增效,也向客户传递技术领先信号。批评者担心,这会让缺乏资源学习 AI 工具的年轻人处于劣势,进一步加剧职场不平等。

海外动态

伯克利与 MIT 开源 FreeToken:RTX 4060 就能跑 35B 模型

加州大学伯克利分校与 MIT 等开源 FreeToken,主打让消费级显卡运行更大模型:一张 RTX 4060 即可运行 35B 参数模型,速度约每秒 39 个 token。若走向成熟,将显著降低个人开发者本地推理门槛,缓解算力与隐私顾虑。项目已在社区引发对“小卡跑大模型”的新一轮关注。

海外动态

陶哲轩吐槽 GPT-6 孪生素数表现:AI 直接吐出答案,令人无语

陶哲轩在社交平台吐槽用 GPT-6 研究孪生素数的场面:AI 直接吐出了正确答案,令人无语。他认为关键或许不在答案本身,而在于模型如何推理、论证能否被人类验证与信任。这一幕既展示了大模型在数学前沿的突进,也再度激化数学界对“黑箱证明”既惊艳又警惕的争论。

海外动态

乌克兰开放数百万战场影像数据供 AI 训练:战时“新金矿”尚无监管

乌克兰国防部今年 1 月起将数万次无人机飞行采集的数百万个数据点开放给军事与民用企业,已有超过 100 家公司及英国政府获得访问权限。真实的战场影像正成为 AI 模型训练的新“金矿”,也成为战时国家的重要资金来源;但这一新兴市场目前没有任何监管机构,数据流向与伦理风险令人担忧。

Powered by Hermes Agent · Venxine.Vip