Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 Opus
Elon Musk 宣布 Grok 4.5 基于 1.5T 参数的 V9 基础模型,已在 SpaceX 和 Tesla 进入私测。初步评估显示性能接近甚至超越 Claude Opus。SpaceX 计划自今年起每月发布完全从头训练的新模型,强化学习仍在持续显著改进模型表现。
~ | 00:00 ~ 08:00
2026-06-27 ~ 2026-06-28 | 2026-06-28 00:00 ~ 2026-06-29 08:00
Elon Musk 宣布 Grok 4.5 基于 1.5T 参数的 V9 基础模型,已在 SpaceX 和 Tesla 进入私测。初步评估显示性能接近甚至超越 Claude Opus。SpaceX 计划自今年起每月发布完全从头训练的新模型,强化学习仍在持续显著改进模型表现。
SpaceX 已注册 SpaceXAI 商标,Elon Musk 宣布 xAI 将不再作为独立公司运营,整体并入 SpaceX 成为其 AI 产品部门。这意味着全球最具价值的航天公司将深度整合 AI 能力,引发业界对 AI 与航天产业融合的关注。
DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成实现无损加速。生产环境中 V4-Flash 和 V4-Pro 每用户生成速度较基线提升 60-85% 和 57-78%,离线测试接受长度比 Eagle3 高 26-31%。
新浪发布仅 3B 参数的 VibeThinker-3B,基于 Qwen2.5-Coder-3B 经多阶段后训练(SFT、强化学习、自蒸馏),在 AIME26 等数学编程基准上持平 DeepSeek V3.2 等大 200-333 倍的模型,LeetCode 竞赛解决 123/128 题超过 GPT-5.2。研究提出「参数压缩-覆盖假说」:逻辑推理可高度压缩,但广泛世界知识仍需大参数量。
据 Mark Gurman 报道,苹果 Vision 产品组副总裁 Paul Meade 将于下周离职加入 OpenAI 硬件部门。Meade 曾负责 Vision Pro、无屏幕 AI 智能眼镜及 AR 眼镜研发。与此同时苹果计划推出首款触控 OLED MacBook,采用 M5 Pro/Max 芯片,核心高管流失凸显 AI 硬件领域的竞争进一步白热化。
前美国商务部长 Raimondo 与前印第安纳州长 Holcomb 发起非营利组织 Raise Us,目标筹集 10 亿美元用于 AI 经济下的工人再培训,已锁定 5 亿。Amazon、Anthropic、Microsoft、OpenAI 等提供支持,将在阿肯色、康涅狄格、马里兰、犹他四州试点,涵盖 AI 职业导航、工资保险等四大支柱。
普林斯顿大学推出 CEO-Bench 基准测试,让 AI 智能体模拟运营软件公司 500 天。14 个模型中仅 Claude Fable 5(盈利 4715 万美元)、Claude Opus 4.8(2780 万)和 GPT-5.5(2130 万)超过起始资本。简单规则启发式方法达到 1576 万美元,超越除三款外的所有模型。多数模型无法保持连贯策略而破产,暴露 AI 长期决策能力不足。
美国企业面临 AI 账单失控,旧金山公司 Lindy 已将 100% 流量切换至 DeepSeek,预计未来数月节省数百万美元。企业开始采用「模型路由」策略按任务匹配不同模型,不再将所有场景都使用最昂贵的前沿模型。部分客户暂停 AI 投入等待证明投资回报率,引发对 OpenAI/Anthropic 定价模式的重新审视。
英国数据科学家 Liam Wilkinson 搭建 76 个 MCP 工具,将 Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 等放入《文明 VI》进行 23 场对局。AI 主动检查全局状态仅占 1-2%,计划后 10 回合内执行率仅 48-66%。结论:智商并非瓶颈,感知盲区和知行差距才是 AI 代理真正需要突破的核心障碍。
GitLab 19.0 将 Agentic AI 嵌入凭证管理、合并请求审核与供应链安全三大核心环节。新版本引入 AI 驱动的代码审查助手,可自动检测安全漏洞并生成修复建议,标志着企业级 DevOps 平台全面进入 AI 原生时代。
Cohere 以 Apache 2.0 许可证开源其旗舰模型 Command A+(05-2026-bf16),这是一款 218B-A25B 的 MoE 模型,具备多模态、多语言和智能体能力。NVIDIA 同期发布 Nemotron-3-Ultra-550B-A55B-BF16,采用 LatentMoE 架构并改用 OpenMDW 许可证,开源模型生态继续扩张。
Runway 宣布广告本地化功能以 API Recipe 形式上线,用户可通过单次 API 调用翻译静态广告和图形资产,大幅简化全球化广告投放流程。该功能结合 Runway 的视频生成能力,为品牌出海提供一站式 AI 本地化解决方案。
Wayfinder Router 通过分析提示词结构特征(长度、标题、列表、代码)在微秒级完成路由决策,完全离线无需调用其他模型。支持任何 OpenAI 兼容 API,避免依赖模型调用的路由器的延迟和成本。可在自有数据上校准评分阈值,提供终端和网页演示。
Adrafinil 是一款 macOS 菜单栏应用,监控 Claude Code、Codex、Cursor、Gemini CLI、Aider、Hermes 等 9 种 AI coding agent 的活跃状态,仅在 agent 工作时阻止系统睡眠。无 agent 工作时合盖正常睡眠,往返延迟低于 50ms。需 macOS Tahoe 26.4。
Coinbase 成为最新一家转向中国 AI 模型的大型西方企业。在美国 AI 服务成本持续攀升的背景下,越来越多的科技和金融公司开始评估 DeepSeek、Qwen 等中国模型作为替代方案,凸显全球 AI 供应链正在发生结构性变化。
HN 热帖披露过去六个月内多起 AI 代理凭证泄露与越权事件,包括 API Key 泄露至训练数据、Agent 绕过权限控制访问敏感系统等。文章呼吁建立 AI Agent 专用的凭证管理标准和最小权限原则,防止 Agent 成为新型攻击面。
HP Inc. 宣布与 OpenAI 建立 Frontier 战略合作伙伴关系,将 OpenAI 的 AI 能力整合至 HP 的打印和个人系统产品线。这是继苹果之后又一家硬件巨头深度绑定 OpenAI 技术生态,标志 AI 正加速渗透消费电子和办公设备领域。
The Decoder 发文指出当前 AI 系统的根本缺陷:它们擅长回答但不会主动提问。真正的同事关系需要 AI 能在信息不足时主动追问、识别自身知识边界并请求澄清。这一观点与文明 VI AI 对决实验的结论相呼应——感知能力比推理能力更关键。
苹果在 WWDC 期间推出 Core AI 框架,专为 Apple Silicon 自研芯片优化端侧生成式 AI 推理。该框架支持本地运行大语言模型和扩散模型,充分利用 M 系列芯片的神经网络引擎和统一内存架构,实现低延迟、高隐私的端侧 AI 体验。
InfoQ 报道称,在 AWS Bedrock 平台上使用 Anthropic Fable 5 模型时,部分推理数据需回传至 Anthropic 用于模型改进。这一要求引发了企业对数据隐私和合规的关注,尤其是金融、医疗等受严格监管行业在使用云 AI 服务时需重新评估数据主权风险。
安全研究员收到伪装成新加坡 VC Lua Ventures 的虚假面试邮件,被要求完成含后门的 TypeScript 仓库「测试」。经 Claude 扫描后,在 patch 文件中发现 base64 混淆载荷构成的 PinpinRAT 后门。该攻击针对 crates.io 上的 Rust 包维护者,已报告加拿大 CCCS 等机构。
阿里千问输入法 macOS 版正式上线官网,支持最快 300 字/分的 AI 语音输入,可自动润色并将口语转为工整文字,支持 9 种方言,纯净无广告。iOS、Android、Windows 版将于近日发布,填补千问在移动端 AI 输入法赛道的空白。
国家统计局数据显示,1-5 月电子行业利润同比增长 103.9%,对规上工业企业利润增长贡献率达 43.1%,主因全球 AI 技术变革推动高端算力芯片和存储芯片需求爆发。高技术制造业利润增 44.7%,电子专用材料制造增 665.4%,凸显 AI 对实体经济的强劲拉动。
量子位报道 Hugging Face 模型排行榜更新,社区开发者 yuxinlu1 以多个高质量模型登顶 TOP 榜。此次更新反映了开源 AI 社区的去中心化趋势——个人开发者正通过创新的微调技术和模型合并策略在榜单上崭露头角,挑战大型机构的主导地位。
量子位对 DeepSeek 创始人梁文锋署名的 DSpark 论文进行深度解读。DSpark 通过半自回归生成(并行骨干+轻量级顺序头)实现无损加速,核心创新在于草稿模块的训练方法——仅需少量额外参数即可大幅提升推理吞吐量,为大规模模型部署提供经济高效的解决方案。