AI简报(9月4日):OpenAI发布GPT-6 Astra,智谱GLM Coding Plan推出GLM-5.3-Flash限时活动,无限量使用

前沿资讯 1788504933更新

0

😱 【1】OpenAI 发布 GPT-6 Astra:最强智能体模型,计算机使用能力达到人类水平

摘要:OpenAI 正式发布 GPT-6 Astra,号称全球最智能、最对齐的模型,在计算机使用、浏览、软件工程、网络安全、科学和专业知识等领域全面刷新 SOTA。

Astra 在 ARC-AGI-3 上拿下 99.9% 的惊人成绩,在 FrontierMath Tier 4 上达到 97.6%,甚至已经帮助解决了一些长期悬而未决的数学难题。计算机使用能力是这次最大的亮点,在 OSWorld 2.0 基准上,Astra 以 72.6% 的得分超越了 GPT-5.6 Sol 的 65.7%,完成任务的时间还缩短了约 47%。

它能在 KiCad 里自动完成 PCB 电路板布线,在 Blender 里建模并导出到虚幻引擎 5 生成可漫游场景,还能帮你填税表、做 PPT、写邮件、做 Excel 表格、做前端 QA 测试,甚至通过浏览器订餐厅、找房子。

编程方面同样炸裂:Terminal-Bench 4.0 得分 57.9%,远超前代的 37.3%;DeepSWE 长周期软件工程达到 74.1%。Astra 还是 OpenAI 最"守规矩"的模型,在面对不可能完成的任务时,前代模型有 48% 的概率会尝试绕过限制,而 Astra 这个数字是 0%。网络安全能力达到了 Preparedness Framework 的"临界"级别,在 ExploitBench 上拿到满分 100%)。

API 定价为输入每百万 Token 10 美元、输出 50 美元,即日起向部分组织开放,未来几天内陆续向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送,同时上线 OpenAI API、微软 Azure 和 AWS Bedrock。

链接:https://openai.com/index/gpt-6-astra/

🏭【2】Greg Brockman 称 Astra 开启了 AGI 时代,这是 OpenAI 最大规模训练(10 万 GPU),定价与 Fable 5.1 相同但单位任务成本更低

摘要:随着 GPT-6 Astra 正式发布,OpenAI 联合创始人 Greg Brockman 在公告中表示“这是 AGI 时代”,Astra 可能是第一个达到这一水平的模型。该模型在德克萨斯州 Stargate 数据中心用 10 万张 GPU 完成了 OpenAI 历史上规模最大的训练,在几乎所有基准测试中占据主导地位。

Astra 专为 AI Agent 工作设计,定价与 Fable 5.1 相当,但单位任务完成成本更低、性能显著更好。模型推理过程极难监控和蒸馏,目前正优先向企业客户推出,个人账户将在未来几天内陆续开放。

链接:https://x.com/AlexFinn/status/2095581065884909661

🧩 【3】ARC 奖创始人 François Chollet:Astra 在 ARC-AGI-3 上达到 66%,是模型智能的重大突破

摘要:ARC 奖创始人 François Chollet 发长文点评 GPT-6 Astra 在 ARC-AGI-3 上的表现。

使用标准测试框架,Astra 得分 66%;而在连续对话框架配合自定义压缩策略下,得分逼近 100%,并且以约每局 360 美元的成本,在几乎所有关卡中超越了人类基线的操作效率。

Chollet 透露,研究团队在检查推理链时发现,Astra 会针对每个游戏和关卡动态构建高效的符号化世界模型,甚至自创了一套简写 DSL(领域特定语言),本质上是一种游戏专用的代数符号系统,来表征游戏中的各种状态。他认为,Astra 展现出的符号化建模能力过去只有在精心设计的复杂框架中才能见到,现在这些能力正在从框架本身向模型内部迁移,这是一个重大的智能突破。

不过 Chollet 也强调,ARC-AGI-3 被解决并不等于 AGI,基准测试本身就是与模型共同演化的过程。他透露下一代 ARC-AGI-4 已经在开发中,预计 2027 年第一季度发布,而他半年前曾预测前沿模型需要约一年才能饱和 ARC-AGI-3,Astra 的速度比他预想的快了一倍,AI 进步的速度会让很多人感到意外。

链接:https://arcprize.org/blog/astra

📊 【4】Perplexity 评测:GPT-6 Astra 在 WANDR 基准上得分最高,比 Fable 5.1 高 13.5% 且成本更低

摘要:Perplexity 公布了 GPT-6 Astra 在其内部 WANDR 基准上的评测结果。Astra 得分为 0.682,每任务成本 11.98 美元,是所有测试模型中得分最高的。

具体对比来看,Astra 比 Claude Fable 5.1 高出 13.5%,同时成本还低了 6.1%;比 Claude Opus 5 高出 27.0%,成本只高出 3.3%。WANDR 是 Perplexity 用于评估模型在真实世界智能体工作流中表现的自研基准。

链接:https://x.com/perplexity_ai/status/2095620419906830788

📊 【5】Artificial Analysis 独立评测:GPT-6 Astra 智能指数达 61 分,幻觉率大幅下降但成本飙升 75%

摘要:Artificial Analysis 发布了对 GPT-6 Astra 的独立评测。

Astra 在 Artificial Analysis 智能指数上拿到 61 分,与 GPT-5.6 Sol 的 60.9 分相比提升并不大。最大亮点是“靠谱程度”的飞跃,AA-Omniscience 知识可靠性指标从 Sol 的 92% 幻觉率骤降到 51%,准确率也有小幅提升,意味着 Astra 犯错和胡说的概率几乎减半。

在智能体知识工作方面表现喜忧参半:AA-Briefcase 分数大涨约 80 分,分析质量显著提升,但另一个真实世界任务测试 GDPval-AA v2 却出现了同等幅度的倒退。

价格方面,API 输入每百万 Token 10 美元、输出 50 美元,比 Sol 贵了 75%,尽管 Astra 每个任务少用了约 10% 的输出 Token(平均 4.2 万个,而 Sol 约 4.7 万个),但依然抵消不了涨价带来的成本暴增,因此在“智能 vs 成本”的性价比曲线上反而落在了 Sol 的后面。

上下文窗口 100 万 Token,知识截止到 2026 年 4 月,支持图文输入和文本输出。

链接:https://artificialanalysis.ai/models/gpt-6-astra

🤗【6】英伟达正式官宣以 129.3 亿美元收购 Hugging Face,保持平台开放,不强制使用英伟达算力,交易金额暗藏彩蛋

摘要:英伟达正式官宣以 129.303 亿美元收购开源 AI 平台 Hugging Face。

Hugging Face 目前拥有超过 1800 万开发者用户,托管着 300 多万个模型、50 万个数据集和 100 万个应用,超过 20 万家企业通过该平台发现、评估、定制和部署 AI。

英伟达 CEO 黄仁勋在公告中强调,Hugging Face 将保持开放平台属性,开发者可以自由选择任意模型、框架、云服务、推理提供商和计算平台,完全不强制使用英伟达算力,同时继续支持多云计算和多加速器部署。

双方表示,收购是为了利用英伟达的基础设施、工程能力和全球覆盖来提升平台的可靠性、安全性和部署能力,同时保持让 Hugging Face 成功的开放生态系统。创始团队和全体员工全部留任,目标是让开源 AI 成为主流,赋能全球更多开发者和机构。

黄仁勋还透露,这次收购是 Hugging Face 创始人 Clement Delangue 主动找上门来的,认为英伟达是“公司、社区和开源模型未来的理想归宿”。

有细心的网友发现,交易金额中的“129303”正好是 Unicode 字符 U+1F917(也就是 🤗 表情符号)的十进制转换,堪称一个精心设计的彩蛋。

链接:https://blogs.nvidia.com/blog/nvidia-to-acquire-hugging-face/

⚙️ 【7】Hermes Desktop 新增一键本地模型配置:自动识别硬件,下载并配置最佳模型

摘要:Nous Research 宣布 Hermes Desktop 桌面版新增一键本地模型配置功能。

用户下载应用后会自动弹出设置引导,也可以在设置中的 Providers 部分手动触发。该功能会自动检测你的电脑硬件配置,然后智能推荐并下载最适合你设备的模型,同时自动完成运行环境配置,整个过程只需点击一次按钮。不需要再去手动翻文档查兼容性、找下载链接、配置路径,极大降低了本地部署大模型的门槛。

链接:https://x.com/NousResearch/status/2095602995874410664

⏰ 【8】智谱 GLM Coding Plan 推出 GLM-5.3-Flash 限时活动:每日夜间至清晨免费无限量使用

摘要:智谱 AI 宣布为 GLM Coding Plan 付费用户推出一项为期 18 天的 GLM-5.3-Flash 用量活动。

从 9 月 3 日到 9 月 20 日,每天新加坡时间 23:00 到次日 09:00(对应美西时间上午 8 点到下午 6 点),在 ZCode 中使用 GLM-5.3-Flash 完全免费且不限量;在其他支持的智能体中使用,配额则按原计划标准翻倍。

如果你不小心选了 GLM-5.3(不带 Flash),还是会按正常规则消耗配额。活动覆盖周末和节假日,无需手动开启,所有付费用户自动生效。

链接:https://docs.z.ai/devpack/notice/event-glm-5.3-flash

🌤️ 【9】谷歌发布 WeatherNext 3:全球最先进 AI 气象模型,分辨率提升 5 倍、每小时更新、降水预报准确率提升 60%

摘要:谷歌 DeepMind 与谷歌研究院联合推出 WeatherNext 3,号称迄今为止最先进、最准确的全球 AI 气象模型。

与前代 WeatherNext 2 在 25 公里网格上每 6 小时更新一次不同,WeatherNext 3 直接学习实时卫星观测数据,每小时输出一次预报,地面温度等变量分辨率达到 5 公里,整体画质精细度提升了约 5 倍。在降水预测这一传统难题上,模型通过训练 NASA 卫星雷达数据和谷歌自研的全球降水再分析资料,中期预报的 CRPS 评分相比基准最高改善了 60%。

模型还新增了专为可再生能源设计的变量,100 米高度风速(约等于风机轮毂高度)和高分辨率云量、太阳辐射数据,帮助电网运营商和光伏电站更精准地预测发电量。

WeatherNext 3 即日起逐步集成到谷歌搜索、Gemini 应用、谷歌地图、地图平台天气 API 和 Earth Engine 中,用户看到的降水预报在一天以上的时间尺度上准确率提升最高达 50%,历史上预报可靠性较低的地区改善最为明显。

开发者还可以通过 BigQuery、Earth Engine 或 Google Cloud Storage 直接访问和批量下载预报数据。

链接:https://blog.google/innovation-and-ai/models-and-research/google-deepmind/introducing-weathernext-3

🧠 【10】谷歌联手 HHMI 完成雄性果蝇全脑连接组图谱:16.6 万个神经元、超 1.1 万种细胞类型,神经科学里程碑

摘要:谷歌研究院与 HHMI Janelia 研究园区及科学界合作,首次完成了成年雄性果蝇大脑和中枢神经系统的完整连接组图谱,也就是每一个神经连接的全景地图。

这个图谱包含超过 16.6 万个神经元,打破了纪录,还识别出近 1.17 万种神经元细胞类型。研究团队将果蝇大脑和身体切成极薄的切片逐层成像,再利用 AI 将数百万张二维图像拼接成三维神经结构,最终还原出从感光神经元到运动神经元的完整通路。

与去年发布的雌性果蝇脑图谱相比,新图谱首次覆盖了包括腹侧神经索(相当于脊髓)在内的完整中枢神经系统,让科学家可以直接对比两性在神经结构上的差异,大部分神经元在两性中相同,但存在少量性别特有或"二态性"神经元,它们在两性中都存在,但连接方式不同,比如与求偶行为相关的"爱情斑"区域。

研究人员表示,果蝇作为科学界最重要的模式生物之一,这张图谱将成为未来多年神经科学研究的基石,也展示了 AI 在连接组学领域规模化重构神经回路的巨大潜力。

链接:https://blog.google/innovation-and-ai/technology/research/male-fruit-fly-brain-map