AI简报(9月3日):谷歌火速发布Gemini 3.8系列模型;Astra将于明天正式发布,性能远超Fable

前沿资讯 1788419469更新

0

⚡ 【1】谷歌发布 Gemini 3.8 Flash 和 3.8 Flash Cyber,编程与智能体能力全面升级

摘要:距离3.7 Flash发布仅三周,谷歌火速推出Gemini 3.8系列模型,包含两个版本。

主力款3.8 Flash,在软件工程、智能体任务和多步推理上进步显著,尤其在DeepSWE长周期编程测试中,它用极低成本就超越了多数昂贵的前沿模型。价格方面依然良心,输入每百万Token收0.75美元,输出收3.75美元,和3.7 Flash完全一样。

另一个版本3.8 Flash Cyber,则是专为安全专家打造的“漏洞猎手”,在漏洞发现和自动修复上达到前沿水准,不仅能处理C/C++代码,还覆盖了20种编程语言,真实场景漏洞发现成功率超过70%。

3.8 Flash现已向开发者、企业和Google AI Pro/Ultra订阅用户开放,Cyber版本则通过Fairwind计划向可信防御者开放申请。

链接:https://deepmind.google/technology/gemini-3-8-flash-cyber

📊 【2】Gemini 3.8 Flash 性价比达到最优,帮助谷歌保持实验室排名第八

摘要:独立评测机构Artificial Analysis的最新数据显示,谷歌新发布的Gemini 3.8 Flash在智能指数上拿下59分,比前代3.7 Flash高出3分,直接追平了GPT-5.6 Sol和Grok 4.6的最高推理水准。

输入输出单价没变,但因为它处理任务时更“卖力”,所以单个任务的成本涨到了0.58美元,涨幅约40%。不过这个价格在同级别智能水平的模型里依然是最便宜的,稳稳站在“智能 vs 成本”的最优边界上。

速度方面,高推理模式下每秒能吐约300个Token,单个任务耗时2.5分钟,比GPT-5.6系列稍快一些;如果切换到低推理模式,耗时能压到0.8分钟,在“智能 vs 速度”的赛道上也拿下了最优。

上下文窗口保持100万Token不变,支持文本、图像、视频和语音输入,年底前继续享受折扣价。

在由Arena.ai发起的模型对战里,3.8 Flash Agent智能体排名直接从第32名蹿升到第14名,用户明确表示“任务成功”的比例涨了11个百分点,好评度更是飙升近15个百分点;文字对话总榜冲到第7,把Claude Opus 5甩在了身后。

细分领域进步更大,写作从第7跃居第3,长对话从第13跳到第5,硬核提示词从第13升到第7,商业金融更是从第26名一路飙到第7名。在Code Arena WebDev中以1567分排第18名,帮助谷歌保持实验室排名第八。

链接:

https://artificialanalysis.ai/models/gemini-3-8-flash

https://arena.ai/leaderboard/code/webdev/overall?rankBy=labs

🤖 【3】Perplexity 开源 Lily 推理引擎:专为 Mac 与 Qwen 模型而生,速度碾压通用框架

摘要:Perplexity 正式开源了 Lily,这是他们为 Perplexity Computer 混合计算场景专门打造的本机推理引擎。

所谓混合计算,就是把云端大模型和 Mac 上的本地模型拆开干活,而 Lily 的任务就是确保本地这一环绝不能拖后腿。它不是 MLX-LM 那样的通用框架,而是专为 Qwen3.6-35B-A3B 模型在苹果芯片上量身定制的,把预填充和解码当成两件完全不同的事来处理:预填充要一次性塞进大量提示词,正好可以利用权重复用;解码则是一个词一个词往外吐,更吃内存带宽。

实测数据很能打,在 M5 Max MacBook Pro 上跑 Qwen 模型,Lily 的预填充吞吐量平均比 MLX-LM 快 23%,解码吞吐量快 35%,而且输出质量丝毫不打折扣。代码已上 GitHub,有兴趣的开发者可以直接去翻。

链接:https://github.com/perplexityai/pplx-garden/tree/main/lily

🤖 【4】Meta 发布 Muse Spark 1.3:专为实际交付的智能体场景调优,长周期多智能体工作流更顺畅

摘要:Meta 今天正式推出 Muse Spark 1.3,已在 Muse Code 和 Meta Model API 中上线。

这个版本专门针对开发者真正会拿来上线的智能体应用做了调优,特别擅长处理长时间运行、多智能体协作的复杂工作流。它能持续追踪上下文和历史结果,面对混乱或矛盾的用户输入也能自己理出头绪,拿不准时还会主动反问确认,让开发者能把更多精力花在测试和构建上。

在长周期编程和指令遵循能力上也下了功夫,尽可能减少不必要的来回对话,输出更干净利落。

定价方面延续了高性价比路线,贡献者层级输入每百万 Token 只要 0.1 美元,输出 0.2 美元,接入方式不变,换个模型 ID 就能直接用。

Meta CEO 扎克伯格亲自站台,说这是他们在编程和智能体领域进步最大的一次跳升,还预告了下一个大版本 🍉 和 Muse Spark 开源权重版即将到来。

链接:https://bit.ly/4xsnmlo

💰 【5】Muse Spark 1.3 登陆 OpenRouter,贡献者版本同步上线

摘要:OpenRouter 今天宣布正式接入 Meta 最新发布的 Muse Spark 1.3 模型,而且同步上线了性价比更高的贡献者版本。和标准版一样,这个精简版同样专为长时间运行、多智能体和编程场景设计,能持续追踪上下文、自己理清矛盾指令,遇到拿不准的情况还会主动反问确认。

定价相当亲民,输入每百万 Token 只要 0.1 美元,输出 0.2 美元。OpenRouter 实测数据显示,在加上缓存和折扣之后,用户实际支付的输入价格还能再压低到每百万 Token 不到 0.02 美元,输出均价约 0.2 美元。

目前模型只通过 Meta 官方一家供应商提供,不涉及路由切换,P50 延迟 3.4 秒,吞吐量每秒 74 个 Token,供应商正常运行时间占比 uptime 达到 100%。

链接:https://openrouter.ai/meta/muse-spark-1.3

🧹 【6】告别电视广告和卡顿:开发者用 Claude 一键清理 Android TV,无需 Root 且随时可逆

摘要:一位开发者实在受不了用了四年的 Android TV 越来越卡,满屏广告和推荐栏,于是他把详细的操作步骤和一段提示词整理好发到了网上,直接交给 Claude Code 这样的 AI 智能体去执行清理。

整个过程分为四步:打开电视的开发者选项和 USB 调试,记下电视的 IP 地址,然后复制粘贴提示词让智能体干活。智能体会自己安装 ADB 工具、连上电视,严格按照规则操作,只禁用应用(pm disable-user)绝不卸载(pm uninstall),每禁用一小批就停下来让用户测试遥控器、HDMI 切换、Netflix 和键盘是否正常,并记录所有操作日志。它还会把动画速度减半、清空缓存,最后帮你把自带广告的谷歌 TV 桌面替换成开源干净的 FLauncher。

整个流程既不去 Root 也不解锁 Bootloader,因为那样会重置电视并可能导致 Widevine 证书降级,让 Netflix 画质跌回标清。开发者称电视现在运行丝滑顺畅,而且所有改动都记录在案,随时可以让智能体一键恢复如初。

链接:https://tv.cobanov.dev

📶 【7】让 Claude 直接动手优化 WiFi:网速从 31 兆飙到 185,延迟降低 24 倍

摘要:一位用户发现, Claude 可以直接登录他的 Wi-Fi 路由器后台,自动把网络调好。

他的 Mac 原本连着扩展器信道 161,信号强度 -75 dBm,测下来只有 31 Mbps 的吞吐量、90 毫秒的路由器延迟,抖动高达 62.6 毫秒。Claude 接手之后一顿操作,吞吐量直接拉到了 125 到 185 Mbps,路由器 ping 值骤降到 3.7 毫秒,抖动更是压到了 0.8 毫秒,相当于网速提升了 4 到 6 倍,延迟减少了 24 倍,抖动改善了 78 倍。

整个过程中 Claude 自己登录、自己诊断、自己调优,用户只需要旁观。当你也遇到同样问题的时候,不妨让手头的智能体也试试看。

链接:https://x.com/typesfaster/status/2094963042203193519

🖥️ 【8】Claude Desktop 计算机使用功能支持后台运行

摘要:Claude 官方宣布,Claude Code 桌面版的“计算机使用”功能现在支持后台运行了。

开启之后,Claude 可以在你授权的应用里独立工作,而你完全可以在同一个桌面干自己的活儿,不用再盯着它一步步操作。如果你之前已经启用过计算机使用功能,这个后台能力会自动生效;新用户则可以在 Settings → General 里手动打开。

目前该功能在 Pro 和 Max 套餐中提供 Beta 测试,仅限 macOS 平台。

链接:https://code.claude.com/docs/en/desktop#let-claude-use-your-computer

😱 【9】爆料:Astra 明天正式发布,性能远超 Fable,已“轻松超过 AGI 定义”,具备人格化、设计品味和超人级电脑操控能力

摘要:据知情人士爆料,OpenAI 的 Astra 已确认将于明天正式发布。爆料者称 Astra“轻松超过了”他个人对 AGI 的定义,在人格化、设计品味、电脑操控速度和各个领域能力上都有巨大飞跃,将明显超越 Fable 5.1。

链接:https://x.com/iruletheworldmo/status/2095099717541581140