跳到正文
9月23日周三
  1. Hacker News:AI 热帖76

    Meta AI 助手 Muse 曝出严重 0-day,可被本地应用窃取账户令牌

    事实摘要:Meta AI 助手 Muse 曝出严重 0-day,可被本地应用窃取账户令牌 事实摘要:Meta AI 助手 Muse 曝出严重 0-day,可被本地应用窃取账户令牌 事实摘要:Meta AI 助手 Muse 曝出严重 0-day,可被本地应用窃取账户令牌 事实摘要:Meta AI 助手 Muse 曝出严重 0-day,可被本地应用窃取账户令牌 事实摘要:。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文给出漏洞成因、攻击路径和 Meta 的设计失误细节,读者可以了解 AI 智能体权限设计的安全教训。

  2. Anthropic:Newsroom(网页)80

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    事实摘要:Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40% 事实摘要:Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40% 事实摘要:Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40% 事实摘要:Anthropic 发布 Claude Opus。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文给出定价、基准与安全评测细节,读者可以据此评估 Opus 5.5 在成本和长任务上的实际变化。

  3. TechCrunch:AI(RSS)78

    Anthropic 发布 Opus 5.5,价格更低并在多项基准上超越 Fable

    事实摘要:Anthropic 发布 Opus 5.5,价格更低并在多项基准上超越 Fable 事实摘要:Anthropic 发布 Opus 5.5,价格更低并在多项基准上超越 Fable 事实摘要:Anthropic 发布 Opus 5.5,价格更低并在多项基准上超越 Fable 事实摘要:Anthropic 发布 Opus 5.5,价格更低并在多项基准上超越 Fab。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:文中给出价格、性能基准和安全保障等具体变化,读者可以了解这次发布与前代的实际差异。

  4. The Decoder:AI News(RSS)78

    Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且总成本低约 40%

    事实摘要:Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且总成本低约 40% 事实摘要:Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且总成本低约 40% 事实摘要:Anthropic 发布 Claude Opus 5.5,性能对标 Fable 5.1 且总成本低约 40% 事实摘要:。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文给出官方定价、token 降幅和多项基准对比数字,读者可据此评估该模型在成本与性能上的实际位置。

  5. GitHub Changelog89

    OpenAI’s GPT-6 Sol and GPT-6 Luna now available

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:OpenAI’s GPT-6 Sol and GPT-6 Luna now available 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:OpenAI’s GPT-6 Sol and GPT-6 Luna now available 事实摘要:这条。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月22日周二
  1. 量子位36

    陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产

    事实摘要:陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。 这条动态来自 量子位,可重点关注模型能力与工程。 陆川手搓历史现场,王珞丹熬夜抽卡,阿里全模态开始兜底生产 阿里:三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. LlamaIndex:产品、工程与评测76

    LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 路由 API

    事实摘要:LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 路由 API 事实摘要:LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 路由 API 事实摘要:LiteParse 9 月更新:PDFium 提速 20-25%,新增视觉定位与 is-complex 。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文给出速度、表格准确率等实测对比数据和新增 API,读者可据此评估是否替换现有 PDF 解析方案。

  3. Apple:Newsroom(RSS)76

    Apple 新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Max/M5 Ultra)今日开售

    事实摘要:Apple 新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Max/M5 Ultra)今日开售 事实摘要:Apple 新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Max/M5 Ultra)今日开售 事实摘要:Apple 新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Ma。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:官方发布文给出了完整芯片规格、AI 性能倍数和定价,读者可据此评估新桌面机对本地 AI 工作流的适配度。

  4. OpenRouter:Announcements(RSS)78

    OpenRouter 推出 Batch API,批量推理可享半价

    事实摘要:OpenRouter 推出 Batch API,批量推理可享半价 事实摘要:OpenRouter 推出 Batch API,批量推理可享半价 事实摘要:OpenRouter 推出 Batch API,批量推理可享半价 事实摘要:OpenRouter 推出 Batch API,批量推理可享半价 事实摘要:OpenRouter 推出 Batch API,批量推理。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:公告给出折扣幅度、70+ 模型覆盖和 beta 期 230k+ 批次的实测完成时间,还提示了提交时段对速度的影响。

  5. OpenAI News82

    Parallel cut research time and cost in half with GPT‑6 Astra

    这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:GPT‑6 Astra allowed Parallel’s agents to research and synthesize labor-market data in half the time and at half the cost vs. prior models.

    推荐理由:来自OpenAI News的《Parallel cut research time and cost in half with GPT‑6 Astra》。重点看智能体工作流、模型能力与工程。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:GPT‑6 Astra allowed Parallel’s agents to research and synthesize labor-market data in half the time and at half the cost vs. prior models.

  6. MIT Technology Review AI89

    Don’t be fooled by this summer of AI hype

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Don’t be fooled by this summer of AI hype 这条英文动态主要涉及模型能力与工程。原文要点:It’s been a busy few months for AI hype. At the end of April, Anthropic claimed that its m。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. 爱范儿66

    光帆携手韶音,以 AI OS 破局单点功能内卷

    事实摘要:光帆携手韶音,以 AI OS 破局单点功能内卷 好 AI,不必自己造。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注其对 AI 应用和产业节奏的影响。 光帆携手韶音,以 AI OS 破局单点功能内卷 好 AI,不必自己造。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifa。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. 量子位70

    基元律动韩凯:从多模型调度到反馈闭环,探索Agent持续进化

    事实摘要:基元律动韩凯:从多模型调度到反馈闭环,探索Agent持续进化 9月22日,在2026杭州云栖大会企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯发表演讲《从Harness到RSI飞轮》。 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程。 基元律动韩凯:从多模型调度到反馈闭环,探索Agent持续进化 9月22日,在2026杭州云栖大会企。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. IT之家 AI70

    AI 助力古籍修复:Apollo 大语言模型问世,专门用于解读古希腊莎草纸残片

    IT之家 9 月 22 日消息,据 《连线》(WIRED)报道,全球各地高校图书馆保存着数十万份古希腊莎草纸残片,不少残片损毁严重,其内容或许已无法解读;对于其余尚存修复希望的文本,学者只能依靠人工逐条补全缺失的词句完成复原。为加快这项繁重的工作,研究人员开始借助人工智能。 奥地利科学院将于当地时间周三正式发布了全球首款面向古希腊语的高级大语言模型。该项目由奥地利科学院联合法国 AI 实验室 Mistral 以及科技服务商 Sail Reply 共同开发,命名为 Apollo。这套模型的训练素材取自手稿、莎草纸与石刻铭文,总计大约 6 亿个古希腊历史词汇。 据IT之家了解,科研人员可以通过聊天机器人界面免费使用该模型。研发团队希望借助 Apollo 帮助学者更快筛选出和自身细分研究方向相关的莎草纸残片,发掘出新的研究切入点。针对破损残缺的文献,Apollo 会基于统计概率给出可能性最高的词句来填补文本空白,有望挖掘出此前被掩盖的...

    推荐理由:来自IT之家 AI的《AI 助力古籍修复:Apollo 大语言模型问世,专门用于解读古希腊莎草纸残片》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 22 日消息,据 《连线》(WIRED)报道,全球各地高校图书馆保存着数十万份古希腊莎草纸残片,不少残片损毁严重,其内容或许已无法解读;对于其余尚存修复希望的文本,学者只能依靠人工逐条补全缺失的词句完成复原。为加快这项繁重的工作,研究人员开始借助人工智能。 奥地利科学院将于当地时间周三正式发布了全球首款面向古希腊语的高级大语言模型。该项目由奥地利科学院联合法国 AI 实验室 Mistral 以及科技服务商 Sail Reply 共同开发,命名为 Apollo。这套模型的训练素材取自手稿、莎草纸与石刻铭文,总计大约 6 亿个古希腊历史词汇。 据IT之家了解,科研人员可以通过聊天机器人界面免费使用该模型。研发团队希望借助 Apollo 帮助学者更快筛选出和自身细分研究方向相关的莎草纸残片,发掘出新的研究切入点。针对破损残缺的文献,Apollo 会基于统计概率给出可能性最高的词句来填补文本空白,有望挖掘出此前被掩盖的...

  10. IT之家 AI70

    OpenAI 呼吁美国牵头联合其他国家为前沿 AI 制定全球性标准

    IT之家 9 月 22 日消息,各界对先进 AI 潜在危害的担忧持续升温之际,OpenAI 呼吁 美国牵头联合其他国家 ,为前沿 AI 制定共同标准。 当地时间 21 日,OpenAI 通过官方博客发文指出,要确保 AI 安全发展, 需要建立国际技术标准 ,重点明确哪些 AI 模型事故必须上报、各国如何协同推进 AI 发展,以及如何改善开发此类技术所需算力的获取条件。“要让 AI 持续进步的同时保持安全并造福社会,既需要推进对齐研究,也需要建立共同标准,为不同实验室和国家的开发工作提供指引。” OpenAI 在博客中强调,各国应合作制定能够 相互衔接的国内和国际标准 ,用于约束最先进 AI 模型的开发。现有 AI 安全机构可以成为推进这项工作的渠道,其中包括美国商务部下属的人工智能标准与创新中心(CAISI),该机构负责协助测试 AI 模型并制定指导规范。 OpenAI 还呼吁针对 AI 日益增强的自主工作能力建立标准,在能够确...

    推荐理由:来自IT之家 AI的《OpenAI 呼吁美国牵头联合其他国家为前沿 AI 制定全球性标准》。重点看模型能力与工程。摘要提到:IT之家 9 月 22 日消息,各界对先进 AI 潜在危害的担忧持续升温之际,OpenAI 呼吁 美国牵头联合其他国家 ,为前沿 AI 制定共同标准。 当地时间 21 日,OpenAI 通过官方博客发文指出,要确保 AI 安全发展, 需要建立国际技术标准 ,重点明确哪些 AI 模型事故必须上报、各国如何协同推进 AI 发展,以及如何改善开发此类技术所需算力的获取条件。“要让 AI 持续进步的同时保持安全并造福社会,既需要推进对齐研究,也需要建立共同标准,为不同实验室和国家的开发工作提供指引。” OpenAI 在博客中强调,各国应合作制定能够 相互衔接的国内和国际标准 ,用于约束最先进 AI 模型的开发。现有 AI 安全机构可以成为推进这项工作的渠道,其中包括美国商务部下属的人工智能标准与创新中心(CAISI),该机构负责协助测试 AI 模型并制定指导规范。 OpenAI 还呼吁针对 AI 日益增强的自主工作能力建立标准,在能够确...

  11. 量子位36

    阿里研究员透露Qwen4.5后模型将扩展至5-10T参数

    事实摘要:阿里研究员透露Qwen4.5后模型将扩展至5-10T参数 未来Qwen4.5、Qwen5等版本将扩展至5-10T参数。 这条动态来自 量子位,可重点关注模型能力与工程。 阿里研究员透露Qwen4.5后模型将扩展至5-10T参数 未来Qwen4.5、Qwen5等版本将扩展至5-10T参数。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  12. 量子位68

    阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中

    事实摘要:阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中 9月22日, 2026云栖大会开幕,阿里巴巴公布大模型最新进展。 这条动态来自 量子位,可重点关注模型能力与工程。 阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中 9月22日, 2026云栖大会开幕,阿里巴巴公布大模型最新进展。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  13. 量子位66

    2026 East Forward出海大会:全球化到达下一站,中国企业如何走得更远

    事实摘要:2026 East Forward出海大会:全球化到达下一站,中国企业如何走得更远 “潮起之时,靠岸相见” 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 2026 East Forward出海大会:全球化到达下一站,中国企业如何走得更远 “潮起之时,靠岸相见”。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. 公众号:数字生命卡兹克74

    卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案

    事实摘要:卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案 事实摘要:卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案 事实摘要:卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者成不可能三角版本答案 事实摘要:卡兹克实测对比 Grok 4.7 与小米 MiMo V2.6:后者。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:作者亲手测试并给出价格、速度和基准对比,读者可以据此评估小米 MiMo V2.6 对自身工作流和成本的实际影响。

  15. 量子位66

    AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」

    事实摘要:AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」 弥补算力缺口,不能只靠堆料 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」 弥补算力缺口,不能只靠堆料。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. IT之家 AI66

    Counterpoint 数据:全球 AI 眼镜出货 2026H1 同比大增 263%

    IT之家 9 月 22 日消息,Counterpoint Research 昨日表示, 全球人工智能眼镜出货量在 2026 年上半年实现了 263% 的显著同比增长 。其中无屏型产品的出货占比继续维持 96% 高位,AR AI 眼镜分得 4% 市场。 ▲ 图源:Counterpoint Research 无屏 AI 眼镜的出货量在 2026H1 同比增长 258%、环比增长 22%;这一细分领域依旧由 Meta 主导,占比 94%,销量同比增长 260%、环比增长 22%。 ▲ 图源:Counterpoint Research 另一方面,定位更高的 AR AI 眼镜出货量同比大增 449%,环比增长 18%。中国 OEM 厂商引领了商业化进程,中国 (45%) 也超越美国 (41%) 成为该细分品类的最大市场。 ▲ 图源:Counterpoint Research 分析认为,存储器等半导体元件价格的上涨、公众对 AI 眼镜隐私问...

    推荐理由:来自IT之家 AI的《Counterpoint 数据:全球 AI 眼镜出货 2026H1 同比大增 263%》。重点看产品发布。摘要提到:IT之家 9 月 22 日消息,Counterpoint Research 昨日表示, 全球人工智能眼镜出货量在 2026 年上半年实现了 263% 的显著同比增长 。其中无屏型产品的出货占比继续维持 96% 高位,AR AI 眼镜分得 4% 市场。 ▲ 图源:Counterpoint Research 无屏 AI 眼镜的出货量在 2026H1 同比增长 258%、环比增长 22%;这一细分领域依旧由 Meta 主导,占比 94%,销量同比增长 260%、环比增长 22%。 ▲ 图源:Counterpoint Research 另一方面,定位更高的 AR AI 眼镜出货量同比大增 449%,环比增长 18%。中国 OEM 厂商引领了商业化进程,中国 (45%) 也超越美国 (41%) 成为该细分品类的最大市场。 ▲ 图源:Counterpoint Research 分析认为,存储器等半导体元件价格的上涨、公众对 AI 眼镜隐私问...

  17. OpenRouter:Announcements(RSS)82

    OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用

    事实摘要:OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用 事实摘要:OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何承担 Agent 高频执行调用 事实摘要:OpenRouter 解读 NVIDIA Nemotron 3.5 Lightning 如何。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:OpenRouter 结合自家端点数据拆解 Nemotron 3.5 Lightning 的定位、上下文和调用差异,读者可据此评估它在 Agent 执行层的适用性。

  18. OpenRouter Announcements86

    What Is Nemotron 3.5 Lightning

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:What Is Nemotron 3.5 LightningNemotron 3.5 Lightning is NVIDIA's open-weight 30B mixture-of-experts model with about 3B active parameters per token。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  19. IT之家 AI74

    OpenAI 宣布成立数学与 AI 顾问组,神秘新模型 24 天攻破 100+ 世界级难题

    IT之家 9 月 22 日消息,OpenAI 宣布成立“数学与 AI 顾问组”(Advisory Group on Mathematics and Artificial Intelligence)。据介绍,该顾问组设在普林斯顿高等研究院,由九位数学家组成,将独立于 OpenAI 运作。 相较于此,更重磅的是 OpenAI 在公告中披露 —— 公司于 8 月 28 日开始训练的一个神秘模型已成功解决了多个数学领域中 100 多个长期未解决的开放问题(包含此前引发争议的纳维-斯托克斯千年大奖难题)。 OpenAI 称,该模型在数学领域的进展速度令公司内部的数学家感到惊讶,这引发了关于如何以最佳方式告知学界的内部讨论。 OpenAI 认为,数学属于基础科学领域,AI 取得新的数学发现后可能产生广泛应用,因此相关能力的开发和部署需要采取更稳重的方式。公司目前正在研究如何更广泛地部署与数学相关的 AI 能力。 此前,陶哲轩、邓煜、彼得 ·...

    推荐理由:来自IT之家 AI的《OpenAI 宣布成立数学与 AI 顾问组,神秘新模型 24 天攻破 100+ 世界级难题》。重点看模型能力与工程、文化创意。摘要提到:IT之家 9 月 22 日消息,OpenAI 宣布成立“数学与 AI 顾问组”(Advisory Group on Mathematics and Artificial Intelligence)。据介绍,该顾问组设在普林斯顿高等研究院,由九位数学家组成,将独立于 OpenAI 运作。 相较于此,更重磅的是 OpenAI 在公告中披露 —— 公司于 8 月 28 日开始训练的一个神秘模型已成功解决了多个数学领域中 100 多个长期未解决的开放问题(包含此前引发争议的纳维-斯托克斯千年大奖难题)。 OpenAI 称,该模型在数学领域的进展速度令公司内部的数学家感到惊讶,这引发了关于如何以最佳方式告知学界的内部讨论。 OpenAI 认为,数学属于基础科学领域,AI 取得新的数学发现后可能产生广泛应用,因此相关能力的开发和部署需要采取更稳重的方式。公司目前正在研究如何更广泛地部署与数学相关的 AI 能力。 此前,陶哲轩、邓煜、彼得 ·...

  20. Simon Willison83

    Jev introduces a new shape of LLM - System One, aka Decision Models

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Jev introduces a new shape of LLM - System One, aka Decision Models 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Jev introduces a new shape of L。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  21. Artificial Analysis 完整文章(网页)82

    Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56

    事实摘要:Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56 事实摘要:Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56 事实摘要:Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56 事实。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文给出 Grok 4.7 在智能体知识工作与编码代理基准的具体得分变化,并指出其高 token 用量代价,可用于横向选型参考。

  22. Linear:Now(RSS)80

    Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟

    事实摘要:Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟 事实摘要:Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟 事实摘要:Linear 重构 CI 流程应对 AI 编码带来的验证瓶颈,PR 等待时间从 6 分钟降至 5 分钟 事实摘要:Linear 重构。影响判断:它可能改变智能体工作流相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流方向的选题、竞品观察和落地方案筛选。

    推荐理由:作者以第一手实践拆解 Linear 优化 CI 的具体做法与数据,读者可将其方法迁移到自己的 TypeScript 项目。

  23. xAI:News(网页)78

    xAI 发布 Grok 4.7,主打编码与知识工作

    事实摘要:xAI 发布 Grok 4.7,主打编码与知识工作 事实摘要:xAI 发布 Grok 4.7,主打编码与知识工作 事实摘要:xAI 发布 Grok 4.7,主打编码与知识工作 事实摘要:xAI 发布 Grok 4.7,主打编码与知识工作 事实摘要:xAI 发布 Grok 4.7,主打编码与知识工作 事实摘要:xAI 发布 Grok 4.7,主打编码与知识工作。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:官方给出了完整定价、速度和多项基准对比,读者可以据此把 Grok 4.7 放进现有模型选型里横向比较。

9月21日周一
  1. GitHub Changelog91

    Grok 4.7 is now available in GitHub Copilot

    事实摘要:Grok 4.7 is now available in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Grok 4.7 is now available in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Grok 4.7。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. 爱范儿66

    日产新一代 Skyline 要来了!搭载双涡轮 V6,还会有 6 速手动挡?

    事实摘要:日产新一代 Skyline 要来了!搭载双涡轮 V6,还会有 6 速手动挡? 新 Skyline 不需要复制过去的传奇,它只需要找准自己的定位。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注其对 AI 应用和产业节奏的影响。 日产新一代 Skyline 要来了!搭载双涡轮 V6。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. 爱范儿74

    新 Mac mini 首发实测:我的第一台「多 Agent」电脑

    事实摘要:新 Mac mini 首发实测:我的第一台「多 Agent」电脑 能跑大模型只是 AI PC 的起点 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注智能体工作流、模型能力与工程。 新 Mac mini 首发实测:我的第一台「多 Agent」电脑 能跑大模型只是 AI PC 的起点。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。