跳到正文
9月23日周三
  1. 量子位70

    DeepSeek新论文公开Agent训练!梁文锋署名

    事实摘要:DeepSeek新论文公开Agent训练!。影响判断:发布了一篇关于Agent(代理)训练的新论文,展示了在每秒产生50,000+个沙盒的能力。场景价值:智能体工作流、模型能力与工程。

    推荐理由:这篇文章为读者提供了一个关于Agent训练的视角,强调了其高效性和灵活性。

  2. IT之家 AI68

    大力投入 AI 未必真能省钱,麦肯锡报告称智能体或让企业面临更高成本

    IT之家 9 月 23 日消息,据《商业内幕》今天(23 日)上午报道,麦肯锡提醒企业,随着智能体越来越普及, AI 支出可能进一步增加 。 与文本类 AI 工具相比,智能体需要实际完成任务,或将带来高得多的运行成本。这类任务往往包含多个步骤,同一目标有不同的实现方式,成本也可能相差悬殊。麦肯锡的一项研究发现,不同智能体完成任务的成本差距 最高可达 30 倍 。 IT之家从报道中获悉,麦肯锡的《2026 年 AI 现状》调查显示,约三分之一的组织把超过 10% 的技术与通信预算投入 AI;60% 的受访者计划明年增加 AI 支出;约五分之一的受访者称, AI 支出开始给运营成本带来压力 。 麦肯锡高级合伙人、麦肯锡全球研究院院长唐吉 · 卡特林指出:“所以,AI 支出的规模开始变得相当可观,也越来越明显。” 麦肯锡表示,使用智能体自动编程的软件开发团队尤其面临成本压力,自动编程显然要消耗大量 token。 麦肯锡发出警告前,企业...

    推荐理由:来自IT之家 AI的《大力投入 AI 未必真能省钱,麦肯锡报告称智能体或让企业面临更高成本》。重点看智能体工作流。摘要提到:IT之家 9 月 23 日消息,据《商业内幕》今天(23 日)上午报道,麦肯锡提醒企业,随着智能体越来越普及, AI 支出可能进一步增加 。 与文本类 AI 工具相比,智能体需要实际完成任务,或将带来高得多的运行成本。这类任务往往包含多个步骤,同一目标有不同的实现方式,成本也可能相差悬殊。麦肯锡的一项研究发现,不同智能体完成任务的成本差距 最高可达 30 倍 。 IT之家从报道中获悉,麦肯锡的《2026 年 AI 现状》调查显示,约三分之一的组织把超过 10% 的技术与通信预算投入 AI;60% 的受访者计划明年增加 AI 支出;约五分之一的受访者称, AI 支出开始给运营成本带来压力 。 麦肯锡高级合伙人、麦肯锡全球研究院院长唐吉 · 卡特林指出:“所以,AI 支出的规模开始变得相当可观,也越来越明显。” 麦肯锡表示,使用智能体自动编程的软件开发团队尤其面临成本压力,自动编程显然要消耗大量 token。 麦肯锡发出警告前,企业...

  3. 量子位66

    Jev vs Decitron:同为决策AI,为什么不是一回事?

    事实摘要:Jev vs Decitron:同为决策AI,为什么不是一回事? 对复杂现实进行推演与决策 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 Jev vs Decitron:同为决策AI,为什么不是一回事? 对复杂现实进行推演与决策。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. 量子位36

    实时世界模型进入“全科生”阶段,PixVerse R2先交卷!

    事实摘要:实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 实时性和通用能力,世界模型可以全都要 这条动态来自 量子位,可重点关注模型能力与工程。 实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 实时性和通用能力,世界模型可以全都要。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. MarkTechPost(RSS)80

    OpenAI 发布 GPT-6 Sol 与 Luna,API 定价降至五折并公布基准成绩

    事实摘要:OpenAI 发布 GPT-6 Sol 与 Luna,API 定价降至五折并公布基准成绩 事实摘要:OpenAI 发布 GPT-6 Sol 与 Luna,API 定价降至五折并公布基准成绩 事实摘要:OpenAI 发布 GPT-6 Sol 与 Luna,API 定价降至五折并公布基准成绩 事实摘要:OpenAI 发布 GPT-6 Sol 与 Luna,API。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文汇总了定价、多组基准对比和新的缓存控制细节,读者可以据此评估 Sol 与 Luna 在不同任务下的成本收益。

  6. 量子位72

    阿里千问AI平台全面升级模型服务、Agent服务、AI应用

    事实摘要:阿里千问AI平台全面升级模型服务、Agent服务、AI应用 覆盖MaaS、Agent服务、行业AI解决方案 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程。 阿里千问AI平台全面升级模型服务、Agent服务、AI应用 覆盖MaaS、Agent服务、行业AI解决方案。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. 量子位66

    GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了

    事实摘要:GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了 下半场开始了 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了 下半场开始了。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. 量子位66

    Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

    事实摘要:Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 缓存读取价砍了60% 这条动态来自 量子位,可重点关注产品发布。 Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 缓存读取价砍了60%。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. 量子位66

    刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降

    事实摘要:刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降 押注互联网里的人类经验 这条动态来自 量子位,可重点关注模型能力与工程。 刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降 押注互联网里的人类经验。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. 量子位65

    滴滴自动驾驶连获全国工商联及北京市荣誉榜单认可

    事实摘要:滴滴自动驾驶连获全国工商联及北京市荣誉榜单认可 滴滴首次入选2026年民营企业发展新质生产力案例,首次登上2026北京民营企业未来产业先锋榜。 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 滴滴自动驾驶连获全国工商联及北京市荣誉榜单认可 滴滴首次入选2026年民营企业发展新质生产力案例,首次登上2026北京民营企业未来产业先锋榜。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  11. 爱范儿66

    Claude 5.5 发布,性能直逼 Fable,还要卷价格

    事实摘要:Claude 5.5 发布,性能直逼 Fable,还要卷价格 最卷一夜! #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注产品发布。 Claude 5.5 发布,性能直逼 Fable,还要卷价格 最卷一夜! #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  12. 爱范儿70

    ⁡⁤‬‍⁤‬​‌‍⁢⁡⁢⁣‌‌ ⁡⁡​⁤​​ ⁢⁡‬⁡‬​‍⁣​​ ⁤⁡‍​⁡‬‌‬⁣⁡⁣​⁡‬⁤刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地

    事实摘要:⁡⁤‬‍⁤‬​‌‍⁢⁡⁢⁣‌‌ ⁡⁡​⁤​​ ⁢⁡‬⁡‬​‍⁣​​ ⁤⁡‍​⁡‬‌‬⁣⁡⁣​⁡‬⁤刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 DeepSeek 的价格护城河,迎来 OpenAI 的挑战 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  13. GitHub Changelog90

    OpenTelemetry in the GitHub Copilot app

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:OpenTelemetry in the GitHub Copilot app 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:OpenTelemetry in the GitHub Copilot app 事实摘要:这条英文动态主要涉及智能体工作流。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. OpenRouter:Announcements(RSS)76

    OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目

    事实摘要:OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目 事实摘要:OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目 事实摘要:OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37 个目录条目 事实摘要:OpenRouter 发布 2026 年最佳嵌入模型选型指南,覆盖 37。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:作者用自家 API 实测 19 个模型并按用例给出候选、价格与维度,读者可按输入类型和存储约束直接对照选型。

  15. GitHub Changelog88

    New features and improvements in Copilot for JetBrains

    事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:New features and improvements in Copilot for JetBrains 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:New features and improvements in Copilot for JetBrains 事实摘要:这条。影响判断:它可能改变智能体工作流、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. Tomer Tunguz78

    The Most Important Market in AI is the Middle

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:The Most Important Market in AI is the Middle 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:The Most Important Market in AI is the Middle 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:The。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  17. OpenRouter Announcements84

    Best Embedding Models in 2026

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:Best Embedding Models in 2026An embedding model decides what your retrieval system can find. We shortlisted the embedding models in our catalog for E。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  18. Epoch AI:研究、数据与评测80

    Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47%

    事实摘要:Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47% 事实摘要:Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47% 事实摘要:Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47% 事实摘要:Epoch AI 研究报告:达到同等 AI 性能的成本每季度下降约 47% 事实摘要:Epoch AI。影响判断:它可能改变模型能力与工程、评测与基准、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:报告用五个基准三年数据量化达到同等性能的成本下降速度,还区分了刚成为 SOTA 与两年后两种情形,数字和方法都值得细看。

  19. OpenAI:官网动态(RSS · 排除企业/客户案例)80

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

    事实摘要:OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50% 事实摘要:OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50% 事实摘要:OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50% 事实摘要:。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。

  20. MarkTechPost(RSS)80

    Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40%

    事实摘要:Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40% 事实摘要:Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,运行成本比 Opus 5 低 40% 事实摘要:Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文汇总了 Opus 5.5 的基准成绩、价格降幅和 API 限制变化,读者可据此评估是否迁移现有工作负载。

  21. IT之家(RSS)80

    Anthropic 发布 Claude Opus 5.5:成本比 Opus 5 低 40%,输出快 30% 以上

    事实摘要:Anthropic 发布 Claude Opus 5.5:成本比 Opus 5 低 40%,输出快 30% 以上 事实摘要:Anthropic 发布 Claude Opus 5.5:成本比 Opus 5 低 40%,输出快 30% 以上 事实摘要:Anthropic 发布 Claude Opus 5.5:成本比 Opus 5 低 40%,输出快 30% 以上。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文汇总了官方公布的性能、安全、定价和订阅变化,读者可据此评估 Opus 5.5 相对 Opus 5 的实际使用成本与能力差异。

  22. Claude Code:GitHub Releases(RSS)78

    Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型

    事实摘要:Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型 事实摘要:Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型 事实摘要:Claude Code v2.1.280 发布,新增 Claude Opus 5.5 为默认 Opus 模型 事实摘要:。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:官方更新日志详列了新增 Opus 5.5 默认模型、价格与大量修复,开发者可据此判断是否升级及对现有工作流的影响。

  23. OpenRouter:Announcements(RSS)76

    OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本

    事实摘要:OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本 事实摘要:OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本 事实摘要:OpenRouter 实测 Jev 1.13 与 Claude Opus。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文用同一测试流程给出两家模型的准确率、延迟与成本数据,并演示了基于置信度的级联路由方法,便于读者按自身流量权衡选型。

  24. GitHub Changelog96

    Claude Opus 5.5 is now available in GitHub Copilot

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Claude Opus 5.5 is now available in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Claude Opus 5.5 is now available in GitHub Copilot。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。