跳到正文
9月3日周四
  1. IT之家 AI78

    Meta 发布最强 AI 模型 Muse Spark 1.3,编码能力超 GPT-5.6 Sol

    IT之家 9 月 3 日消息,Meta Platforms 于 2026 年 9 月 2 日发布迄今最强大 AI 模型 Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。 Meta 首席 AI 官 Alexandr Wang 表示, 该模型在编码能力上超越 OpenAI 的 GPT-5.6 Sol ,与 Anthropic 的 Claude Fable 5.1 表现持平。 定价方面,Muse Spark 1.3 维持与前代 Muse Spark 1.2 相同的定价,通过 Meta Model API 向开发者提供付费访问: 每 100 万词元输入费用为 1.25 美元 (IT之家注:现汇率约合 8.4 元人民币) 每 100 万词元缓存命中输入费用为 0.15 美元 (现汇率约合 1 元人民币) 每 100 万词元输出费用为 4.25 美元 (现汇率约合 28.6 元人民币) Wang 透露,API 平台市场...

    推荐理由:来自IT之家 AI的《Meta 发布最强 AI 模型 Muse Spark 1.3,编码能力超 GPT-5.6 Sol》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 3 日消息,Meta Platforms 于 2026 年 9 月 2 日发布迄今最强大 AI 模型 Muse Spark 1.3,专为延长智能体工作流与增强编码能力设计。 Meta 首席 AI 官 Alexandr Wang 表示, 该模型在编码能力上超越 OpenAI 的 GPT-5.6 Sol ,与 Anthropic 的 Claude Fable 5.1 表现持平。 定价方面,Muse Spark 1.3 维持与前代 Muse Spark 1.2 相同的定价,通过 Meta Model API 向开发者提供付费访问: 每 100 万词元输入费用为 1.25 美元 (IT之家注:现汇率约合 8.4 元人民币) 每 100 万词元缓存命中输入费用为 0.15 美元 (现汇率约合 1 元人民币) 每 100 万词元输出费用为 4.25 美元 (现汇率约合 28.6 元人民币) Wang 透露,API 平台市场...

  2. IT之家 AI76

    欧洲最强 AI:西班牙公司推出 Quasar 438B 模型,1M 词元上下文

    IT之家 9 月 3 日消息,西班牙 AI 公司 Multiverse Computing 最新推出 Quasar 438B 模型,根据 Artificial Analysis 得分, 该模型 Intelligence Index v4.1.1 得分为 43,在参与比较的欧洲模型中排名最高。 IT之家注:该指数综合 9 项评测,覆盖智能体、代码、科学推理、通用知识和长上下文推理,是评估模型能力的主要基准之一。作为对比,Mistral Medium 3.5 得分为 30,NVIDIA Nemotron 3 Ultra 得分为 38。 该模型拥有 4,380 亿参数,定位为推理模型,主要面向企业级智能体、软件开发和复杂多步任务。Quasar 438B 支持英语和西班牙语,并已通过 CompactifAI API 提供访问。 在官方 X 推文下方的“背景信息”中,补充表示该模型可能基于智谱的 GLM5.2 模型制作。 该模型目前属于专...

    推荐理由:来自IT之家 AI的《欧洲最强 AI:西班牙公司推出 Quasar 438B 模型,1M 词元上下文》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 3 日消息,西班牙 AI 公司 Multiverse Computing 最新推出 Quasar 438B 模型,根据 Artificial Analysis 得分, 该模型 Intelligence Index v4.1.1 得分为 43,在参与比较的欧洲模型中排名最高。 IT之家注:该指数综合 9 项评测,覆盖智能体、代码、科学推理、通用知识和长上下文推理,是评估模型能力的主要基准之一。作为对比,Mistral Medium 3.5 得分为 30,NVIDIA Nemotron 3 Ultra 得分为 38。 该模型拥有 4,380 亿参数,定位为推理模型,主要面向企业级智能体、软件开发和复杂多步任务。Quasar 438B 支持英语和西班牙语,并已通过 CompactifAI API 提供访问。 在官方 X 推文下方的“背景信息”中,补充表示该模型可能基于智谱的 GLM5.2 模型制作。 该模型目前属于专...

  3. Claude Code Releases84

    Claude Code Releases v2.1.259:Added managedMcpServers managed setting: organizations can...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.259:Added managedMcpServers managed setting: organizations can... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. GitHub Blog AI53

    Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my!

    这条英文动态主要涉及开源生态。原文要点:From loop engineering to harnesses, squads, and open weights, the GitHub Podcast breaks down the AI terms showing up in developer conversations. The post Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my! appeared first on The GitHub Blog .

    推荐理由:来自GitHub Blog AI的《Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my!》。重点看开源生态。摘要提到:这条英文动态主要涉及开源生态。原文要点:From loop engineering to harnesses, squads, and open weights, the GitHub Podcast breaks down the AI terms showing up in developer conversations. The post Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my! appeared first on The GitHub Blog .

  5. GitHub Changelog88

    Enterprise-managed settings support any default model

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Enterprise-managed settings support any default model 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Enterprise-managed settings support any default。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. Simon Willison85

    llm-gemini 0.34

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:llm-gemini 0.34 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:llm-gemini 0.34 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:llm-gemini 0.34 事实摘要:这条英文动态。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. IT之家 AI70

    谷歌推出 Gemini 3.8 Flash Cyber 模型,内部已全面部署用于代码安全防护

    IT之家 9 月 3 日消息,当地时间 9 月 2 日,谷歌宣布推出 Gemini 3.8 Flash Cyber 模型,通过 Fairwind 计划面向首批受信任的安全防护团队开放。 官方表示,在针对漏洞挖掘的行业权威基准测试 CyberGym 上,Gemini 3.8 Flash Cyber 展现出了顶尖水平的自主漏洞挖掘能力。不仅超越了前代 3.5 Flash Cyber,还将多款体量显著更大的前沿模型甩在身后。 谷歌在更全面的内部基准测试中对 Gemini 3.8 Flash Cyber 进行了评测。该测试要求模型在涵盖 20 种编程语言的复杂代码工程中,挖掘各类型的安全漏洞。结果表明,该模型相较于谷歌此前的模型实现了大幅跨越,漏洞挖掘成功率突破了 70%。 谷歌表示,在研发 Gemini 3.8 Flash Cyber 时,其核心目标是为安全防御方赋予专业级能力,使其在面对攻击方时能够占据主导优势。正因如此,谷歌从一开...

    推荐理由:来自IT之家 AI的《谷歌推出 Gemini 3.8 Flash Cyber 模型,内部已全面部署用于代码安全防护》。重点看模型能力与工程、评测与基准。摘要提到:IT之家 9 月 3 日消息,当地时间 9 月 2 日,谷歌宣布推出 Gemini 3.8 Flash Cyber 模型,通过 Fairwind 计划面向首批受信任的安全防护团队开放。 官方表示,在针对漏洞挖掘的行业权威基准测试 CyberGym 上,Gemini 3.8 Flash Cyber 展现出了顶尖水平的自主漏洞挖掘能力。不仅超越了前代 3.5 Flash Cyber,还将多款体量显著更大的前沿模型甩在身后。 谷歌在更全面的内部基准测试中对 Gemini 3.8 Flash Cyber 进行了评测。该测试要求模型在涵盖 20 种编程语言的复杂代码工程中,挖掘各类型的安全漏洞。结果表明,该模型相较于谷歌此前的模型实现了大幅跨越,漏洞挖掘成功率突破了 70%。 谷歌表示,在研发 Gemini 3.8 Flash Cyber 时,其核心目标是为安全防御方赋予专业级能力,使其在面对攻击方时能够占据主导优势。正因如此,谷歌从一开...

9月2日周三
  1. IT之家 AI74

    谷歌 Gemini 3.8 Flash 模型上线,适用软件工程、智能体任务等场景

    IT之家 9 月 2 日消息,谷歌今天(2 日)在 Google DeepMind 网站低调上线了 Gemini 3.8 Flash 模型。其基于 Gemini 3.7 Flash,拥有在软件工程和智能体知识工作流方面的性能提升,并持续支持可定制的努力水平,以控制质量、成本和延迟的组合。 不过截至IT之家发稿,谷歌官方暂未通过新闻稿或社媒平台官宣这一模型的存在。 Gemini 3.8 Flash 基于 Gemini 3.7 Flash,具有最高 1M 的 token 上下文窗口,文本支持 64K token 输出。官方还公布了多项基准测试评估结果,涵盖编程、知识处理、多模态处理能力、长上下文处理、计算机使用能力以及科学推理能力。 截至 2026 年 9 月的结果如下: 根据介绍,Gemini 3.8 Flash 面向个人用户、开发者和企业,适合以较低成本大规模部署通用型、可直接用于生产环境的智能体,典型用途包括 软件工程、智能体...

    推荐理由:来自IT之家 AI的《谷歌 Gemini 3.8 Flash 模型上线,适用软件工程、智能体任务等场景》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 2 日消息,谷歌今天(2 日)在 Google DeepMind 网站低调上线了 Gemini 3.8 Flash 模型。其基于 Gemini 3.7 Flash,拥有在软件工程和智能体知识工作流方面的性能提升,并持续支持可定制的努力水平,以控制质量、成本和延迟的组合。 不过截至IT之家发稿,谷歌官方暂未通过新闻稿或社媒平台官宣这一模型的存在。 Gemini 3.8 Flash 基于 Gemini 3.7 Flash,具有最高 1M 的 token 上下文窗口,文本支持 64K token 输出。官方还公布了多项基准测试评估结果,涵盖编程、知识处理、多模态处理能力、长上下文处理、计算机使用能力以及科学推理能力。 截至 2026 年 9 月的结果如下: 根据介绍,Gemini 3.8 Flash 面向个人用户、开发者和企业,适合以较低成本大规模部署通用型、可直接用于生产环境的智能体,典型用途包括 软件工程、智能体...

  2. IT之家 AI36

    科学家疑似探测到暗物质首个直接证据,待进一步验证

    IT之家 9 月 2 日消息,科学家近日报告称,他们可能探测到了暗物质的首个直接证据。如果这一发现最终得到证实,将可能成为一项突破性成果。此次潜在探测来自 LUX-ZEPLIN 实验,研究人员发现了一个疑似由弱相互作用大质量粒子(WIMP)与普通物质粒子发生相互作用产生的事件。WIMP 是目前暗物质最主要的假想粒子候选者之一。 暗物质一直是困扰科学家的难题。尽管暗物质约占宇宙总质量的 85%,但科学家至今仍不知道它究竟是什么。由于暗物质不会与电磁辐射,也就是光发生相互作用,因此它不可能由电子、质子和中子构成。电子、质子和中子正是组成原子的基本粒子,而原子又构成了恒星、行星、卫星、人体以及我们日常生活中能够看到的一切物体。 这也推动科学家寻找超越所谓“粒子物理学标准模型”的新型粒子。遗憾的是,到目前为止,这项搜索始终没有取得令人信服的结果。不过,LUX-ZEPLIN 实验或许终于捕捉到了重要线索。 研究人员分析了 LUX-ZEPL...

    推荐理由:来自IT之家 AI的《科学家疑似探测到暗物质首个直接证据,待进一步验证》。重点看模型能力与工程。摘要提到:IT之家 9 月 2 日消息,科学家近日报告称,他们可能探测到了暗物质的首个直接证据。如果这一发现最终得到证实,将可能成为一项突破性成果。此次潜在探测来自 LUX-ZEPLIN 实验,研究人员发现了一个疑似由弱相互作用大质量粒子(WIMP)与普通物质粒子发生相互作用产生的事件。WIMP 是目前暗物质最主要的假想粒子候选者之一。 暗物质一直是困扰科学家的难题。尽管暗物质约占宇宙总质量的 85%,但科学家至今仍不知道它究竟是什么。由于暗物质不会与电磁辐射,也就是光发生相互作用,因此它不可能由电子、质子和中子构成。电子、质子和中子正是组成原子的基本粒子,而原子又构成了恒星、行星、卫星、人体以及我们日常生活中能够看到的一切物体。 这也推动科学家寻找超越所谓“粒子物理学标准模型”的新型粒子。遗憾的是,到目前为止,这项搜索始终没有取得令人信服的结果。不过,LUX-ZEPLIN 实验或许终于捕捉到了重要线索。 研究人员分析了 LUX-ZEPL...

  3. IT之家 AI68

    美光探索近 GPU NAND 闪存,可支撑更大规模 AI 模型

    IT之家 9 月 2 日消息,据 DigiTimes 今天报道,美光正在研究高耐久性 NAND 闪存模块,该公司计划将其部署在距离 GPU 更近的位置,而不是像传统存储方案那样,通过多个协议连接到距 GPU 较远的存储池。 据报道,美光正在探索如何将 NAND 闪存进一步靠近 GPU,希望在存储密度和耐久性之间提供一种折中方案。这种产品当前被称为“近 GPU NAND”(IT之家注:near-GPU NAND),可用于处理非低延迟 / 高带宽工作负载。 这种方案可以让 GPU 直接访问数百 GB 的 NAND 存储池, 它可以直接放置在 GPU 封装内部或 PCB ,工作方式类似 HBM、GDDR7 等方案。与传统 TLC 或 QLC NAND 相比, 这种 NAND 芯片的存储密度更低 ,重点在于提升 I/O 速度、带宽。 该存储层位于显存和普通存储之间,可充当高速缓冲层,因此特别适合运行更大规模的 AI 大语言模型。该方案落...

    推荐理由:来自IT之家 AI的《美光探索近 GPU NAND 闪存,可支撑更大规模 AI 模型》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,据 DigiTimes 今天报道,美光正在研究高耐久性 NAND 闪存模块,该公司计划将其部署在距离 GPU 更近的位置,而不是像传统存储方案那样,通过多个协议连接到距 GPU 较远的存储池。 据报道,美光正在探索如何将 NAND 闪存进一步靠近 GPU,希望在存储密度和耐久性之间提供一种折中方案。这种产品当前被称为“近 GPU NAND”(IT之家注:near-GPU NAND),可用于处理非低延迟 / 高带宽工作负载。 这种方案可以让 GPU 直接访问数百 GB 的 NAND 存储池, 它可以直接放置在 GPU 封装内部或 PCB ,工作方式类似 HBM、GDDR7 等方案。与传统 TLC 或 QLC NAND 相比, 这种 NAND 芯片的存储密度更低 ,重点在于提升 I/O 速度、带宽。 该存储层位于显存和普通存储之间,可充当高速缓冲层,因此特别适合运行更大规模的 AI 大语言模型。该方案落...

  4. IT之家 AI76

    Kimi API 已原生支持 Codex 和 Claude Code

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:Kimi API 已原生支持 Codex 和 Claude Code IT之家 9 月 2 日消息,月之暗面宣布,为满足大家在 Codex 和 Claude Code 中接入 Kimi API 的需求,Kimi API 现已支持 OpenAI 的 Responses API 格式,base_ur。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. IT之家 AI36

    月球藏着超新星遗迹:新模型揭示放射性星尘在月壤中的踪迹

    IT之家 9 月 2 日消息,就像散落在泥土中的闪粉一样,月球表面也遍布着来自超新星爆炸的放射性残骸。 如今,科学家已经能够将月球尘土中混杂的超新星尘埃分离出来。这得益于一种全新的计算机模型。该模型让月球表面成为一座“时间胶囊”,帮助科学家了解太阳系在绕银河系运行并穿越太空的过程中,地球附近曾发生过哪些超新星爆炸。 恒星以超新星形式爆炸时,会向宇宙空间喷射大量碎片,其中一些是以极高速度运动的放射性同位素。这些放射性同位素中的一部分会进入太阳系,并最终落到包括地球和月球在内的各个行星和卫星上。科学家对地球深海沉积物中的放射性同位素进行研究,同时分析阿波罗任务带回的月球土壤样本 —— 科学家称其为“月壤”(regolith),发现超新星活动可能在 230 万年前和 730 万年前出现过两次明显的高峰。 “如果我们掌握了解读星尘的方法,那么过去恒星留下的残骸就能够帮助我们探索地月附近区域漫长而浩瀚的历史,我认为这是一件非常美妙的事情。...

    推荐理由:来自IT之家 AI的《月球藏着超新星遗迹:新模型揭示放射性星尘在月壤中的踪迹》。重点看模型能力与工程。摘要提到:IT之家 9 月 2 日消息,就像散落在泥土中的闪粉一样,月球表面也遍布着来自超新星爆炸的放射性残骸。 如今,科学家已经能够将月球尘土中混杂的超新星尘埃分离出来。这得益于一种全新的计算机模型。该模型让月球表面成为一座“时间胶囊”,帮助科学家了解太阳系在绕银河系运行并穿越太空的过程中,地球附近曾发生过哪些超新星爆炸。 恒星以超新星形式爆炸时,会向宇宙空间喷射大量碎片,其中一些是以极高速度运动的放射性同位素。这些放射性同位素中的一部分会进入太阳系,并最终落到包括地球和月球在内的各个行星和卫星上。科学家对地球深海沉积物中的放射性同位素进行研究,同时分析阿波罗任务带回的月球土壤样本 —— 科学家称其为“月壤”(regolith),发现超新星活动可能在 230 万年前和 730 万年前出现过两次明显的高峰。 “如果我们掌握了解读星尘的方法,那么过去恒星留下的残骸就能够帮助我们探索地月附近区域漫长而浩瀚的历史,我认为这是一件非常美妙的事情。...

  6. 爱范儿66

    李飞飞的 World Labs,把赛博朋克的「超梦」做出来了

    世界模型的「ChatGPT 时刻」 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

    推荐理由:来自爱范儿的《李飞飞的 World Labs,把赛博朋克的「超梦」做出来了》。重点看模型能力与工程。摘要提到:世界模型的「ChatGPT 时刻」 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

  7. IT之家 AI66

    自变量发布 TwinDEX 三指九自由度灵巧操作手,纯无本体数据实现灵巧操作

    IT之家 9 月 2 日消息,具身机器人企业自变量今日发布了一对孪生的三指九自由度灵巧操作手 TwinDEX。 据官方介绍,该灵巧操作手一个可穿戴,用于数据采集;一个装在机器人上,用于真机部署,这首次实现了纯无本体数据、零真机遥操作数据驱动的灵巧操作。 评测显示,TwinDEX 的无本体数据采集效率达到真机遥操作的 5.3 倍;训练模型时无本体数据近乎可 100% 完全替代真机遥操作数据。 官方称,这重塑了具身智能行业对“数据金字塔”的认知:过去,真机遥操作数据因包含丰富的物理交互信息,被视为最有价值、也最难规模化的数据。TwinDEX 则创新性地通过保持采集端与执行端的一致性,并结合完备的数据处理管线和模型训练流程,让无本体数据也能达到媲美真机数据的训练效果。这意味着,灵巧操作训练不再完全受制于高成本真机数据,规模化采集无本体数据、推动机器人能力提升,找到了新的可行路径。 IT之家附官方详细介绍如下: 反向设计破解灵巧操作难题...

    推荐理由:来自IT之家 AI的《自变量发布 TwinDEX 三指九自由度灵巧操作手,纯无本体数据实现灵巧操作》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 2 日消息,具身机器人企业自变量今日发布了一对孪生的三指九自由度灵巧操作手 TwinDEX。 据官方介绍,该灵巧操作手一个可穿戴,用于数据采集;一个装在机器人上,用于真机部署,这首次实现了纯无本体数据、零真机遥操作数据驱动的灵巧操作。 评测显示,TwinDEX 的无本体数据采集效率达到真机遥操作的 5.3 倍;训练模型时无本体数据近乎可 100% 完全替代真机遥操作数据。 官方称,这重塑了具身智能行业对“数据金字塔”的认知:过去,真机遥操作数据因包含丰富的物理交互信息,被视为最有价值、也最难规模化的数据。TwinDEX 则创新性地通过保持采集端与执行端的一致性,并结合完备的数据处理管线和模型训练流程,让无本体数据也能达到媲美真机数据的训练效果。这意味着,灵巧操作训练不再完全受制于高成本真机数据,规模化采集无本体数据、推动机器人能力提升,找到了新的可行路径。 IT之家附官方详细介绍如下: 反向设计破解灵巧操作难题...

  8. IT之家 AI70

    国内首部 AIGC 长剧:《后西游记》策划到上线时间较传统三维动画减少 70%,总成本约为同类 S 级真人剧几分之一

    IT之家 9 月 2 日消息,8 月 31 日,没有真人演员参演的国内首部 AIGC 长剧《后西游记》上线芒果 TV,同步登陆湖南卫视黄金档。 据每日经济新闻今日报道,芒果超媒董事长蔡怀军接受采访时透露, 该剧总成本约为同类 S 级真人剧的几分之一 ;30 集、单集 40 分钟的体量,从策划到上线, 时间较传统三维动画压缩了 70% 。 按照蔡怀军的介绍,导演首先确定作品的情绪基调,美术团队完成人物和环境设计,AI 团队再从文生图推进到图生视频。 导演、编剧和美术仍要参与整个制作过程 ,团队花费更多精力的地方,变成了创意把控、模型生成和不同工序之间的协作。 在会员转化方面,芒果 TV 过去聚集了较多女性用户,但蔡怀军观察到,《后西游记》的神话题材加上电影级的 AI 视觉呈现,对站内用户拉新效果显著。“ 特别是男性用户群体拉新率超出了我们的预期 ,也验证了 AI 长剧在拓宽用户结构上的独特价值。” 作为国内首部 AIGC 长剧 ,...

    推荐理由:来自IT之家 AI的《国内首部 AIGC 长剧:《后西游记》策划到上线时间较传统三维动画减少 70%,总成本约为同类 S 级真人剧几分之一》。重点看模型能力与工程、文化创意、产品发布。摘要提到:IT之家 9 月 2 日消息,8 月 31 日,没有真人演员参演的国内首部 AIGC 长剧《后西游记》上线芒果 TV,同步登陆湖南卫视黄金档。 据每日经济新闻今日报道,芒果超媒董事长蔡怀军接受采访时透露, 该剧总成本约为同类 S 级真人剧的几分之一 ;30 集、单集 40 分钟的体量,从策划到上线, 时间较传统三维动画压缩了 70% 。 按照蔡怀军的介绍,导演首先确定作品的情绪基调,美术团队完成人物和环境设计,AI 团队再从文生图推进到图生视频。 导演、编剧和美术仍要参与整个制作过程 ,团队花费更多精力的地方,变成了创意把控、模型生成和不同工序之间的协作。 在会员转化方面,芒果 TV 过去聚集了较多女性用户,但蔡怀军观察到,《后西游记》的神话题材加上电影级的 AI 视觉呈现,对站内用户拉新效果显著。“ 特别是男性用户群体拉新率超出了我们的预期 ,也验证了 AI 长剧在拓宽用户结构上的独特价值。” 作为国内首部 AIGC 长剧 ,...

  9. 爱范儿70

    刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位

    事实摘要:刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位 大模型理解文字,李飞飞想让 Atlas 理解空间 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程、产品发布。 刚刚,李飞飞掀桌!全球首个多模态世界模型发布,几张照片省掉几百个机位 大模型理解文字。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. IT之家 AI70

    阿里云企业级 Agent 协作平台“万有无界”开启公测

    IT之家 9 月 2 日消息,据阿里云官方消息,今日,阿里云旗下企业级人与 Agent 协作平台“万有无界”开启公测。 企业用户和个人用户均可通过官网 ( https://www.qianwenai.com/agents/wanyou ) 注册体验,可调用阿里最新旗舰模型 Qwen3.8-Max。 据介绍,万有无界是一个多角色 Agent 协作工作台。与让单一 AI Agent 大包大揽不同,它把一件复杂的事拆解给多位有不同职责的 Agent—— 在“项目空间”里组织成员和资产,通过群聊让多位 Agent 围绕同一个任务接力推进,过程中的产出沉淀到资产库,成为企业可复用的数字资产。 IT之家附官方详细介绍如下: 整个平台围绕几个核心功能展开。项目空间是组织协作的容器,把群聊、成员、资产归拢到同一个项目下;Agent 会话分为单聊和群聊两种形态,用户既可以单独与 Agent 对话,也可以在群聊里与多个 Agent 协作;项目由 P...

    推荐理由:来自IT之家 AI的《阿里云企业级 Agent 协作平台“万有无界”开启公测》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 2 日消息,据阿里云官方消息,今日,阿里云旗下企业级人与 Agent 协作平台“万有无界”开启公测。 企业用户和个人用户均可通过官网 ( https://www.qianwenai.com/agents/wanyou ) 注册体验,可调用阿里最新旗舰模型 Qwen3.8-Max。 据介绍,万有无界是一个多角色 Agent 协作工作台。与让单一 AI Agent 大包大揽不同,它把一件复杂的事拆解给多位有不同职责的 Agent—— 在“项目空间”里组织成员和资产,通过群聊让多位 Agent 围绕同一个任务接力推进,过程中的产出沉淀到资产库,成为企业可复用的数字资产。 IT之家附官方详细介绍如下: 整个平台围绕几个核心功能展开。项目空间是组织协作的容器,把群聊、成员、资产归拢到同一个项目下;Agent 会话分为单聊和群聊两种形态,用户既可以单独与 Agent 对话,也可以在群聊里与多个 Agent 协作;项目由 P...

  11. IT之家 AI76

    AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜

    IT之家 9 月 2 日消息,Arena( arena.ai )平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。 国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 ...

    推荐理由:来自IT之家 AI的《AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,Arena( arena.ai )平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。 国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 ...

  12. IT之家 AI72

    消息称腾讯在开发全新 AI 输入法助手“ChatterFly”,中文名可能叫元宝输入法

    IT之家 9 月 2 日消息,据读佳消息, 腾讯在开发全新 AI 输入法助手 App “ChatterFly” (中文名可能叫:元宝输入法),除移动端 App 之外,这款产品或计划推出 Windows、macOS 桌面客户端,打通多端输入场景。 消息称,ChatterFly 是一个智能输入助手产品,支持语音、拼音等主流输入模式,在基础输入能力之上,搭载文本润色、表达优化等 生成式 AI 能力 ,面向用户输出层面提供辅助。 该产品依托腾讯混元大模型,内部配套完整的个人能力模块,覆盖表达 skills、语音记录、输入行为统计、个人词库、以及个性化偏好设置等功能,兼顾输入效率与用户使用习惯沉淀。 产品上线时间,具体功能等一系列详情,一切还需以官方口径为主。 IT之家注意到,腾讯旗下现有搜狗输入法、微信输入法等产品。8 月底,搜狗输入法宣布:“这次,我们把输入法重做了”,上线“AI 服务”总入口,将 AI 帮写、表情搜索、合成表情、AI...

    推荐理由:来自IT之家 AI的《消息称腾讯在开发全新 AI 输入法助手“ChatterFly”,中文名可能叫元宝输入法》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,据读佳消息, 腾讯在开发全新 AI 输入法助手 App “ChatterFly” (中文名可能叫:元宝输入法),除移动端 App 之外,这款产品或计划推出 Windows、macOS 桌面客户端,打通多端输入场景。 消息称,ChatterFly 是一个智能输入助手产品,支持语音、拼音等主流输入模式,在基础输入能力之上,搭载文本润色、表达优化等 生成式 AI 能力 ,面向用户输出层面提供辅助。 该产品依托腾讯混元大模型,内部配套完整的个人能力模块,覆盖表达 skills、语音记录、输入行为统计、个人词库、以及个性化偏好设置等功能,兼顾输入效率与用户使用习惯沉淀。 产品上线时间,具体功能等一系列详情,一切还需以官方口径为主。 IT之家注意到,腾讯旗下现有搜狗输入法、微信输入法等产品。8 月底,搜狗输入法宣布:“这次,我们把输入法重做了”,上线“AI 服务”总入口,将 AI 帮写、表情搜索、合成表情、AI...

  13. 量子位68

    还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍

    事实摘要:还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文 这条动态来自 量子位,可重点关注模型能力与工程。 还在为大模型洗数据熬夜?蚂蚁拿下VLDB工业最佳论文,一套宽表搞定35PB语料,效率狂飙5.6倍 蚂蚁集团推出统一宽表系统O。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. 量子位36

    阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一

    阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一 这条动态来自 量子位,可重点关注模型能力与工程。

    推荐理由:来自量子位的《阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一》。重点看模型能力与工程。摘要提到:阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一 这条动态来自 量子位,可重点关注模型能力与工程。

  15. IT之家 AI68

    马斯克预告 Grok 4.7 十天后上线:参数量增 40%,性能表现有望超越所有 AI 竞品

    IT之家 9 月 2 日消息,全球首富埃隆 · 马斯克(Elon Musk)今天(9 月 2 日)在 X 平台发布推文, 预告将会在未来 10 天后发布 Grok 4.7 模型,预计上线时间为 2026 年 9 月 12 日。 在参数规模方面,马斯克此前已透露称 Grok 4.7 模型参数规模达到 2.1 万亿, 相比较 Grok 4.6(1.5 万亿)增涨 40%。 IT之家附上推文内容如下:“Grok 4.7 参数规模达到 2.1T,除了服务速度略慢之外,在各方面表现均优于 Grok 4.6,且 Token 效率更高” Cognition 于 8 月 13 日发布推文,表示:“相比较 Grok 4.5 模型,Grok 4.6 有了显著的改进,超越了 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。” 马斯克随后转发该推文,并表示:“Grok 4.7 上线后,将会超越所有现有模型。”(以推文 2026 年 8...

    推荐理由:来自IT之家 AI的《马斯克预告 Grok 4.7 十天后上线:参数量增 40%,性能表现有望超越所有 AI 竞品》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,全球首富埃隆 · 马斯克(Elon Musk)今天(9 月 2 日)在 X 平台发布推文, 预告将会在未来 10 天后发布 Grok 4.7 模型,预计上线时间为 2026 年 9 月 12 日。 在参数规模方面,马斯克此前已透露称 Grok 4.7 模型参数规模达到 2.1 万亿, 相比较 Grok 4.6(1.5 万亿)增涨 40%。 IT之家附上推文内容如下:“Grok 4.7 参数规模达到 2.1T,除了服务速度略慢之外,在各方面表现均优于 Grok 4.6,且 Token 效率更高” Cognition 于 8 月 13 日发布推文,表示:“相比较 Grok 4.5 模型,Grok 4.6 有了显著的改进,超越了 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。” 马斯克随后转发该推文,并表示:“Grok 4.7 上线后,将会超越所有现有模型。”(以推文 2026 年 8...

  16. IT之家 AI70

    阿里千问 Qwen3.8-Max-0902 版本模型发布,拿下前端编程总榜冠军

    IT之家 9 月 2 日消息,阿里千问今日宣布 Qwen3.8-Max 模型升级到 0902 版本。 官方围绕编程(Coding)和专业办公(Cowork),对 Qwen3.8-Max 进行了进一步的后训练,使得模型整体性能再度突破, 更适合企业真实复杂任务、科研、长周期任务等 。 在 CodeArena 前端编程总榜中, Qwen3.8-Max 提升 22 分至 1691 分夺得冠军 。这说明,Qwen3.8-Max 拥有更强的智能体编程能力,在多步推理、工具调用、端到端 app 生成方面均刷新了全球模型的新上限。 同时,CodeArena 更新的模型性价比榜单(帕累托前沿)显示, Qwen3.8-Max-0902 新版本每百万 Tokens 综合平均价格为 5 美元 (IT之家注:现汇率约合 33.7 元人民币) ,而当前性能排名第二和第三的模型百万 Tokens 综合价格分别为 20 美元 (现汇率约合 134.7 元人民...

    推荐理由:来自IT之家 AI的《阿里千问 Qwen3.8-Max-0902 版本模型发布,拿下前端编程总榜冠军》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,阿里千问今日宣布 Qwen3.8-Max 模型升级到 0902 版本。 官方围绕编程(Coding)和专业办公(Cowork),对 Qwen3.8-Max 进行了进一步的后训练,使得模型整体性能再度突破, 更适合企业真实复杂任务、科研、长周期任务等 。 在 CodeArena 前端编程总榜中, Qwen3.8-Max 提升 22 分至 1691 分夺得冠军 。这说明,Qwen3.8-Max 拥有更强的智能体编程能力,在多步推理、工具调用、端到端 app 生成方面均刷新了全球模型的新上限。 同时,CodeArena 更新的模型性价比榜单(帕累托前沿)显示, Qwen3.8-Max-0902 新版本每百万 Tokens 综合平均价格为 5 美元 (IT之家注:现汇率约合 33.7 元人民币) ,而当前性能排名第二和第三的模型百万 Tokens 综合价格分别为 20 美元 (现汇率约合 134.7 元人民...

  17. IT之家 AI74

    编程能力追赶 OpenAI 与 Anthropic:谷歌 Gemini 3.8 Flash 最快当地时间周三上线,内部代号“Skimaki”

    IT之家 9 月 2 日消息,据《华尔街日报》当地时间 9 月 1 日报道,谷歌即将发布一款编程能力大幅升级的新模型 Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三上线。 在谷歌内部编程工具 Jetski 的对比测试中,工程师对 Gemini 3.8 Flash 的偏好程度超过了 Anthropic 的 Opus 模型。内部测试结果显示,Gemini 3.8 Flash 在编程方面显著缩小了谷歌与 Anthropic 和 OpenAI 之间的差距。 Gemini 3.8 Flash 的发布正值谷歌 DeepMind 经历重大人事调整之际。上月,DeepMind 联合创始人 Demis Hassabis 卸下日常管理职责,转任部门主席及 Alphabet 首席科学家。长期担任其副手的 Koray Kavukcuoglu 升任 DeepMind 高级副总裁,全面接手日常运营。Kavukc...

    推荐理由:来自IT之家 AI的《编程能力追赶 OpenAI 与 Anthropic:谷歌 Gemini 3.8 Flash 最快当地时间周三上线,内部代号“Skimaki”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,据《华尔街日报》当地时间 9 月 1 日报道,谷歌即将发布一款编程能力大幅升级的新模型 Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三上线。 在谷歌内部编程工具 Jetski 的对比测试中,工程师对 Gemini 3.8 Flash 的偏好程度超过了 Anthropic 的 Opus 模型。内部测试结果显示,Gemini 3.8 Flash 在编程方面显著缩小了谷歌与 Anthropic 和 OpenAI 之间的差距。 Gemini 3.8 Flash 的发布正值谷歌 DeepMind 经历重大人事调整之际。上月,DeepMind 联合创始人 Demis Hassabis 卸下日常管理职责,转任部门主席及 Alphabet 首席科学家。长期担任其副手的 Koray Kavukcuoglu 升任 DeepMind 高级副总裁,全面接手日常运营。Kavukc...

  18. IT之家 AI72

    全球首个多模态世界模型:李飞飞 World Labs 发布 Atlas,像素级精度控制镜头、拍出“子弹时间”大片

    IT之家 9 月 2 日消息,“AI 教母”李飞飞的创企 World Labs 今日发布了“ 全球首个多模态世界模型 ”—— Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。 World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。 通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧, 实现类似“子弹时间”的拍摄效果 。 Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。 Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像 。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。 具体来看,Atlas 能够执行涵盖世界生成、重建和模拟的广泛任务: 相机控制生成:Atlas 通过...

    推荐理由:来自IT之家 AI的《全球首个多模态世界模型:李飞飞 World Labs 发布 Atlas,像素级精度控制镜头、拍出“子弹时间”大片》。重点看模型能力与工程、开源生态、产品发布。摘要提到:IT之家 9 月 2 日消息,“AI 教母”李飞飞的创企 World Labs 今日发布了“ 全球首个多模态世界模型 ”—— Atlas,宣称该模型能够以像素级精确的相机控制生成图像和视频帧,并将其在 3D 中重建。 World Labs 官方介绍,其从头开始对 Atlas 进行预训练,使其能够接受多模态输入,包括相机移动,并将其转化为 3D 视图。 通过在模型的空间上下文中定位多个输入视图,Atlas 允许用户生成具有精确控制的图像和视频帧, 实现类似“子弹时间”的拍摄效果 。 Atlas 还能从一张到多张输入图像输出明确的 3D 模型,超越了顶级开源重建模型。 Atlas 会根据你指定的任意摄像机位置和角度生成一个或多个参考图像 。生成的视图与输入图像的内容和几何形状相匹配,能够平滑地扩展图像,自主想象输入中看不到的场景部分。 具体来看,Atlas 能够执行涵盖世界生成、重建和模拟的广泛任务: 相机控制生成:Atlas 通过...

  19. 量子位68

    李飞飞发布:全球首个多模态世界模型

    一张图补全3D世界,还能给机器人造训练场 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。

    推荐理由:来自量子位的《李飞飞发布:全球首个多模态世界模型》。重点看模型能力与工程、产品发布。摘要提到:一张图补全3D世界,还能给机器人造训练场 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。

  20. IT之家 AI70

    Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写

    IT之家 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe, 这是其首个实时音频感知模型。 开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元 (现汇率约合 20.2 元人民币) ,等同每小时 0.18 美元 (现汇率约合 1.2 元人民币) 。 该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。 IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。 Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。 模型训练覆盖 70 余...

    推荐理由:来自IT之家 AI的《Meta 发布首个实时音频感知 AI 模型,支持 20 余人分轨转写》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe, 这是其首个实时音频感知模型。 开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元 (现汇率约合 20.2 元人民币) ,等同每小时 0.18 美元 (现汇率约合 1.2 元人民币) 。 该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。 IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。 Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。 模型训练覆盖 70 余...

  21. Apple Machine Learning Research50

    REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:REFACTOR-VLA: Unsupervised Library Learning of Typed Moto。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  22. Claude Code Releases82

    Claude Code Releases v2.1.258:Fixed Claude Code failing to launch on macOS 12 (Monterey)...

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.258:Fixed Claude Code failing to launch on macOS 12 (Monterey)... 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.258:Fix。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  23. IT之家 AI76

    Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75%

    IT之家 9 月 2 日消息,当地时间 9 月 1 日,Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1 模型。该公司称这两款模型为“全球最先进的编程与知识工作模型”。 Fable 5.1 与 Mythos 5.1 采用相同的基础模型,区别在于安全防护等级不同 ——Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过可信访问计划向经过审核的网络安全和生命科学领域的机构提供。 性能方面,Anthropic 披露的基准测试数据显示,Fable 5.1 在多项测试中超过了前代 Fable 5、Opus 5 以及 OpenAI 的 GPT-5.6 Sol。 在智能体科学研究基准 Terminal-Bench-Science 0.1 中,Fable 5.1 得分为 52.6%,而 Fable 5 为 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 为 2...

    推荐理由:来自IT之家 AI的《Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75%》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 2 日消息,当地时间 9 月 1 日,Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1 模型。该公司称这两款模型为“全球最先进的编程与知识工作模型”。 Fable 5.1 与 Mythos 5.1 采用相同的基础模型,区别在于安全防护等级不同 ——Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过可信访问计划向经过审核的网络安全和生命科学领域的机构提供。 性能方面,Anthropic 披露的基准测试数据显示,Fable 5.1 在多项测试中超过了前代 Fable 5、Opus 5 以及 OpenAI 的 GPT-5.6 Sol。 在智能体科学研究基准 Terminal-Bench-Science 0.1 中,Fable 5.1 得分为 52.6%,而 Fable 5 为 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 为 2...

  24. Claude Code Releases86

    Claude Code Releases v2.1.257:Added Claude Fable 5.1 ( claude-fable-5-1 ), now the defau...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.257:Added Claude Fable 5.1 ( claude-fable-5-1 ), now the defau... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  25. IT之家 AI68

    谷歌推出智能体视频理解功能:提升 Gemini 模型视频分析准确率,大幅降本减耗

    IT之家 9 月 2 日消息,谷歌今日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,推出 智能体视频理解(agentic video understanding) 功能。该新功能可提升视频分析准确率,同时大幅减少视频分析过程中的 Token 使用量和成本。 该功能使用标准 Gemini API Token 定价,不收取额外功能费用。 与现有“静态”处理方式(模型按固定帧率读取视频,默认 1 FPS,可通过 API 调整)不同,智能体视频理解将模型核心推理与原生视频工具结合,可在视觉帧、音频和转录文本中动态搜索、扫描和检查目标视频片段。 在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型可将 分析成本降低最高 66% , Token 消耗量降低最高 88% ,同时将准确率提升最高 7%。这类效率提升在长视频场景中尤为明显,因为传统静态处理会让开发者不得...

    推荐理由:来自IT之家 AI的《谷歌推出智能体视频理解功能:提升 Gemini 模型视频分析准确率,大幅降本减耗》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 2 日消息,谷歌今日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,推出 智能体视频理解(agentic video understanding) 功能。该新功能可提升视频分析准确率,同时大幅减少视频分析过程中的 Token 使用量和成本。 该功能使用标准 Gemini API Token 定价,不收取额外功能费用。 与现有“静态”处理方式(模型按固定帧率读取视频,默认 1 FPS,可通过 API 调整)不同,智能体视频理解将模型核心推理与原生视频工具结合,可在视觉帧、音频和转录文本中动态搜索、扫描和检查目标视频片段。 在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型可将 分析成本降低最高 66% , Token 消耗量降低最高 88% ,同时将准确率提升最高 7%。这类效率提升在长视频场景中尤为明显,因为传统静态处理会让开发者不得...

  26. Google AI Blog55

    Try Google Pics: Easy image creation and editing in Google Workspace

    这条英文动态主要涉及模型能力与工程。原文要点:Built on our latest Nano Banana model, Google Pics — our image creation and editing tool — is now available.

    推荐理由:来自Google AI Blog的《Try Google Pics: Easy image creation and editing in Google Workspace》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Built on our latest Nano Banana model, Google Pics — our image creation and editing tool — is now available.

9月1日周二
  1. Simon Willison45

    datasette-mcp 0.2

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:datasette-mcp 0.2 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:datasette-mcp 0.2 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:datasette-mcp 0.2 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:datasette-m。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. Simon Willison83

    Python 3.15.0 candidate 2 is here!

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Python 3.15.0 candidate 2 is here! 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Python 3.15.0 candidate 2 is here! 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文。影响判断:它可能改变模型能力与工程、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. GitHub Changelog89

    Claude Fable 5.1 is generally available in GitHub Copilot

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Fable 5.1 is generally available in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Fable 5.1 is generally available in GitHub Copilot。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI36

    英伟达 DLSS 5 发布:支持 RTX 50 系显卡,首发支持《NBA 2K27》游戏

    IT之家 9 月 1 日消息,英伟达官方今天发布 DLSS 5 技术, 首发支持游戏有《NBA 2K27》 , 支持所有 RTX 50 系显卡的笔记本和台式电脑 ,以及 GeForce NOW 云游戏平台。 据悉,《NBA 2K27》由 Visual Concepts 开发、2K 发行,本作利用 DLSS 5 全面改善全明星后卫凯德 · 坎宁安(Cade Cunningham)的皮肤次表面散射效果,并提高颈部和球衣领口附近的接触阴影精度,头发表现更加细致,进一步增强角色真实感。 同时,DLSS 5 还将提升控球后卫泰瑞斯 · 哈利伯顿(Tyrese Haliburton)的面部色调、鼻子下巴接触阴影,还可在护臂袖口褶皱呈现更清晰的阴影细节。场边观众和工作人员同样应用自然皮肤次表面散射及清晰接触阴影,使人物模型画面质量得到大幅提升。 当玩家使用 RTX 5090 显卡时,本作在 4K 分辨率、Ultra 画质、开启光追下,最高帧率...

    推荐理由:来自IT之家 AI的《英伟达 DLSS 5 发布:支持 RTX 50 系显卡,首发支持《NBA 2K27》游戏》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 1 日消息,英伟达官方今天发布 DLSS 5 技术, 首发支持游戏有《NBA 2K27》 , 支持所有 RTX 50 系显卡的笔记本和台式电脑 ,以及 GeForce NOW 云游戏平台。 据悉,《NBA 2K27》由 Visual Concepts 开发、2K 发行,本作利用 DLSS 5 全面改善全明星后卫凯德 · 坎宁安(Cade Cunningham)的皮肤次表面散射效果,并提高颈部和球衣领口附近的接触阴影精度,头发表现更加细致,进一步增强角色真实感。 同时,DLSS 5 还将提升控球后卫泰瑞斯 · 哈利伯顿(Tyrese Haliburton)的面部色调、鼻子下巴接触阴影,还可在护臂袖口褶皱呈现更清晰的阴影细节。场边观众和工作人员同样应用自然皮肤次表面散射及清晰接触阴影,使人物模型画面质量得到大幅提升。 当玩家使用 RTX 5090 显卡时,本作在 4K 分辨率、Ultra 画质、开启光追下,最高帧率...

  5. OpenAI News83

    Path to Astra: critical capabilities and frontier safeguards

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Path to Astra: critical capabilities and frontier safeguards 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Path to Astra: critical capabilities and frontier safeguards 事实摘。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. IT之家 AI70

    中科曙光预热全球首款 64 线程移动工作站:16GB 显存、16.9mm 厚度

    IT之家 9 月 1 日消息,中科曙光 (Sugon) 今日宣布将推出 全球首款 64 线程移动工作站 (MWS)。 IT之家获悉,这款设备 机身厚度仅 16.9mm ,配备 16GB 显存,本地运行 35B MoE 模型可实现 50 Tokens/s 的输出速率,AI 推理速度最高可达业界主流产品 3~5 倍。

    推荐理由:来自IT之家 AI的《中科曙光预热全球首款 64 线程移动工作站:16GB 显存、16.9mm 厚度》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 1 日消息,中科曙光 (Sugon) 今日宣布将推出 全球首款 64 线程移动工作站 (MWS)。 IT之家获悉,这款设备 机身厚度仅 16.9mm ,配备 16GB 显存,本地运行 35B MoE 模型可实现 50 Tokens/s 的输出速率,AI 推理速度最高可达业界主流产品 3~5 倍。

  7. IT之家 AI72

    豆包、清华大学一起“开课”,《AI 赋能学术研究:人机互动的知识生产》课程开放报名

    IT之家 9 月 1 日消息,“豆包”公众号今天(1 日)发文称,清华大学 2026 年秋季学期校级课程《人工智能赋能学术研究:人机互动的知识生产》面向全校学生开放报名。 根据介绍,课程主要分享 AI 在真实研究流程中的应用,并与豆包工作深度协作,将前沿大模型对接学术场景,完成问题发现、知识综述、数据分析等环节。 课程目标:本课程覆盖从选题到发表的研究全流程,以人机协同方式完成问题发现、知识综述、数据分析与成果发表。 教学特色:课程邀请顶尖行业专家与跨学科教师结合自身科研实践,分享 AI 在真实研究中的应用,并与豆包深度合作,将前沿大模型对接真实学术场景。 学生共创:学生可随时针对 AI 工具提出反馈,推动产品迭代,成为 AI 学术工具的共创者。课程将组织前往豆包参访,与一线工程师面对面。 授课对象:面向清华大学全体在校学生,涵盖各专业本科、硕士及博士生。 同时,授课团队还将把清华课堂延展到线上,将学术实践方法流程沉淀为可复用的...

    推荐理由:来自IT之家 AI的《豆包、清华大学一起“开课”,《AI 赋能学术研究:人机互动的知识生产》课程开放报名》。重点看模型能力与工程、教育应用、产品发布。摘要提到:IT之家 9 月 1 日消息,“豆包”公众号今天(1 日)发文称,清华大学 2026 年秋季学期校级课程《人工智能赋能学术研究:人机互动的知识生产》面向全校学生开放报名。 根据介绍,课程主要分享 AI 在真实研究流程中的应用,并与豆包工作深度协作,将前沿大模型对接学术场景,完成问题发现、知识综述、数据分析等环节。 课程目标:本课程覆盖从选题到发表的研究全流程,以人机协同方式完成问题发现、知识综述、数据分析与成果发表。 教学特色:课程邀请顶尖行业专家与跨学科教师结合自身科研实践,分享 AI 在真实研究中的应用,并与豆包深度合作,将前沿大模型对接真实学术场景。 学生共创:学生可随时针对 AI 工具提出反馈,推动产品迭代,成为 AI 学术工具的共创者。课程将组织前往豆包参访,与一线工程师面对面。 授课对象:面向清华大学全体在校学生,涵盖各专业本科、硕士及博士生。 同时,授课团队还将把清华课堂延展到线上,将学术实践方法流程沉淀为可复用的...