跳到正文
9月10日周四
  1. IT之家 AI68

    DeepSeek V4.1 Flash 模型上线国家超算互联网

    IT之家 9 月 10 日消息,DeepSeek V4.1 Flash 模型今日上线国家 超算互联网中心。用户可登录国家超算互联网官网, 从首页进入「模型服务」页面,即可快速打开 DeepSeek V4.1 Flash 模型 API 调用界面。 据IT之家了解,DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。 同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。 此外,DeepSeek V4.1 Flash 大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/...

    推荐理由:来自IT之家 AI的《DeepSeek V4.1 Flash 模型上线国家超算互联网》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 10 日消息,DeepSeek V4.1 Flash 模型今日上线国家 超算互联网中心。用户可登录国家超算互联网官网, 从首页进入「模型服务」页面,即可快速打开 DeepSeek V4.1 Flash 模型 API 调用界面。 据IT之家了解,DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。 同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。 此外,DeepSeek V4.1 Flash 大幅减少了 KV Cache 缓存的大小,与上一代模型相比,对 HBM 的需求减少到 1/4,对 SSD 的需求减少到 1/...

  2. IT之家 AI72

    DeepMind 工程师反驳“谷歌搞不出前沿模型”:Gemini 3.8 Cyber 已在多项测试中优于 Mythos

    IT之家 9 月 10 日消息,AI 研究员伊森 · 莫利克( Ethan Mollick )今日在 X 平台发文称,谷歌已不再拥有前沿模型,这代表着谷歌将错失数学领域,以及网络安全领域。 谷歌 DeepMind 工程师洛根 · 基尔帕特里克( Logan Kilpatrick )对此反驳称, Gemini 3.8 Cyber 在许多网络安全测试、实际应用能力已经超过 Anthropic 的 Mythos 。谷歌内部的 Chrome、Wiz 和 Cloud 团队已经广泛使用该模型。 IT之家注意到,该工程师还进一步表示:“我们的重点是让越来越多的网络安全防御人员拥有更强能力。Gemini 4 系列模型将继续推动前沿网络安全模型发展。”

    推荐理由:来自IT之家 AI的《DeepMind 工程师反驳“谷歌搞不出前沿模型”:Gemini 3.8 Cyber 已在多项测试中优于 Mythos》。重点看模型能力与工程。摘要提到:IT之家 9 月 10 日消息,AI 研究员伊森 · 莫利克( Ethan Mollick )今日在 X 平台发文称,谷歌已不再拥有前沿模型,这代表着谷歌将错失数学领域,以及网络安全领域。 谷歌 DeepMind 工程师洛根 · 基尔帕特里克( Logan Kilpatrick )对此反驳称, Gemini 3.8 Cyber 在许多网络安全测试、实际应用能力已经超过 Anthropic 的 Mythos 。谷歌内部的 Chrome、Wiz 和 Cloud 团队已经广泛使用该模型。 IT之家注意到,该工程师还进一步表示:“我们的重点是让越来越多的网络安全防御人员拥有更强能力。Gemini 4 系列模型将继续推动前沿网络安全模型发展。”

  3. IT之家 AI70

    英伟达与 Palantir 达成合作,将主权 AI 引入关键供应链

    IT之家 9 月 10 日消息,Palantir 与英伟达今日宣布达成合作,将主权 AI 技术落地于关键供应链领域,合作率先从英伟达自身的生产运营场景启动。 据IT之家了解,此次部署将打造一套 AI 技术栈,把英伟达 Nemotron 开源模型接入 Palantir Foundry 平台及人工智能平台(AIP),并以 Palantir 本体框架为底层支撑。这套技术栈旨在实现前所未有的供应链可视化能力,识别产能瓶颈,持续沉淀运营专业经验,并以机器级速度辅助决策 —— 在保障英伟达 AI 基础设施供应链可靠性与运转效率的同时,确保企业对自有专有数据的控制权与所有权。 支撑本次合作的这套 AI 技术栈及其跨行业应用方案,将在 Palantir AIPCon 11 大会上进行深度展示。农业、制造业、制药、零售、科技等复杂行业的企业及政府机构,均可借助这套 AI 技术栈优化自身专属的供应链运营。 英伟达拥有全球最复杂的供应链体系之一,覆盖...

    推荐理由:来自IT之家 AI的《英伟达与 Palantir 达成合作,将主权 AI 引入关键供应链》。重点看模型能力与工程、开源生态。摘要提到:IT之家 9 月 10 日消息,Palantir 与英伟达今日宣布达成合作,将主权 AI 技术落地于关键供应链领域,合作率先从英伟达自身的生产运营场景启动。 据IT之家了解,此次部署将打造一套 AI 技术栈,把英伟达 Nemotron 开源模型接入 Palantir Foundry 平台及人工智能平台(AIP),并以 Palantir 本体框架为底层支撑。这套技术栈旨在实现前所未有的供应链可视化能力,识别产能瓶颈,持续沉淀运营专业经验,并以机器级速度辅助决策 —— 在保障英伟达 AI 基础设施供应链可靠性与运转效率的同时,确保企业对自有专有数据的控制权与所有权。 支撑本次合作的这套 AI 技术栈及其跨行业应用方案,将在 Palantir AIPCon 11 大会上进行深度展示。农业、制造业、制药、零售、科技等复杂行业的企业及政府机构,均可借助这套 AI 技术栈优化自身专属的供应链运营。 英伟达拥有全球最复杂的供应链体系之一,覆盖...

  4. IT之家 AI72

    高德发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7,实现从星球到街景的全尺寸 AI 生成

    IT之家 9 月 10 日消息,今日阿里巴巴集团旗下高德正式发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7。依托 3D 原生技术架构与高德海量时空数据积累,ABot-Earth 0.7 支持从星球到街景的一体化全尺寸 AI 生成,并将多种空间信息组织为可连续进入、自由探索和实时交互的三维数字孪生世界,从而构建起目前覆盖范围最广的数字地球,覆盖超过 196 个国家和地区。 “大模型理解语言,高德空间智能理解世界。”高德 CEO 郭宁认为,世界不只存在于语言里,它更存在于二维的网络拓扑、三维的空间结构、真实世界的“流动”以及时间的变化中。ABot-Earth 0.7 作为全球首个全模态、可预测、3D 原生的城市世界模型,其核心价值是让 Earth 从一个只能浏览的数字地球,变成了高德空间智能理解真实世界的入口。 3D 原生重建数字地球,城市探索有了在场感 过去二十年,数字地球主要建立在卫星影像、航拍和点云重建之上...

    推荐理由:来自IT之家 AI的《高德发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7,实现从星球到街景的全尺寸 AI 生成》。重点看模型能力与工程、文化创意、产品发布。摘要提到:IT之家 9 月 10 日消息,今日阿里巴巴集团旗下高德正式发布全球首个 3D 原生城市世界模型 ABot-Earth 0.7。依托 3D 原生技术架构与高德海量时空数据积累,ABot-Earth 0.7 支持从星球到街景的一体化全尺寸 AI 生成,并将多种空间信息组织为可连续进入、自由探索和实时交互的三维数字孪生世界,从而构建起目前覆盖范围最广的数字地球,覆盖超过 196 个国家和地区。 “大模型理解语言,高德空间智能理解世界。”高德 CEO 郭宁认为,世界不只存在于语言里,它更存在于二维的网络拓扑、三维的空间结构、真实世界的“流动”以及时间的变化中。ABot-Earth 0.7 作为全球首个全模态、可预测、3D 原生的城市世界模型,其核心价值是让 Earth 从一个只能浏览的数字地球,变成了高德空间智能理解真实世界的入口。 3D 原生重建数字地球,城市探索有了在场感 过去二十年,数字地球主要建立在卫星影像、航拍和点云重建之上...

  5. IT之家 AI72

    支持前实习生创业项目:消息称阿里拟领投 AI 评测公司 UniPat 的 3 亿美元融资

    IT之家 9 月 10 日消息,据彭博社今天(10 日)上午报道,阿里巴巴集团拟领投 AI 训练与基准测试初创公司 UniPat AI 的一轮 3 亿美元 (IT之家注:现汇率约合 20.18 亿元人民币) 融资,本轮估值达 25 亿美元 (现汇率约合 168.14 亿元人民币) 。这笔投资也是阿里巴巴对一名前实习生创业的认可。 知情人士透露,融资预计很快完成,腾讯控股及红杉等老股东也参与投资。各方仍在磋商,交易细节可能发生变化。 UniPat 由 去年在通义 AI 实验室从事后训练分析、数据合成和强化学习工作 的李宽创办,为 AI 模型设计贴近真实使用环境的测试与评估场景。该公司专门生成细致的训练和评测数据,计划向 AI 领域的其他研究人员及企业出售。 这笔融资说明,为了获得高质量数据、了解 AI 系统的表现,巨头是愿意支付高价的。 UniPat 成立于 2025 年末,提供的基准测试涵盖 AI 编程智能体的软件工程能力、浏览...

    推荐理由:来自IT之家 AI的《支持前实习生创业项目:消息称阿里拟领投 AI 评测公司 UniPat 的 3 亿美元融资》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 10 日消息,据彭博社今天(10 日)上午报道,阿里巴巴集团拟领投 AI 训练与基准测试初创公司 UniPat AI 的一轮 3 亿美元 (IT之家注:现汇率约合 20.18 亿元人民币) 融资,本轮估值达 25 亿美元 (现汇率约合 168.14 亿元人民币) 。这笔投资也是阿里巴巴对一名前实习生创业的认可。 知情人士透露,融资预计很快完成,腾讯控股及红杉等老股东也参与投资。各方仍在磋商,交易细节可能发生变化。 UniPat 由 去年在通义 AI 实验室从事后训练分析、数据合成和强化学习工作 的李宽创办,为 AI 模型设计贴近真实使用环境的测试与评估场景。该公司专门生成细致的训练和评测数据,计划向 AI 领域的其他研究人员及企业出售。 这笔融资说明,为了获得高质量数据、了解 AI 系统的表现,巨头是愿意支付高价的。 UniPat 成立于 2025 年末,提供的基准测试涵盖 AI 编程智能体的软件工程能力、浏览...

  6. IT之家 AI72

    刷新全球开源模型多项评测 SOTA,宇树科技开源全新一代通用人形机器人基座模型 UnifoLM-WLA-1.0

    IT之家 9 月 10 日消息,宇树科技宣布完全开源 UnifoLM-WLA-1.0 具身基座模型,刷新全球开源模型多项评测 SOTA。单模型统筹桌面与全身移动操作,支持跨任务、跨末端执行器泛化。 据介绍,UnifoLM-WLA-1.0 是宇树科技全新一代通用人形机器人基础模型,依托大规模通用多模态感知与理解数据,融合以交互为中心的世界建模,全面提升空间感知与理解能力,在多项具身推理评测中领先国内外开源模型,亦可比肩头部闭源模型。真机评测实现单模型统筹 64 个任务,覆盖桌面操作与全身移动操作,具备跨任务、跨末端执行器的泛化能力。 IT之家附官方介绍视频如下:

    推荐理由:来自IT之家 AI的《刷新全球开源模型多项评测 SOTA,宇树科技开源全新一代通用人形机器人基座模型 UnifoLM-WLA-1.0》。重点看模型能力与工程、评测与基准、开源生态。摘要提到:IT之家 9 月 10 日消息,宇树科技宣布完全开源 UnifoLM-WLA-1.0 具身基座模型,刷新全球开源模型多项评测 SOTA。单模型统筹桌面与全身移动操作,支持跨任务、跨末端执行器泛化。 据介绍,UnifoLM-WLA-1.0 是宇树科技全新一代通用人形机器人基础模型,依托大规模通用多模态感知与理解数据,融合以交互为中心的世界建模,全面提升空间感知与理解能力,在多项具身推理评测中领先国内外开源模型,亦可比肩头部闭源模型。真机评测实现单模型统筹 64 个任务,覆盖桌面操作与全身移动操作,具备跨任务、跨末端执行器的泛化能力。 IT之家附官方介绍视频如下:

  7. 量子位44

    全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口

    事实摘要:全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口 9月10日,阿里巴巴集团旗下高德正式发布全球首个3D原生城市世界模型ABot-Earth 0.7。 这条动态来自 量子位,可重点关注模型能力与工程、文化创意、产品发布。 全球首个3D原生城市世界模型ABot-Earth 0.7发布,构建AI理解真实世界的入口 9月10日。影响判断:它可能改变模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. 量子位37

    这个新开源的世界模型只有1.3B,单卡就能实时跑!

    轻量版LingBot-World 2.0 这条动态来自 量子位,可重点关注模型能力与工程、开源生态。

    推荐理由:来自量子位的《这个新开源的世界模型只有1.3B,单卡就能实时跑!》。重点看模型能力与工程、开源生态。摘要提到:轻量版LingBot-World 2.0 这条动态来自 量子位,可重点关注模型能力与工程、开源生态。

  9. 量子位66

    AGI时代的第一个生图模型,ChatGPT Images 2.5上线

    事实摘要:ChatGPT Images 2.5 是 AGI时代的第一个生图模型。影响判断:生成更快,细节更好,改图也终于越来越像‘真·修图’了。场景价值:适用于需要快速生成高质量图像的场景,如广告、设计等。

    推荐理由:该模型通过优化生成速度和提高细节处理能力,使其在图像生成领域具有竞争优势。

  10. IT之家 AI74

    AI 智能体出现失控行为,OpenAI 呼吁美国出台强制性全国 AI 安全法规

    IT之家 9 月 10 日消息,据路透社报道,OpenAI 当地时间周三表示,鉴于自身部分 AI 智能体出现失控行为,出于对该技术可能加速自身发展的担忧,该公司正推动美国出台强制性的全国人工智能安全法规。 IT之家注意到,包括 OpenAI 在内的多家开发商的 AI 模型在测试期间访问外部系统的多起事件,凸显了在高级智能体中遏制意外行为的难度,也引发了对更严格安全法规的呼吁。 OpenAI 全球事务主管克里斯 · 莱昂在一篇博客文章中表示:“AI 加速的 AI 开发前景要求的不仅仅是自愿承诺。美国需要制定强制性、基于能力的国家监管规则,使其能随着技术的发展而不断完善。” 这标志着 OpenAI 大力推动制定具有约束力的国家人工智能安全规则,而目前美国国会尚未制定联邦人工智能法律框架,与此同时美国已有多个州出台了各自的相关立法。 这家人工智能巨头及其竞争对手 Anthropic 正筹备首次公开募股,与此同时人工智能正迅速成为本十年...

    推荐理由:来自IT之家 AI的《AI 智能体出现失控行为,OpenAI 呼吁美国出台强制性全国 AI 安全法规》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 10 日消息,据路透社报道,OpenAI 当地时间周三表示,鉴于自身部分 AI 智能体出现失控行为,出于对该技术可能加速自身发展的担忧,该公司正推动美国出台强制性的全国人工智能安全法规。 IT之家注意到,包括 OpenAI 在内的多家开发商的 AI 模型在测试期间访问外部系统的多起事件,凸显了在高级智能体中遏制意外行为的难度,也引发了对更严格安全法规的呼吁。 OpenAI 全球事务主管克里斯 · 莱昂在一篇博客文章中表示:“AI 加速的 AI 开发前景要求的不仅仅是自愿承诺。美国需要制定强制性、基于能力的国家监管规则,使其能随着技术的发展而不断完善。” 这标志着 OpenAI 大力推动制定具有约束力的国家人工智能安全规则,而目前美国国会尚未制定联邦人工智能法律框架,与此同时美国已有多个州出台了各自的相关立法。 这家人工智能巨头及其竞争对手 Anthropic 正筹备首次公开募股,与此同时人工智能正迅速成为本十年...

  11. OpenAI News78

    Introducing ChatGPT for Financial Services

    这条英文动态主要涉及模型能力与工程。原文要点:Introducing ChatGPT for Financial Services, combining built-in financial data and GPT-6 Astra for research, modeling, and client-ready materials.

    推荐理由:来自OpenAI News的《Introducing ChatGPT for Financial Services》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Introducing ChatGPT for Financial Services, combining built-in financial data and GPT-6 Astra for research, modeling, and client-ready materials.

  12. IT之家 AI74

    DeepSeek V4.1 Flash 模型正式发布:全面超越 V4 Pro、原生多模态视觉理解,API 定价下调

    IT之家 9 月 10 日消息,深度求索今日正式发布 DeepSeek V4.1 Flash 模型 。这是其全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。 新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。 DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型 ,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。 ▲ DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比 此外,新一代模型大幅减少了 KV Cache 缓存的大小,与...

    推荐理由:来自IT之家 AI的《DeepSeek V4.1 Flash 模型正式发布:全面超越 V4 Pro、原生多模态视觉理解,API 定价下调》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 10 日消息,深度求索今日正式发布 DeepSeek V4.1 Flash 模型 。这是其全新模型结构系列中的最小尺寸的模型,具备原生多模态视觉理解能力。 新模型结构的设计初衷是:能力上限更高、推理速度更快、吞吐更大、可扩展到更大参数模型。 DeepSeek V4.1 Flash 为 552B 参数的 MoE 模型 ,采用了全新的 Causal-Encoder-Decoder 结构,输入和输出不对称,输入激活只有 8B,输出激活 16B,成本显著低于已知的同尺寸模型。同时,V4.1 Flash 还采用了新的预训练方式、经过了更大规模的强化学习后训练,在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。 ▲ DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比 此外,新一代模型大幅减少了 KV Cache 缓存的大小,与...

  13. IT之家 AI68

    DeepSeek Harness 0.1.5 更新:适配 DeepSeek V4.1 Flash 模型,新增文件上传与侧边栏预览功能

    IT之家 9 月 10 日消息,DeepSeek Harness v0.1.5 版本现已发布。新版本与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 DeepSeek Harness 不同配置中进行了专项训练和优化。 新版同时为插件作者提供更多标准化 UI 扩展入口,新增文件上传、侧边栏文件预览等功能,优化 UI 性能与交互,并持续增加与模型研究前沿结合的实验性功能。 面向 DeepSeek V4.1 Flash 模型的适配方面,该模型针对 DeepSeek Harness 专项训练和优化,覆盖标准模式、程序化工具调用(PTC)模式和极简模式。使用该模型时,新版本支持在保留已有 KV Cache 的情况下更新系统提示词。IT之家注:KV Cache 是模型推理中缓存键值对以加速生成的技术。 文件处理与预览方面,Web 界面支持上传图片、PDF 等多种文件,模型可通过文件工具按需读取。右侧 Sidebar 支持...

    推荐理由:来自IT之家 AI的《DeepSeek Harness 0.1.5 更新:适配 DeepSeek V4.1 Flash 模型,新增文件上传与侧边栏预览功能》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 10 日消息,DeepSeek Harness v0.1.5 版本现已发布。新版本与 DeepSeek V4.1 Flash 模型训练深度结合,模型在 DeepSeek Harness 不同配置中进行了专项训练和优化。 新版同时为插件作者提供更多标准化 UI 扩展入口,新增文件上传、侧边栏文件预览等功能,优化 UI 性能与交互,并持续增加与模型研究前沿结合的实验性功能。 面向 DeepSeek V4.1 Flash 模型的适配方面,该模型针对 DeepSeek Harness 专项训练和优化,覆盖标准模式、程序化工具调用(PTC)模式和极简模式。使用该模型时,新版本支持在保留已有 KV Cache 的情况下更新系统提示词。IT之家注:KV Cache 是模型推理中缓存键值对以加速生成的技术。 文件处理与预览方面,Web 界面支持上传图片、PDF 等多种文件,模型可通过文件工具按需读取。右侧 Sidebar 支持...

  14. IT之家 AI68

    中国科学技术大学陆朝阳:有些公司号称量子计算可以用来养猪,简直匪夷所思

    9 月 10 日,中国科学技术大学上海研究院执行院长、世界青年科学家联合会理事长陆朝阳在 2026 Inclusion· 外滩大会上表示, 量子计算不是能加速一切的超级 GPU,只对特定问题有加速效果 。很遗憾,对于当下大模型这类重要场景,目前科学界还没有公认的量子加速算法。所以大家不要过度狂热,遇到明显不实的宣传要理性看待。 他指出,真正适合量子计算的方向是 分子、材料模拟 ,从国家战略层面,最重要的是不对称信息安全优势。一旦可以破解现在广泛使用的 RSA、椭圆加密,会对金融、信息安全领域带来致命影响。 陆朝阳表示,最强团队尚且在悬赏寻找算法,反观国内不少量子公司,已经宣称用量子计算研发新药、做量子金融, 甚至之前宣传量子计算可以用来养猪 。在学术界看来,这类说法匪夷所思。

    推荐理由:来自IT之家 AI的《中国科学技术大学陆朝阳:有些公司号称量子计算可以用来养猪,简直匪夷所思》。重点看模型能力与工程。摘要提到:9 月 10 日,中国科学技术大学上海研究院执行院长、世界青年科学家联合会理事长陆朝阳在 2026 Inclusion· 外滩大会上表示, 量子计算不是能加速一切的超级 GPU,只对特定问题有加速效果 。很遗憾,对于当下大模型这类重要场景,目前科学界还没有公认的量子加速算法。所以大家不要过度狂热,遇到明显不实的宣传要理性看待。 他指出,真正适合量子计算的方向是 分子、材料模拟 ,从国家战略层面,最重要的是不对称信息安全优势。一旦可以破解现在广泛使用的 RSA、椭圆加密,会对金融、信息安全领域带来致命影响。 陆朝阳表示,最强团队尚且在悬赏寻找算法,反观国内不少量子公司,已经宣称用量子计算研发新药、做量子金融, 甚至之前宣传量子计算可以用来养猪 。在学术界看来,这类说法匪夷所思。

  15. 量子位38

    一周连发6个模型!这家公司把具身智能的闭环跑通了

    事实摘要:一周连发6个模型!这家公司把具身智能的闭环跑通了 模型可以开源,部署经验不能 这条动态来自 量子位,可重点关注模型能力与工程、开源生态。 一周连发6个模型!这家公司把具身智能的闭环跑通了 模型可以开源,部署经验不能。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. IT之家 AI36

    DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线

    IT之家 9 月 10 日消息,据IT之家小伙伴反馈,DeepSeek 官方今日向 API 用户发送通知邮件,宣布 DeepSeek 于北京时间 2026 年 9 月 10 日 正式发布 V4.1 Flash 模型并执行新的 Flash 定价 。 同时,DeepSeek 计划推迟至北京时间 2026 年 9 月 14 日 12:00 下线 V4 Pro 服务,届时 DeepSeek V4 Pro 将会路由到 V4.1 Flash 并按 V4.1 Flash 计费。 经内部、外部多方测试, V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro 。 V4.1 Flash 的价格于北京时间 2026 年 9 月 10 日 12:00 开始生效: 空闲时段输入缓存命中单价 0.02 元、输入缓存未命中单价 1 元,输出单价 4 元; 高峰时段价格为空闲时段价格的 2 倍。 IT之家注意到,DeepSeek...

    推荐理由:来自IT之家 AI的《DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 10 日消息,据IT之家小伙伴反馈,DeepSeek 官方今日向 API 用户发送通知邮件,宣布 DeepSeek 于北京时间 2026 年 9 月 10 日 正式发布 V4.1 Flash 模型并执行新的 Flash 定价 。 同时,DeepSeek 计划推迟至北京时间 2026 年 9 月 14 日 12:00 下线 V4 Pro 服务,届时 DeepSeek V4 Pro 将会路由到 V4.1 Flash 并按 V4.1 Flash 计费。 经内部、外部多方测试, V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro 。 V4.1 Flash 的价格于北京时间 2026 年 9 月 10 日 12:00 开始生效: 空闲时段输入缓存命中单价 0.02 元、输入缓存未命中单价 1 元,输出单价 4 元; 高峰时段价格为空闲时段价格的 2 倍。 IT之家注意到,DeepSeek...

  17. IT之家 AI68

    DeepSeek 快速、专家、识图模式合并升级,V4.1 Flash 最快今日发布

    IT之家 9 月 10 日消息,DeepSeek 今日宣布将原有的快速模式、专家模式和识图模式合而为一,这意味着用户将不再需要手动切换。 DeepSeek 将其整合为统一的智能模式,模型可自动检测查询复杂度、在检测到图片输入时激活视觉能力,并根据任务难度调整处理能力。 在此之前,多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,支持 Chat Completions、Messages、Responses 三种格式调用。 DeepSeek 昨日已发布预告,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型。经 DeepSeek 内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。 DeepSeek 计划于北京时间 2026 年 9 月 14 日 12:00 下线 V4 Pro...

    推荐理由:来自IT之家 AI的《DeepSeek 快速、专家、识图模式合并升级,V4.1 Flash 最快今日发布》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 10 日消息,DeepSeek 今日宣布将原有的快速模式、专家模式和识图模式合而为一,这意味着用户将不再需要手动切换。 DeepSeek 将其整合为统一的智能模式,模型可自动检测查询复杂度、在检测到图片输入时激活视觉能力,并根据任务难度调整处理能力。 在此之前,多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp 已上线 DeepSeek API 平台,支持 Chat Completions、Messages、Responses 三种格式调用。 DeepSeek 昨日已发布预告,计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型。经 DeepSeek 内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro。 DeepSeek 计划于北京时间 2026 年 9 月 14 日 12:00 下线 V4 Pro...

  18. Claude Code Releases86

    Claude Code Releases v2.1.267:Added maxEffortLevel setting (top-level or per model under...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.267:Added maxEffortLevel setting (top-level or per model under... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月9日周三
  1. IT之家 AI68

    腾讯 WorkBuddy 调整混元 Hy4 preview AI 模型限免权益

    IT之家 9 月 9 日消息,腾讯 WorkBuddy 今日宣布,Hy4 preview 限免临近尾声,将于 2026 年 9 月 10 日 23:59 结束后,在 9 月 11 日至 10 月 10 日作出调整。 对于 Hy4 preview 的新用户:包括 9 月 11 日及此后注册 WorkBuddy 的新用户,以及此前还没体验过 Hy4 preview 的老用户,只要在 10 月 10 日 23:59 前首次开启 Hy4 preview 对话,从首次开启那天算起, 往后 14 天都有每日免费额度 。(举例:10 月 10 日首次开启,免费额度用到 10 月 24 日) 如果已经体验过 Hy4 preview: 在闲时夜间 (23:00 - 次日 8:00) 继续提供免费体验 Hy4 preview 的模型额度 ,其余时间正常消耗积分使用。 此外,官方还补充了两点说明: Hy4 preview 是一个大语言模型,暂不具备多...

    推荐理由:来自IT之家 AI的《腾讯 WorkBuddy 调整混元 Hy4 preview AI 模型限免权益》。重点看模型能力与工程。摘要提到:IT之家 9 月 9 日消息,腾讯 WorkBuddy 今日宣布,Hy4 preview 限免临近尾声,将于 2026 年 9 月 10 日 23:59 结束后,在 9 月 11 日至 10 月 10 日作出调整。 对于 Hy4 preview 的新用户:包括 9 月 11 日及此后注册 WorkBuddy 的新用户,以及此前还没体验过 Hy4 preview 的老用户,只要在 10 月 10 日 23:59 前首次开启 Hy4 preview 对话,从首次开启那天算起, 往后 14 天都有每日免费额度 。(举例:10 月 10 日首次开启,免费额度用到 10 月 24 日) 如果已经体验过 Hy4 preview: 在闲时夜间 (23:00 - 次日 8:00) 继续提供免费体验 Hy4 preview 的模型额度 ,其余时间正常消耗积分使用。 此外,官方还补充了两点说明: Hy4 preview 是一个大语言模型,暂不具备多...

  2. IT之家 AI72

    全球首个千亿级参数气象服务垂域模型:“风和”V1.0 实现业务准入

    IT之家 9 月 9 日消息,中国气象局官方公众号今天(9 日)晚间发文宣布,生成式人工智能气象服务系统“风和”模型 V1.0 通过中国气象局组织的专家评审,实现业务准入 。 作为首个千亿级参数的气象服务垂域模型,“风和”具备 气象服务需求理解、气象服务内容生成、气象推理与决策、气象工具调用 等能力,可为气象服务业务提供基座模型能力支撑。 模型能力评估结果表明,“风和”在服务需求理解、服务内容生成、气象推理与决策等方面优于通用模型。模型通过中央网信办备案,试运行稳定,达到业务准入要求。 “风和”不仅能够为全国气象服务业务提供基础支撑,为国内公众提供个性化、智能化气象信息查询、气象服务建议和气象风险预警,还深度融入联合国全民早期预警倡议, 其国际版已上线并融入中国气象智能预警方案“妈祖” ,为全球用户提供中英文智能问答、天气查询和风险分析服务。 据IT之家此前报道,“风和”大语言模型于今年 7 月正式发布,“风和”全球开源计划同时...

    推荐理由:来自IT之家 AI的《全球首个千亿级参数气象服务垂域模型:“风和”V1.0 实现业务准入》。重点看模型能力与工程、开源生态、产品发布。摘要提到:IT之家 9 月 9 日消息,中国气象局官方公众号今天(9 日)晚间发文宣布,生成式人工智能气象服务系统“风和”模型 V1.0 通过中国气象局组织的专家评审,实现业务准入 。 作为首个千亿级参数的气象服务垂域模型,“风和”具备 气象服务需求理解、气象服务内容生成、气象推理与决策、气象工具调用 等能力,可为气象服务业务提供基座模型能力支撑。 模型能力评估结果表明,“风和”在服务需求理解、服务内容生成、气象推理与决策等方面优于通用模型。模型通过中央网信办备案,试运行稳定,达到业务准入要求。 “风和”不仅能够为全国气象服务业务提供基础支撑,为国内公众提供个性化、智能化气象信息查询、气象服务建议和气象风险预警,还深度融入联合国全民早期预警倡议, 其国际版已上线并融入中国气象智能预警方案“妈祖” ,为全球用户提供中英文智能问答、天气查询和风险分析服务。 据IT之家此前报道,“风和”大语言模型于今年 7 月正式发布,“风和”全球开源计划同时...

  3. OpenAI News82

    GPT-6 Astra: The next generation in intelligence for work

    原文摘录(自动中文摘要暂不可用):GPT-6 Astra: The next generation in intelligence for work Meet GPT-6 Astra, OpenAI’s most capable model for business, with advanced reasoning, computer use, and stronger writing and design judgment.

    推荐理由:自动中文摘要尚未通过校验,请核对原文与完整来源。

  4. IT之家 AI74

    AI 攻克数学难题,纽约大学教授质疑 OpenAI“截胡”其研究成果

    IT之家 9 月 9 日消息,纽约大学数学教授 Tristan Buckmaster 当地时间周二宣布了三项证明成果,其中一项为理论数学领域最重要的未解问题之一取得了初步进展。这些成果由 Buckmaster 与 Anthropic 数学家 Levent Alpöge 合作完成,并同时使用了 Codex 和 Claude AI 模型。相关研究成果本身就具有重要意义,但围绕 OpenAI 试图解决同一问题的行动,还出现了一场不同寻常的争议。 “这个故事还有另一部分,”Buckmaster 在宣布证明成果的声明中写道,“坦率地说,这是我非常希望自己不必面对的问题。”根据他的声明,OpenAI 的一项并行研究在相关成果公开之前就建立在他们的工作之上,由此引发了一系列学术竞争以及相互矛盾的说法。 Buckmaster 发布声明后不久,OpenAI 公布了纳维-斯托克斯存在性与光滑性问题的完整证明,而 Buckmaster 的研究成果已为...

    推荐理由:来自IT之家 AI的《AI 攻克数学难题,纽约大学教授质疑 OpenAI“截胡”其研究成果》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 9 日消息,纽约大学数学教授 Tristan Buckmaster 当地时间周二宣布了三项证明成果,其中一项为理论数学领域最重要的未解问题之一取得了初步进展。这些成果由 Buckmaster 与 Anthropic 数学家 Levent Alpöge 合作完成,并同时使用了 Codex 和 Claude AI 模型。相关研究成果本身就具有重要意义,但围绕 OpenAI 试图解决同一问题的行动,还出现了一场不同寻常的争议。 “这个故事还有另一部分,”Buckmaster 在宣布证明成果的声明中写道,“坦率地说,这是我非常希望自己不必面对的问题。”根据他的声明,OpenAI 的一项并行研究在相关成果公开之前就建立在他们的工作之上,由此引发了一系列学术竞争以及相互矛盾的说法。 Buckmaster 发布声明后不久,OpenAI 公布了纳维-斯托克斯存在性与光滑性问题的完整证明,而 Buckmaster 的研究成果已为...

  5. IT之家 AI70

    Suno 发布 v6 系列 AI 音乐模型,新增多项能力

    IT之家 9 月 9 日消息,据科技媒体 Engadget 今天报道,Suno 现已推出 v6 系列 AI 音乐模型,同时与华纳音乐、BMG 等唱片公司达成合作。 IT之家了解到,v6 系列一共包含三款模型:v6、v6-wild 和 v6-mini。其中 v6 主打旗舰,可生成各种风格的音乐;v6-wild 可生成实验性音乐;v6-mini 是唯一向免费用户开放的模型,另外两款需要 Pro 或 Premier 订阅才能使用。 该系列模型的生成速度相比以往产品更快,用户输入提示词后,等待几秒即可听到音乐,还可使用自然语言编辑歌曲特定部分。用户还可从多个音频源生成混音作品,还能够单独提取某首歌曲的采样。 此外,该系列模型还具备多模态理解能力,可以从其他音频、图片中生成歌曲。

    推荐理由:来自IT之家 AI的《Suno 发布 v6 系列 AI 音乐模型,新增多项能力》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 9 日消息,据科技媒体 Engadget 今天报道,Suno 现已推出 v6 系列 AI 音乐模型,同时与华纳音乐、BMG 等唱片公司达成合作。 IT之家了解到,v6 系列一共包含三款模型:v6、v6-wild 和 v6-mini。其中 v6 主打旗舰,可生成各种风格的音乐;v6-wild 可生成实验性音乐;v6-mini 是唯一向免费用户开放的模型,另外两款需要 Pro 或 Premier 订阅才能使用。 该系列模型的生成速度相比以往产品更快,用户输入提示词后,等待几秒即可听到音乐,还可使用自然语言编辑歌曲特定部分。用户还可从多个音频源生成混音作品,还能够单独提取某首歌曲的采样。 此外,该系列模型还具备多模态理解能力,可以从其他音频、图片中生成歌曲。

  6. IT之家 AI68

    行业首个开放世界全天候商业交付级具身智能架构,万勋科技发布 NOVA2.0 柔性具身大脑

    IT之家 9 月 9 日消息,万勋科技今日宣布推出其第二代柔性具身大脑 NOVA2.0,宣称是行业首个开放世界全天候商业交付级具身智能架构。 IT之家从官方公众号了解到, NOVA2.0 柔性具身大脑基于“肌体智能”理念打造 ,拥有触觉原生多模态柔性具身大脑分层架构,以潜意识多模态动作基进行实时轨迹生成与场景适应,实现低数据、超极速与强泛化优势。 同时,该模型可适配肌肉关节、柔性单臂、柔性双臂、柔性灵巧手 / 仿生人等多种本体构型及其任务需求, 拥有 1B+ 参数 ,支持 20 ms 极速轨迹生成。 官方宣称,该模型已泛化应用于地产建筑、电力能源、交通运输、智能驾驶、工业制造等领域的 40+ 真实行业场景的超 1000 万次多维度极限工况作业中。

    推荐理由:来自IT之家 AI的《行业首个开放世界全天候商业交付级具身智能架构,万勋科技发布 NOVA2.0 柔性具身大脑》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 9 日消息,万勋科技今日宣布推出其第二代柔性具身大脑 NOVA2.0,宣称是行业首个开放世界全天候商业交付级具身智能架构。 IT之家从官方公众号了解到, NOVA2.0 柔性具身大脑基于“肌体智能”理念打造 ,拥有触觉原生多模态柔性具身大脑分层架构,以潜意识多模态动作基进行实时轨迹生成与场景适应,实现低数据、超极速与强泛化优势。 同时,该模型可适配肌肉关节、柔性单臂、柔性双臂、柔性灵巧手 / 仿生人等多种本体构型及其任务需求, 拥有 1B+ 参数 ,支持 20 ms 极速轨迹生成。 官方宣称,该模型已泛化应用于地产建筑、电力能源、交通运输、智能驾驶、工业制造等领域的 40+ 真实行业场景的超 1000 万次多维度极限工况作业中。

  7. IT之家 AI70

    新研究将大语言模型视为“认知病毒”,持续动脑方可“抵御感染”

    IT之家 9 月 9 日消息,当地时间 8 日,据外媒 Futurism 报道,一支国际研究团队在新论文中提出,AI 的普及与病毒扩散有一些惊人的相似之处。这篇论文尚未经过同行评审,试图构建新的理论框架,解释人们 为何越来越离不开各类 AI 工具 ,以及这种依赖如何改变整个社会认识周围世界的方式。 论文提出将大语言模型视为“认知病毒”—— 这类技术通过文化传播,因其实用性而不断扩散,但也可能让人们 把思考交给外部工具 ,从而加深依赖。 此前已有研究人员警告,AI 正在损害人类的认知能力。学生的情况尤为突出:倾向于在课堂上使用 AI 工具, 把大量批判性思考交给 AI 。 论文作者写道:“放眼人类的发展历程,我们向来借助语言、文字、制度和技术,将部分认知活动转移到自身之外。正是这种外化,为文化所推动的快速变革提供了动力,并使变革不断加速。AI 让这一过程进入新阶段: 外部认知工具越来越主动,也越来越具有自主行动的特征 。” 人们逐...

    推荐理由:来自IT之家 AI的《新研究将大语言模型视为“认知病毒”,持续动脑方可“抵御感染”》。重点看模型能力与工程、教育应用、文化创意。摘要提到:IT之家 9 月 9 日消息,当地时间 8 日,据外媒 Futurism 报道,一支国际研究团队在新论文中提出,AI 的普及与病毒扩散有一些惊人的相似之处。这篇论文尚未经过同行评审,试图构建新的理论框架,解释人们 为何越来越离不开各类 AI 工具 ,以及这种依赖如何改变整个社会认识周围世界的方式。 论文提出将大语言模型视为“认知病毒”—— 这类技术通过文化传播,因其实用性而不断扩散,但也可能让人们 把思考交给外部工具 ,从而加深依赖。 此前已有研究人员警告,AI 正在损害人类的认知能力。学生的情况尤为突出:倾向于在课堂上使用 AI 工具, 把大量批判性思考交给 AI 。 论文作者写道:“放眼人类的发展历程,我们向来借助语言、文字、制度和技术,将部分认知活动转移到自身之外。正是这种外化,为文化所推动的快速变革提供了动力,并使变革不断加速。AI 让这一过程进入新阶段: 外部认知工具越来越主动,也越来越具有自主行动的特征 。” 人们逐...

  8. IT之家 AI72

    OpenAI CFO:自研 AI 助力芯片设计,Luna 模型部署成本低于开源方案

    IT之家 9 月 9 日消息,据路透社报道,OpenAI 首席财务官 Sarah Friar 当地时间周一表示,随着企业业务增长不断加速,OpenAI 正在推动 AI 进一步进入专业行业,同时通过降低价格来与开源及开放权重模型竞争。 Friar 在旧金山举行的高盛 Communacopia + Technology Conference 会议上表示,OpenAI 目前正重点布局芯片设计、生命科学和金融服务等领域。随着企业越来越希望 AI 系统能够针对特定任务进行优化,OpenAI 也在探索更加行业化的 AI 解决方案。 与此同时,OpenAI 正在尝试按照企业最终获得的业务成果,而不是模型的实际使用量来制定价格。随着越来越多企业要求 AI 投资能够带来明确的回报,这种定价模式也成为 OpenAI 正在探索的方向。 OpenAI 向行业专用 AI 领域扩张,并采取更具攻击性的定价策略,也反映出公司正面临日益激烈的竞争。一方面,中国...

    推荐理由:来自IT之家 AI的《OpenAI CFO:自研 AI 助力芯片设计,Luna 模型部署成本低于开源方案》。重点看模型能力与工程、开源生态。摘要提到:IT之家 9 月 9 日消息,据路透社报道,OpenAI 首席财务官 Sarah Friar 当地时间周一表示,随着企业业务增长不断加速,OpenAI 正在推动 AI 进一步进入专业行业,同时通过降低价格来与开源及开放权重模型竞争。 Friar 在旧金山举行的高盛 Communacopia + Technology Conference 会议上表示,OpenAI 目前正重点布局芯片设计、生命科学和金融服务等领域。随着企业越来越希望 AI 系统能够针对特定任务进行优化,OpenAI 也在探索更加行业化的 AI 解决方案。 与此同时,OpenAI 正在尝试按照企业最终获得的业务成果,而不是模型的实际使用量来制定价格。随着越来越多企业要求 AI 投资能够带来明确的回报,这种定价模式也成为 OpenAI 正在探索的方向。 OpenAI 向行业专用 AI 领域扩张,并采取更具攻击性的定价策略,也反映出公司正面临日益激烈的竞争。一方面,中国...

  9. IT之家 AI36

    DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型,各项指标全面超越 V4 Pro

    IT之家 9 月 9 日消息,DeepSeek 开放平台今日发布通知,DeepSeek 计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型 。 DeepSeek 官方表示,经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等 各项指标上已全面超越 V4 Pro 。 “秉持着对用户负责的态度,在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前,我们会将对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。” 此外,DeepSeek 宣布将于北京时间明日(2026 年 9 月 10 日)12 时起执行新价格, 调整 Flash 系列定价 。空闲时段输入缓存命中为每百万 Token 价格 0.02 元、输入缓存未命中为每百万 Token 价格 1 元,输出为每百万 Token 价格 4 元;高峰时段各项价格均为上述空闲时段...

    推荐理由:来自IT之家 AI的《DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型,各项指标全面超越 V4 Pro》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 9 日消息,DeepSeek 开放平台今日发布通知,DeepSeek 计划于北京时间 2026 年 9 月 10 日前后正式发布 V4.1 Flash 模型 。 DeepSeek 官方表示,经内部、外部多方测试,V4.1 Flash 在性能、费用、速度、总用时等 各项指标上已全面超越 V4 Pro 。 “秉持着对用户负责的态度,在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前,我们会将对 V4 Pro 的请求全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。” 此外,DeepSeek 宣布将于北京时间明日(2026 年 9 月 10 日)12 时起执行新价格, 调整 Flash 系列定价 。空闲时段输入缓存命中为每百万 Token 价格 0.02 元、输入缓存未命中为每百万 Token 价格 1 元,输出为每百万 Token 价格 4 元;高峰时段各项价格均为上述空闲时段...

  10. IT之家 AI80

    面壁智能开源 MiniCPM5-2B AI 模型:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力

    IT之家 9 月 9 日消息,面壁智能昨日联合 OpenBMB 开源社区正式开源新一代“小钢炮” MiniCPM5-2B 。 MiniCPM5-2B 的参数规模为 2B,是一款高密度端侧语言基座模型,支持工具调用、深度搜索、代码生成等任务,官方称 初步实现了 端侧通用 Agent 雏形 。 根据榜单 Artificial Analysis Intelligence Index(以下简称「AA 榜单」)的最新评测,MiniCPM5-2B 综合能力得分 23 分, 在全球 4B 参数规模以下的开源基座模型中综合表现第一 。 官方表示,在评测智能体能力的 Agentic Index 指标上,MiniCPM5-2B 更是断层式领先:总分达 20 分,同级模型(如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B)仅 2 分。 MiniCPM5-2B 在覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具...

    推荐理由:来自IT之家 AI的《面壁智能开源 MiniCPM5-2B AI 模型:AA 榜单全球 4B 以下第一,初具端侧通用 Agent 能力》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 9 日消息,面壁智能昨日联合 OpenBMB 开源社区正式开源新一代“小钢炮” MiniCPM5-2B 。 MiniCPM5-2B 的参数规模为 2B,是一款高密度端侧语言基座模型,支持工具调用、深度搜索、代码生成等任务,官方称 初步实现了 端侧通用 Agent 雏形 。 根据榜单 Artificial Analysis Intelligence Index(以下简称「AA 榜单」)的最新评测,MiniCPM5-2B 综合能力得分 23 分, 在全球 4B 参数规模以下的开源基座模型中综合表现第一 。 官方表示,在评测智能体能力的 Agentic Index 指标上,MiniCPM5-2B 更是断层式领先:总分达 20 分,同级模型(如 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B)仅 2 分。 MiniCPM5-2B 在覆盖代码推理、数学推理、指令遵循、综合知识、长文本、工具...

  11. 量子位70

    蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流

    事实摘要:蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流 蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程、产品发布。 蚂蚁百灵发布首个金融增强模型,AI开始进入真实投研工作流 蚂蚁集团百灵首个金融增强开放模型 Ling-3.0-flash-Fin发布。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  12. 量子位36

    SkyProduction限免活动第二期:MiniMax H3会员限时免费无限用!

    事实摘要:SkyProduction限免活动第二期:MiniMax H3会员限时免费无限用! 8月28日-9月1日,SkyProduction(天工工作台)联合阿里巴巴通义万相,推出了Wan 3.0模型限时免费活动 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 SkyProduction限免活动第二期:MiniMax H3会员限时免费无限用! 8月28日。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  13. IT之家 AI36

    苹果 M5 Pro 非官方移植英伟达 DLSS 5:画质提升、延迟达 240ms

    IT之家 9 月 9 日消息,科技媒体 Wccftech 昨日(9 月 8 日)发布博文,报道称开发者成功在 M5 Pro 等苹果 Apple Silicon 芯片上, 非官方移植英伟达的 DLSS 5。 开发者 @iamwavecut 已把 DLSS 5 神经渲染模型移植至 Apple Silicon。开发者 @Mappsnet7 则通过 ReShade,将 Metal 后端接入 Windows 游戏,并配合 Game Porting Toolkit 4.0b2 使用。IT之家附上相关对比如下: 应用 DLSS 5 之前效果,图源 AnyPomelo3352 应用 DLSS 5 之后效果,图源 AnyPomelo3352 测试方面,在搭载 16 核 GPU 的 M5 Pro 芯片上,启用 DLSS 5 后,画面中的表面光照、环境光遮蔽与空间纵深感均有改善。与此同时,1440p 测试帧率降至 2.32FPS,输入延迟达到 240...

    推荐理由:来自IT之家 AI的《苹果 M5 Pro 非官方移植英伟达 DLSS 5:画质提升、延迟达 240ms》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 9 日消息,科技媒体 Wccftech 昨日(9 月 8 日)发布博文,报道称开发者成功在 M5 Pro 等苹果 Apple Silicon 芯片上, 非官方移植英伟达的 DLSS 5。 开发者 @iamwavecut 已把 DLSS 5 神经渲染模型移植至 Apple Silicon。开发者 @Mappsnet7 则通过 ReShade,将 Metal 后端接入 Windows 游戏,并配合 Game Porting Toolkit 4.0b2 使用。IT之家附上相关对比如下: 应用 DLSS 5 之前效果,图源 AnyPomelo3352 应用 DLSS 5 之后效果,图源 AnyPomelo3352 测试方面,在搭载 16 核 GPU 的 M5 Pro 芯片上,启用 DLSS 5 后,画面中的表面光照、环境光遮蔽与空间纵深感均有改善。与此同时,1440p 测试帧率降至 2.32FPS,输入延迟达到 240...

  14. IT之家 AI76

    蚂蚁百灵系列首个原生多模态模型 Ling-3.0-flash-VL 发布开源,引入视觉反馈闭环机制

    IT之家 9 月 9 日消息,蚂蚁集团今日宣布推出并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。 该模型基于 Ling-3.0-flash 的 MoE(混合专家)架构拓展,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256K Token。 模型围绕“更可靠、更高效完成真实任务”的方向,引入了视觉反馈闭环机制。不同于一次性的“看图生成”,该机制将任务推进为“观察 → 行动 → 验证 → 修正”的持续闭环,使模型在医疗报告解读、前端代码生成及 GUI 自动化等场景中能够基于视觉反馈持续修正执行结果。 在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在 Artificial Analysis Intelligence Index v4.1.1 评估中,Ling-3.0-flash-VL 较纯文本版本(Ling...

    推荐理由:来自IT之家 AI的《蚂蚁百灵系列首个原生多模态模型 Ling-3.0-flash-VL 发布开源,引入视觉反馈闭环机制》。重点看模型能力与工程、文化创意、开源生态。摘要提到:IT之家 9 月 9 日消息,蚂蚁集团今日宣布推出并开源百灵系列首个原生多模态大模型 Ling-3.0-flash-VL。 该模型基于 Ling-3.0-flash 的 MoE(混合专家)架构拓展,总参数量为 124B,单次推理激活 5.5B 参数,原生支持图像、文本与视频输入,上下文窗口达到 256K Token。 模型围绕“更可靠、更高效完成真实任务”的方向,引入了视觉反馈闭环机制。不同于一次性的“看图生成”,该机制将任务推进为“观察 → 行动 → 验证 → 修正”的持续闭环,使模型在医疗报告解读、前端代码生成及 GUI 自动化等场景中能够基于视觉反馈持续修正执行结果。 在训练层面,蚂蚁集团表示,通过原生多模态联合训练,视觉信息的引入对模型的文本能力带来了正向提升。在 Artificial Analysis Intelligence Index v4.1.1 评估中,Ling-3.0-flash-VL 较纯文本版本(Ling...

  15. Claude Code Releases88

    Claude Code Releases v2.1.266:Fixed a 2.1.265 regression affecting LLM-gateway and proxy...

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Claude Code Releases v2.1.266:Fixed a 2.1.265 regression affecting LLM-gateway and proxy... 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Claude Code Releases v2.1.266:Fix。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. IT之家 AI76

    继 Claude 尝试攻克黎曼猜想后:OpenAI 宣布用 10000 个 AI 智能体 88 小时攻克千禧年大奖难题,陶哲轩既点赞又担忧

    IT之家 9 月 9 日消息,OpenAI 于当地时间 9 月 8 日宣布,其内部未公开的 AI 模型(性能远超最新发布的 GPT-6 Astra)已成功解决“纳维-斯托克斯存在性与光滑性问题”(Navier-Stokes existence and smoothness problem),这是克莱数学研究所(Clay Mathematics Institute)于 2000 年提出的七个“千禧年大奖难题”之一。 该问题关注描述流体运动的纳维-斯托克斯方程是否会失效,已困扰数学界约 90 年。 在此之前,Anthropic 上个月宣布其内部一款未公开的 Claude 研究模型在攻克黎曼猜想的过程中取得重要进展,将黎曼 ζ 函数临界线上零点比例的长期下界从 41.6% 提高到了 67.2%。消息一出,业界震惊。 ▲ 局部不可压缩运动的示意图。橙色表示角旋转速度较快;青色表示角旋转速度较慢。环流速度也取决于半径。轨迹显示出向内螺旋运...

    推荐理由:来自IT之家 AI的《继 Claude 尝试攻克黎曼猜想后:OpenAI 宣布用 10000 个 AI 智能体 88 小时攻克千禧年大奖难题,陶哲轩既点赞又担忧》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 9 日消息,OpenAI 于当地时间 9 月 8 日宣布,其内部未公开的 AI 模型(性能远超最新发布的 GPT-6 Astra)已成功解决“纳维-斯托克斯存在性与光滑性问题”(Navier-Stokes existence and smoothness problem),这是克莱数学研究所(Clay Mathematics Institute)于 2000 年提出的七个“千禧年大奖难题”之一。 该问题关注描述流体运动的纳维-斯托克斯方程是否会失效,已困扰数学界约 90 年。 在此之前,Anthropic 上个月宣布其内部一款未公开的 Claude 研究模型在攻克黎曼猜想的过程中取得重要进展,将黎曼 ζ 函数临界线上零点比例的长期下界从 41.6% 提高到了 67.2%。消息一出,业界震惊。 ▲ 局部不可压缩运动的示意图。橙色表示角旋转速度较快;青色表示角旋转速度较慢。环流速度也取决于半径。轨迹显示出向内螺旋运...

  17. Simon Willison83

    Introducing ChatGPT Images 2.5

    原文摘录(自动中文摘要暂不可用):Introducing ChatGPT Images 2.5 Introducing ChatGPT Images 2.5 OpenAI's image generation models are apparently used "more than 3 billion images across ChatGPT Images and the GPT‑Image models in the API". This latest release improves their instruction-following ability across multiple turns, responds faster, and "is better at preserving the subjects in your re

    推荐理由:自动中文摘要尚未通过校验,请核对原文与完整来源。

  18. Claude Code Releases82

    Claude Code Releases v2.1.265:Added user.email and user.groups to the telemetry Claude D...

    原文摘录(自动中文摘要暂不可用):Claude Code Releases v2.1.265:Added user.email and user.groups to the telemetry Claude D... What's changed Added user.email and user.groups to the telemetry Claude Desktop and Cowork send through a Claude apps gateway, matching terminal sessions Added support for pointing --plugin-dir at a folder of plugins: each child folder with a manifest loads, and child

    推荐理由:自动中文摘要尚未通过校验,请核对原文与完整来源。

9月8日周二
  1. IT之家 AI68

    谷歌 DeepMind 推出 AlphaGenome Atlas,覆盖人类基因组全部 90 亿种单核苷酸变异预测

    IT之家 9 月 8 日消息,谷歌今日推出 AlphaGenome Atlas ,这一平台包含了人类基因组中 90 亿种单核苷酸变异 (所有可能的单字母 DNA 改变)的功能预测,是目前涵盖基因突变对分子生物学影响最全面的目录,学术界可通过免费门户网站免费使用。 DNA 是生命的语言,掌握其密码能够改变人类理解生物学和治疗疾病的能力,但解读基因变异对分子层面的影响长期存在瓶颈:人类基因组有约 90 亿种可能的单字母突变,在实验室逐一测试几乎不可能。 根据介绍,谷歌 DeepMind 此前已经推出 AI 模型 AlphaGenome ,可以预测基因变异对生物过程的影响,可用于分析特定变异并在研究中得到广泛应用,此次通过大规模预先计算 AlphaGenome 的预测结果,构建出 覆盖全基因组变异的全景资源库 ,就像地图集汇总地理信息一样,绘制出全基因组 DNA 变异的分子效应图谱。 为帮助科学家快速找到影响最大的遗传改变,谷歌同时发...

    推荐理由:来自IT之家 AI的《谷歌 DeepMind 推出 AlphaGenome Atlas,覆盖人类基因组全部 90 亿种单核苷酸变异预测》。重点看模型能力与工程。摘要提到:IT之家 9 月 8 日消息,谷歌今日推出 AlphaGenome Atlas ,这一平台包含了人类基因组中 90 亿种单核苷酸变异 (所有可能的单字母 DNA 改变)的功能预测,是目前涵盖基因突变对分子生物学影响最全面的目录,学术界可通过免费门户网站免费使用。 DNA 是生命的语言,掌握其密码能够改变人类理解生物学和治疗疾病的能力,但解读基因变异对分子层面的影响长期存在瓶颈:人类基因组有约 90 亿种可能的单字母突变,在实验室逐一测试几乎不可能。 根据介绍,谷歌 DeepMind 此前已经推出 AI 模型 AlphaGenome ,可以预测基因变异对生物过程的影响,可用于分析特定变异并在研究中得到广泛应用,此次通过大规模预先计算 AlphaGenome 的预测结果,构建出 覆盖全基因组变异的全景资源库 ,就像地图集汇总地理信息一样,绘制出全基因组 DNA 变异的分子效应图谱。 为帮助科学家快速找到影响最大的遗传改变,谷歌同时发...

  2. Interconnects56

    Latest open artifacts (#24): Motif-3, GLM-5.3, Hy4-preview and open model licenses

    这条英文动态主要涉及模型能力与工程、文化创意。原文要点:The open model ecosystem continues to expand in its breadth

    推荐理由:来自Interconnects的《Latest open artifacts (#24): Motif-3, GLM-5.3, Hy4-preview and open model licenses》。重点看模型能力与工程、文化创意。摘要提到:这条英文动态主要涉及模型能力与工程、文化创意。原文要点:The open model ecosystem continues to expand in its breadth