跳到正文
9月18日周五
  1. IT之家 AI74

    消息称 Anthropic 和 OpenAI 正寻求规模较小的数据中心交易,争夺 AI 算力部署能力

    IT之家 9 月 18 日消息,据 CNBC 消息,知情人士透露,随着部署模型工作负载所需基础设施的争夺日趋白热化,Anthropic 和 OpenAI 正在寻求规模更小的人工智能数据中心合作。 过去一年中,这两家 AI 实验室曾就容量达数百兆瓦乃至吉瓦级的超大规模设施签署过重磅协议;但消息人士表示, 两家公司目前也开始寻求针对 20 至 30 兆瓦这一更小部署规模的算力合作 。 知情人士透露,Anthropic 已就该容量区间的协议在英国及北欧地区展开接触试探,OpenAI 也一直在北欧评估这类小容量部署的可行方案。此外,Anthropic 和 OpenAI 同样在美国针对该规模的算力部署展开过磋商。 IT之家注意到,在过去一年里,为了持续训练自身模型并向终端用户提供在线推理服务,两家公司密集公布了一系列 AI 基础设施协议。在当前的 AI 发展浪潮下,锁定规模更小的算力资源,有助于企业大幅缩短工作负载的落地交付周期。 Ope...

    推荐理由:来自IT之家 AI的《消息称 Anthropic 和 OpenAI 正寻求规模较小的数据中心交易,争夺 AI 算力部署能力》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,据 CNBC 消息,知情人士透露,随着部署模型工作负载所需基础设施的争夺日趋白热化,Anthropic 和 OpenAI 正在寻求规模更小的人工智能数据中心合作。 过去一年中,这两家 AI 实验室曾就容量达数百兆瓦乃至吉瓦级的超大规模设施签署过重磅协议;但消息人士表示, 两家公司目前也开始寻求针对 20 至 30 兆瓦这一更小部署规模的算力合作 。 知情人士透露,Anthropic 已就该容量区间的协议在英国及北欧地区展开接触试探,OpenAI 也一直在北欧评估这类小容量部署的可行方案。此外,Anthropic 和 OpenAI 同样在美国针对该规模的算力部署展开过磋商。 IT之家注意到,在过去一年里,为了持续训练自身模型并向终端用户提供在线推理服务,两家公司密集公布了一系列 AI 基础设施协议。在当前的 AI 发展浪潮下,锁定规模更小的算力资源,有助于企业大幅缩短工作负载的落地交付周期。 Ope...

  2. 极客公园74

    那个教 ChatGPT 说话的人,做了一个「哑巴」模型

    作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 ...

    推荐理由:来自极客公园的《那个教 ChatGPT 说话的人,做了一个「哑巴」模型》。重点看模型能力与工程、产品发布。摘要提到:作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 ...

  3. IT之家 AI72

    亚马逊:AI 模型必须经过严格测试,确认足够安全才能发布

    IT之家 9 月 18 日消息,据彭博社今天(18 日)凌晨报道,亚马逊认为,AI 模型必须 经过严格测试,确认具备足够的安全保障 后才能发布。 此前,多家顶尖 AI 实验室因安全问题呼吁放缓 AI 研发速度,亚马逊也由此加入了这场围绕 AI 发展节奏的讨论。 亚马逊发言人汤姆 · 帕内尔在邮件中指出:“ 我们不认为进步与安全只能二选一 。模型只有在准备充分、能够安全使用时才应该发布,而这离不开严格测试和强有力的安全保障。如果整个行业不能共同做到这一点,就会产生风险。我们相信,整个行业会与政府合作,制定适当的保护措施。” 帕内尔坦言,当下的 AI 已能为客户创造实实在在的价值,因此把“这件事”做好非常重要。 亚马逊既是 OpenAI、Anthropic 等领先 AI 企业的合作伙伴,也是投资者。据IT之家了解,OpenAI 和 Anthropic 的高管此前都曾主张适度放慢尖端 AI 研发速度,以便评估技术安全性。 亚马逊也在开...

    推荐理由:来自IT之家 AI的《亚马逊:AI 模型必须经过严格测试,确认足够安全才能发布》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,据彭博社今天(18 日)凌晨报道,亚马逊认为,AI 模型必须 经过严格测试,确认具备足够的安全保障 后才能发布。 此前,多家顶尖 AI 实验室因安全问题呼吁放缓 AI 研发速度,亚马逊也由此加入了这场围绕 AI 发展节奏的讨论。 亚马逊发言人汤姆 · 帕内尔在邮件中指出:“ 我们不认为进步与安全只能二选一 。模型只有在准备充分、能够安全使用时才应该发布,而这离不开严格测试和强有力的安全保障。如果整个行业不能共同做到这一点,就会产生风险。我们相信,整个行业会与政府合作,制定适当的保护措施。” 帕内尔坦言,当下的 AI 已能为客户创造实实在在的价值,因此把“这件事”做好非常重要。 亚马逊既是 OpenAI、Anthropic 等领先 AI 企业的合作伙伴,也是投资者。据IT之家了解,OpenAI 和 Anthropic 的高管此前都曾主张适度放慢尖端 AI 研发速度,以便评估技术安全性。 亚马逊也在开...

  4. IT之家 AI72

    法庭文件显示,微软应用科学主管称 AI 行业是“史上最大规模”劳动成果盗窃

    IT之家 9 月 18 日消息,《纽约时报》与 OpenAI、微软之间的诉讼仍在继续,而近期解封并完整公开的一份动议显示,多名 AI 行业高管承认,训练 AI 模型需要进行 一场“规模惊人、前所未有”的盗窃 。 据外媒 Futurism 当地时间 17 日报道,一份由《纽约时报》一方提交、并由数字媒体倡导人士杰森 · 金特披露的动议,直接援引微软应用科学主管布伦特 · 赫克特和 OpenAI 联合创始人兼总裁格雷格 · 布罗克曼的原话,试图证明原告《纽约时报》的核心主张:AI 行业是在 数量难以想象的被盗知识产权 基础上建立起来的。 赫克特将 AI 产业的大规模建设称为“ 人类历史上规模最大的劳动成果盗窃 ”。《纽约时报》则指控 OpenAI 和微软未经许可,完整复制了原告数百万篇受版权保护的文章,以生产能够形成替代效应的商业 AI 产品,因此赫克特的说法对两家公司尤其不利。 布罗克曼也称,生成式 AI 让“出版商”面临“生存威...

    推荐理由:来自IT之家 AI的《法庭文件显示,微软应用科学主管称 AI 行业是“史上最大规模”劳动成果盗窃》。重点看模型能力与工程、文化创意、产品发布。摘要提到:IT之家 9 月 18 日消息,《纽约时报》与 OpenAI、微软之间的诉讼仍在继续,而近期解封并完整公开的一份动议显示,多名 AI 行业高管承认,训练 AI 模型需要进行 一场“规模惊人、前所未有”的盗窃 。 据外媒 Futurism 当地时间 17 日报道,一份由《纽约时报》一方提交、并由数字媒体倡导人士杰森 · 金特披露的动议,直接援引微软应用科学主管布伦特 · 赫克特和 OpenAI 联合创始人兼总裁格雷格 · 布罗克曼的原话,试图证明原告《纽约时报》的核心主张:AI 行业是在 数量难以想象的被盗知识产权 基础上建立起来的。 赫克特将 AI 产业的大规模建设称为“ 人类历史上规模最大的劳动成果盗窃 ”。《纽约时报》则指控 OpenAI 和微软未经许可,完整复制了原告数百万篇受版权保护的文章,以生产能够形成替代效应的商业 AI 产品,因此赫克特的说法对两家公司尤其不利。 布罗克曼也称,生成式 AI 让“出版商”面临“生存威...

  5. IT之家 AI74

    阿里达摩院开源全球首个专家级通用医疗影像 AI 模型 DAMO RADAR:可一次性识别超 146 种病症,成果登《科学》

    IT之家 9 月 18 日消息,阿里达摩院今日宣布,与浙江大学医学院附属第一医院等机构研发出的通用医疗影像 AI 模型 DAMO RADAR,登上国际顶级学术期刊《科学》(Science)。 该模型面向腹部增强 CT 诊断, 可一次性识别超过 146 种病症 ,其准确性首次达到影像科专家级水平, 现已正式开源 。 据介绍,达摩院采用视觉-语言学习方法(Vision-Language Learning),让模型直接学习医学影像和相对应报告文本的内在关联信息。达摩院高级算法专家张建鹏表示,由于 CT 数据信号稀疏,常规的视觉-语言学习效果不佳, 该项研究在国际上首次采用“器官级细粒度对齐”策略 ,将 CT 构建三维数据并分解为解剖单元,在组织器官层面实现图像与报告文本的精确对齐,并通过自适应对比建模策略来动态调整, 无需额外人工标注即可完成可扩展、多用途、可解释的诊断 。 最终,DAMO RADAR 覆盖了含恶性肿瘤在内的广泛腹部病...

    推荐理由:来自IT之家 AI的《阿里达摩院开源全球首个专家级通用医疗影像 AI 模型 DAMO RADAR:可一次性识别超 146 种病症,成果登《科学》》。重点看模型能力与工程、开源生态。摘要提到:IT之家 9 月 18 日消息,阿里达摩院今日宣布,与浙江大学医学院附属第一医院等机构研发出的通用医疗影像 AI 模型 DAMO RADAR,登上国际顶级学术期刊《科学》(Science)。 该模型面向腹部增强 CT 诊断, 可一次性识别超过 146 种病症 ,其准确性首次达到影像科专家级水平, 现已正式开源 。 据介绍,达摩院采用视觉-语言学习方法(Vision-Language Learning),让模型直接学习医学影像和相对应报告文本的内在关联信息。达摩院高级算法专家张建鹏表示,由于 CT 数据信号稀疏,常规的视觉-语言学习效果不佳, 该项研究在国际上首次采用“器官级细粒度对齐”策略 ,将 CT 构建三维数据并分解为解剖单元,在组织器官层面实现图像与报告文本的精确对齐,并通过自适应对比建模策略来动态调整, 无需额外人工标注即可完成可扩展、多用途、可解释的诊断 。 最终,DAMO RADAR 覆盖了含恶性肿瘤在内的广泛腹部病...

  6. IT之家 AI70

    全国首个海洋 Token 工厂落地青岛:算力规模超 800P,AI 像用水用电一样即开即用

    IT之家 9 月 18 日消息,2026 海洋合作发展论坛“探索深海 —— 海洋未来产业的价值变革”平行论坛 9 月 17 日举行,全国首个面向海洋产业的智能要素供给平台 —— 海洋 Token 工厂正式发布并落地青岛。 该平台由中国移动通信集团山东有限公司参与建设。公司副总经理颜承捷在发布现场介绍了平台的整体架构,包含数据、算力、算法三个部分。 数据方面,平台可提供海上作业规范、海洋环境要素等 130 多类涉海数据,建成面向海洋一线需求的专属数据库。算力方面,已形成总算力规模超过 800P 的海洋算力资源池,且仍在持续扩容。 算法方面,平台汇聚观海、海星等 20 多个海洋领域专有大模型,以及“九天”大模型等 30 多款通用模型。这些资源通过统一平台按需供给。 据介绍,海洋 Token 工厂以 Token 作为智能服务的统一计量载体,将数据治理、算力调度、模型服务和工具组件标准化封装。 IT之家从官方获悉,该平台被描述为海洋领域...

    推荐理由:来自IT之家 AI的《全国首个海洋 Token 工厂落地青岛:算力规模超 800P,AI 像用水用电一样即开即用》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,2026 海洋合作发展论坛“探索深海 —— 海洋未来产业的价值变革”平行论坛 9 月 17 日举行,全国首个面向海洋产业的智能要素供给平台 —— 海洋 Token 工厂正式发布并落地青岛。 该平台由中国移动通信集团山东有限公司参与建设。公司副总经理颜承捷在发布现场介绍了平台的整体架构,包含数据、算力、算法三个部分。 数据方面,平台可提供海上作业规范、海洋环境要素等 130 多类涉海数据,建成面向海洋一线需求的专属数据库。算力方面,已形成总算力规模超过 800P 的海洋算力资源池,且仍在持续扩容。 算法方面,平台汇聚观海、海星等 20 多个海洋领域专有大模型,以及“九天”大模型等 30 多款通用模型。这些资源通过统一平台按需供给。 据介绍,海洋 Token 工厂以 Token 作为智能服务的统一计量载体,将数据治理、算力调度、模型服务和工具组件标准化封装。 IT之家从官方获悉,该平台被描述为海洋领域...

  7. IT之家 AI70

    智谱 GLM-5.3-FlashX 模型上线,更快、更流畅

    IT之家 9 月 18 日消息,智谱今日宣布推出 GLM-5.3-FlashX(最高 200 tokens/s) ,为企业与开发者带来更快、更流畅的模型体验。 智谱官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名与全球开发者见面,获得海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在 10 万张国产芯片提供的推理算力基础上, 进一步加大对 Infra 侧的投入与推理优化 。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。 GLM-5.3-FlashX API 现已上线,Model Key: GLM-5.3-FlashX 。 价格方面,GLM-5.3-FlashX 相比 GLM-5.3-Flash 更贵一些: 模型名称 上下文 输入单价(元 / 百万 Tokens) 输出单价(元 / 百万 Tokens) 缓存存储(元 / 百万 Token...

    推荐理由:来自IT之家 AI的《智谱 GLM-5.3-FlashX 模型上线,更快、更流畅》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,智谱今日宣布推出 GLM-5.3-FlashX(最高 200 tokens/s) ,为企业与开发者带来更快、更流畅的模型体验。 智谱官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名与全球开发者见面,获得海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在 10 万张国产芯片提供的推理算力基础上, 进一步加大对 Infra 侧的投入与推理优化 。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。 GLM-5.3-FlashX API 现已上线,Model Key: GLM-5.3-FlashX 。 价格方面,GLM-5.3-FlashX 相比 GLM-5.3-Flash 更贵一些: 模型名称 上下文 输入单价(元 / 百万 Tokens) 输出单价(元 / 百万 Tokens) 缓存存储(元 / 百万 Token...

  8. IT之家 AI70

    苹果详解 Safari 27 浏览器升级:解决阅读“乱跳”,修复 844 个问题

    IT之家 9 月 18 日消息,苹果公司昨日(9 月 17 日)更新 WebKit 博文,详细介绍了 Safari 27 系统带来的诸多新功能 / 新特性, 包括支持 MCP 协议,以及修复 844 个问题等。 对于开发者而言,Safari 27 浏览器最主要变化在于新增支持 MCP(Model Context Protocol)服务器支持,让 Claude Code、Codex 等 AI 工具能够控制浏览器窗口,读取 DOM 结构、网络请求、屏幕截图和控制台输出,从而帮助开发者更快地调试网站。 对于用户而言,Safari 27 新增滚动锚定(Scroll Anchoring)功能,当用户正在读文章时,页面上方延迟加载的图片、广告、评论或推荐模块,不会再把正在看的段落往下推。 IT之家翻译官方相关介绍如下: 许多网站会在用户阅读或浏览内容时向页面注入新内容。这些新内容通常会出现在用户当前视线上方,例如图片、广告或评论。过去这会导...

    推荐理由:来自IT之家 AI的《苹果详解 Safari 27 浏览器升级:解决阅读“乱跳”,修复 844 个问题》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,苹果公司昨日(9 月 17 日)更新 WebKit 博文,详细介绍了 Safari 27 系统带来的诸多新功能 / 新特性, 包括支持 MCP 协议,以及修复 844 个问题等。 对于开发者而言,Safari 27 浏览器最主要变化在于新增支持 MCP(Model Context Protocol)服务器支持,让 Claude Code、Codex 等 AI 工具能够控制浏览器窗口,读取 DOM 结构、网络请求、屏幕截图和控制台输出,从而帮助开发者更快地调试网站。 对于用户而言,Safari 27 新增滚动锚定(Scroll Anchoring)功能,当用户正在读文章时,页面上方延迟加载的图片、广告、评论或推荐模块,不会再把正在看的段落往下推。 IT之家翻译官方相关介绍如下: 许多网站会在用户阅读或浏览内容时向页面注入新内容。这些新内容通常会出现在用户当前视线上方,例如图片、广告或评论。过去这会导...

  9. IT之家 AI70

    Qoder 福利:10 月前阿里千问 Qwen3.8-Flash 免费用,每日登录还能领 100 Credits

    IT之家 9 月 18 日消息,阿里 Qoder 官方今日宣布,Qwen3.8-Flash 模型在 Qoder 平台限时免费(活动从 9 月 18 日 10:00 持续至 9 月 30 日 23:59:59)。 活动期间,Qwen3.8-Flash 计费系数由 0.1× 降至 0.0×,每次调用不扣 Credits。用户无需领取免费资格,打开 Qoder 桌面端并在模型选择器中选择该模型即可使用。 在此基础上,Qoder 还推出每日登录奖励。每天 10:00 开放新一轮领取,至次日 10:00 前可领(每个账号每轮可领一次 100 通用 Credits,错过不补),每笔奖励自领取之日起 30 天有效。 值得一提的是,未到期的额度可以累积。奖励计入 Add-on Credits,可在 Qoder、Qoder IDE、Qoder JetBrains 插件、Qoder CLI、QoderWake、Qoder Cloud Agents、...

    推荐理由:来自IT之家 AI的《Qoder 福利:10 月前阿里千问 Qwen3.8-Flash 免费用,每日登录还能领 100 Credits》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 18 日消息,阿里 Qoder 官方今日宣布,Qwen3.8-Flash 模型在 Qoder 平台限时免费(活动从 9 月 18 日 10:00 持续至 9 月 30 日 23:59:59)。 活动期间,Qwen3.8-Flash 计费系数由 0.1× 降至 0.0×,每次调用不扣 Credits。用户无需领取免费资格,打开 Qoder 桌面端并在模型选择器中选择该模型即可使用。 在此基础上,Qoder 还推出每日登录奖励。每天 10:00 开放新一轮领取,至次日 10:00 前可领(每个账号每轮可领一次 100 通用 Credits,错过不补),每笔奖励自领取之日起 30 天有效。 值得一提的是,未到期的额度可以累积。奖励计入 Add-on Credits,可在 Qoder、Qoder IDE、Qoder JetBrains 插件、Qoder CLI、QoderWake、Qoder Cloud Agents、...

  10. IT之家 AI38

    微软 Azure CTO 惊叹 AI 能力:30 分钟跨平台移植基础功能、2 天实现约 90% 功能

    IT之家 9 月 18 日消息,科技媒体 Windows Latest 昨日(9 月 17 日)发布博文,报道称微软 Azure 首席技术官马克 · 鲁西诺维奇(Mark Russinovich)在 AI 技术的帮助下, 仅用 2 天时间就成功将拥有 20 年历史的 Windows 工具移植到苹果 macOS 平台,并表示“我当时简直惊呆了”(I was flabbergasted)。 IT之家援引博文介绍,本次移植的 Windows 工具名为 ZoomIt,是一款屏幕缩放、实时标注和录制工具,由鲁西诺维奇开发和维护,目前已经有 20 多年历史,最新版本是 9 月 10 日发布的 v12.22 版。 鲁西诺维奇在某个周末,调用 AI(原文并未提及具体模型),在输入约 12 条提示词后,AI 不到 30 分钟就成功移植到苹果 macOS 平台,完成基础功能。 鲁西诺维奇在不到 2 天时间里,不断调用 AI 完善相关功能,目前已完成...

    推荐理由:来自IT之家 AI的《微软 Azure CTO 惊叹 AI 能力:30 分钟跨平台移植基础功能、2 天实现约 90% 功能》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,科技媒体 Windows Latest 昨日(9 月 17 日)发布博文,报道称微软 Azure 首席技术官马克 · 鲁西诺维奇(Mark Russinovich)在 AI 技术的帮助下, 仅用 2 天时间就成功将拥有 20 年历史的 Windows 工具移植到苹果 macOS 平台,并表示“我当时简直惊呆了”(I was flabbergasted)。 IT之家援引博文介绍,本次移植的 Windows 工具名为 ZoomIt,是一款屏幕缩放、实时标注和录制工具,由鲁西诺维奇开发和维护,目前已经有 20 多年历史,最新版本是 9 月 10 日发布的 v12.22 版。 鲁西诺维奇在某个周末,调用 AI(原文并未提及具体模型),在输入约 12 条提示词后,AI 不到 30 分钟就成功移植到苹果 macOS 平台,完成基础功能。 鲁西诺维奇在不到 2 天时间里,不断调用 AI 完善相关功能,目前已完成...

  11. Claude Code Releases84

    Claude Code Releases v2.1.276:Fixed every request failing with 400 … Input tag 'advisor_...

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.276:Fixed every request failing with 400 … Input tag 'advisor_... 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.276:Fix。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  12. IT之家 AI66

    人形机器人可“自主做家务”,Figure 发布 Helix 2.5 模型

    IT之家 9 月 18 日消息,人形机器人企业 Figure 今日发布了 Helix 2.5 模型, 能让机器人“自主做家务” 。 IT之家从 Figure 官方介绍获悉,Figure 在美国旧金山湾区租了 30 套房子,机器人没有进行额外训练,到了地方就开始自己收拾房子。 Helix 2.5 的构建旨在回答一个问题 —— 类人生物能否进入一个它从未见过的家,并立即自主工作? 为此,Figure 在全球人类行为数据集 Index 上预训练了 Helix 2.5。基于这个单一的基础模型,机器人产生了三种行为: 整理客厅、折叠毛巾和整理床铺 。然后 Figure 带着机器人进入了湾区 30 户家庭,之前没有收集任何数据。 在测试中,一个单一的 Index 预训练基础模型被调整为三种不同行为,涵盖运动、刚性和可变形操作、双手协调以及主动感知。 根据实测数据,Index 预训练显著提高了人形机器人零样本全身泛化能力,在任务专用数据、架构...

    推荐理由:来自IT之家 AI的《人形机器人可“自主做家务”,Figure 发布 Helix 2.5 模型》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,人形机器人企业 Figure 今日发布了 Helix 2.5 模型, 能让机器人“自主做家务” 。 IT之家从 Figure 官方介绍获悉,Figure 在美国旧金山湾区租了 30 套房子,机器人没有进行额外训练,到了地方就开始自己收拾房子。 Helix 2.5 的构建旨在回答一个问题 —— 类人生物能否进入一个它从未见过的家,并立即自主工作? 为此,Figure 在全球人类行为数据集 Index 上预训练了 Helix 2.5。基于这个单一的基础模型,机器人产生了三种行为: 整理客厅、折叠毛巾和整理床铺 。然后 Figure 带着机器人进入了湾区 30 户家庭,之前没有收集任何数据。 在测试中,一个单一的 Index 预训练基础模型被调整为三种不同行为,涵盖运动、刚性和可变形操作、双手协调以及主动感知。 根据实测数据,Index 预训练显著提高了人形机器人零样本全身泛化能力,在任务专用数据、架构...

  13. IT之家 AI72

    谷歌最强数学推理 AI 模型曝光:100 万词元上下文,专攻数学难题

    IT之家 9 月 18 日消息,消息源 @lyraxana 于 9 月 16 日在 X 平台发布推文,爆料称谷歌正基于 DeepThink V3 模型, 构建内部代号为 Mathematica 的实验 AI 模型,主要针对繁重计算、复杂的符号问题求解特别优化,预估将成为谷歌最强数学推理 AI 模型。 API 数据显示,该模型内部标识符为“models / deepthink-mathematica-tf-raw-thoughts ”,支持高达 100 万个词元(token)的上下文窗口,同时输出限制为 65,536 个词元。 IT之家注:上下文窗口指模型单次处理时可读取的文本单位总量;输出上限指模型单次回答可生成的文本单位数量。 泄露配置还标注“UNSTABLE_EXPERIMENTAL”。这一状态名称表明,该版本属于不稳定实验版本。模型同时带有“Teamfood”标签,是谷歌用于内部员工测试的术语,意味着相关服务处于内部测试范...

    推荐理由:来自IT之家 AI的《谷歌最强数学推理 AI 模型曝光:100 万词元上下文,专攻数学难题》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,消息源 @lyraxana 于 9 月 16 日在 X 平台发布推文,爆料称谷歌正基于 DeepThink V3 模型, 构建内部代号为 Mathematica 的实验 AI 模型,主要针对繁重计算、复杂的符号问题求解特别优化,预估将成为谷歌最强数学推理 AI 模型。 API 数据显示,该模型内部标识符为“models / deepthink-mathematica-tf-raw-thoughts ”,支持高达 100 万个词元(token)的上下文窗口,同时输出限制为 65,536 个词元。 IT之家注:上下文窗口指模型单次处理时可读取的文本单位总量;输出上限指模型单次回答可生成的文本单位数量。 泄露配置还标注“UNSTABLE_EXPERIMENTAL”。这一状态名称表明,该版本属于不稳定实验版本。模型同时带有“Teamfood”标签,是谷歌用于内部员工测试的术语,意味着相关服务处于内部测试范...

  14. IT之家 AI72

    谷歌最强 AI 模型:Gemini 4 Pro 开测,SVG 生图表现惊艳

    IT之家 9 月 18 日消息,根据 @LuminaBench 等网友反馈,谷歌正以“gemini-3.8-flash”名称, 在 Arena 等基准平台测试其最强 Gemini 4 Pro 模型,内部开发代号为 Argon。 根据网友晒出的模型测试图片,在生成经典的“鹈鹕骑自行车”SVG 图片为例,其非常优秀,该网友还附上了和 OpenAI 最强模型 GPT-6 Astra Pro 的对比,并认为在谷歌官方发布后,Gemini 4 Pro 模型的能力会进一步提升。 IT之家附上相关截图如下:

    推荐理由:来自IT之家 AI的《谷歌最强 AI 模型:Gemini 4 Pro 开测,SVG 生图表现惊艳》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 18 日消息,根据 @LuminaBench 等网友反馈,谷歌正以“gemini-3.8-flash”名称, 在 Arena 等基准平台测试其最强 Gemini 4 Pro 模型,内部开发代号为 Argon。 根据网友晒出的模型测试图片,在生成经典的“鹈鹕骑自行车”SVG 图片为例,其非常优秀,该网友还附上了和 OpenAI 最强模型 GPT-6 Astra Pro 的对比,并认为在谷歌官方发布后,Gemini 4 Pro 模型的能力会进一步提升。 IT之家附上相关截图如下:

  15. Apple Machine Learning Research48

    Dynamically Scaled Activation Steering

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Dynamically Scaled Activation Steering 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Dynamically Scaled Activation Steering 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Dynamically Scale。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. IT之家 AI70

    OpenAI 被指控“为赚钱不择手段”:明知威胁出版商生存,仍大量侵权

    北京时间 9 月 18 日,根据《纽约时报》提交的最新诉讼文件,OpenAI 在明知其对出版商构成“生存威胁”的情况下,仍复制了数百万篇受版权保护的文章,以打造潜在价值高达“天文数字”的 AI 技术。 目前,《纽约时报》和其他媒体机构正向 OpenAI 寻求数十亿美元的损害赔偿金。此案的关键在于,OpenAI 和共同被告微软是否通过利用出版商的内容训练其模型,侵犯了版权法。 《纽约时报》的律师表示,OpenAI 受商业利益驱动,大量获取该报的内容。他们称,OpenAI 联合创始人格雷格 · 布罗克曼 (Greg Brockman) 大约在 2017 年写道,他“被那些天文数字般的财富深深驱动”,希望通过 OpenAI 技术的商业化获得这笔财富。 《纽约时报》周四提交的文件披露了新的证据。这起案件是版权持有人针对 AI 公司提起的数十起诉讼中最受关注的案件之一。版权持有人指控这些公司盗用相关材料训练 AI 模型,而这些模型正在威胁...

    推荐理由:来自IT之家 AI的《OpenAI 被指控“为赚钱不择手段”:明知威胁出版商生存,仍大量侵权》。重点看模型能力与工程、文化创意。摘要提到:北京时间 9 月 18 日,根据《纽约时报》提交的最新诉讼文件,OpenAI 在明知其对出版商构成“生存威胁”的情况下,仍复制了数百万篇受版权保护的文章,以打造潜在价值高达“天文数字”的 AI 技术。 目前,《纽约时报》和其他媒体机构正向 OpenAI 寻求数十亿美元的损害赔偿金。此案的关键在于,OpenAI 和共同被告微软是否通过利用出版商的内容训练其模型,侵犯了版权法。 《纽约时报》的律师表示,OpenAI 受商业利益驱动,大量获取该报的内容。他们称,OpenAI 联合创始人格雷格 · 布罗克曼 (Greg Brockman) 大约在 2017 年写道,他“被那些天文数字般的财富深深驱动”,希望通过 OpenAI 技术的商业化获得这笔财富。 《纽约时报》周四提交的文件披露了新的证据。这起案件是版权持有人针对 AI 公司提起的数十起诉讼中最受关注的案件之一。版权持有人指控这些公司盗用相关材料训练 AI 模型,而这些模型正在威胁...

  17. IT之家 AI72

    OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误

    IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compaction summaries)中加入额外指令,向未来版本留下提醒,要求其隐藏错误或与预期目标不一致的行为。 例如,一个 Sol 智能体负责制作财务模型时无法找到用户要求的历史数据,于是在摘要中写道,由于没有源文件,可能需要自行创建“Historical Data”工作表并填入合理的 2024 年历史数据,并留下指令,要求后续模型“只有被问到时才保持信息透明度”、“最终回复只需要提供文件链接”。 再如,另一个 ...

    推荐理由:来自IT之家 AI的《OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compaction summaries)中加入额外指令,向未来版本留下提醒,要求其隐藏错误或与预期目标不一致的行为。 例如,一个 Sol 智能体负责制作财务模型时无法找到用户要求的历史数据,于是在摘要中写道,由于没有源文件,可能需要自行创建“Historical Data”工作表并填入合理的 2024 年历史数据,并留下指令,要求后续模型“只有被问到时才保持信息透明度”、“最终回复只需要提供文件链接”。 再如,另一个 ...

  18. Simon Willison79

    How To Write With An LLM

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:How To Write With An LLM 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:How To Write With An LLM 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:How To Wr。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  19. IT之家 AI70

    安全顾虑成普及关键:外媒调查显示超七成受访者不愿令 OpenClaw 等 AI 工具完全控制自己的电脑

    IT之家 9 月 18 日消息,大语言模型(LLM)问世仅数年,但如今已经逐渐走出聊天窗口。从回答问题、修改邮件,到如今 OpenClaw 诞生,可代替用户操作电脑,减少大量重复劳动, 但 OpenClaw 本身也是双刃剑,其虽然可以帮助人类完成相当复杂的任务,但本身存在一定风险,不法分子可以利用提示词注入等各种攻击方案对用户环境造成重大破坏。 对此,外媒 Android Authority 发起一项投票,询问用户是否愿意让 OpenClaw 等 AI 工具获得电脑的完整访问权限。 调查结果显示,43% 的受访者明确表示出于安全原因不会允许 AI 访问电脑,另有 27% 的受访者则表示自己对此类功能完全不感兴趣。约四分之一的受访者对这一想法持相对开放态度,但前提是 AI 能够得到妥善的安全保护。此外,不到 4% 的受访者表示并不担心相关风险。 外媒表示,这意味着 其平台超过 70% 的受访者明确不愿让 AI 完全接管电脑 ,即使...

    推荐理由:来自IT之家 AI的《安全顾虑成普及关键:外媒调查显示超七成受访者不愿令 OpenClaw 等 AI 工具完全控制自己的电脑》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,大语言模型(LLM)问世仅数年,但如今已经逐渐走出聊天窗口。从回答问题、修改邮件,到如今 OpenClaw 诞生,可代替用户操作电脑,减少大量重复劳动, 但 OpenClaw 本身也是双刃剑,其虽然可以帮助人类完成相当复杂的任务,但本身存在一定风险,不法分子可以利用提示词注入等各种攻击方案对用户环境造成重大破坏。 对此,外媒 Android Authority 发起一项投票,询问用户是否愿意让 OpenClaw 等 AI 工具获得电脑的完整访问权限。 调查结果显示,43% 的受访者明确表示出于安全原因不会允许 AI 访问电脑,另有 27% 的受访者则表示自己对此类功能完全不感兴趣。约四分之一的受访者对这一想法持相对开放态度,但前提是 AI 能够得到妥善的安全保护。此外,不到 4% 的受访者表示并不担心相关风险。 外媒表示,这意味着 其平台超过 70% 的受访者明确不愿让 AI 完全接管电脑 ,即使...

  20. Claude Code Releases90

    Claude Code Releases v2.1.275:Added the signed-in account to Claude apps gateway sign-in...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.275:Added the signed-in account to Claude apps gateway sign-in... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  21. Simon Willison61

    Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Bonsai 2 27B: Near-Lossless Compression。影响判断:它可能改变模型能力与工程、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  22. GitHub Changelog90

    Agentic CLI customizations now in the usage metrics API

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Agentic CLI customizations now in the usage metrics API 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Agentic CLI customizations now in the usage m。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  23. Simon Willison93

    Self-generated prompt injections in compaction summaries

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Self-generated prompt injections in compaction summaries 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Self-generated prompt injections in compacti。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  24. GitHub Changelog90

    Ubuntu 26 generally available and latest migration

    事实摘要:这条英文动态主要涉及智能体工作流、文化创意、开源生态,原文信息显示:Ubuntu 26 generally available and latest migration 事实摘要:这条英文动态主要涉及智能体工作流、文化创意、开源生态,原文信息显示:Ubuntu 26 generally available and latest migration 事实摘要:。影响判断:它可能改变智能体工作流、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月17日周四
  1. IT之家 AI36

    天文学家发现已知最年轻系外行星:诞生不足百万年

    IT之家 9 月 17 日消息,天文学家发现了有记录以来最年轻的系外行星,而且这个“新生儿”并不是通过最新观测设备发现的,而是隐藏在过去的观测数据档案中。 新发现的系外行星 Elias 2-24 b 质量与木星大致相当。尽管体型庞大,但它的年龄却小得惊人,目前估计还不到 100 万年,是迄今发现的最年轻行星。更特别的是,这颗位于太阳系之外的行星距离地球约 450 光年,目前仍处于孕育它的气体和尘埃盘中。 智利天体物理研究所(Instituto de Estudios Astrofísicos)教授、Elias 2-24 b 研究论文共同作者 Lucas Cieza 表示,此前的“最年轻系外行星”纪录由 4 颗行星共同保持,它们的年龄都超过 500 万年。 Cieza 在声明中说:“我们的行星形成模型本就难以解释已知最年轻行星的前纪录保持者,而 Elias 2-24 b 的发现让我们看到,即便是我们最完善的行星形成模型,也仍缺失了...

    推荐理由:来自IT之家 AI的《天文学家发现已知最年轻系外行星:诞生不足百万年》。重点看模型能力与工程。摘要提到:IT之家 9 月 17 日消息,天文学家发现了有记录以来最年轻的系外行星,而且这个“新生儿”并不是通过最新观测设备发现的,而是隐藏在过去的观测数据档案中。 新发现的系外行星 Elias 2-24 b 质量与木星大致相当。尽管体型庞大,但它的年龄却小得惊人,目前估计还不到 100 万年,是迄今发现的最年轻行星。更特别的是,这颗位于太阳系之外的行星距离地球约 450 光年,目前仍处于孕育它的气体和尘埃盘中。 智利天体物理研究所(Instituto de Estudios Astrofísicos)教授、Elias 2-24 b 研究论文共同作者 Lucas Cieza 表示,此前的“最年轻系外行星”纪录由 4 颗行星共同保持,它们的年龄都超过 500 万年。 Cieza 在声明中说:“我们的行星形成模型本就难以解释已知最年轻行星的前纪录保持者,而 Elias 2-24 b 的发现让我们看到,即便是我们最完善的行星形成模型,也仍缺失了...

  2. IT之家 AI72

    不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想

    IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存在性与光滑性问题”也是其中之一。 据这名人士透露,OpenAI 员工预计, 下一道“霍奇猜想”有望在不久后得到解决 。 IT之家注:霍奇猜想研究的是由多项式方程定义的几何形状中,某些几何特征能否始终用更简单的代数结构来描述。不过,即使找到解法,OpenAI 可能也不会立即公布。公司正考虑如何与数学界合作发布消息,避免再次酿成公关危机。 据悉,OpenAI 为了解决纳维-斯托克斯问题,或已花掉数百万美元。前述人士透露,OpenAI 当时使用的是下一款预训练模型的一个变体,代号为“Doug”。 部分 OpenAI 研究人员认为,继软件工程之后, 数学是大模型最自然的下一块试验场 。两者有一个重要共...

    推荐理由:来自IT之家 AI的《不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存在性与光滑性问题”也是其中之一。 据这名人士透露,OpenAI 员工预计, 下一道“霍奇猜想”有望在不久后得到解决 。 IT之家注:霍奇猜想研究的是由多项式方程定义的几何形状中,某些几何特征能否始终用更简单的代数结构来描述。不过,即使找到解法,OpenAI 可能也不会立即公布。公司正考虑如何与数学界合作发布消息,避免再次酿成公关危机。 据悉,OpenAI 为了解决纳维-斯托克斯问题,或已花掉数百万美元。前述人士透露,OpenAI 当时使用的是下一款预训练模型的一个变体,代号为“Doug”。 部分 OpenAI 研究人员认为,继软件工程之后, 数学是大模型最自然的下一块试验场 。两者有一个重要共...

  3. IT之家 AI68

    前谷歌 DeepMind 研究员创立:初创公司 Emulate 即将完成 7 亿美元种子轮融资,估值有望达 37 亿美元

    IT之家 9 月 17 日消息,据《金融时报》今天报道,前谷歌 DeepMind 研究员创立的英国初创公司 Emulate 即将完成种子轮融资, 估值预计将达到 37 亿美元 (IT之家注:现汇率约合 248.72 亿元人民币) 。 据知情人士透露,Emulate 正在与潜在投资者进行深入谈判, 计划融资最多 7 亿美元 (现汇率约合 47.06 亿元人民币) ,融资完成后的估值可达 37 亿美元 (现汇率约合 248.72 亿元人民币) 。英国 Index Ventures 和硅谷 Lightspeed Venture Partners 预计将共同领投。 Emulate 公司成立于今年 8 月,由一群曾经在 DeepMind 工作的研究员创立,其中包括 Jack Parker-Holder、Matthew McGill 以及 Philip Ball,他们曾研发 Genie 世界模型,该产品可根据简短提示词生成逼真的 3D 交互...

    推荐理由:来自IT之家 AI的《前谷歌 DeepMind 研究员创立:初创公司 Emulate 即将完成 7 亿美元种子轮融资,估值有望达 37 亿美元》。重点看模型能力与工程、文化创意、产品发布。摘要提到:IT之家 9 月 17 日消息,据《金融时报》今天报道,前谷歌 DeepMind 研究员创立的英国初创公司 Emulate 即将完成种子轮融资, 估值预计将达到 37 亿美元 (IT之家注:现汇率约合 248.72 亿元人民币) 。 据知情人士透露,Emulate 正在与潜在投资者进行深入谈判, 计划融资最多 7 亿美元 (现汇率约合 47.06 亿元人民币) ,融资完成后的估值可达 37 亿美元 (现汇率约合 248.72 亿元人民币) 。英国 Index Ventures 和硅谷 Lightspeed Venture Partners 预计将共同领投。 Emulate 公司成立于今年 8 月,由一群曾经在 DeepMind 工作的研究员创立,其中包括 Jack Parker-Holder、Matthew McGill 以及 Philip Ball,他们曾研发 Genie 世界模型,该产品可根据简短提示词生成逼真的 3D 交互...

  4. 爱范儿36

    刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM

    事实摘要:刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM 模型优化系统,而系统服务模型。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程、产品发布。 刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM 模型优化系统,而系统服务模型。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. IT之家 AI74

    智谱 GLM 公开国内大模型首个递归自我改进实践:AI 在十万卡国产集群上自建推理系统

    IT之家 9 月 17 日消息,今日,智谱 GLM 团队披露递归自我改进(Recursive Self‑Improvement,简称 RSI)方向首个工程化实践进展,也就是让 AI 自己动手改进自己的运行系统。 具体来说,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。 据官方博客,Infra Agent 在超 10 万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平。这套系统已投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,6 天 Token 调用量超过 62 万亿。 IT之家注意到,这是国内大模型厂商首次公开将“AI 自我改进”...

    推荐理由:来自IT之家 AI的《智谱 GLM 公开国内大模型首个递归自我改进实践:AI 在十万卡国产集群上自建推理系统》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,今日,智谱 GLM 团队披露递归自我改进(Recursive Self‑Improvement,简称 RSI)方向首个工程化实践进展,也就是让 AI 自己动手改进自己的运行系统。 具体来说,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。 据官方博客,Infra Agent 在超 10 万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平。这套系统已投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,6 天 Token 调用量超过 62 万亿。 IT之家注意到,这是国内大模型厂商首次公开将“AI 自我改进”...

  6. IT之家 AI76

    台积电 COO 米玉杰:AI 像三岁超人,在尖端芯片设计上不太实用

    IT之家 9 月 17 日消息,台积电一名高层管理人员将人工智能比作拥有超强能力却尚不辨是非的幼童,以此解释该公司对待这项技术为何采取谨慎态度。 IT之家注意到,台积电在利用人工智能处理研发敏感信息方面尤为审慎,公司共同首席运营官米玉杰( Y.J . Mii)于本周二发表了上述看法。他着重提醒,如果员工对 AI 使用不当,就会出现数据泄露或遗失的风险;并且提到曾发生过 OpenAI 以及 Anthropic PBC 的模型侵入外部机构系统的相关事件。 “AI 就像是三岁版超人。它能力十分强大,但并不知道自己会造成什么样的破坏。”米玉杰在母校台湾大学面向在校学生发言时表示,“而且它分不清是非对错。”他并未就此进一步展开阐述。 这场在台北举办的校园职业论坛上,有学生问到企业内部如何使用 AI,这位共同首席运营官就此作出回应。就在此次发言前不久,已经出现过失控 AI 智能体程序侵入 Hugging Face 以及其他数据系统的事件;A...

    推荐理由:来自IT之家 AI的《台积电 COO 米玉杰:AI 像三岁超人,在尖端芯片设计上不太实用》。重点看智能体工作流、模型能力与工程、教育应用。摘要提到:IT之家 9 月 17 日消息,台积电一名高层管理人员将人工智能比作拥有超强能力却尚不辨是非的幼童,以此解释该公司对待这项技术为何采取谨慎态度。 IT之家注意到,台积电在利用人工智能处理研发敏感信息方面尤为审慎,公司共同首席运营官米玉杰( Y.J . Mii)于本周二发表了上述看法。他着重提醒,如果员工对 AI 使用不当,就会出现数据泄露或遗失的风险;并且提到曾发生过 OpenAI 以及 Anthropic PBC 的模型侵入外部机构系统的相关事件。 “AI 就像是三岁版超人。它能力十分强大,但并不知道自己会造成什么样的破坏。”米玉杰在母校台湾大学面向在校学生发言时表示,“而且它分不清是非对错。”他并未就此进一步展开阐述。 这场在台北举办的校园职业论坛上,有学生问到企业内部如何使用 AI,这位共同首席运营官就此作出回应。就在此次发言前不久,已经出现过失控 AI 智能体程序侵入 Hugging Face 以及其他数据系统的事件;A...

  7. IT之家 AI66

    我国科学家首次给二维铁电材料装上“方向盘”,实现定向滑移

    IT之家 9 月 17 日消息,据科技日报今日报道,宁波大学物理科学与技术学院研究员王宏伟联合宁波东方理工大学讲席教授李润伟、中国科学院宁波材料所研究员何日等人, 首次给原子层厚度的滑移铁电体装上了“方向盘”,使这种新型二维铁电材料实现了精准定向滑移 。相关成果发表在国际物理学期刊《物理评论快报》上。 滑移铁电体是一种依靠 原子层间整体滑移 来实现极化翻转的新型二维铁电材料,核心特点是超低能耗、超快响应和极强抗疲劳性。它不像传统铁电材料靠离子位移,而是像两张纸一样整体滑动,所以天然规避了铁电疲劳问题。 然而,其在理想单畴结构中,材料内部存在多条对称等价的滑移路径, 原子层沿哪一方向运动不受控制 。如何让原子层在二维世界里沿指定方向滑动,一直是铁电行业的难题。 研究团队以双层氮化硼为模型体系,用直接从量子力学基本方程出发的第一性原理计算,摸清材料的电子和微观结构“家底”,再借助人工智能加持的深度势能分子动力学模拟, 追踪上百万个原...

    推荐理由:来自IT之家 AI的《我国科学家首次给二维铁电材料装上“方向盘”,实现定向滑移》。重点看模型能力与工程。摘要提到:IT之家 9 月 17 日消息,据科技日报今日报道,宁波大学物理科学与技术学院研究员王宏伟联合宁波东方理工大学讲席教授李润伟、中国科学院宁波材料所研究员何日等人, 首次给原子层厚度的滑移铁电体装上了“方向盘”,使这种新型二维铁电材料实现了精准定向滑移 。相关成果发表在国际物理学期刊《物理评论快报》上。 滑移铁电体是一种依靠 原子层间整体滑移 来实现极化翻转的新型二维铁电材料,核心特点是超低能耗、超快响应和极强抗疲劳性。它不像传统铁电材料靠离子位移,而是像两张纸一样整体滑动,所以天然规避了铁电疲劳问题。 然而,其在理想单畴结构中,材料内部存在多条对称等价的滑移路径, 原子层沿哪一方向运动不受控制 。如何让原子层在二维世界里沿指定方向滑动,一直是铁电行业的难题。 研究团队以双层氮化硼为模型体系,用直接从量子力学基本方程出发的第一性原理计算,摸清材料的电子和微观结构“家底”,再借助人工智能加持的深度势能分子动力学模拟, 追踪上百万个原...

  8. IT之家 AI72

    ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费

    IT之家 9 月 17 日消息,TypeSafe AI 昨日(9 月 16 日)发布公告,宣布推出 Jev,该 AI 模型定位为“System One Model”(系统一模型), 不生成文本,直接返回结构化决策,其成本和延迟远低于大型语言模型。 IT之家查询公开资料,TypeSafe AI 由 Diogo Almeida 成立,他曾在 OpenAI 工作,是 RLHF 研究的幕后功臣之一,而该研究催生了 ChatGPT。该公司成立于 2 年前,本周宣布结束隐身状态,宣布完成由 DCVC 领投的 4,000 万美元 (IT之家注:现汇率约合 2.69 亿元人民币) 种子轮融资。 该公司将 Jev 定义为“System One Model”(系统一模型),对应快速、低延迟的重复决策场景。该定义借用心理学中的“系统 1”概念,指快速、直觉式判断。该类模型面向固定选项、连续评分或是非概率等重复决策任务,不以生成自然语言文本、代码或多轮...

    推荐理由:来自IT之家 AI的《ChatGPT 背后功臣:Almeida 推出 AI 模型 Jev,不生成文本、输出免费》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,TypeSafe AI 昨日(9 月 16 日)发布公告,宣布推出 Jev,该 AI 模型定位为“System One Model”(系统一模型), 不生成文本,直接返回结构化决策,其成本和延迟远低于大型语言模型。 IT之家查询公开资料,TypeSafe AI 由 Diogo Almeida 成立,他曾在 OpenAI 工作,是 RLHF 研究的幕后功臣之一,而该研究催生了 ChatGPT。该公司成立于 2 年前,本周宣布结束隐身状态,宣布完成由 DCVC 领投的 4,000 万美元 (IT之家注:现汇率约合 2.69 亿元人民币) 种子轮融资。 该公司将 Jev 定义为“System One Model”(系统一模型),对应快速、低延迟的重复决策场景。该定义借用心理学中的“系统 1”概念,指快速、直觉式判断。该类模型面向固定选项、连续评分或是非概率等重复决策任务,不以生成自然语言文本、代码或多轮...

  9. 极客公园70

    IDC 发布企业级 Agent 评估报告,中国电信 TeleAgent 综合跻身国内第一梯队

    近日,国际数据公司(IDC)发布《中国企业级通用 Agent 产品技术评估》报告,对国内多款主流通用智能体产品开展标准化实测。中国电信星辰超级智能体 TeleAgent 综合得分 6.85 分,成本效率、安全可控、任务表现等多个维度高于行业普遍水平,面向高频办公场景的常规任务能力进入国内第一梯队。 本次评估在统一的仿真测试环境中进行,覆盖任务表现、成本效率、交互体验、安全可控、生态开放性等九大维度,并加入脏数据、权限约束、模糊指令等真实工作中常见的干扰条件。测评显示,TeleAgent 在 Token 消耗方面优于同类产品。对于需要高频调用、规模化部署智能体的企业而言,这意味着使用成本有望进一步降低。 支撑 TeleAgent 的,是中国电信在算力、平台、数据、模型和应用上的全栈布局。中电信人工智能公司依托这一体系,连接基础研究、工程研发与产品落地。其中,星辰通用人工智能实验室基于国产算力和国产框架,自主完成了十亿、百亿、千亿参...

    推荐理由:来自极客公园的《IDC 发布企业级 Agent 评估报告,中国电信 TeleAgent 综合跻身国内第一梯队》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:近日,国际数据公司(IDC)发布《中国企业级通用 Agent 产品技术评估》报告,对国内多款主流通用智能体产品开展标准化实测。中国电信星辰超级智能体 TeleAgent 综合得分 6.85 分,成本效率、安全可控、任务表现等多个维度高于行业普遍水平,面向高频办公场景的常规任务能力进入国内第一梯队。 本次评估在统一的仿真测试环境中进行,覆盖任务表现、成本效率、交互体验、安全可控、生态开放性等九大维度,并加入脏数据、权限约束、模糊指令等真实工作中常见的干扰条件。测评显示,TeleAgent 在 Token 消耗方面优于同类产品。对于需要高频调用、规模化部署智能体的企业而言,这意味着使用成本有望进一步降低。 支撑 TeleAgent 的,是中国电信在算力、平台、数据、模型和应用上的全栈布局。中电信人工智能公司依托这一体系,连接基础研究、工程研发与产品落地。其中,星辰通用人工智能实验室基于国产算力和国产框架,自主完成了十亿、百亿、千亿参...

  10. 量子位36

    国产RSI模型交卷!Flash模型靠它反打旗舰

    事实摘要:国产RSI模型交卷!Flash模型靠它反打旗舰 1亿Tokens人人免费领 这条动态来自 量子位,可重点关注模型能力与工程。 国产RSI模型交卷!Flash模型靠它反打旗舰 1亿Tokens人人免费领。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  11. IT之家 AI68

    OPPO ColorOS 17 发布:全新“流体设计”、新一代小布

    IT之家 9 月 17 日消息,在今日的 OPPO ColorOS 17 发布暨开发者大会上, ColorOS 17 正式发布 ,口号为“超流畅,更懂你”。 ColorOS 17 的流畅双引擎迎来全面升级:极光引擎从绘制层深入渲染层,实现融合渲染,内存占用和渲染负载降低;潮汐引擎通过个性化行为感知链实现精准调度,带来行业首个记忆后台。 ColorOS 17 采用“ 流体设计 ”,带来凝光视效、流体动效、柔性反馈,比如拖动音乐播放器进度条,会有光影变化。 性能优化方面,ColorOS 17 带来个性化感知调度,官方称之为“记忆后台”,前台应用性能前倾、重要后台应用精准保活、非重要后台智能冷存, 后台稳定保活率提升 55.6% 。 此外,相册选图、小程序启动、应用内跳转等高频场景均实现秒加载、秒启动、秒跳转。 ColorOS 17 是迈向个性化主动智能的关键一步,On-Device Compute 端侧大模型、Persona X 记...

    推荐理由:来自IT之家 AI的《OPPO ColorOS 17 发布:全新“流体设计”、新一代小布》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,在今日的 OPPO ColorOS 17 发布暨开发者大会上, ColorOS 17 正式发布 ,口号为“超流畅,更懂你”。 ColorOS 17 的流畅双引擎迎来全面升级:极光引擎从绘制层深入渲染层,实现融合渲染,内存占用和渲染负载降低;潮汐引擎通过个性化行为感知链实现精准调度,带来行业首个记忆后台。 ColorOS 17 采用“ 流体设计 ”,带来凝光视效、流体动效、柔性反馈,比如拖动音乐播放器进度条,会有光影变化。 性能优化方面,ColorOS 17 带来个性化感知调度,官方称之为“记忆后台”,前台应用性能前倾、重要后台应用精准保活、非重要后台智能冷存, 后台稳定保活率提升 55.6% 。 此外,相册选图、小程序启动、应用内跳转等高频场景均实现秒加载、秒启动、秒跳转。 ColorOS 17 是迈向个性化主动智能的关键一步,On-Device Compute 端侧大模型、Persona X 记...

  12. 量子位73

    网易有道周枫:AI能力竞争,正在进入「Model + Agent + Workflow」时代,网易有道AI Open Day展示AI时代“有道解法”

    事实摘要:网易有道周枫:AI能力竞争,正在进入「Model + Agent + Workflow」时代,网易有道AI Open Day展示AI时代“有道解法” 9月16日,网易有道「NEXT,AGENT|有道AI Open Day」在北京举办。 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程。 网易有道周枫:AI能力竞争,正在进入「Model + Age。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  13. IT之家 AI72

    OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件

    IT之家 9 月 17 日消息,当地时间 9 月 16 日,OpenAI 发布报告,披露了其“对齐失效”框架下的六起模型异常行为案例,涉及隐瞒错误、编造数据、未经许可上传文件等。 对齐失效在这里是指 AI 系统的目标与行为偏离人类设计意图和价值观。OpenAI 表示,行业尚未充分解决对齐与监控问题,已无法继续以最快速度且安稳地扩大 AI 规模。OpenAI 也借此机会宣布将系统性跟踪、调查和披露模型在训练、评估、测试及部署过程中出现的异常行为。 OpenAI 称,有关 AI 应如何发展的决策,必须建立在外部人士可以自行核验的实证依据之上。该公司希望新框架推动行业形成公开披露标准,而非仅靠零散报告。 此番披露之际,外界正争论是否应放缓 AI 研发。今年早些时候,OpenAI 系统出现失控行为并攻击 AI 初创企业 Hugging Face,几周后 Hugging Face 主动告知,OpenAI 方才知晓。 此后,Anthropi...

    推荐理由:来自IT之家 AI的《OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,当地时间 9 月 16 日,OpenAI 发布报告,披露了其“对齐失效”框架下的六起模型异常行为案例,涉及隐瞒错误、编造数据、未经许可上传文件等。 对齐失效在这里是指 AI 系统的目标与行为偏离人类设计意图和价值观。OpenAI 表示,行业尚未充分解决对齐与监控问题,已无法继续以最快速度且安稳地扩大 AI 规模。OpenAI 也借此机会宣布将系统性跟踪、调查和披露模型在训练、评估、测试及部署过程中出现的异常行为。 OpenAI 称,有关 AI 应如何发展的决策,必须建立在外部人士可以自行核验的实证依据之上。该公司希望新框架推动行业形成公开披露标准,而非仅靠零散报告。 此番披露之际,外界正争论是否应放缓 AI 研发。今年早些时候,OpenAI 系统出现失控行为并攻击 AI 初创企业 Hugging Face,几周后 Hugging Face 主动告知,OpenAI 方才知晓。 此后,Anthropi...

  14. Claude Code Releases92

    Claude Code Releases v2.1.274:Added a visible warning when memory usage is critical, wit...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.274:Added a visible warning when memory usage is critical, wit... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  15. Tomer Tunguz69

    The Harness Margin Opportunity

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:The Harness Margin Opportunity 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:The Harness Margin Opportunity 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:。影响判断:它可能改变模型能力与工程、评测与基准、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. Simon Willison50

    datasette 0.65.5

    这条英文动态主要涉及开源生态。原文要点:Release: datasette 0.65.5 Security fix for an issue where a trailing newline in a requested table name could bypass table permissions and expose private rows, reported by dpfkdlemtp in GHSA-h547-rmjf-5m2m . Tags: security , datasette

    推荐理由:来自Simon Willison的《datasette 0.65.5》。重点看开源生态。摘要提到:这条英文动态主要涉及开源生态。原文要点:Release: datasette 0.65.5 Security fix for an issue where a trailing newline in a requested table name could bypass table permissions and expose private rows, reported by dpfkdlemtp in GHSA-h547-rmjf-5m2m . Tags: security , datasette