本期为本站采集记录汇总版
AI 日报 · 2026 年 9 月 23 日 · 星期三
AI.BAIZE
Claude Opus 5.5 is now available in GitHub Copilot
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Claude Opus 5.5 is now available in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Claude Opus 5.5 is now available in GitHub Copilot。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。
模型发布/更新
Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war
这条英文动态主要涉及模型能力与工程。原文要点:Yesterday was Grok 4.7 ( pelicans ) and MiMo v2.6 Flash/Pro ( more pelicans ). Today Anthropic released Claude Opus 5.5 , and around an hour later OpenAI released GPT-6 Sol and GPT-6 Luna . It's going to take a while to get a good read on all of these new models, but here are my impressions so far. GPT-6 Sol and Luna are half the price of their GPT-5.6 equivalents GPT-5.6 Luna was already my favorite model for buildi...
llm-anthropic 0.29
这条英文动态主要涉及模型能力与工程。原文要点:Release: llm-anthropic 0.29 Adds support for Claude Opus 5.5 : llm -m claude-opus-5.5 "prompt goes here" Tags: llm , anthropic
Introducing GPT-6 Sol and Luna
这条英文动态主要涉及模型能力与工程。原文要点:Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
Airbnb widens access to GPT-6 Astra and OpenAI frontier models
这条英文动态主要涉及模型能力与工程。原文要点:Learn how Airbnb is expanding access to GPT-6 Astra and OpenAI frontier models to help engineering teams solve bugs, design systems, and ship faster.
Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看
IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出色的模型?负责 Claude 微调的 Anthropic 工程师杰克逊 · 克尼恩今天(23 日)对此给出了解释:后续模型的优化重点 更多放在数学和代码能力上 。 这些模型还接受了大量 面向其他 AI 模型撰写技术解释 的训练,而这正是 Claude 逐渐形成奇特表达方式,也就是所谓“Claude 腔”(Claudeish)的主要原因。克尼恩称,模型被“调整得适应 LLM 心理”,最终学会了 写给 AI 模型看,而不是写给人看 。 克尼恩把这种现象类比为 只与其他自闭症人士交流的人 。此类群体会逐渐形成一套 在群体内部沟通顺畅、外人却难以理解 的表达方式。LLM 拥有远超人类的工作记忆,也能捕...
rabbit 沉寂许久后发布 OS3 智能体操作系统,支持多设备编排
IT之家 9 月 23 日消息,人工智能初创企业 rabbit 曾因其口袋 AI 设备 Rabbit R1 名噪一时。但在硬件产品备受争议的推出后,该企业热度迅速降低并最终陷入沉寂。根据IT之家的查询, 其本周之前的最后一条官网新闻发布于 2025 年 9 月 。 而在当地时间 22 日, rabbit 宣布正式发布其智能体操作系统 OS3 。其兼容广泛第三方硬件,以单一聊天界面为主要入口。用户仅需设定一个目标,系统便会自动调度所需的设备、模型、文件来完成剩余步骤。 OS3 在云端运行并通过 rabbit agent 智能体连接和操作设备,一个账户最多可以连接五台设备。其 支持 多设备编排 、单一连续对话,兼容通用技能,可进行直接的计算机控制与自动编程。 IT之家了解到,用户使用 OS3 时 需自备 API 接口 。其 仅访问本地文件,仅通过模型提供程序处理上下文,仅执行用户发起的操作。
产品发布/更新
SpaceXAI 智能体 Grok Bot 上线首月,周用户数突破 40 万
IT之家 9 月 23 日消息,据彭博社 22 日报道,SpaceXAI 的 AI 智能体 Grok Bot 上线约一个月,周用户数便已突破 40 万。 据伦敦一场活动的演示材料和与会人士透露,截至 9 月 14 日, Grok Bot 用户数达到 41.8 万 。彭博社看到的材料显示,用户数较前一周增加 24%。 SpaceX 的 AI 部门于 8 月中旬推出 Grok Bot,希望在不断扩大的 AI 智能体市场上跟上 Anthropic 和 OpenAI。Grok Bot 的定位更像一名 全天候待命的员工 ,而不只是聊天机器人,可以 回复邮件、更新销售数据库、处理发票、安排工作,以及提交软件错误报告 。 本周,Meta 的 Muse 登顶苹果 App Store 免费应用榜,令华尔街聚焦 AI 智能体的市场潜力。Muse 初期吸引用户的表现,让分析师联想到 ChatGPT 在 2022 年底迅速走红 的情形。 Muse 主要...
汇智智能发布Hellome:国内首个FDE直连智能体服务平台,把AI交付周期压进“周”
企业AI服务迎来平台化交付时代 这条动态来自 量子位,可重点关注智能体工作流、产品发布。
Meta 测试真人代 Muse 拨打电话,引发内部隐私争议
IT之家 9 月 23 日消息,据路透社看到的 Meta 公司内部帖子显示,Meta 一直在为其新推出的个人 AI 助手 Muse 测试一项“人工礼宾”服务,即由人类承包商在后台悄悄处理部分通过该数字助手拨出的电话。 这家 Facebook 和 Instagram 的母公司上周向员工披露了这一测试,时间就在该公司公开推出 Muse 电话呼叫功能后不久。 自发布两周以来,Muse 一直位居美国应用下载排行榜榜首。该智能体旨在自主完成代发邮件、购物和预订旅行等任务。 借助电话呼叫功能,用户可以指示 Muse 拨打美国商家的电话,并与接听者交谈,办理预约理发、询问门店是否有现货,或向不同承包商询价等事务。 这些内部帖子显示,一些员工对由人工处理这些电话提出了隐私担忧,警告称这种做法可能导致敏感信息被无意中分享给呼叫中心的承包商。 “令我费解的是,我们为什么会认为这项功能值得冒这样的风险,”一名员工在内部帖子中写道。“我们距离不必要的信...
雷神预告 STATION 系列迷你 AI 工作站,至高可选 AMD 锐龙 AI Max+ PRO 495
IT之家 9 月 23 日消息,雷神 (THUNDEROBOT) 今日宣布雷神 STATION 系列迷你 AI 工作站即将亮相。 该系列产品 至高可选 AMD 锐龙 AI Max+ PRO 495 处理器 ,支持集群弹性组网,允许多机灵活部署、算力按需扩容,面向 AI 开发、专业创作、企业商用等多元场景。 IT之家注意到,雷神近期发售了基于 "Strix Halo" 的 AI Master M7000 移动工作站。根据 此前发布会 ,该企业将推出升级至 "Gorgon Halo" 的 AI Master M 移动工作站、基于 "Strix Halo" 或 "Gorgon Halo" 的 AI Master D 系列 AI 迷你工作站。
我国将适度超前、系统推进新一代通信网建设,推进宽带网络向双万兆演进
IT之家 9 月 23 日消息,据央视新闻从今天(23 日)的中国国际信息通信展览会上了解到,“十五五”时期,我国将把握新一代通信网络建设的战略机遇, 适度超前、系统推进新一代通信网建设 。 不久前,《信息通信行业发展“十五五”规划》发布,提出到 2030 年,全面建成覆盖完善、性能领先的新一代通信网, 5G 用户普及率达到 95%、千兆以上宽带用户数达到 3.2 亿户 、智能算力规模达到每秒 9800 百亿亿次浮点运算,为到 2035 年基本实现信息通信行业现代化奠定坚实基础。 IT之家从报道中获悉,工业和信息化部副部长余晓晖表示,要坚持应用牵引、适度超前、系统推进新一代通信网建设, 推进宽带网络向双万兆演进 ,推进低轨卫星互联网系统建设,统筹优化国际海陆网络布局,推动算力设施扩容提质,强化算网协同和算力互联,更好支撑一体化算力网建设。 相关负责人表示,以人工智能为代表的数智技术加速突破,为信息通信发展带来重大机遇。数据显示,...
AMD 展示新型“四面体笼”光线追踪技术,BVH 显存占用从 80GB 降至 1.7 GB
IT之家 9 月 23 日消息,AMD 发布了一篇 GPUOpen 博客,展示了一项名为“四面体笼”(Tetrahedral Cages)的光线追踪技术。 该方案可将大规模动态场景下的 BVH 显存占用从 80GB 骤降至仅 1.7GB,相当于原来的 47 分之一,并将 BVH 更新速度提升约 90 倍。 IT之家注:BVH(层次包围盒)是光线追踪中用于加速射线与几何体求交的数据结构。 在博客中,AMD 使用了一个包含约 2.5 万株独立动画植物的大型场景进行演示。在基于 Radeon RX 9070 XT 的测试平台上,该场景以 1080p 分辨率、60 FPS 以上运行,并使用主射线和阴影射线进行光线追踪。 该场景在最高 LOD 下约有 28 亿个三角形;经过 LOD 选择后,每帧约 5 亿个动画植物三角形被光线追踪。 传统方法下,同样场景需要最高 80GB 显存,BVH 每帧更新耗时超过 300 毫秒。改用四面体笼后,BV...
行业动态
Gemini 3.8 text-to-speech says hello
Gemini 3.8 text-to-speech says hello 这条动态来自 Google DeepMind,可重点关注其对 AI 应用和产业节奏的影响。
OpenAI extends cyber access to Ukraine for civilian defense
这条英文动态讨论了 AI 领域的新进展。原文要点:OpenAI is extending access to its Daybreak program to the Government of Ukraine to support the cyber defense of civilian infrastructure.
Better prompt caching for GPT-6
这条英文动态讨论了 AI 领域的新进展。原文要点:Learn how GPT-6 improves prompt caching with higher cache hit rates, new diagnostics, explicit breakpoints, and controls that reduce latency and costs.
Harvey turns legal context into stronger drafts with GPT-6 Astra
这条英文动态讨论了 AI 领域的新进展。原文要点:GPT-6 Astra produces more structured, context-aware legal documents, freeing lawyers to focus on strategy.
ChatGPT Ads expands to Southeast Asia and Taiwan
这条英文动态讨论了 AI 领域的新进展。原文要点:ChatGPT Ads is expanding to Southeast Asia and Taiwan, giving eligible businesses new ways to reach people across more than 60 countries.
它石智航顶尖团队引领中国具身智能率先迈入规模化落地阶段
它石智航将继续扩大研发团队,加快布局生产基地,全面提升机器人交付能力 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
论文研究
Arena 上线 GPT-6 Sol 与 GPT-6 Luna 测试,评分即将公布Scores for GPT-6 Sol and GPT-6 Luna by @OpenAI are comi...
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:Arena 上线 GPT-6 Sol 与 GPT-6 Luna 测试,评分即将公布Scores for GPT-6 Sol and GPT-6 Luna by @OpenAI are comi... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:Arena 上线 GP。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。
Artificial Analysis 评测 GPT-6 Sol 与 Luna:成本减半,智能指数持平GPT-6 Sol and Luna push the cost efficiency f...
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Artificial Analysis 评测 GPT-6 Sol 与 Luna:成本减半,智能指数持平GPT-6 Sol and Luna push the cost efficiency f... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。
OpenTelemetry in the GitHub Copilot app
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:OpenTelemetry in the GitHub Copilot app 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:OpenTelemetry in the GitHub Copilot app 事实摘要:这条英文动态主要涉及智能体工作流。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GPT-5.6 促销价低 50%GPT-6 Sol and Luna are great models but...
事实摘要:OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GPT-5.6 促销价低 50%GPT-6 Sol and Luna are great models but... 事实摘要:OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格比 GPT-5.6 促销价低 50%GPT-6 Sol and Luna。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%Please welcome GPT-6 Sol and GPT-6 Luna...
事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 促销价低 50%Please welcome GPT-6 Sol and GPT-6 Luna... 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:OpenAI 发布 GPT-6 Sol 和 GPT。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。
技巧与观点
SF October 14th: A Birds of a Feather Session on Agentic Engineering
这条英文动态主要涉及智能体工作流。原文要点:SF October 14th: A Birds of a Feather Session on Agentic Engineering I'm hosting an evening event with Jesse Vincent in San Francisco on Wednesday 14th October for people who are building weird and interesting things with and on top of coding agents. Think of it as an agentic show-and-tell: Compare notes with other builders and experimenters on things you’re trying, what you're learning, and what you haven’t figured...
美国纳斯达克综合指数周二盘中再创历史新高:科技股回暖 / 油价回落等因素驱动
IT之家 9 月 23 日消息, 美国纳斯达克综合指数(Nasdaq Composite)于美国当地时间周二(9 月 22 日)盘中再度刷新历史高位 ,其中科技股强势反弹叠加油价回落提振市场风险偏好,成为推动指数突破的关键力量。 IT之家发稿前,美国当地时间 9 月 22 日纳斯达克综合指数盘中最高触及 27,272.72 点 ,超越此前于 6 月 1 日创下的盘中纪录 27,190.21 点 。 伴随着纳斯达克综合指数上涨,道琼斯工业平均指数与标普 500 指数亦同步走高,分别上涨 0.30% 与 0.19% 。 华尔街日报认为,带动纳斯达克综合指数上涨的主要驱动因素,是科技股领涨,尤其是人工智能(AI)相关权重股及半导体板块表现强劲;此外叠加原油价格跌至 11 日低位,缓解通胀担忧并提升风险资产吸引力。 investopedia 分析师认为若科技股盈利预期持续改善、通胀数据保持温和,纳指有望在短期内巩固新高并挑战更高目标。然...
教育科技
马斯克惊叹中国 AI 大模型“单位算力产出性能几乎是全球顶尖水平”,预计两到三年内就能靠光刻技术与芯片制造补齐算力缺口
IT之家 9 月 23 日消息,特斯拉 CEO 埃隆 · 马斯克今日接受了央视财经专访。 当谈及 AI,他表示中国的 AI 大模型整体而言非常出色,单位算力产出的性能几乎全球顶尖。 他认为,中国解决算力问题的速度会比大多数人预想更快。粗略估计,大概两到三年内,中国就能依靠光刻技术与芯片制造补齐算力缺口。 图源:Pexels 谈及 AI 时代教育,马斯克建议广泛学习,兼顾人文艺术、科学与工程,夯实通识基础。 他表示,想要向机器人下达指令,就要学会组织问题;知识面越广,越擅长提问,这正是给 AI 写提示词。 马斯克此前曾表示,预计到 2027 年底,人工智能将独立完成所有数字领域工作,彻底替代人工直接操作的各类数字化岗位。 在短期技术突破上,他预判未来 12 至 18 个月内,AI 将在工程及各类数字领域实现能力跨越式提升。 其中,AI 编程能力最快明年达到“Stockfish 级”水准(IT之家注:Stockfish 是一款开源国...
文化创意
llm 0.36
这条英文动态主要涉及模型能力与工程、文化创意。原文要点:Release: llm 0.36 New OpenAI models: gpt-6-sol for GPT-6 Sol and gpt-6-luna for GPT-6 Luna . #1702 Model plugins can now declare supports_conversation = False for models that only accept single-turn prompts. LLM raises llm.ConversationNotSupported when these models receive assistant or tool history, and llm chat rejects them before starting a session. See Models that do not support conversations . The first plugin to...
Grab and OpenAI bring practical AI skills to Southeast Asia
这条英文动态主要涉及文化创意、产品发布。原文要点:OpenAI and Grab launch GO Forward with AI, a regional programme helping 30,000 partners build practical AI skills across Southeast Asia.
How to Guide Your Language Flow
事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:How to Guide Your Language Flow 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:How to Guide Your Language Flow 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显。影响判断:它可能改变模型能力与工程、评测与基准、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准、文化创意方向的选题、竞品观察和落地方案筛选。
蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,UI 设计专项评测位列开源第一
IT之家 9 月 23 日消息,今日,蚂蚁百灵大模型正式开源 Ming-Image-0.1-Design 系列,包含两个参数量均为 6B 的模型:Ming-Image-0.1-Design,从文字需求生成 UI、信息图、海报和完整视觉设计;Ming-Image-0.1-Design-Layer,将创意图或者设计图拆成可独立编辑的透明图层。 IT之家注意到,蚂蚁百灵同时开源了 Design Skill 和 PPT Skill,将模型能力继续连接到前端页面与可编辑演示文稿。 据官方介绍,Ming-Image-0.1-Design 重点增强了四项能力: 支持 8K 长结构化提示词增强,将自然语言需求组织为文案、模块、布局和视觉风格; 优化标题、按钮、卡片和多区域信息的文字渲染与版式稳定性; 通过端到端生成一次性完成整体设计,统一配色、构图和素材风格; 创建原生 RGBA VAE,直接生成人物、商品、图标和装饰等透明背景素材。 相比通过...
谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制
IT之家 9 月 23 日消息,谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成 从静态预设转变为动态创意工作室 ,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook 和 Google Vids 等产品改进用户体验。 两款新模型分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS ,定位各有不同: Gemini 3.8 Flash TTS :面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,在游戏、沉浸式有声读物、播客和互动媒体中赋予角色生命力,还可对表演提示、节奏、方言转换等进行精细控制。 Gemini 3.8 Flash-Lite TTS :面向大容量、高性价比规模场景,针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,可对音调、节奏和表现力细微差别进行精细控制。 据IT之家了...
Anthropic 发布 Claude Opus 5.5 模型:性能媲美 Fable 5.1,运行成本比 Opus 5 低 40%
IT之家 9 月 23 日消息,Anthropic 今日正式发布了 Claude Opus 5.5 模型,这是其全新 Claude 5.5 家族的首个模型, 宣称在大多数工作上表现可媲美 Claude Fable 5.1,运行成本比 Opus 5 低 40% 。 IT之家从 Anthropic 公告获悉,具体来看,Claude Opus 5.5 模型有以下提升: 性能方面,Opus 5.5 比 Opus 5 有了很大提升,官方宣传早期测试者在最复杂的工作中看到性能大幅提升。一名测试人员在不到一天内完成了 68 万行代码迁移 —— 这一任务本应耗时数周。 Opus 5.5 擅长发现并修复软件中的低效程序 —— 当官方要求它将网页应用的每个页面缩短加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次,而 Opus 5 仅仅做了一些小改进,也改变了应用的行为。另一位测试者让多个 Claude 模型根据单一提示构建游戏,Op...
开源项目
The AI Hype Index: AI loves cheating
这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:Brace yourself: It turns out AI is being optimized for cheating. OpenAI’s agents hacked into Hugging Face to get the answers to a cybersecurity test. Next, they solved a prestigious math problem (or just stole from two top mathematicians’ answer sheets). Anthropic’s models have also hacked into other companies’ systems four times already. And that’s…
Claude Code Releases v2.1.280:Added Claude Opus 5.5 ( claude-opus-5-5 ), now the default...
这条英文动态主要涉及模型能力与工程。原文要点:What's changed Added Claude Opus 5.5 ( claude-opus-5-5 ), now the default Opus model — 1M context, $4/$20 per Mtok with $0.20/Mtok cache reads Added mouse support to more lists in fullscreen mode: the wheel scrolls the /skills list, and a skill's state options in /plugin can be clicked Added CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH to change the 2,048-character cap on MCP tool descriptions and server instructions for e...