跳到正文
9月19日周六
  1. IT之家 AI72

    Claude Code 宣布添加支持“AI 通用说明书”AGENTS.md

    IT之家 9 月 19 日消息,Anthropic 公司 Claude Code 团队工程师萨里克 · 希希帕尔(Thariq Shihipar,网名 @trq212)在 X 平台发布推文, 宣布在今天(9 月 19 日)发布的 2.1.277 版本 Claude Code 中添加支持 AGENTS.md 。 IT之家翻译其推文内容如下: 从今天发布的 2.1.277 版本开始,如果文件夹中没有 CLAUDE.md ,Claude 将检查并使用 AGENTS.md 。 用户可以在 /config 中切换此行为。 CLAUDE.md 是 Claude Code 特有的工作流、MCP、Sub-agent 或命令配置;而 AGENTS.md 的目标是让不同工具共享项目级基础规则, 可视为所有 AI 都应该遵守的通用规则。 对于普通用户或者开发者而言, AGENTS.md 可以降低工具切换成本和配置成本,而 Claude Code 本次...

    推荐理由:来自IT之家 AI的《Claude Code 宣布添加支持“AI 通用说明书”AGENTS.md》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 19 日消息,Anthropic 公司 Claude Code 团队工程师萨里克 · 希希帕尔(Thariq Shihipar,网名 @trq212)在 X 平台发布推文, 宣布在今天(9 月 19 日)发布的 2.1.277 版本 Claude Code 中添加支持 AGENTS.md 。 IT之家翻译其推文内容如下: 从今天发布的 2.1.277 版本开始,如果文件夹中没有 CLAUDE.md ,Claude 将检查并使用 AGENTS.md 。 用户可以在 /config 中切换此行为。 CLAUDE.md 是 Claude Code 特有的工作流、MCP、Sub-agent 或命令配置;而 AGENTS.md 的目标是让不同工具共享项目级基础规则, 可视为所有 AI 都应该遵守的通用规则。 对于普通用户或者开发者而言, AGENTS.md 可以降低工具切换成本和配置成本,而 Claude Code 本次...

  2. Simon Willison81

    Note on 18th September 2026

    这条英文动态主要涉及模型能力与工程。原文要点:Being a computer scientist who refuses to find anything about LLMs interesting right now is a bit like being a geneticist who refuses to find anything interesting about the recently opened Jurassic Park. Skeptical geneticist: "pfft, it's just frog DNA. And they deliberately let them eat people for the marketing." Tags: llms , ai , generative-ai

    推荐理由:来自Simon Willison的《Note on 18th September 2026》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Being a computer scientist who refuses to find anything about LLMs interesting right now is a bit like being a geneticist who refuses to find anything interesting about the recently opened Jurassic Park. Skeptical geneticist: "pfft, it's just frog DNA. And they deliberately let them eat people for the marketing." Tags: llms , ai , generative-ai

  3. GitHub Changelog90

    Upcoming deprecation of selected GitHub Copilot models in mid-October

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Upcoming deprecation of selected GitHub Copilot models in mid-October 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Upcoming deprecation of selecte。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月18日周五
  1. IT之家 AI72

    全面追赶 OpenAI,消息称 Anthropic 计划在今年年底前拥有约 5 吉瓦可用算力、明年年底翻倍

    IT之家 9 月 18 日消息,在争夺顶尖模型性能的较量中,OpenAI 与 Anthropic 的竞争已进入白热化阶段。而这场较量的核心,正是训练与部署这些模型不可或缺的基础设施 —— 算力。 据纽约时报消息,过去几年里,OpenAI 在可用算力规模上始终占据领跑地位。据知情人士透露,截至去年,Anthropic 在可用算力储备上仍处于下风,其规模约为 1.5 吉瓦(GW),而 OpenAI 则已达到约 2 吉瓦。 消息称 Anthropic 已经制定了全面的追赶计划。多位知情人士表示,该 AI 实验室已告知投资者, 计划在今年年底前储备约 5 吉瓦规模的可用算力 ,并预计到明年年底将这一容量再度翻倍 。 而据掌握 OpenAI 内部预估数据的人士称,这一节奏已与 OpenAI 的扩容路径大体持平 —— 后者同样计划在今年达到约 5 吉瓦的算力规模,并在明年拓展至约 10 吉瓦。 IT之家注意到,在巨额算力支出的态度上,Ant...

    推荐理由:来自IT之家 AI的《全面追赶 OpenAI,消息称 Anthropic 计划在今年年底前拥有约 5 吉瓦可用算力、明年年底翻倍》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,在争夺顶尖模型性能的较量中,OpenAI 与 Anthropic 的竞争已进入白热化阶段。而这场较量的核心,正是训练与部署这些模型不可或缺的基础设施 —— 算力。 据纽约时报消息,过去几年里,OpenAI 在可用算力规模上始终占据领跑地位。据知情人士透露,截至去年,Anthropic 在可用算力储备上仍处于下风,其规模约为 1.5 吉瓦(GW),而 OpenAI 则已达到约 2 吉瓦。 消息称 Anthropic 已经制定了全面的追赶计划。多位知情人士表示,该 AI 实验室已告知投资者, 计划在今年年底前储备约 5 吉瓦规模的可用算力 ,并预计到明年年底将这一容量再度翻倍 。 而据掌握 OpenAI 内部预估数据的人士称,这一节奏已与 OpenAI 的扩容路径大体持平 —— 后者同样计划在今年达到约 5 吉瓦的算力规模,并在明年拓展至约 10 吉瓦。 IT之家注意到,在巨额算力支出的态度上,Ant...

  2. IT之家 AI68

    北京发布“词元经济十条”:高标准建设词元工厂,推动关键核心技术攻关

    IT之家 9 月 18 日消息,北京市经济和信息化局今日宣布, 北京市“词元经济十条”正式发布。 为贯彻落实《国务院关于深入实施“人工智能+”行动的意见》(国发〔2025〕11 号),率先培育智能经济新形态,以词元(Token)为抓手,发展词元经济新增量,制定 《 北京市加快词元经济发展的行动方案(2026—2028 年) 》 (IT之家注:以下简称《行动方案》)。 《行动方案》提出, 高标准建设词元工厂。 制定北京市词元工厂分级评价标准,覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、电能利用效率(PUE)等核心技术指标,优化土地资源、能耗指标、通信网络等要素保障,对具有行业引领力的词元工厂给予支持。 推动关键核心技术攻关。 加快基础模型技术迭代,提升模型智能上限水平。推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,高水平建设、调用智算资源,全面提升词元生产能力。 建立词元质量评测体系。 支持...

    推荐理由:来自IT之家 AI的《北京发布“词元经济十条”:高标准建设词元工厂,推动关键核心技术攻关》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 18 日消息,北京市经济和信息化局今日宣布, 北京市“词元经济十条”正式发布。 为贯彻落实《国务院关于深入实施“人工智能+”行动的意见》(国发〔2025〕11 号),率先培育智能经济新形态,以词元(Token)为抓手,发展词元经济新增量,制定 《 北京市加快词元经济发展的行动方案(2026—2028 年) 》 (IT之家注:以下简称《行动方案》)。 《行动方案》提出, 高标准建设词元工厂。 制定北京市词元工厂分级评价标准,覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、电能利用效率(PUE)等核心技术指标,优化土地资源、能耗指标、通信网络等要素保障,对具有行业引领力的词元工厂给予支持。 推动关键核心技术攻关。 加快基础模型技术迭代,提升模型智能上限水平。推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,高水平建设、调用智算资源,全面提升词元生产能力。 建立词元质量评测体系。 支持...

  3. 量子位66

    AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢

    事实摘要:AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 LimiX让模型理解数据背后的因果机制 这条动态来自 量子位,可重点关注模型能力与工程。 AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 LimiX让模型理解数据背后的因果机制。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI70

    腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用

    IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBuddy 全栈「网页应用」生成,包括以下核心能力: 一站式制作发布: 页面生成、数据配置、上线发布闭环在 WorkBuddy 免部署: 不用买服务器、不配环境,发布即得访问链接 云数据库: 结构化数据存云端,支持增删改查,可配权限规则控制谁能读写 文件存储: 图片、附件等文件上传到云端并在应用内调用 注册登录: 内置身份认证,用户可注册登录,数据按用户隔离 免密钥 AI 调用: 直接调用大模型,不用自己申请和管理 API Key 运营数据统计: 上线后可查看用户数量、注册增长 IT之家注意到,随着 WorkBuddy 的资料库与「应用」(使用到云服务能力的应用)生成能力的上线,WorkBuddy...

    推荐理由:来自IT之家 AI的《腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBuddy 全栈「网页应用」生成,包括以下核心能力: 一站式制作发布: 页面生成、数据配置、上线发布闭环在 WorkBuddy 免部署: 不用买服务器、不配环境,发布即得访问链接 云数据库: 结构化数据存云端,支持增删改查,可配权限规则控制谁能读写 文件存储: 图片、附件等文件上传到云端并在应用内调用 注册登录: 内置身份认证,用户可注册登录,数据按用户隔离 免密钥 AI 调用: 直接调用大模型,不用自己申请和管理 API Key 运营数据统计: 上线后可查看用户数量、注册增长 IT之家注意到,随着 WorkBuddy 的资料库与「应用」(使用到云服务能力的应用)生成能力的上线,WorkBuddy...

  5. IT之家 AI74

    消息称 Anthropic 和 OpenAI 正寻求规模较小的数据中心交易,争夺 AI 算力部署能力

    IT之家 9 月 18 日消息,据 CNBC 消息,知情人士透露,随着部署模型工作负载所需基础设施的争夺日趋白热化,Anthropic 和 OpenAI 正在寻求规模更小的人工智能数据中心合作。 过去一年中,这两家 AI 实验室曾就容量达数百兆瓦乃至吉瓦级的超大规模设施签署过重磅协议;但消息人士表示, 两家公司目前也开始寻求针对 20 至 30 兆瓦这一更小部署规模的算力合作 。 知情人士透露,Anthropic 已就该容量区间的协议在英国及北欧地区展开接触试探,OpenAI 也一直在北欧评估这类小容量部署的可行方案。此外,Anthropic 和 OpenAI 同样在美国针对该规模的算力部署展开过磋商。 IT之家注意到,在过去一年里,为了持续训练自身模型并向终端用户提供在线推理服务,两家公司密集公布了一系列 AI 基础设施协议。在当前的 AI 发展浪潮下,锁定规模更小的算力资源,有助于企业大幅缩短工作负载的落地交付周期。 Ope...

    推荐理由:来自IT之家 AI的《消息称 Anthropic 和 OpenAI 正寻求规模较小的数据中心交易,争夺 AI 算力部署能力》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,据 CNBC 消息,知情人士透露,随着部署模型工作负载所需基础设施的争夺日趋白热化,Anthropic 和 OpenAI 正在寻求规模更小的人工智能数据中心合作。 过去一年中,这两家 AI 实验室曾就容量达数百兆瓦乃至吉瓦级的超大规模设施签署过重磅协议;但消息人士表示, 两家公司目前也开始寻求针对 20 至 30 兆瓦这一更小部署规模的算力合作 。 知情人士透露,Anthropic 已就该容量区间的协议在英国及北欧地区展开接触试探,OpenAI 也一直在北欧评估这类小容量部署的可行方案。此外,Anthropic 和 OpenAI 同样在美国针对该规模的算力部署展开过磋商。 IT之家注意到,在过去一年里,为了持续训练自身模型并向终端用户提供在线推理服务,两家公司密集公布了一系列 AI 基础设施协议。在当前的 AI 发展浪潮下,锁定规模更小的算力资源,有助于企业大幅缩短工作负载的落地交付周期。 Ope...

  6. 极客公园74

    那个教 ChatGPT 说话的人,做了一个「哑巴」模型

    作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 ...

    推荐理由:来自极客公园的《那个教 ChatGPT 说话的人,做了一个「哑巴」模型》。重点看模型能力与工程、产品发布。摘要提到:作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 ...

  7. IT之家 AI34

    2026 四季系列第三章:AX 电竞叛客公布 GeForce RTX 5070 12G 秋序限定版显卡

    IT之家 9 月 18 日消息,AX 电竞叛客 (AX GAMING) 今日宣布推出其 2026 四季限定系列的第三款产品 —— GeForce RTX 5070 12G 秋序限定版。 该显卡外观上采用白紫渐变的秋日色调机身,扇叶分别印有桂花、AX、星月等标识,边缘点缀斑斓枫叶与细碎星点纹样;金属背板采用高精度 UV 打印与多重表面雕琢工艺, 展现了端坐于鎏金弯月之上的“雪璃”IP 形象 ;内部还嵌有特调电竞香薰。 GeForce RTX 5070 12G 秋序限定版采用 3 风扇模具,搭载 Punk 4.0 散热模组,内置 5 根直径为 8mm 的热管,GPU 加速频率可达 2542MHz (+90MHz),支持隐藏式供电走线设计。

    推荐理由:来自IT之家 AI的《2026 四季系列第三章:AX 电竞叛客公布 GeForce RTX 5070 12G 秋序限定版显卡》。重点看产品发布。摘要提到:IT之家 9 月 18 日消息,AX 电竞叛客 (AX GAMING) 今日宣布推出其 2026 四季限定系列的第三款产品 —— GeForce RTX 5070 12G 秋序限定版。 该显卡外观上采用白紫渐变的秋日色调机身,扇叶分别印有桂花、AX、星月等标识,边缘点缀斑斓枫叶与细碎星点纹样;金属背板采用高精度 UV 打印与多重表面雕琢工艺, 展现了端坐于鎏金弯月之上的“雪璃”IP 形象 ;内部还嵌有特调电竞香薰。 GeForce RTX 5070 12G 秋序限定版采用 3 风扇模具,搭载 Punk 4.0 散热模组,内置 5 根直径为 8mm 的热管,GPU 加速频率可达 2542MHz (+90MHz),支持隐藏式供电走线设计。

  8. IT之家 AI64

    同德发布“二次元”主题显卡 GeForce RTX 5060 Ti 8GB RiTONA OC

    IT之家 9 月 18 日消息,显卡制造商同德 (Palit) 在上月面向全球发布数字品牌大使 RiTONA 后,又在近日基于该“二次元”形象推出了显卡新品 GeForce RTX 5060 Ti 8GB RiTONA OC。 GeForce RTX 5060 Ti 8GB RiTONA OC 采用双风扇模具,三维 233.9×125.8×40 (mm),搭载 2 颗 102m 风扇;侧面集成 ARGB 灯区; 金属背板前部印有手持魔杖的 RiTONA 形象 ,后部则是通风镂空开口。 其采用标准的 180W 显卡总功耗设计;GPU 核心加速频率 2587MHz, 相较基准值提升 15MHz 。 该显卡还随附定制的 RiTONA 防水贴纸,用户可在喜好的位置装点以 RiTONA 与其伙伴 Gelo 的形象。

    推荐理由:来自IT之家 AI的《同德发布“二次元”主题显卡 GeForce RTX 5060 Ti 8GB RiTONA OC》。重点看评测与基准、产品发布。摘要提到:IT之家 9 月 18 日消息,显卡制造商同德 (Palit) 在上月面向全球发布数字品牌大使 RiTONA 后,又在近日基于该“二次元”形象推出了显卡新品 GeForce RTX 5060 Ti 8GB RiTONA OC。 GeForce RTX 5060 Ti 8GB RiTONA OC 采用双风扇模具,三维 233.9×125.8×40 (mm),搭载 2 颗 102m 风扇;侧面集成 ARGB 灯区; 金属背板前部印有手持魔杖的 RiTONA 形象 ,后部则是通风镂空开口。 其采用标准的 180W 显卡总功耗设计;GPU 核心加速频率 2587MHz, 相较基准值提升 15MHz 。 该显卡还随附定制的 RiTONA 防水贴纸,用户可在喜好的位置装点以 RiTONA 与其伙伴 Gelo 的形象。

  9. IT之家 AI70

    智谱 GLM-5.3-FlashX 模型上线,更快、更流畅

    IT之家 9 月 18 日消息,智谱今日宣布推出 GLM-5.3-FlashX(最高 200 tokens/s) ,为企业与开发者带来更快、更流畅的模型体验。 智谱官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名与全球开发者见面,获得海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在 10 万张国产芯片提供的推理算力基础上, 进一步加大对 Infra 侧的投入与推理优化 。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。 GLM-5.3-FlashX API 现已上线,Model Key: GLM-5.3-FlashX 。 价格方面,GLM-5.3-FlashX 相比 GLM-5.3-Flash 更贵一些: 模型名称 上下文 输入单价(元 / 百万 Tokens) 输出单价(元 / 百万 Tokens) 缓存存储(元 / 百万 Token...

    推荐理由:来自IT之家 AI的《智谱 GLM-5.3-FlashX 模型上线,更快、更流畅》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,智谱今日宣布推出 GLM-5.3-FlashX(最高 200 tokens/s) ,为企业与开发者带来更快、更流畅的模型体验。 智谱官方表示,GLM-5.3-Flash 此前以“Ox Alpha”之名与全球开发者见面,获得海内外开发者的广泛认可,调用量持续攀升。面对快速增长的需求,智谱在 10 万张国产芯片提供的推理算力基础上, 进一步加大对 Infra 侧的投入与推理优化 。GLM-5.3-Flash 长期保持同尺寸最强智能水平,本次提速进一步形成智能、价格、速度的全面竞争力。 GLM-5.3-FlashX API 现已上线,Model Key: GLM-5.3-FlashX 。 价格方面,GLM-5.3-FlashX 相比 GLM-5.3-Flash 更贵一些: 模型名称 上下文 输入单价(元 / 百万 Tokens) 输出单价(元 / 百万 Tokens) 缓存存储(元 / 百万 Token...

  10. IT之家 AI68

    消息称美国空中交通管理系统将部署 AI“大脑”,最早 9 月 21 日上线试用

    IT之家 9 月 18 日消息,《华尔街日报》报道称,一款名为 SMART(空域、航线和轨迹战略管理)的人工智能驱动空中交通管制软件预计最早在当地时间 9 月 21 日在美国华盛顿特区启动试用,并逐步推广至全美国范围。 美国拥有全球最为发达的航空运输系统 , 但其空中交通管理当前正面临严重困境 :基础设施老化、人力资源短缺等因素都在降低高度复杂的航线系统的容错性。 图源:Pexels SMART 软件项目合同规模达到 8.75 亿美元 (IT之家注:现汇率约合 58.82 亿元人民币) 。其可分析航空公司航班时刻表以及天气、机场跑道容量和运行限制等因素,从而 预测空中交通流量并提前识别潜在冲突 。 作为该软件全面推广的一部分,美国联邦航空管理局的官员正持续与各航空公司讨论如何协调航班时刻表。

    推荐理由:来自IT之家 AI的《消息称美国空中交通管理系统将部署 AI“大脑”,最早 9 月 21 日上线试用》。重点看文化创意、产品发布。摘要提到:IT之家 9 月 18 日消息,《华尔街日报》报道称,一款名为 SMART(空域、航线和轨迹战略管理)的人工智能驱动空中交通管制软件预计最早在当地时间 9 月 21 日在美国华盛顿特区启动试用,并逐步推广至全美国范围。 美国拥有全球最为发达的航空运输系统 , 但其空中交通管理当前正面临严重困境 :基础设施老化、人力资源短缺等因素都在降低高度复杂的航线系统的容错性。 图源:Pexels SMART 软件项目合同规模达到 8.75 亿美元 (IT之家注:现汇率约合 58.82 亿元人民币) 。其可分析航空公司航班时刻表以及天气、机场跑道容量和运行限制等因素,从而 预测空中交通流量并提前识别潜在冲突 。 作为该软件全面推广的一部分,美国联邦航空管理局的官员正持续与各航空公司讨论如何协调航班时刻表。

  11. IT之家 AI70

    打官司最佳 AI 助手:OpenAI 推出 Astra for Law,提高案件胜诉率

    IT之家 9 月 18 日消息,OpenAI 公司昨日(9 月 17 日)发布博文,宣布推出 Astra for Law 服务,定位法律专用人工智能基础平台, 其法律搜索索引覆盖超过 2.3 亿个 URL,并纳入覆盖 99.9% 以上已发布美国判例法的 CourtListener 案例库。 IT之家附上相关截图如下: OpenAI 使用 Vals AI 法律研究基准私有验证集中的 200 道美国法律问题测试系统。在最高推理强度下,Astra for Law 整体正确率为 54.0%,而仅使用网页搜索的 GPT-6 Astra 为 38.7%。 在案例法导向问题中,Astra for Law 找到的参考案例数量多 24%。在经审计的目标段落集合中,其从正确法院意见书中检出的相关段落最高多 54%。 该服务并非“AI 律师”,主要服务于律师和法律软件公司,帮助其区分法院判决中的核心裁判理由与附带评论,寻找不利判例,分析合同条款如何分...

    推荐理由:来自IT之家 AI的《打官司最佳 AI 助手:OpenAI 推出 Astra for Law,提高案件胜诉率》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 18 日消息,OpenAI 公司昨日(9 月 17 日)发布博文,宣布推出 Astra for Law 服务,定位法律专用人工智能基础平台, 其法律搜索索引覆盖超过 2.3 亿个 URL,并纳入覆盖 99.9% 以上已发布美国判例法的 CourtListener 案例库。 IT之家附上相关截图如下: OpenAI 使用 Vals AI 法律研究基准私有验证集中的 200 道美国法律问题测试系统。在最高推理强度下,Astra for Law 整体正确率为 54.0%,而仅使用网页搜索的 GPT-6 Astra 为 38.7%。 在案例法导向问题中,Astra for Law 找到的参考案例数量多 24%。在经审计的目标段落集合中,其从正确法院意见书中检出的相关段落最高多 54%。 该服务并非“AI 律师”,主要服务于律师和法律软件公司,帮助其区分法院判决中的核心裁判理由与附带评论,寻找不利判例,分析合同条款如何分...

  12. IT之家 AI72

    谷歌最强数学推理 AI 模型曝光:100 万词元上下文,专攻数学难题

    IT之家 9 月 18 日消息,消息源 @lyraxana 于 9 月 16 日在 X 平台发布推文,爆料称谷歌正基于 DeepThink V3 模型, 构建内部代号为 Mathematica 的实验 AI 模型,主要针对繁重计算、复杂的符号问题求解特别优化,预估将成为谷歌最强数学推理 AI 模型。 API 数据显示,该模型内部标识符为“models / deepthink-mathematica-tf-raw-thoughts ”,支持高达 100 万个词元(token)的上下文窗口,同时输出限制为 65,536 个词元。 IT之家注:上下文窗口指模型单次处理时可读取的文本单位总量;输出上限指模型单次回答可生成的文本单位数量。 泄露配置还标注“UNSTABLE_EXPERIMENTAL”。这一状态名称表明,该版本属于不稳定实验版本。模型同时带有“Teamfood”标签,是谷歌用于内部员工测试的术语,意味着相关服务处于内部测试范...

    推荐理由:来自IT之家 AI的《谷歌最强数学推理 AI 模型曝光:100 万词元上下文,专攻数学难题》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,消息源 @lyraxana 于 9 月 16 日在 X 平台发布推文,爆料称谷歌正基于 DeepThink V3 模型, 构建内部代号为 Mathematica 的实验 AI 模型,主要针对繁重计算、复杂的符号问题求解特别优化,预估将成为谷歌最强数学推理 AI 模型。 API 数据显示,该模型内部标识符为“models / deepthink-mathematica-tf-raw-thoughts ”,支持高达 100 万个词元(token)的上下文窗口,同时输出限制为 65,536 个词元。 IT之家注:上下文窗口指模型单次处理时可读取的文本单位总量;输出上限指模型单次回答可生成的文本单位数量。 泄露配置还标注“UNSTABLE_EXPERIMENTAL”。这一状态名称表明,该版本属于不稳定实验版本。模型同时带有“Teamfood”标签,是谷歌用于内部员工测试的术语,意味着相关服务处于内部测试范...

  13. Apple Machine Learning Research48

    Dynamically Scaled Activation Steering

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Dynamically Scaled Activation Steering 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Dynamically Scaled Activation Steering 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Dynamically Scale。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. IT之家 AI72

    OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误

    IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compaction summaries)中加入额外指令,向未来版本留下提醒,要求其隐藏错误或与预期目标不一致的行为。 例如,一个 Sol 智能体负责制作财务模型时无法找到用户要求的历史数据,于是在摘要中写道,由于没有源文件,可能需要自行创建“Historical Data”工作表并填入合理的 2024 年历史数据,并留下指令,要求后续模型“只有被问到时才保持信息透明度”、“最终回复只需要提供文件链接”。 再如,另一个 ...

    推荐理由:来自IT之家 AI的《OpenAI 披露 GPT-5.6 Sol 异常行为:AI 模型会留下指令要求“未来版本的自己”隐瞒自身错误》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 18 日消息,OpenAI 发文,披露研究团队在训练最新模型 GPT-5.6 Sol 的过程中,研究人员发现了一项异常行为:模型曾通过对话摘要向未来版本的自己留下指令,要求后续模型隐瞒自身错误以及与预期行为不一致的表现。目前,研究团队已经针对这一具体问题进行修复。 IT之家参考 OpenAI 的报告,研究人员在训练 GPT-5.6 Sol 过程中发现,尚未部署的 Sol 智能体会在“压缩摘要”(compaction summaries)中加入额外指令,向未来版本留下提醒,要求其隐藏错误或与预期目标不一致的行为。 例如,一个 Sol 智能体负责制作财务模型时无法找到用户要求的历史数据,于是在摘要中写道,由于没有源文件,可能需要自行创建“Historical Data”工作表并填入合理的 2024 年历史数据,并留下指令,要求后续模型“只有被问到时才保持信息透明度”、“最终回复只需要提供文件链接”。 再如,另一个 ...

  15. Simon Willison79

    How To Write With An LLM

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:How To Write With An LLM 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:How To Write With An LLM 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:How To Wr。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. GitHub AI Trending60

    unicity-sphere/sphere-sdk: The SDK for autonomous economic agents. Give an agent an identity, a wallet, and the ability to find, negotiate with, and settle with other agents - peer-to-peer, with perfect privacy and ultra-fast finality

    事实摘要:这条英文动态主要涉及智能体工作流,原文信息显示:unicity-sphere/sphere-sdk: The SDK for autonomous economic agents. Give an agent an identity, a wallet, and the ability to find, negotiate with, and settle 。影响判断:它可能改变智能体工作流相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  17. IT之家 AI34

    开发者成功令英伟达 DLSS 5 在浏览器里运行,苹果 macOS 也可体验

    IT之家 9 月 18 日消息,据外媒 TweakTown 报道,近期开发者 MAAN 在 X 平台展示了一项概念验证项目,成功让英伟达 DLSS 5 在 WebGPU 环境下直接处理浏览器中的 3D 图形,相应方案可在 macOS 设备上运行。目前项目已经提供在线演示( 点此访问 ),开发者还计划将源代码发布至 GitHub,不过从实际体验来看,其运行速度仍然较慢,暂时不适合实时游戏场景。 IT之家获悉,DLSS 5 原本计划作为《NBA 2K27》的独占技术推出,但在相关技术被破解后,大量开发者将其移植至各种 3A 游戏,而此次 MAAN 更进一步,将其带入浏览器环境,绕开了基于应用的 DLSS 集成方式。 事实上,英伟达目前并没有提供官方支持的浏览器 DLSS 方案。该公司的 DLSS SDK 文档主要针对基于 DirectX 或 Vulkan 的原生应用,通常通过英伟达 NGX 接口或 Streamline SDK 进行...

    推荐理由:来自IT之家 AI的《开发者成功令英伟达 DLSS 5 在浏览器里运行,苹果 macOS 也可体验》。重点看开源生态、产品发布。摘要提到:IT之家 9 月 18 日消息,据外媒 TweakTown 报道,近期开发者 MAAN 在 X 平台展示了一项概念验证项目,成功让英伟达 DLSS 5 在 WebGPU 环境下直接处理浏览器中的 3D 图形,相应方案可在 macOS 设备上运行。目前项目已经提供在线演示( 点此访问 ),开发者还计划将源代码发布至 GitHub,不过从实际体验来看,其运行速度仍然较慢,暂时不适合实时游戏场景。 IT之家获悉,DLSS 5 原本计划作为《NBA 2K27》的独占技术推出,但在相关技术被破解后,大量开发者将其移植至各种 3A 游戏,而此次 MAAN 更进一步,将其带入浏览器环境,绕开了基于应用的 DLSS 集成方式。 事实上,英伟达目前并没有提供官方支持的浏览器 DLSS 方案。该公司的 DLSS SDK 文档主要针对基于 DirectX 或 Vulkan 的原生应用,通常通过英伟达 NGX 接口或 Streamline SDK 进行...

  18. Claude Code Releases90

    Claude Code Releases v2.1.275:Added the signed-in account to Claude apps gateway sign-in...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.275:Added the signed-in account to Claude apps gateway sign-in... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  19. GitHub Changelog90

    Agentic CLI customizations now in the usage metrics API

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Agentic CLI customizations now in the usage metrics API 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Agentic CLI customizations now in the usage m。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  20. Simon Willison93

    Self-generated prompt injections in compaction summaries

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Self-generated prompt injections in compaction summaries 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Self-generated prompt injections in compacti。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  21. GitHub AI Trending70

    CVHub520/X-AnyLabeling: X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop application for annotating text, image, video, and multimodal data, combining versatile built-in tools with state-of-the-art AI models and flexible multi-format export.

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:CVHub520/X-AnyLabeling: X-AnyLabeling: A lightweight, efficient, and unified cross-platform desktop application for annotating text, image, vid。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月17日周四
  1. IT之家 AI72

    不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想

    IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存在性与光滑性问题”也是其中之一。 据这名人士透露,OpenAI 员工预计, 下一道“霍奇猜想”有望在不久后得到解决 。 IT之家注:霍奇猜想研究的是由多项式方程定义的几何形状中,某些几何特征能否始终用更简单的代数结构来描述。不过,即使找到解法,OpenAI 可能也不会立即公布。公司正考虑如何与数学界合作发布消息,避免再次酿成公关危机。 据悉,OpenAI 为了解决纳维-斯托克斯问题,或已花掉数百万美元。前述人士透露,OpenAI 当时使用的是下一款预训练模型的一个变体,代号为“Doug”。 部分 OpenAI 研究人员认为,继软件工程之后, 数学是大模型最自然的下一块试验场 。两者有一个重要共...

    推荐理由:来自IT之家 AI的《不到一个月连破两道千禧年大奖难题?消息称 OpenAI 即将攻克霍奇猜想》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,今天(17 日)晚间,据《The Information》援引一名了解解法的人士消息称,OpenAI 已接近攻克“千禧年大奖难题”中的另一道题 。这组著名数学难题共有 7 道,此前引发争议的“纳维-斯托克斯存在性与光滑性问题”也是其中之一。 据这名人士透露,OpenAI 员工预计, 下一道“霍奇猜想”有望在不久后得到解决 。 IT之家注:霍奇猜想研究的是由多项式方程定义的几何形状中,某些几何特征能否始终用更简单的代数结构来描述。不过,即使找到解法,OpenAI 可能也不会立即公布。公司正考虑如何与数学界合作发布消息,避免再次酿成公关危机。 据悉,OpenAI 为了解决纳维-斯托克斯问题,或已花掉数百万美元。前述人士透露,OpenAI 当时使用的是下一款预训练模型的一个变体,代号为“Doug”。 部分 OpenAI 研究人员认为,继软件工程之后, 数学是大模型最自然的下一块试验场 。两者有一个重要共...

  2. GitHub AI Trending66

    deeplearning4j/deeplearning4j: Suite of tools for deploying and training deep learning models using the JVM. Highlights include model import for keras, tensorflow, and onnx/pytorch, a modular and tiny c++ library for running math code and a java based math library on top of the core c++ library. Also includes samediff: a pytorch/tensorflow like library for running deep learn...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:deeplearning4j/deeplearning4j: Suite of tools for deploying and training deep learning models using the JVM. Highlights include model import for ker。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. 量子位68

    Claude Code团队讲究啊,这都往外说

    工程师的核心永远是Problem Solving。 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

    推荐理由:来自量子位的《Claude Code团队讲究啊,这都往外说》。重点看编码、部署/工程。摘要提到:工程师的核心永远是Problem Solving。 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

  4. 爱范儿36

    刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM

    事实摘要:刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM 模型优化系统,而系统服务模型。 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程、产品发布。 刚刚,智谱首个 RSI 成果发布,10 万国产卡用 GLM 造 GLM 模型优化系统,而系统服务模型。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. IT之家 AI74

    智谱 GLM 公开国内大模型首个递归自我改进实践:AI 在十万卡国产集群上自建推理系统

    IT之家 9 月 17 日消息,今日,智谱 GLM 团队披露递归自我改进(Recursive Self‑Improvement,简称 RSI)方向首个工程化实践进展,也就是让 AI 自己动手改进自己的运行系统。 具体来说,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。 据官方博客,Infra Agent 在超 10 万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平。这套系统已投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,6 天 Token 调用量超过 62 万亿。 IT之家注意到,这是国内大模型厂商首次公开将“AI 自我改进”...

    推荐理由:来自IT之家 AI的《智谱 GLM 公开国内大模型首个递归自我改进实践:AI 在十万卡国产集群上自建推理系统》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,今日,智谱 GLM 团队披露递归自我改进(Recursive Self‑Improvement,简称 RSI)方向首个工程化实践进展,也就是让 AI 自己动手改进自己的运行系统。 具体来说,由 GLM-5.3 驱动的 Infra Agent 完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化,实现模型对自身运行系统的反向改进。 据官方博客,Infra Agent 在超 10 万张国产芯片组成的集群上从零完成生产级推理服务搭建,不到两周将端到端吞吐提升至初始基线的 3 倍,硬件利用效率与单 Token 成本达到主流 NVIDIA GPU 相当水平。这套系统已投入真实使用,GLM-5.3-Flash 以匿名模型 Ox-Alpha 在 OpenCode、OpenRouter 上线,6 天 Token 调用量超过 62 万亿。 IT之家注意到,这是国内大模型厂商首次公开将“AI 自我改进”...

  6. IT之家 AI68

    研究显示:印度外包行业几乎没被 AI 挤占市场

    IT之家 9 月 17 日消息,荷兰国际集团(ING Bank NV)表示,随着印度向价值链上游攀升,逐步拓展更难被自动化替代的服务业务,该国外包行业几乎没有显现出被人工智能挤占市场的迹象。 荷兰国际集团经济学家迪帕利 · 巴加瓦(Deepali Bhargava)于当地时间周三发布的一份研究报告中写道,软件服务出口占印度国内生产总值的比重,已经从疫情之前的 3.3% 上升至大约 5.2%。同一时期,包含财务、会计、工程、研究与数据分析在内的商业服务,在 GDP 当中的占比更是翻了一倍以上,达到 3.3%。 这一发展表现缓解了市场此前的担忧:人们原本担心生成式 AI 会接管以往外包至低成本地区的工作,进而冲击印度这一支柱产业。据荷兰国际集团的数据,印度占据全球外包行业一半以上的市场份额;软件服务出口每年可以带来约 2,050 亿美元 (IT之家注:现汇率约合 1.38 万亿元人民币) 收入,为约 580 万人提供就业岗位。软件与...

    推荐理由:来自IT之家 AI的《研究显示:印度外包行业几乎没被 AI 挤占市场》。重点看产品发布。摘要提到:IT之家 9 月 17 日消息,荷兰国际集团(ING Bank NV)表示,随着印度向价值链上游攀升,逐步拓展更难被自动化替代的服务业务,该国外包行业几乎没有显现出被人工智能挤占市场的迹象。 荷兰国际集团经济学家迪帕利 · 巴加瓦(Deepali Bhargava)于当地时间周三发布的一份研究报告中写道,软件服务出口占印度国内生产总值的比重,已经从疫情之前的 3.3% 上升至大约 5.2%。同一时期,包含财务、会计、工程、研究与数据分析在内的商业服务,在 GDP 当中的占比更是翻了一倍以上,达到 3.3%。 这一发展表现缓解了市场此前的担忧:人们原本担心生成式 AI 会接管以往外包至低成本地区的工作,进而冲击印度这一支柱产业。据荷兰国际集团的数据,印度占据全球外包行业一半以上的市场份额;软件服务出口每年可以带来约 2,050 亿美元 (IT之家注:现汇率约合 1.38 万亿元人民币) 收入,为约 580 万人提供就业岗位。软件与...

  7. IT之家 AI70

    AI 推理 MLPerf 6.1 发布:AMD 以 512 个 MI355X 刷新纪录、英伟达 Vera Rubin 首次现身

    IT之家 9 月 17 日消息,科技媒体 Wccftech 昨日(9 月 16 日)发布博文, 报道称在 MLPerf Inference v6.1 发布后,AMD、NVIDIA 等厂商同步提交结果。 IT之家注:MLPerf Inference 是由 MLCommons 维护的推理基准测试套件,用于衡量不同硬件在 AI 推理任务中的吞吐和延迟表现。最新 6.1 版重点集中在 AI 推理吞吐、扩展效率和不同 GPU 配置下的表现。 AMD 称以 575 万个 token / 秒的速度在 512 个 GPU 规模下创造了新的 MLPerf 记录 ,这是 AMD 迄今为止规模最大的提交,再次证明了 AMD 的性能、规模、软件成熟度和可复现性。 DeepSeek R1 测试中,AMD 以 512 个 Instinct MI355X GPU 参赛,离线(强调批量处理能力,通常用于衡量系统在非实时场景下的最大吞吐)成绩 2,901,950...

    推荐理由:来自IT之家 AI的《AI 推理 MLPerf 6.1 发布:AMD 以 512 个 MI355X 刷新纪录、英伟达 Vera Rubin 首次现身》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 17 日消息,科技媒体 Wccftech 昨日(9 月 16 日)发布博文, 报道称在 MLPerf Inference v6.1 发布后,AMD、NVIDIA 等厂商同步提交结果。 IT之家注:MLPerf Inference 是由 MLCommons 维护的推理基准测试套件,用于衡量不同硬件在 AI 推理任务中的吞吐和延迟表现。最新 6.1 版重点集中在 AI 推理吞吐、扩展效率和不同 GPU 配置下的表现。 AMD 称以 575 万个 token / 秒的速度在 512 个 GPU 规模下创造了新的 MLPerf 记录 ,这是 AMD 迄今为止规模最大的提交,再次证明了 AMD 的性能、规模、软件成熟度和可复现性。 DeepSeek R1 测试中,AMD 以 512 个 Instinct MI355X GPU 参赛,离线(强调批量处理能力,通常用于衡量系统在非实时场景下的最大吞吐)成绩 2,901,950...

  8. IT之家 AI36

    格里费:英伟达驱动支持是 Valve 首要任务之一,SteamOS 已能点亮部分 GPU

    IT之家 9 月 17 日消息,在接受游戏媒体 IGN 采访时,Valve 软件开发人员皮埃尔-卢普 · 格里费(Pierre-Loup Griffais)表示 已在 SteamOS 主开发树中启用英伟达驱动程序,部分 GPU 型号可初始化并显示图像。 IT之家曾于今年 6 月报道,格里费接受 The Verge 采访时候透露 Valve 已和英伟达公司密切合作,且内部组建了相关团队, 负责为 SteamOS 开发英伟达显卡驱动程序支持 ,且团队规模在不断扩大。 在最新采访中,格里费表示 Valve 公司正在大力推进 NVIDIA 支持,并将其列为首要任务: 是的,我们正在努力。 这绝对是我们最优先考虑的事情之一。就像 FEX 和高通驱动程序开发一样,这需要数年时间。 格里费表示 Valve 已在 SteamOS 主开发树中启用了 NVIDIA 驱动程序, 让某些 NVIDIA GPU 型号能够在 SteamOS 下点亮并显示图...

    推荐理由:来自IT之家 AI的《格里费:英伟达驱动支持是 Valve 首要任务之一,SteamOS 已能点亮部分 GPU》。重点看多模态、部署/工程、文化创意。摘要提到:IT之家 9 月 17 日消息,在接受游戏媒体 IGN 采访时,Valve 软件开发人员皮埃尔-卢普 · 格里费(Pierre-Loup Griffais)表示 已在 SteamOS 主开发树中启用英伟达驱动程序,部分 GPU 型号可初始化并显示图像。 IT之家曾于今年 6 月报道,格里费接受 The Verge 采访时候透露 Valve 已和英伟达公司密切合作,且内部组建了相关团队, 负责为 SteamOS 开发英伟达显卡驱动程序支持 ,且团队规模在不断扩大。 在最新采访中,格里费表示 Valve 公司正在大力推进 NVIDIA 支持,并将其列为首要任务: 是的,我们正在努力。 这绝对是我们最优先考虑的事情之一。就像 FEX 和高通驱动程序开发一样,这需要数年时间。 格里费表示 Valve 已在 SteamOS 主开发树中启用了 NVIDIA 驱动程序, 让某些 NVIDIA GPU 型号能够在 SteamOS 下点亮并显示图...

  9. 极客公园70

    IDC 发布企业级 Agent 评估报告,中国电信 TeleAgent 综合跻身国内第一梯队

    近日,国际数据公司(IDC)发布《中国企业级通用 Agent 产品技术评估》报告,对国内多款主流通用智能体产品开展标准化实测。中国电信星辰超级智能体 TeleAgent 综合得分 6.85 分,成本效率、安全可控、任务表现等多个维度高于行业普遍水平,面向高频办公场景的常规任务能力进入国内第一梯队。 本次评估在统一的仿真测试环境中进行,覆盖任务表现、成本效率、交互体验、安全可控、生态开放性等九大维度,并加入脏数据、权限约束、模糊指令等真实工作中常见的干扰条件。测评显示,TeleAgent 在 Token 消耗方面优于同类产品。对于需要高频调用、规模化部署智能体的企业而言,这意味着使用成本有望进一步降低。 支撑 TeleAgent 的,是中国电信在算力、平台、数据、模型和应用上的全栈布局。中电信人工智能公司依托这一体系,连接基础研究、工程研发与产品落地。其中,星辰通用人工智能实验室基于国产算力和国产框架,自主完成了十亿、百亿、千亿参...

    推荐理由:来自极客公园的《IDC 发布企业级 Agent 评估报告,中国电信 TeleAgent 综合跻身国内第一梯队》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:近日,国际数据公司(IDC)发布《中国企业级通用 Agent 产品技术评估》报告,对国内多款主流通用智能体产品开展标准化实测。中国电信星辰超级智能体 TeleAgent 综合得分 6.85 分,成本效率、安全可控、任务表现等多个维度高于行业普遍水平,面向高频办公场景的常规任务能力进入国内第一梯队。 本次评估在统一的仿真测试环境中进行,覆盖任务表现、成本效率、交互体验、安全可控、生态开放性等九大维度,并加入脏数据、权限约束、模糊指令等真实工作中常见的干扰条件。测评显示,TeleAgent 在 Token 消耗方面优于同类产品。对于需要高频调用、规模化部署智能体的企业而言,这意味着使用成本有望进一步降低。 支撑 TeleAgent 的,是中国电信在算力、平台、数据、模型和应用上的全栈布局。中电信人工智能公司依托这一体系,连接基础研究、工程研发与产品落地。其中,星辰通用人工智能实验室基于国产算力和国产框架,自主完成了十亿、百亿、千亿参...

  10. 量子位36

    国产RSI模型交卷!Flash模型靠它反打旗舰

    事实摘要:国产RSI模型交卷!Flash模型靠它反打旗舰 1亿Tokens人人免费领 这条动态来自 量子位,可重点关注模型能力与工程。 国产RSI模型交卷!Flash模型靠它反打旗舰 1亿Tokens人人免费领。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  11. IT之家 AI34

    广电总局:电视“套娃”收费治理显著,全国电视频道虚假宣传医药广告已全面清除

    IT之家 9 月 17 日消息,国务院新闻办公室今天举行“开局起步‘十五五’”系列主题新闻发布会,国家广播电视总局(简称广电总局)有关负责人介绍“十五五”时期加快推动广播电视和网络视听高质量发展有关情况。 据央视新闻报道,会上介绍,过去三年,广电总局联合多部门持续推进电视“套娃”收费和操作复杂治理,成效显著。进入“十五五”,将在“双治理”基础上,向服务和体验“双提升”迈进: 推广一体化电视等新型终端,更好满足人民群众便捷操作需求 。今年,广电总局会同工信部,制定一体化电视技术标准,将机顶盒功能以软件形态内置于电视机中,打造极简终端形态,一台电视即可畅享直播、点播等全类型电视业务,用户配备通用遥控器,可一键开关机、一键看频道节目。当前广电总局正组织各方全力推进,考虑到相当数量的老旧电视机不支持一体化升级,将先部署数千万,随着家庭存量电视换新升级,“十五五”将实现一体化电视更广范围覆盖。 强化公共服务保障,扩大“双提升”成果惠及面。...

    推荐理由:来自IT之家 AI的《广电总局:电视“套娃”收费治理显著,全国电视频道虚假宣传医药广告已全面清除》。重点看产品发布。摘要提到:IT之家 9 月 17 日消息,国务院新闻办公室今天举行“开局起步‘十五五’”系列主题新闻发布会,国家广播电视总局(简称广电总局)有关负责人介绍“十五五”时期加快推动广播电视和网络视听高质量发展有关情况。 据央视新闻报道,会上介绍,过去三年,广电总局联合多部门持续推进电视“套娃”收费和操作复杂治理,成效显著。进入“十五五”,将在“双治理”基础上,向服务和体验“双提升”迈进: 推广一体化电视等新型终端,更好满足人民群众便捷操作需求 。今年,广电总局会同工信部,制定一体化电视技术标准,将机顶盒功能以软件形态内置于电视机中,打造极简终端形态,一台电视即可畅享直播、点播等全类型电视业务,用户配备通用遥控器,可一键开关机、一键看频道节目。当前广电总局正组织各方全力推进,考虑到相当数量的老旧电视机不支持一体化升级,将先部署数千万,随着家庭存量电视换新升级,“十五五”将实现一体化电视更广范围覆盖。 强化公共服务保障,扩大“双提升”成果惠及面。...

  12. 量子位73

    网易有道周枫:AI能力竞争,正在进入「Model + Agent + Workflow」时代,网易有道AI Open Day展示AI时代“有道解法”

    事实摘要:网易有道周枫:AI能力竞争,正在进入「Model + Agent + Workflow」时代,网易有道AI Open Day展示AI时代“有道解法” 9月16日,网易有道「NEXT,AGENT|有道AI Open Day」在北京举办。 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程。 网易有道周枫:AI能力竞争,正在进入「Model + Age。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  13. IT之家 AI72

    OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件

    IT之家 9 月 17 日消息,当地时间 9 月 16 日,OpenAI 发布报告,披露了其“对齐失效”框架下的六起模型异常行为案例,涉及隐瞒错误、编造数据、未经许可上传文件等。 对齐失效在这里是指 AI 系统的目标与行为偏离人类设计意图和价值观。OpenAI 表示,行业尚未充分解决对齐与监控问题,已无法继续以最快速度且安稳地扩大 AI 规模。OpenAI 也借此机会宣布将系统性跟踪、调查和披露模型在训练、评估、测试及部署过程中出现的异常行为。 OpenAI 称,有关 AI 应如何发展的决策,必须建立在外部人士可以自行核验的实证依据之上。该公司希望新框架推动行业形成公开披露标准,而非仅靠零散报告。 此番披露之际,外界正争论是否应放缓 AI 研发。今年早些时候,OpenAI 系统出现失控行为并攻击 AI 初创企业 Hugging Face,几周后 Hugging Face 主动告知,OpenAI 方才知晓。 此后,Anthropi...

    推荐理由:来自IT之家 AI的《OpenAI 首次公开六起模型异常案例,涉及瞒报错误、编造数据及未经授权上传文件》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 17 日消息,当地时间 9 月 16 日,OpenAI 发布报告,披露了其“对齐失效”框架下的六起模型异常行为案例,涉及隐瞒错误、编造数据、未经许可上传文件等。 对齐失效在这里是指 AI 系统的目标与行为偏离人类设计意图和价值观。OpenAI 表示,行业尚未充分解决对齐与监控问题,已无法继续以最快速度且安稳地扩大 AI 规模。OpenAI 也借此机会宣布将系统性跟踪、调查和披露模型在训练、评估、测试及部署过程中出现的异常行为。 OpenAI 称,有关 AI 应如何发展的决策,必须建立在外部人士可以自行核验的实证依据之上。该公司希望新框架推动行业形成公开披露标准,而非仅靠零散报告。 此番披露之际,外界正争论是否应放缓 AI 研发。今年早些时候,OpenAI 系统出现失控行为并攻击 AI 初创企业 Hugging Face,几周后 Hugging Face 主动告知,OpenAI 方才知晓。 此后,Anthropi...

  14. Claude Code Releases92

    Claude Code Releases v2.1.274:Added a visible warning when memory usage is critical, wit...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.274:Added a visible warning when memory usage is critical, wit... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  15. Tomer Tunguz69

    The Harness Margin Opportunity

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:The Harness Margin Opportunity 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:The Harness Margin Opportunity 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:。影响判断:它可能改变模型能力与工程、评测与基准、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  16. Cloudflare AI84

    When scanners miss the attack: how Cloudflare Client-Side Security protects storefronts

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:When scanners miss the attack: how Cloudflare Client-Side Security protects storefronts 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:When scanners miss the attack: how Cl。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。