跳到正文
9月24日周四
  1. 极客公园70

    Agent 时代来了,3D 生成大模型接下来比什么?

    9 月 3 日,GPT-6 Astra 的发布,把 3D 内容创作带到了舞台中央。 在 GPT-6 Astra 官方发布页的一个不到 3 分钟的视频里与后续解读中,Astra 已经能直接进入 Blender,从一句住宅设计需求开始搭场景,先生成极简住宅,后来又将其扩展为围绕庭院展开的家庭住宅。里面有卧室、办公室、厨房和卫生间;家具从床板、衣柜挂杆、烤箱、餐具抽屉,再到灯光模拟,一应俱全。甚至水槽表面的法线出了问题之后,Astra 还会自己返工。 为了制作 30 秒室内漫游,它还会把相机放在约 1.65 米的人眼高度,用 24—26mm 镜头安排四段运动;进入 Unreal Engine 5 之后,它又自己处理 FBX、JSON、米和厘米的单位差、坐标转换、材质映射、碰撞和第一人称控制。 当通用模型也能做 3D 了,专业 3D 生成模型的价值会发生什么变化? 当下, 3D 工具的使用者,正逐渐从人 扩展 为 Agent...

    推荐理由:来自极客公园的《Agent 时代来了,3D 生成大模型接下来比什么?》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:9 月 3 日,GPT-6 Astra 的发布,把 3D 内容创作带到了舞台中央。 在 GPT-6 Astra 官方发布页的一个不到 3 分钟的视频里与后续解读中,Astra 已经能直接进入 Blender,从一句住宅设计需求开始搭场景,先生成极简住宅,后来又将其扩展为围绕庭院展开的家庭住宅。里面有卧室、办公室、厨房和卫生间;家具从床板、衣柜挂杆、烤箱、餐具抽屉,再到灯光模拟,一应俱全。甚至水槽表面的法线出了问题之后,Astra 还会自己返工。 为了制作 30 秒室内漫游,它还会把相机放在约 1.65 米的人眼高度,用 24—26mm 镜头安排四段运动;进入 Unreal Engine 5 之后,它又自己处理 FBX、JSON、米和厘米的单位差、坐标转换、材质映射、碰撞和第一人称控制。 当通用模型也能做 3D 了,专业 3D 生成模型的价值会发生什么变化? 当下, 3D 工具的使用者,正逐渐从人 扩展 为 Agent...

  2. 量子位68

    PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍

    1.5台6000D跑赢1台B300! 这条动态来自 量子位,可重点关注模型能力与工程。

    推荐理由:来自量子位的《PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍》。重点看模型能力与工程。摘要提到:1.5台6000D跑赢1台B300! 这条动态来自 量子位,可重点关注模型能力与工程。

  3. IT之家 AI72

    摩尔线程官宣:MTT S5000 适配字节跳动 Protenix-v2 开源生物分子结构预测模型

    IT之家 9 月 24 日消息,摩尔线程今天宣布,旗下训推一体智算卡 MTT S5000 正式完成了开源生物分子结构预测模型 Protenix-v2 的全链路推理支持。 据IT之家了解,Protenix-v2 开源模型由字节跳动 Seed 团队研发,发布于 2026 年 4 月,在多项核心基准测试中性能持平甚至超越 DeepMind AlphaFold 3,是目前全球少数能够对蛋白质、DNA、RNA 及小分子配体复合物进行高精度端到端预测的开源基座。 MTT S5000 此次适配,标志着摩尔线程实现了大分子结构预测、全基因组序列建模与临床医学影像三大 AI for Science(AI4S)核心场景的端到端工程验证,为国内药企及科研机构提供 AI4S 算力底座。

    推荐理由:来自IT之家 AI的《摩尔线程官宣:MTT S5000 适配字节跳动 Protenix-v2 开源生物分子结构预测模型》。重点看模型能力与工程、评测与基准、开源生态。摘要提到:IT之家 9 月 24 日消息,摩尔线程今天宣布,旗下训推一体智算卡 MTT S5000 正式完成了开源生物分子结构预测模型 Protenix-v2 的全链路推理支持。 据IT之家了解,Protenix-v2 开源模型由字节跳动 Seed 团队研发,发布于 2026 年 4 月,在多项核心基准测试中性能持平甚至超越 DeepMind AlphaFold 3,是目前全球少数能够对蛋白质、DNA、RNA 及小分子配体复合物进行高精度端到端预测的开源基座。 MTT S5000 此次适配,标志着摩尔线程实现了大分子结构预测、全基因组序列建模与临床医学影像三大 AI for Science(AI4S)核心场景的端到端工程验证,为国内药企及科研机构提供 AI4S 算力底座。

  4. 极客公园72

    李彦宏的长期主义,进入回报周期

    作者|cola 编辑|郑玄 9 月 21 日,百度创始人李彦宏在内部活动上为技术团队颁发「百度最高奖」。两支入围团队均获奖,各获 100 万美元奖励。 其中,天池团队面向万亿级 MoE 大模型,自主研发百度天池超节点架构;dodo 团队是通过打造企业 AI 员工。 它们代表着百度当下两条重要的技术探索:基于 昆仑芯 的天池超节点,向更大规模的 AI 基础设施深入;以及让 Agent 真正进入组织。 但如果把时间轴再往前拉,百度今天的 AI 故事,还有一条更早埋下的技术伏笔——昆仑芯。 2010 年前后,百度搜索业务的服务器集群规模随流量高速扩张,海外进口芯片单片成本高达上万美元,持续攀升的算力开支不断挤压业务利润空间。这份成本压力,倒逼百度启动了 AI 加速器的自研探索。 没有人在一开始就预判到,这场造芯之路会跨过十余年的周期,中间要穿过外界的质疑、技术的反复迭代、商业化的重重关卡。 从内部低调摸索 FP...

    推荐理由:来自极客公园的《李彦宏的长期主义,进入回报周期》。重点看智能体工作流、模型能力与工程。摘要提到:作者|cola 编辑|郑玄 9 月 21 日,百度创始人李彦宏在内部活动上为技术团队颁发「百度最高奖」。两支入围团队均获奖,各获 100 万美元奖励。 其中,天池团队面向万亿级 MoE 大模型,自主研发百度天池超节点架构;dodo 团队是通过打造企业 AI 员工。 它们代表着百度当下两条重要的技术探索:基于 昆仑芯 的天池超节点,向更大规模的 AI 基础设施深入;以及让 Agent 真正进入组织。 但如果把时间轴再往前拉,百度今天的 AI 故事,还有一条更早埋下的技术伏笔——昆仑芯。 2010 年前后,百度搜索业务的服务器集群规模随流量高速扩张,海外进口芯片单片成本高达上万美元,持续攀升的算力开支不断挤压业务利润空间。这份成本压力,倒逼百度启动了 AI 加速器的自研探索。 没有人在一开始就预判到,这场造芯之路会跨过十余年的周期,中间要穿过外界的质疑、技术的反复迭代、商业化的重重关卡。 从内部低调摸索 FP...

  5. IT之家 AI72

    微软总裁布拉德 · 史密斯支持独立评估 AI 安全,还要确保系统处于人类控制之下

    IT之家 9 月 24 日消息,微软总裁布拉德 · 史密斯表态 支持引入独立评估方 ,对 AI 进行安全评估。 正在纽约举行的联合国大会上,AI 安全以及全球范围内如何监管 AI 行业,是各国领导人和企业高管重点讨论的问题。当地时间 23 日,史密斯接受彭博社采访时称,如果 AI 安全只由一两家机构负责, 就很难取得进展 。“模型公司固然至关重要,但像微软这样提供软件层、负责控制 AI 智能体并监控智能体行为的公司同样重要。” ▲ 图源微软官网 史密斯称,微软与亲密合作伙伴 OpenAI 设有一个 双方共同派员组成的安全委员会 ,微软通过这一委员会参与双方的 AI 安全讨论,并协助判断模型何时达到可以发布的安全水平。 IT之家从报道中获悉,他还提到,微软支持为先进系统设置关闭开关, 确保系统处于人类控制之下 。“安全机制真正需要部署在多个层面。有时,你可能希望政府也能掌握开关,但既然可以在三个或四个地方设置开关,为什么只把开关放...

    推荐理由:来自IT之家 AI的《微软总裁布拉德 · 史密斯支持独立评估 AI 安全,还要确保系统处于人类控制之下》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 24 日消息,微软总裁布拉德 · 史密斯表态 支持引入独立评估方 ,对 AI 进行安全评估。 正在纽约举行的联合国大会上,AI 安全以及全球范围内如何监管 AI 行业,是各国领导人和企业高管重点讨论的问题。当地时间 23 日,史密斯接受彭博社采访时称,如果 AI 安全只由一两家机构负责, 就很难取得进展 。“模型公司固然至关重要,但像微软这样提供软件层、负责控制 AI 智能体并监控智能体行为的公司同样重要。” ▲ 图源微软官网 史密斯称,微软与亲密合作伙伴 OpenAI 设有一个 双方共同派员组成的安全委员会 ,微软通过这一委员会参与双方的 AI 安全讨论,并协助判断模型何时达到可以发布的安全水平。 IT之家从报道中获悉,他还提到,微软支持为先进系统设置关闭开关, 确保系统处于人类控制之下 。“安全机制真正需要部署在多个层面。有时,你可能希望政府也能掌握开关,但既然可以在三个或四个地方设置开关,为什么只把开关放...

  6. IT之家 AI70

    OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力

    IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。 据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。 OpenAI 表示,目前针对 AI 在心理健康领域表现的多数评估主要集中于紧急情况,并使用宽泛的预设标准衡量模型表现,因此对于模型如何应对完整范围的心理健康对话,仍存在一...

    推荐理由:来自IT之家 AI的《OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。 据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。 OpenAI 表示,目前针对 AI 在心理健康领域表现的多数评估主要集中于紧急情况,并使用宽泛的预设标准衡量模型表现,因此对于模型如何应对完整范围的心理健康对话,仍存在一...

  7. IT之家 AI72

    谷歌确认新一代旗舰模型 Gemini 4 即将推出,有望不用等到年底

    IT之家 9 月 24 日消息,The Information 当地时间 23 日举办的 AI Agenda Live 峰会上,谷歌 DeepMind 负责人科拉伊 · 卡武克奥卢透露, 谷歌新一代旗舰模型 Gemini 4 即将推出 ,现已进入 开发流程中的后训练初期 。 IT之家注:“后训练”是在基础 AI 模型完成后进一步调整模型,提高其行为可靠性。 卡武克奥卢希望 Gemini 4 能在“ 远早于年底 ”的时间点推出。“我们的打算是尽快拿出后训练阶段的早期成果, 因为我们看到了结果,也很振奋 。” 随后,谷歌会继续快速迭代模型。 Gemini 4 将成为谷歌自去年年底推出 Gemini 3 系列后 首款下一代旗舰模型 。谷歌 2 月发布了 Gemini 3.1 升级版,此后还推出多款 规模更小、成本更低,但复杂推理能力也较弱的 Flash 模型 。 今年 5 月,谷歌 CEO 桑达尔 · 皮查伊曾在年度 I/O 大会上宣...

    推荐理由:来自IT之家 AI的《谷歌确认新一代旗舰模型 Gemini 4 即将推出,有望不用等到年底》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 24 日消息,The Information 当地时间 23 日举办的 AI Agenda Live 峰会上,谷歌 DeepMind 负责人科拉伊 · 卡武克奥卢透露, 谷歌新一代旗舰模型 Gemini 4 即将推出 ,现已进入 开发流程中的后训练初期 。 IT之家注:“后训练”是在基础 AI 模型完成后进一步调整模型,提高其行为可靠性。 卡武克奥卢希望 Gemini 4 能在“ 远早于年底 ”的时间点推出。“我们的打算是尽快拿出后训练阶段的早期成果, 因为我们看到了结果,也很振奋 。” 随后,谷歌会继续快速迭代模型。 Gemini 4 将成为谷歌自去年年底推出 Gemini 3 系列后 首款下一代旗舰模型 。谷歌 2 月发布了 Gemini 3.1 升级版,此后还推出多款 规模更小、成本更低,但复杂推理能力也较弱的 Flash 模型 。 今年 5 月,谷歌 CEO 桑达尔 · 皮查伊曾在年度 I/O 大会上宣...

  8. IT之家 AI66

    特斯拉向北美 HW3 版 Model S/X 推送 FSD v14.2 Lite

    IT之家 9 月 24 日消息,特斯拉首次开始向北美搭载 HW3 硬件的 Model S 和 Model X 推送 FSD v14.2 Lite。此前,搭载 HW3 的 Model 3 和 Model Y 已于今年 7 月获得 FSD v14 Lite,这是更新后的 FSD 技术栈首次推送至 Model S 和 Model X。 此次软件更新随 2026.27.10 和 2026.27.11 版本一同发布,这两个版本也是目前最新的 FSD 更新。不过,特斯拉目前尚未向所有符合条件的车辆推送该更新。现阶段收到更新的 Model S 和 Model X 数量非常少,特斯拉可能希望先确认不会出现严重问题,再进一步扩大推送范围。 特斯拉自动驾驶软件负责人埃隆 · 阿肖克(Ashok Elluswamy)此前已经暗示该版本即将发布。他在奥斯汀举行的 Cybercab 发布活动上透露,这一版本原计划在前一周推送。 据IT之家了解,FSD v...

    推荐理由:来自IT之家 AI的《特斯拉向北美 HW3 版 Model S/X 推送 FSD v14.2 Lite》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 24 日消息,特斯拉首次开始向北美搭载 HW3 硬件的 Model S 和 Model X 推送 FSD v14.2 Lite。此前,搭载 HW3 的 Model 3 和 Model Y 已于今年 7 月获得 FSD v14 Lite,这是更新后的 FSD 技术栈首次推送至 Model S 和 Model X。 此次软件更新随 2026.27.10 和 2026.27.11 版本一同发布,这两个版本也是目前最新的 FSD 更新。不过,特斯拉目前尚未向所有符合条件的车辆推送该更新。现阶段收到更新的 Model S 和 Model X 数量非常少,特斯拉可能希望先确认不会出现严重问题,再进一步扩大推送范围。 特斯拉自动驾驶软件负责人埃隆 · 阿肖克(Ashok Elluswamy)此前已经暗示该版本即将发布。他在奥斯汀举行的 Cybercab 发布活动上透露,这一版本原计划在前一周推送。 据IT之家了解,FSD v...

  9. IT之家 AI36

    港大与北师大用三维波模拟研究超轻暗物质,首次预测其对引力透镜成像的影响

    IT之家 9 月 24 日消息,香港大学物理系与该校天文及天体物理研究所,联合北京师范大学主导的研究团队,提出一种更贴近物理实际的方案,用三维波模拟检验超轻暗物质对引力透镜图像的影响。 这是首次直接基于超轻暗物质的三维波模拟,直接预测其对引力透镜成像的影响,为利用高分辨率引力透镜观测研究暗物质性质提供了新的方法。相关成果已发表于《天体物理学杂志快报》。 暗物质被认为占宇宙全部物质的约 85%,不发光也不吸收或反射光,目前只能通过引力效应被探测。它不在粒子物理标准模型之内。过去十年,越来越多天文证据提示,暗物质可能由超轻粒子组成(超轻暗物质也称“模糊暗物质”,指质量极低、集体行为类似波的暗物质候选者)。 由于质量极低,这类粒子可像波一样集体运动,形成类似海浪相遇时的复杂干涉图样。这种图样可能在星系多重像中留下痕迹。 引力透镜是指大质量天体的引力弯曲并扭曲更遥远光源的光,从而形成多个图像。研究团队据此预测,若星系由超轻暗物质构成,透...

    推荐理由:来自IT之家 AI的《港大与北师大用三维波模拟研究超轻暗物质,首次预测其对引力透镜成像的影响》。重点看模型能力与工程。摘要提到:IT之家 9 月 24 日消息,香港大学物理系与该校天文及天体物理研究所,联合北京师范大学主导的研究团队,提出一种更贴近物理实际的方案,用三维波模拟检验超轻暗物质对引力透镜图像的影响。 这是首次直接基于超轻暗物质的三维波模拟,直接预测其对引力透镜成像的影响,为利用高分辨率引力透镜观测研究暗物质性质提供了新的方法。相关成果已发表于《天体物理学杂志快报》。 暗物质被认为占宇宙全部物质的约 85%,不发光也不吸收或反射光,目前只能通过引力效应被探测。它不在粒子物理标准模型之内。过去十年,越来越多天文证据提示,暗物质可能由超轻粒子组成(超轻暗物质也称“模糊暗物质”,指质量极低、集体行为类似波的暗物质候选者)。 由于质量极低,这类粒子可像波一样集体运动,形成类似海浪相遇时的复杂干涉图样。这种图样可能在星系多重像中留下痕迹。 引力透镜是指大质量天体的引力弯曲并扭曲更遥远光源的光,从而形成多个图像。研究团队据此预测,若星系由超轻暗物质构成,透...

  10. IT之家 AI68

    阿里达摩院发布食管癌 AI 模型,“不插管”发现早期和癌前病变

    IT之家 9 月 24 日消息,阿里巴巴发布第 4 个癌症筛查 AI 模型。阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构研发 食管癌筛查 AI 模型 DAMO EAGLE ,无需插管和造影,从平扫 CT 上就能识别食管癌,包括早期和癌前恶性病变,已在 3 个国家 8 万多病例上获得验证。 相关论文于 9 月 22 日登上国际顶级期刊《自然 · 医学》(Nature Medicine)。 阿里达摩院介绍称,中国食管癌发病率和死亡率约占全球一半,多数患者直到晚期才发现,失去根治机会。 如能早发现,大部分患者可通过内镜下微创手术根治,5 年生存率可达 95% 以上 。目前食管癌的标准筛查手段是上消化道内镜,具有一定的侵入性,且操作复杂,难以大范围推广。 胸部平扫 CT 成本低、接受度高,广泛应用于各类医疗场景,尤其是低剂量的平扫 CT,已是肺癌的推荐筛查方法。这些 CT 的扫描范围本身就覆盖了食管,筛查肺癌时如能同时识别食...

    推荐理由:来自IT之家 AI的《阿里达摩院发布食管癌 AI 模型,“不插管”发现早期和癌前病变》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 24 日消息,阿里巴巴发布第 4 个癌症筛查 AI 模型。阿里达摩院联合四川省肿瘤医院、中山大学肿瘤防治中心等机构研发 食管癌筛查 AI 模型 DAMO EAGLE ,无需插管和造影,从平扫 CT 上就能识别食管癌,包括早期和癌前恶性病变,已在 3 个国家 8 万多病例上获得验证。 相关论文于 9 月 22 日登上国际顶级期刊《自然 · 医学》(Nature Medicine)。 阿里达摩院介绍称,中国食管癌发病率和死亡率约占全球一半,多数患者直到晚期才发现,失去根治机会。 如能早发现,大部分患者可通过内镜下微创手术根治,5 年生存率可达 95% 以上 。目前食管癌的标准筛查手段是上消化道内镜,具有一定的侵入性,且操作复杂,难以大范围推广。 胸部平扫 CT 成本低、接受度高,广泛应用于各类医疗场景,尤其是低剂量的平扫 CT,已是肺癌的推荐筛查方法。这些 CT 的扫描范围本身就覆盖了食管,筛查肺癌时如能同时识别食...

  11. IT之家 AI74

    月之暗面最强 AI:消息称 Kimi K3.1 下月登场

    IT之家 9 月 24 日消息,科技媒体 Wccftech 昨日(9 月 23 日)发布博文,报道称月之暗面(Moonshot)正酝酿推出 Kimi K3.1 模型, 并将提供 Low、High、Max 共 3 档推理强度,预估会在下月(2026 年 10 月)登场。 消息源 @MaxForAI 昨日在 X 平台发布推文,发现月之暗面内部 JSON / API 响应中,出现 Kimi K3.1 相关标识,其中包括“k3d1-agent”等模型名称,片段还出现 Agent 模式、应用场景及多项配置开关。 根据相关配置文件,K3.1 可能支持: Low、High、Max 等多档推理强度; “Extra Long”等超长上下文选项,最高支持 100 万 Token; Agent 智能体模式; Swarm 多智能体协作; 搜索、批处理等任务模式。 Kimi K3 于 2026 年 7 月发布,是月之暗面目前公开推出的旗舰模型。官方资料显...

    推荐理由:来自IT之家 AI的《月之暗面最强 AI:消息称 Kimi K3.1 下月登场》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 24 日消息,科技媒体 Wccftech 昨日(9 月 23 日)发布博文,报道称月之暗面(Moonshot)正酝酿推出 Kimi K3.1 模型, 并将提供 Low、High、Max 共 3 档推理强度,预估会在下月(2026 年 10 月)登场。 消息源 @MaxForAI 昨日在 X 平台发布推文,发现月之暗面内部 JSON / API 响应中,出现 Kimi K3.1 相关标识,其中包括“k3d1-agent”等模型名称,片段还出现 Agent 模式、应用场景及多项配置开关。 根据相关配置文件,K3.1 可能支持: Low、High、Max 等多档推理强度; “Extra Long”等超长上下文选项,最高支持 100 万 Token; Agent 智能体模式; Swarm 多智能体协作; 搜索、批处理等任务模式。 Kimi K3 于 2026 年 7 月发布,是月之暗面目前公开推出的旗舰模型。官方资料显...

  12. Apple Machine Learning Research77

    Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

    这条英文动态主要涉及模型能力与工程。原文要点:System-wide Dictation on Apple devices runs entirely on-device, and the speech it transcribes reaches the foundation model through a tokenizer: an encoder that maps short windows of waveform onto the representation the language model reads. Because that model is sparsely activated under Instruction-Following Pruning, only a small subset of its experts occupies DRAM at any time, so the always-on tokenizer competes for...

    推荐理由:来自Apple Machine Learning Research的《Compressing Streaming Neural Audio Encoders via Latent-Space Distillation》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:System-wide Dictation on Apple devices runs entirely on-device, and the speech it transcribes reaches the foundation model through a tokenizer: an encoder that maps short windows of waveform onto the representation the language model reads. Because that model is sparsely activated under Instruction-Following Pruning, only a small subset of its experts occupies DRAM at any time, so the always-on...

  13. Apple Machine Learning Research89

    A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization

    这条英文动态主要涉及模型能力与工程、教育应用、文化创意。原文要点:Semi-supervised federated learning (SSFL) trains models on clients’ unlabeled data using a teacher to generate pseudo-labels, with a small labeled seed dataset on the server. Automatic Speech Recognition (ASR) is particularly fragile here: pseudo-label errors compound across the output sequence and across training rounds into divergence, leaving a large gap to fully-supervised FL. We show that closing this gap turns ...

    推荐理由:来自Apple Machine Learning Research的《A Practical Recipe for Semi-Supervised Federated ASR: Online Pseudo-Labels with Server Update Stabilization》。重点看模型能力与工程、教育应用、文化创意。摘要提到:这条英文动态主要涉及模型能力与工程、教育应用、文化创意。原文要点:Semi-supervised federated learning (SSFL) trains models on clients’ unlabeled data using a teacher to generate pseudo-labels, with a small labeled seed dataset on the server. Automatic Speech Recognition (ASR) is particularly fragile here: pseudo-label errors compound across the output sequence and across training rounds into divergence, leaving a large gap to fully-supervised FL. We ...

  14. Claude Code Releases82

    Claude Code Releases v2.1.281:Added Claude apps gateway support for newer Claude Desktop...

    这条英文动态讨论了 AI 领域的新进展。原文要点:What's changed Added Claude apps gateway support for newer Claude Desktop keys in desktop policy blocks, including blockReadsOutsideWorkingDirectories and disableBypassPermissionsMode Added assume_role on Claude apps gateway Bedrock upstreams: the gateway calls Bedrock as an IAM role it assumes through STS, in another AWS account if needed, optionally one session per developer Added guardrail: {id, version} on Claude...

    推荐理由:来自Claude Code Releases的《Claude Code Releases v2.1.281:Added Claude apps gateway support for newer Claude Desktop...》。重点看模型发布、编码、政策/监管。摘要提到:这条英文动态讨论了 AI 领域的新进展。原文要点:What's changed Added Claude apps gateway support for newer Claude Desktop keys in desktop policy blocks, including blockReadsOutsideWorkingDirectories and disableBypassPermissionsMode Added assume_role on Claude apps gateway Bedrock upstreams: the gateway calls Bedrock as an IAM role it assumes through STS, in another AWS account if needed, optionally one session per developer Added guardrail...

9月23日周三
  1. IT之家 AI76

    Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看

    IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出色的模型?负责 Claude 微调的 Anthropic 工程师杰克逊 · 克尼恩今天(23 日)对此给出了解释:后续模型的优化重点 更多放在数学和代码能力上 。 这些模型还接受了大量 面向其他 AI 模型撰写技术解释 的训练,而这正是 Claude 逐渐形成奇特表达方式,也就是所谓“Claude 腔”(Claudeish)的主要原因。克尼恩称,模型被“调整得适应 LLM 心理”,最终学会了 写给 AI 模型看,而不是写给人看 。 克尼恩把这种现象类比为 只与其他自闭症人士交流的人 。此类群体会逐渐形成一套 在群体内部沟通顺畅、外人却难以理解 的表达方式。LLM 拥有远超人类的工作记忆,也能捕...

    推荐理由:来自IT之家 AI的《Anthropic 工程师解释为何 Claude 写作变差:模型被训练成写给 AI 看而非写给人看》。重点看模型能力与工程。摘要提到:IT之家 9 月 23 日消息,AI 模型在数学、编程和推理能力上进步迅速,写作水平却停滞不前,甚至有所退步,Anthropic 的 Claude 同样也存在这一问题。 为何 Opus 4.6 会成为 Anthropic 最后一款写作表现出色的模型?负责 Claude 微调的 Anthropic 工程师杰克逊 · 克尼恩今天(23 日)对此给出了解释:后续模型的优化重点 更多放在数学和代码能力上 。 这些模型还接受了大量 面向其他 AI 模型撰写技术解释 的训练,而这正是 Claude 逐渐形成奇特表达方式,也就是所谓“Claude 腔”(Claudeish)的主要原因。克尼恩称,模型被“调整得适应 LLM 心理”,最终学会了 写给 AI 模型看,而不是写给人看 。 克尼恩把这种现象类比为 只与其他自闭症人士交流的人 。此类群体会逐渐形成一套 在群体内部沟通顺畅、外人却难以理解 的表达方式。LLM 拥有远超人类的工作记忆,也能捕...

  2. IT之家 AI70

    谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制

    IT之家 9 月 23 日消息,谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成 从静态预设转变为动态创意工作室 ,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook 和 Google Vids 等产品改进用户体验。 两款新模型分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS ,定位各有不同: Gemini 3.8 Flash TTS :面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,在游戏、沉浸式有声读物、播客和互动媒体中赋予角色生命力,还可对表演提示、节奏、方言转换等进行精细控制。 Gemini 3.8 Flash-Lite TTS :面向大容量、高性价比规模场景,针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,可对音调、节奏和表现力细微差别进行精细控制。 据IT之家了...

    推荐理由:来自IT之家 AI的《谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型,每一行台词都能精确控制》。重点看模型能力与工程、文化创意、产品发布。摘要提到:IT之家 9 月 23 日消息,谷歌今日宣布,Gemini 家族新增两款全新文本转语音模型,将语音生成 从静态预设转变为动态创意工作室 ,能够帮助创作者、开发者和企业打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook 和 Google Vids 等产品改进用户体验。 两款新模型分别为 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS ,定位各有不同: Gemini 3.8 Flash TTS :面向深度创意方向和角色设计,可通过自然语言提示从头创建全新语音,在游戏、沉浸式有声读物、播客和互动媒体中赋予角色生命力,还可对表演提示、节奏、方言转换等进行精细控制。 Gemini 3.8 Flash-Lite TTS :面向大容量、高性价比规模场景,针对大容量配音、音频内容创作和富有表现力的语音代理进行了优化,可对音调、节奏和表现力细微差别进行精细控制。 据IT之家了...

  3. IT之家 AI72

    rabbit 沉寂许久后发布 OS3 智能体操作系统,支持多设备编排

    IT之家 9 月 23 日消息,人工智能初创企业 rabbit 曾因其口袋 AI 设备 Rabbit R1 名噪一时。但在硬件产品备受争议的推出后,该企业热度迅速降低并最终陷入沉寂。根据IT之家的查询, 其本周之前的最后一条官网新闻发布于 2025 年 9 月 。 而在当地时间 22 日, rabbit 宣布正式发布其智能体操作系统 OS3 。其兼容广泛第三方硬件,以单一聊天界面为主要入口。用户仅需设定一个目标,系统便会自动调度所需的设备、模型、文件来完成剩余步骤。 OS3 在云端运行并通过 rabbit agent 智能体连接和操作设备,一个账户最多可以连接五台设备。其 支持 多设备编排 、单一连续对话,兼容通用技能,可进行直接的计算机控制与自动编程。 IT之家了解到,用户使用 OS3 时 需自备 API 接口 。其 仅访问本地文件,仅通过模型提供程序处理上下文,仅执行用户发起的操作。

    推荐理由:来自IT之家 AI的《rabbit 沉寂许久后发布 OS3 智能体操作系统,支持多设备编排》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 23 日消息,人工智能初创企业 rabbit 曾因其口袋 AI 设备 Rabbit R1 名噪一时。但在硬件产品备受争议的推出后,该企业热度迅速降低并最终陷入沉寂。根据IT之家的查询, 其本周之前的最后一条官网新闻发布于 2025 年 9 月 。 而在当地时间 22 日, rabbit 宣布正式发布其智能体操作系统 OS3 。其兼容广泛第三方硬件,以单一聊天界面为主要入口。用户仅需设定一个目标,系统便会自动调度所需的设备、模型、文件来完成剩余步骤。 OS3 在云端运行并通过 rabbit agent 智能体连接和操作设备,一个账户最多可以连接五台设备。其 支持 多设备编排 、单一连续对话,兼容通用技能,可进行直接的计算机控制与自动编程。 IT之家了解到,用户使用 OS3 时 需自备 API 接口 。其 仅访问本地文件,仅通过模型提供程序处理上下文,仅执行用户发起的操作。

  4. IT之家 AI68

    部分苹果 Mac 升级 macOS 27 后,Apple Intelligence 占用空间超 30GB

    IT之家 9 月 23 日消息,安装 macOS 27 Golden Gate 系统后,苹果会在 Mac 下一次连接互联网时,自动下载一个数 GB 大小的 AI 模型。与此前的 macOS 版本不同,用户无法阻止这一过程。Siri AI 以及 Apple Intelligence,如今已经成为系统中不可或缺的一部分。 对于 macOS 27,苹果表示,最新的 Apple Intelligence 功能在搭载 M3 芯片或更新芯片、且配备至少 12GB 统一内存的 Mac 上,最多需要占用 14GB 本地存储空间;对于其他支持 Apple Intelligence 的 Mac,最多需要 8GB 存储空间。 不过,根据实际测试,不同 Mac 对 AI 模型分配的存储空间似乎存在明显差异,而且部分设备的占用空间远高于苹果公布的数字。 例如,在一台运行 macOS 27 的 M4 Pro Mac mini 上,MacRumors 发现 ...

    推荐理由:来自IT之家 AI的《部分苹果 Mac 升级 macOS 27 后,Apple Intelligence 占用空间超 30GB》。重点看模型能力与工程。摘要提到:IT之家 9 月 23 日消息,安装 macOS 27 Golden Gate 系统后,苹果会在 Mac 下一次连接互联网时,自动下载一个数 GB 大小的 AI 模型。与此前的 macOS 版本不同,用户无法阻止这一过程。Siri AI 以及 Apple Intelligence,如今已经成为系统中不可或缺的一部分。 对于 macOS 27,苹果表示,最新的 Apple Intelligence 功能在搭载 M3 芯片或更新芯片、且配备至少 12GB 统一内存的 Mac 上,最多需要占用 14GB 本地存储空间;对于其他支持 Apple Intelligence 的 Mac,最多需要 8GB 存储空间。 不过,根据实际测试,不同 Mac 对 AI 模型分配的存储空间似乎存在明显差异,而且部分设备的占用空间远高于苹果公布的数字。 例如,在一台运行 macOS 27 的 M4 Pro Mac mini 上,MacRumors 发现 ...

  5. IT之家 AI72

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,UI 设计专项评测位列开源第一

    IT之家 9 月 23 日消息,今日,蚂蚁百灵大模型正式开源 Ming-Image-0.1-Design 系列,包含两个参数量均为 6B 的模型:Ming-Image-0.1-Design,从文字需求生成 UI、信息图、海报和完整视觉设计;Ming-Image-0.1-Design-Layer,将创意图或者设计图拆成可独立编辑的透明图层。 IT之家注意到,蚂蚁百灵同时开源了 Design Skill 和 PPT Skill,将模型能力继续连接到前端页面与可编辑演示文稿。 据官方介绍,Ming-Image-0.1-Design 重点增强了四项能力: 支持 8K 长结构化提示词增强,将自然语言需求组织为文案、模块、布局和视觉风格; 优化标题、按钮、卡片和多区域信息的文字渲染与版式稳定性; 通过端到端生成一次性完成整体设计,统一配色、构图和素材风格; 创建原生 RGBA VAE,直接生成人物、商品、图标和装饰等透明背景素材。 相比通过...

    推荐理由:来自IT之家 AI的《蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,UI 设计专项评测位列开源第一》。重点看模型能力与工程、评测与基准、文化创意。摘要提到:IT之家 9 月 23 日消息,今日,蚂蚁百灵大模型正式开源 Ming-Image-0.1-Design 系列,包含两个参数量均为 6B 的模型:Ming-Image-0.1-Design,从文字需求生成 UI、信息图、海报和完整视觉设计;Ming-Image-0.1-Design-Layer,将创意图或者设计图拆成可独立编辑的透明图层。 IT之家注意到,蚂蚁百灵同时开源了 Design Skill 和 PPT Skill,将模型能力继续连接到前端页面与可编辑演示文稿。 据官方介绍,Ming-Image-0.1-Design 重点增强了四项能力: 支持 8K 长结构化提示词增强,将自然语言需求组织为文案、模块、布局和视觉风格; 优化标题、按钮、卡片和多区域信息的文字渲染与版式稳定性; 通过端到端生成一次性完成整体设计,统一配色、构图和素材风格; 创建原生 RGBA VAE,直接生成人物、商品、图标和装饰等透明背景素材。 相比通过...

  6. IT之家 AI70

    微软 Win11 Clipchamp 新增本地 AI 视频超分功能,可将视频分辨率提升至 4K

    IT之家 9 月 23 日消息,微软正在为 Windows 11 内置的免费视频编辑器 Clipchamp 加入另一项 AI 功能。全新的“视频超分辨率”(Video Super Resolution)功能可以直接利用 PC 本地算力,将低分辨率视频提升至最高 4K 分辨率。 这项新功能在处理老旧智能手机拍摄的视频、通过即时通讯应用接收的压缩片段,或是低画质网络摄像头录制内容时非常实用,Clipchamp 会利用设备端 AI 模型,在提升视频分辨率的同时生成额外的画面细节,让处理后的视频看起来更加清晰、锐利。 IT之家注意到,目前市场上已经有多种视频超分辨率服务,但与依赖云端处理的工具不同,Clipchamp 可以在本地完成整个视频超分辨率处理过程。微软表示,在支持的 PC 上,Windows 可以调用 CPU 进行处理;Copilot+ PC 则可以利用 NPU。该功能支持 AMD、英特尔和高通的兼容硬件。 用户将视频添加到 ...

    推荐理由:来自IT之家 AI的《微软 Win11 Clipchamp 新增本地 AI 视频超分功能,可将视频分辨率提升至 4K》。重点看模型能力与工程。摘要提到:IT之家 9 月 23 日消息,微软正在为 Windows 11 内置的免费视频编辑器 Clipchamp 加入另一项 AI 功能。全新的“视频超分辨率”(Video Super Resolution)功能可以直接利用 PC 本地算力,将低分辨率视频提升至最高 4K 分辨率。 这项新功能在处理老旧智能手机拍摄的视频、通过即时通讯应用接收的压缩片段,或是低画质网络摄像头录制内容时非常实用,Clipchamp 会利用设备端 AI 模型,在提升视频分辨率的同时生成额外的画面细节,让处理后的视频看起来更加清晰、锐利。 IT之家注意到,目前市场上已经有多种视频超分辨率服务,但与依赖云端处理的工具不同,Clipchamp 可以在本地完成整个视频超分辨率处理过程。微软表示,在支持的 PC 上,Windows 可以调用 CPU 进行处理;Copilot+ PC 则可以利用 NPU。该功能支持 AMD、英特尔和高通的兼容硬件。 用户将视频添加到 ...

  7. MIT Technology Review AI87

    The AI Hype Index: AI loves cheating

    这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:Brace yourself: It turns out AI is being optimized for cheating. OpenAI’s agents hacked into Hugging Face to get the answers to a cybersecurity test. Next, they solved a prestigious math problem (or just stole from two top mathematicians’ answer sheets). Anthropic’s models have also hacked into other companies’ systems four times already. And that’s…

    推荐理由:来自MIT Technology Review AI的《The AI Hype Index: AI loves cheating》。重点看智能体工作流、模型能力与工程。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:Brace yourself: It turns out AI is being optimized for cheating. OpenAI’s agents hacked into Hugging Face to get the answers to a cybersecurity test. Next, they solved a prestigious math problem (or just stole from two top mathematicians’ answer sheets). Anthropic’s models have also hacked into other companies’ systems four times already. And that’s…

  8. 量子位70

    斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”

    事实摘要:斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界” 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型AutoOmni 2.0-23B-A3B 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界” 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型A。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. IT之家 AI72

    科大讯飞发布全新语音识别大模型 Spark-ASR-2.0,明日上线讯飞输入法

    IT之家 9 月 23 日消息,今日,科大讯飞正式发布最新一代语音识别大模型 Spark-ASR-2.0。 据官方介绍,Spark-ASR-2.0 通过非自回归与 LLM 增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术创新,整体的语音识别效果大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明显。在效果提升的同时,Spark-ASR-2.0 的整体推理成本相对 Spark-ASR-1.0 仅增加了 10%。 官方称,“如果说过去的语音识别追求的是一字不差地还原所说内容,那么 Spark-ASR-2.0 则更进一步,让识别结果‘流畅成文’—— 在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让文字更连贯、语义更清晰。” 相较于 Spark-ASR-1.0,Spark-ASR-2.0 在语音...

    推荐理由:来自IT之家 AI的《科大讯飞发布全新语音识别大模型 Spark-ASR-2.0,明日上线讯飞输入法》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 23 日消息,今日,科大讯飞正式发布最新一代语音识别大模型 Spark-ASR-2.0。 据官方介绍,Spark-ASR-2.0 通过非自回归与 LLM 增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术创新,整体的语音识别效果大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明显。在效果提升的同时,Spark-ASR-2.0 的整体推理成本相对 Spark-ASR-1.0 仅增加了 10%。 官方称,“如果说过去的语音识别追求的是一字不差地还原所说内容,那么 Spark-ASR-2.0 则更进一步,让识别结果‘流畅成文’—— 在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让文字更连贯、语义更清晰。” 相较于 Spark-ASR-1.0,Spark-ASR-2.0 在语音...

  10. IT之家 AI72

    荣耀 YOYO Claw、小米 miclaw、阶跃终端 AI 三款手机端侧生成式 AI 服务通过网信部门备案

    IT之家 9 月 23 日消息,据网信中国公众号,网信部门会同有关部门按照《生成式人工智能服务管理暂行办法》要求,有序开展生成式人工智能服务备案工作,现将新增的“YOYO Claw”等 3 款提供手机端侧生成式人工智能服务备案信息予以公告。 IT之家汇总此次备案的生成式人工智能服务如下表: 序号 属地 大模型名称 备案单位 备案编号 备案时间 适用场景 1 广东省 YOYO Claw 深圳荣耀软件技术有限公司 GuangDong-YOYOClaw-202607280195 2026/9/22 荣耀手机 2 北京市 Xiaomi miclaw 小米科技有限责任公司 Beijing-Xiaomimiclaw-202605180225 2026/9/22 小米手机 3 上海市 阶跃终端 AI 智源星辰(上海)智能科技有限公司 Shanghai-JieYueZhongDuanAI-202607280184 2026/9/22 阶跃手机

    推荐理由:来自IT之家 AI的《荣耀 YOYO Claw、小米 miclaw、阶跃终端 AI 三款手机端侧生成式 AI 服务通过网信部门备案》。重点看模型能力与工程。摘要提到:IT之家 9 月 23 日消息,据网信中国公众号,网信部门会同有关部门按照《生成式人工智能服务管理暂行办法》要求,有序开展生成式人工智能服务备案工作,现将新增的“YOYO Claw”等 3 款提供手机端侧生成式人工智能服务备案信息予以公告。 IT之家汇总此次备案的生成式人工智能服务如下表: 序号 属地 大模型名称 备案单位 备案编号 备案时间 适用场景 1 广东省 YOYO Claw 深圳荣耀软件技术有限公司 GuangDong-YOYOClaw-202607280195 2026/9/22 荣耀手机 2 北京市 Xiaomi miclaw 小米科技有限责任公司 Beijing-Xiaomimiclaw-202605180225 2026/9/22 小米手机 3 上海市 阶跃终端 AI 智源星辰(上海)智能科技有限公司 Shanghai-JieYueZhongDuanAI-202607280184 2026/9/22 阶跃手机

  11. 量子位70

    DeepSeek新论文公开Agent训练!梁文锋署名

    事实摘要:DeepSeek新论文公开Agent训练!。影响判断:发布了一篇关于Agent(代理)训练的新论文,展示了在每秒产生50,000+个沙盒的能力。场景价值:智能体工作流、模型能力与工程。

    推荐理由:这篇文章为读者提供了一个关于Agent训练的视角,强调了其高效性和灵活性。

  12. IT之家 AI68

    阿里千问发布 Qwen-Audio-3.1 系列语音大模型,并下调全线产品价格

    IT之家 9 月 23 日消息,今天,千问正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别、语音合成和实时语音交互三大核心模型进行了全面进化,更重磅推出了全新的音频创作模型 Qwen-Audio-3.1-TTS-Next 和音频理解模型 Qwen-Audio-3.1-ASR-Next。 官方称,五款全新的语音模型同时推出,形成了一套覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低用户使用成本, Qwen-Audio 全线语音模型价格均下调 ,其中 TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅达 95%。 IT之家附官方详细介绍如下: Qwen-Audio-3.1-ASR: 更强的上下文理解和润色 Qwen-Audio-3.1-ASR 是新一代语音识别大模型,进一步增强多语种、方言识别与上下文理解能力,并新增原生转写润色能力,可自动去除语气词与重复表达并重组语义,...

    推荐理由:来自IT之家 AI的《阿里千问发布 Qwen-Audio-3.1 系列语音大模型,并下调全线产品价格》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 23 日消息,今天,千问正式发布 Qwen-Audio-3.1 系列语音大模型。本次升级不仅对语音识别、语音合成和实时语音交互三大核心模型进行了全面进化,更重磅推出了全新的音频创作模型 Qwen-Audio-3.1-TTS-Next 和音频理解模型 Qwen-Audio-3.1-ASR-Next。 官方称,五款全新的语音模型同时推出,形成了一套覆盖“理解-生成-交互-创作”的完整音频能力栈。为进一步降低用户使用成本, Qwen-Audio 全线语音模型价格均下调 ,其中 TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅达 95%。 IT之家附官方详细介绍如下: Qwen-Audio-3.1-ASR: 更强的上下文理解和润色 Qwen-Audio-3.1-ASR 是新一代语音识别大模型,进一步增强多语种、方言识别与上下文理解能力,并新增原生转写润色能力,可自动去除语气词与重复表达并重组语义,...

  13. 量子位36

    实时世界模型进入“全科生”阶段,PixVerse R2先交卷!

    事实摘要:实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 实时性和通用能力,世界模型可以全都要 这条动态来自 量子位,可重点关注模型能力与工程。 实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 实时性和通用能力,世界模型可以全都要。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. 极客公园76

    从单卡到千卡互联,平头哥真武 V900 背后的 AI 算力变局

    作者|Cynthia 编辑|郑玄 9 月 22 日的 2026 杭州云栖大会,平头哥少见地被完整推到了主论坛台前。 当天上午,吴泳铭完成主旨演讲后,千问大模型、多模态模型负责人依次登场,随后就是平头哥副总裁高慧。她的演讲题目是「Agentic 时代卓越算力基石」。 平头哥带来的产品,则从一颗最新得真武 V900 芯片,一直延伸到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、倚天 CPU 路线图,以及下一步的算、存、网全栈协同的超节点服务器。 发布「产品全家桶」地背后,是 Agentic 时代的负载变化:算力需求已经从训练为主进一步走向推理增长,应用从单轮请求变成连续的多步任务, 硬件的竞争也从一颗芯片的指标扩展到整个计算系统的协同。 01 真武V900,平头哥最新一代AI训推芯片 这次发布里,平头哥新一代训推一体 AI 芯片真武 V900 仍然是分量最重的产品。 这颗芯片搭载 216GB 显存,片间互联带宽...

    推荐理由:来自极客公园的《从单卡到千卡互联,平头哥真武 V900 背后的 AI 算力变局》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:作者|Cynthia 编辑|郑玄 9 月 22 日的 2026 杭州云栖大会,平头哥少见地被完整推到了主论坛台前。 当天上午,吴泳铭完成主旨演讲后,千问大模型、多模态模型负责人依次登场,随后就是平头哥副总裁高慧。她的演讲题目是「Agentic 时代卓越算力基石」。 平头哥带来的产品,则从一颗最新得真武 V900 芯片,一直延伸到 ICN Switch 互联芯片、磐脉智能网卡、镇岳 SSD 主控、倚天 CPU 路线图,以及下一步的算、存、网全栈协同的超节点服务器。 发布「产品全家桶」地背后,是 Agentic 时代的负载变化:算力需求已经从训练为主进一步走向推理增长,应用从单轮请求变成连续的多步任务, 硬件的竞争也从一颗芯片的指标扩展到整个计算系统的协同。 01 真武V900,平头哥最新一代AI训推芯片 这次发布里,平头哥新一代训推一体 AI 芯片真武 V900 仍然是分量最重的产品。 这颗芯片搭载 216GB 显存,片间互联带宽...

  15. IT之家 AI78

    马斯克惊叹中国 AI 大模型“单位算力产出性能几乎是全球顶尖水平”,预计两到三年内就能靠光刻技术与芯片制造补齐算力缺口

    IT之家 9 月 23 日消息,特斯拉 CEO 埃隆 · 马斯克今日接受了央视财经专访。 当谈及 AI,他表示中国的 AI 大模型整体而言非常出色,单位算力产出的性能几乎全球顶尖。 他认为,中国解决算力问题的速度会比大多数人预想更快。粗略估计,大概两到三年内,中国就能依靠光刻技术与芯片制造补齐算力缺口。 图源:Pexels 谈及 AI 时代教育,马斯克建议广泛学习,兼顾人文艺术、科学与工程,夯实通识基础。 他表示,想要向机器人下达指令,就要学会组织问题;知识面越广,越擅长提问,这正是给 AI 写提示词。 马斯克此前曾表示,预计到 2027 年底,人工智能将独立完成所有数字领域工作,彻底替代人工直接操作的各类数字化岗位。 在短期技术突破上,他预判未来 12 至 18 个月内,AI 将在工程及各类数字领域实现能力跨越式提升。 其中,AI 编程能力最快明年达到“Stockfish 级”水准(IT之家注:Stockfish 是一款开源国...

    推荐理由:来自IT之家 AI的《马斯克惊叹中国 AI 大模型“单位算力产出性能几乎是全球顶尖水平”,预计两到三年内就能靠光刻技术与芯片制造补齐算力缺口》。重点看模型能力与工程、教育应用、文化创意。摘要提到:IT之家 9 月 23 日消息,特斯拉 CEO 埃隆 · 马斯克今日接受了央视财经专访。 当谈及 AI,他表示中国的 AI 大模型整体而言非常出色,单位算力产出的性能几乎全球顶尖。 他认为,中国解决算力问题的速度会比大多数人预想更快。粗略估计,大概两到三年内,中国就能依靠光刻技术与芯片制造补齐算力缺口。 图源:Pexels 谈及 AI 时代教育,马斯克建议广泛学习,兼顾人文艺术、科学与工程,夯实通识基础。 他表示,想要向机器人下达指令,就要学会组织问题;知识面越广,越擅长提问,这正是给 AI 写提示词。 马斯克此前曾表示,预计到 2027 年底,人工智能将独立完成所有数字领域工作,彻底替代人工直接操作的各类数字化岗位。 在短期技术突破上,他预判未来 12 至 18 个月内,AI 将在工程及各类数字领域实现能力跨越式提升。 其中,AI 编程能力最快明年达到“Stockfish 级”水准(IT之家注:Stockfish 是一款开源国...

  16. 量子位72

    阿里千问AI平台全面升级模型服务、Agent服务、AI应用

    事实摘要:阿里千问AI平台全面升级模型服务、Agent服务、AI应用 覆盖MaaS、Agent服务、行业AI解决方案 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程。 阿里千问AI平台全面升级模型服务、Agent服务、AI应用 覆盖MaaS、Agent服务、行业AI解决方案。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  17. 量子位66

    刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降

    事实摘要:刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降 押注互联网里的人类经验 这条动态来自 量子位,可重点关注模型能力与工程。 刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降 押注互联网里的人类经验。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  18. 爱范儿70

    ⁡⁤‬‍⁤‬​‌‍⁢⁡⁢⁣‌‌ ⁡⁡​⁤​​ ⁢⁡‬⁡‬​‍⁣​​ ⁤⁡‍​⁡‬‌‬⁣⁡⁣​⁡‬⁤刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地

    事实摘要:⁡⁤‬‍⁤‬​‌‍⁢⁡⁢⁣‌‌ ⁡⁡​⁤​​ ⁢⁡‬⁡‬​‍⁣​​ ⁤⁡‍​⁡‬‌‬⁣⁡⁣​⁡‬⁤刚刚,GPT-6 新模型掀桌!「白菜价」杀进 DeepSeek 腹地 DeepSeek 的价格护城河,迎来 OpenAI 的挑战 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  19. GitHub Changelog90

    OpenTelemetry in the GitHub Copilot app

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:OpenTelemetry in the GitHub Copilot app 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:OpenTelemetry in the GitHub Copilot app 事实摘要:这条英文动态主要涉及智能体工作流。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  20. OpenAI News79

    Airbnb widens access to GPT-6 Astra and OpenAI frontier models

    这条英文动态主要涉及模型能力与工程。原文要点:Learn how Airbnb is expanding access to GPT-6 Astra and OpenAI frontier models to help engineering teams solve bugs, design systems, and ship faster.

    推荐理由:来自OpenAI News的《Airbnb widens access to GPT-6 Astra and OpenAI frontier models》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Learn how Airbnb is expanding access to GPT-6 Astra and OpenAI frontier models to help engineering teams solve bugs, design systems, and ship faster.

  21. Tomer Tunguz78

    The Most Important Market in AI is the Middle

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:The Most Important Market in AI is the Middle 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:The Most Important Market in AI is the Middle 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:The。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  22. Apple Machine Learning Research78

    How to Guide Your Language Flow

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:How to Guide Your Language Flow 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显示:How to Guide Your Language Flow 事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准、文化创意,原文信息显。影响判断:它可能改变模型能力与工程、评测与基准、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  23. Simon Willison87

    Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war

    这条英文动态主要涉及模型能力与工程。原文要点:Yesterday was Grok 4.7 ( pelicans ) and MiMo v2.6 Flash/Pro ( more pelicans ). Today Anthropic released Claude Opus 5.5 , and around an hour later OpenAI released GPT-6 Sol and GPT-6 Luna . It's going to take a while to get a good read on all of these new models, but here are my impressions so far. GPT-6 Sol and Luna are half the price of their GPT-5.6 equivalents GPT-5.6 Luna was already my favorite model for buildi...

    推荐理由:来自Simon Willison的《Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Yesterday was Grok 4.7 ( pelicans ) and MiMo v2.6 Flash/Pro ( more pelicans ). Today Anthropic released Claude Opus 5.5 , and around an hour later OpenAI released GPT-6 Sol and GPT-6 Luna . It's going to take a while to get a good read on all of these new models, but here are my impressions so far. GPT-6 Sol and Luna are half the price of their GPT-5.6 equivalents GPT-5.6 Luna was already my fa...

  24. IT之家 AI72

    预填充吞吐超 330 Token/s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型

    IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台, 端侧适配与推理优化阶跃 StepEdge-Omni 30B-MoE 模型,并现场演示相关智能体助手。 该模型拥有 300 亿参数,依托混合专家架构,仅根据任务需要激活部分专家模块,以降低计算量和内存带宽需求。 合作方通过推理引擎、异构调度及存储方案优化,让模型运行内存需求较行业常规方案降低超过 50%,并支持在智能手机上稳定运行。 高通表示,该方案无需调用云端服务,可以在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等任务。 测试数据显示,模型预填充吞吐性能超过每秒 330 个 Token,解码吞吐性能超过每秒 28 个 Token。 IT之家注:“模型预填充吞吐性能是指大语言模型在推理的预填充...

    推荐理由:来自IT之家 AI的《预填充吞吐超 330 Token/s:高通携手阶跃等为第六代骁龙 8 超级至尊版端侧适配 300 亿参数 AI 模型》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,高通宣布携手阶跃、无量火及江波龙,基于第六代骁龙 8 超级至尊版移动平台, 端侧适配与推理优化阶跃 StepEdge-Omni 30B-MoE 模型,并现场演示相关智能体助手。 该模型拥有 300 亿参数,依托混合专家架构,仅根据任务需要激活部分专家模块,以降低计算量和内存带宽需求。 合作方通过推理引擎、异构调度及存储方案优化,让模型运行内存需求较行业常规方案降低超过 50%,并支持在智能手机上稳定运行。 高通表示,该方案无需调用云端服务,可以在本地完成邮件理解、行程规划、日历同步、航班及酒店推荐、行程分享和邮件草拟等任务。 测试数据显示,模型预填充吞吐性能超过每秒 330 个 Token,解码吞吐性能超过每秒 28 个 Token。 IT之家注:“模型预填充吞吐性能是指大语言模型在推理的预填充...

  25. IT之家 AI70

    高通骁龙芯片将整合 HBC 架构:手机本地运行 AI 更快、更省电

    IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,IT之家带来前方现场报道, 高通宣布将会向骁龙芯片下放 HBC 技术。 IT之家注:HBC 全称为 High Bandwidth Compute,直译为“高带宽计算”,于 2026 年 6 月召开的投资者日上公开,最初面向数据中心产品,在本次活动中宣布未来将会应用于骁龙芯片。 该架构是一种近内存计算(near-memory computing)架构,将计算芯片放置在堆叠式 LPDDR DRAM 下方,通过 3D 集成和硅通孔(TSV)缩短数据传输距离,目标是缓解 AI 推理中的“内存墙”问题。 对于普通用户而言,高通骁龙芯片未来如果整合 HBC 架构,手机能够更快、更省电地运行更大的端侧 AI 模型, 而且可以在本地运行更多 AI 功能。 目前限制手机端 AI 的瓶颈,不再仅是 NPU 的乘加计...

    推荐理由:来自IT之家 AI的《高通骁龙芯片将整合 HBC 架构:手机本地运行 AI 更快、更省电》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 23 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会上,IT之家带来前方现场报道, 高通宣布将会向骁龙芯片下放 HBC 技术。 IT之家注:HBC 全称为 High Bandwidth Compute,直译为“高带宽计算”,于 2026 年 6 月召开的投资者日上公开,最初面向数据中心产品,在本次活动中宣布未来将会应用于骁龙芯片。 该架构是一种近内存计算(near-memory computing)架构,将计算芯片放置在堆叠式 LPDDR DRAM 下方,通过 3D 集成和硅通孔(TSV)缩短数据传输距离,目标是缓解 AI 推理中的“内存墙”问题。 对于普通用户而言,高通骁龙芯片未来如果整合 HBC 架构,手机能够更快、更省电地运行更大的端侧 AI 模型, 而且可以在本地运行更多 AI 功能。 目前限制手机端 AI 的瓶颈,不再仅是 NPU 的乘加计...

  26. IT之家 AI72

    OpenAI 发布 GPT-6 Sol 和 Luna 模型,API 价格大降 50%

    IT之家 9 月 23 日消息,OpenAI 今日发布 GPT-6 系列模型的最新成员 GPT-6 Sol 和 GPT-6 Luna 。 OpenAI 官方表示,两款模型采用与 GPT-6 Astra 类似的方法进行训练,将 Astra 在专业工作、事实性、编码、计算机使用和对齐等方面 最先进的性能带入更快、更经济的模型 。 GPT-6 Sol 和 Luna 模型的 API 价格相比 GPT-5.6 促销价降低 50% 。不过 OpenAI 官方也表示,GPT-6 Astra 依然是其整体上最优秀的模型,如果你想要最佳效果和无妥协的体验,还是建议选择 GPT-6 Astra。 性能方面,在 AutomationBench 的跨应用业务流程测试中,GPT-6 Sol 在 xhigh 强度下表现优于 Claude Opus 5, 成本仅为 Opus 5 每任务成本的 9% 。在 high 强度下,GPT-6 Luna 比前代提升了 ...

    推荐理由:来自IT之家 AI的《OpenAI 发布 GPT-6 Sol 和 Luna 模型,API 价格大降 50%》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 23 日消息,OpenAI 今日发布 GPT-6 系列模型的最新成员 GPT-6 Sol 和 GPT-6 Luna 。 OpenAI 官方表示,两款模型采用与 GPT-6 Astra 类似的方法进行训练,将 Astra 在专业工作、事实性、编码、计算机使用和对齐等方面 最先进的性能带入更快、更经济的模型 。 GPT-6 Sol 和 Luna 模型的 API 价格相比 GPT-5.6 促销价降低 50% 。不过 OpenAI 官方也表示,GPT-6 Astra 依然是其整体上最优秀的模型,如果你想要最佳效果和无妥协的体验,还是建议选择 GPT-6 Astra。 性能方面,在 AutomationBench 的跨应用业务流程测试中,GPT-6 Sol 在 xhigh 强度下表现优于 Claude Opus 5, 成本仅为 Opus 5 每任务成本的 9% 。在 high 强度下,GPT-6 Luna 比前代提升了 ...