跳到正文
9月21日周一
  1. Tomer Tunguz78

    AI Comes for the If Statement

    这条英文动态主要涉及模型能力与工程。原文要点:Machine-native models replace human-facing text generation with zero-token typed execution, cutting inference costs by orders of magnitude for basic programming primitives.

    推荐理由:来自Tomer Tunguz的《AI Comes for the If Statement》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Machine-native models replace human-facing text generation with zero-token typed execution, cutting inference costs by orders of magnitude for basic programming primitives.

  2. IT之家 AI72

    Vals AI 使用《我的世界》评测 Open GPT‑6 Astra 模型:显示 AI 遇重大变故可能陷入行为僵局

    IT之家 9 月 21 日消息,AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。 Vals AI 的这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。 在测试过程中,GPT‑6 Astra 展现出前所未有的长周期规划与执行能力,达成过往 AI 难以实现的成就。其成功搭建半自动烈焰人农场,收集 6 根烈焰棒。深入下界诡异森林,击杀多名末影人,拿到 3 颗珍贵末影珍珠。完成大量探险后,将全部稀有物资集中存放在营地木箱当中,床也放置在储物箱旁作为重生点。一切都在向着末地打龙的通关之路发展。 然而,一只苦力怕悄悄靠近营地并发生自爆,直接炸毁储物木箱与重生床。AI 耗费上百小时积攒的关键道具几乎全部损毁,...

    推荐理由:来自IT之家 AI的《Vals AI 使用《我的世界》评测 Open GPT‑6 Astra 模型:显示 AI 遇重大变故可能陷入行为僵局》。重点看模型能力与工程、评测与基准。摘要提到:IT之家 9 月 21 日消息,AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT‑6 Astra 开展长时自主游戏测试,全程在 Twitch 直播,总测试时长达到 141 小时。 Vals AI 的这项测试并非由 OpenAI 官方设计,而是由第三方独立开展的评估项目,因此可以观察 Astra 在封闭测试环境之外的实际表现。 在测试过程中,GPT‑6 Astra 展现出前所未有的长周期规划与执行能力,达成过往 AI 难以实现的成就。其成功搭建半自动烈焰人农场,收集 6 根烈焰棒。深入下界诡异森林,击杀多名末影人,拿到 3 颗珍贵末影珍珠。完成大量探险后,将全部稀有物资集中存放在营地木箱当中,床也放置在储物箱旁作为重生点。一切都在向着末地打龙的通关之路发展。 然而,一只苦力怕悄悄靠近营地并发生自爆,直接炸毁储物木箱与重生床。AI 耗费上百小时积攒的关键道具几乎全部损毁,...

  3. Simon Willison88

    llm-keys-ui 0.1

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:llm-keys-ui 0.1 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:llm-keys-ui 0.1 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:llm-keys-ui 0.1 事实摘要:这条英文动态。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月20日周日
  1. IT之家 AI36

    智谱 MaaS 平台上线数据内容不留存机制,用户可申请开通

    IT之家 9 月 20 日消息,智谱 MaaS 平台今日宣布, 近期将上线数据内容不留存功能 ,为企业和开发者用户提供更严格的数据隐私保护。 公告称,数据内容不留存机制旨在减少模型调用内容在平台侧的持久化留存。任何用户均可以申请开通,生效后,智谱 MaaS 平台不会对用户的输入和输出进行静态存储, 数据仅用于完成当次模型调用 。企业和开发者可通过 MaaS 控制台提交开通申请,具体生效时间及适用范围以平台确认结果为准。 公告提到, 这个功能并不意味着任何情形下都不留存数据 。Batch API、File API 等需要在平台侧持久化保存任务或文件的功能不在上述覆盖范围内,以及法律法规要求留存、为核查涉嫌违规或滥用行为的情况,平台可能按有关要求留存相关数据 30 天及以上。 据IT之家此前报道,针对社区中有关代码库数据上传的讨论,智谱旗下编程产品 ZCode 于 9 月 18 日通过智谱官方群组向受影响用户致歉,并发布回应称已第一...

    推荐理由:来自IT之家 AI的《智谱 MaaS 平台上线数据内容不留存机制,用户可申请开通》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 20 日消息,智谱 MaaS 平台今日宣布, 近期将上线数据内容不留存功能 ,为企业和开发者用户提供更严格的数据隐私保护。 公告称,数据内容不留存机制旨在减少模型调用内容在平台侧的持久化留存。任何用户均可以申请开通,生效后,智谱 MaaS 平台不会对用户的输入和输出进行静态存储, 数据仅用于完成当次模型调用 。企业和开发者可通过 MaaS 控制台提交开通申请,具体生效时间及适用范围以平台确认结果为准。 公告提到, 这个功能并不意味着任何情形下都不留存数据 。Batch API、File API 等需要在平台侧持久化保存任务或文件的功能不在上述覆盖范围内,以及法律法规要求留存、为核查涉嫌违规或滥用行为的情况,平台可能按有关要求留存相关数据 30 天及以上。 据IT之家此前报道,针对社区中有关代码库数据上传的讨论,智谱旗下编程产品 ZCode 于 9 月 18 日通过智谱官方群组向受影响用户致歉,并发布回应称已第一...

  2. IT之家 AI70

    阿里千问开源 Qwen-Image-2.1 图像模型:可生成、编辑透明图像,支持最多 10 张参考图

    IT之家 9 月 20 日消息,阿里千问今日宣布,开源千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型 Qwen-Image-2.1。 Qwen-Image-2.1 将文生图与图像编辑整合在同一模型中,视觉生成部分仅有 7B 参数,并原生支持透明图像的生成与编辑。 官方表示,本次更新的主要特色包括四个方面: 小模强效,极致价比 :轻量的模型结构与推理优化,在生成质量和计算成本之间取得平衡。 ▲ Qwen-Image-Bench 公开评测对比 原生透明,创改一体 :根据提示词生成普通图像或透明图像,并支持透明图层编辑与抠图。 ▲ 通过文本直接生成透明图像的示例 全能编辑,多局保全 :支持最多 10 张参考图 ,增强局部编辑、人像与商品保真,并覆盖多种编辑任务。 ▲ 十张家居参考图生成室内布置 真实质感,字雅人美 :提升文字排版、人物光影与细节表现,让生成结果更具美感。 ▲ 文字渲染示例 IT之家附相关链接: GitH...

    推荐理由:来自IT之家 AI的《阿里千问开源 Qwen-Image-2.1 图像模型:可生成、编辑透明图像,支持最多 10 张参考图》。重点看模型能力与工程、评测与基准、开源生态。摘要提到:IT之家 9 月 20 日消息,阿里千问今日宣布,开源千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型 Qwen-Image-2.1。 Qwen-Image-2.1 将文生图与图像编辑整合在同一模型中,视觉生成部分仅有 7B 参数,并原生支持透明图像的生成与编辑。 官方表示,本次更新的主要特色包括四个方面: 小模强效,极致价比 :轻量的模型结构与推理优化,在生成质量和计算成本之间取得平衡。 ▲ Qwen-Image-Bench 公开评测对比 原生透明,创改一体 :根据提示词生成普通图像或透明图像,并支持透明图层编辑与抠图。 ▲ 通过文本直接生成透明图像的示例 全能编辑,多局保全 :支持最多 10 张参考图 ,增强局部编辑、人像与商品保真,并覆盖多种编辑任务。 ▲ 十张家居参考图生成室内布置 真实质感,字雅人美 :提升文字排版、人物光影与细节表现,让生成结果更具美感。 ▲ 文字渲染示例 IT之家附相关链接: GitH...

  3. IT之家 AI68

    FBI 局长称该局 AI 使用暴增 605%,靠 AI 拦下多起枪击事件

    IT之家 9 月 20 日消息,美国联邦调查局(FBI)局长卡什 · 帕特尔(Kash Patel)近日在一场采访中称,经他推动,联邦调查局对人工智能技术的使用量实现了 605% 的增长。虽然人工智能模型强大的模式识别能力,使其十分适合执法机构采用;人们也确实有理由预期 FBI 这类部门会运用这项技术,但外界很难厘清 605% 这个数字究竟统计的是什么。 该说法出自福克斯新闻的一次访谈。帕特尔同时表示,人工智能“如果依法使用,就是开展数据筛选分类的关键工具”。他指出,这项技术对于保护儿童、防范校园枪击案有着极高价值。自他就职以来,人工智能在跟进一条线索、阻止北卡罗来纳州以及“另外六个州”发生枪击事件的过程中发挥了关键作用。 帕特尔所说的 AI 使用规模提升接近七倍,具体所指并不明确。目前几乎没有确凿公开数据,可以说明 FBI 究竟在多大范围、以哪些方式引入人工智能。不过仍有部分线索,或许能够佐证他这一说法。 最新相关资料来自一份...

    推荐理由:来自IT之家 AI的《FBI 局长称该局 AI 使用暴增 605%,靠 AI 拦下多起枪击事件》。重点看模型能力与工程。摘要提到:IT之家 9 月 20 日消息,美国联邦调查局(FBI)局长卡什 · 帕特尔(Kash Patel)近日在一场采访中称,经他推动,联邦调查局对人工智能技术的使用量实现了 605% 的增长。虽然人工智能模型强大的模式识别能力,使其十分适合执法机构采用;人们也确实有理由预期 FBI 这类部门会运用这项技术,但外界很难厘清 605% 这个数字究竟统计的是什么。 该说法出自福克斯新闻的一次访谈。帕特尔同时表示,人工智能“如果依法使用,就是开展数据筛选分类的关键工具”。他指出,这项技术对于保护儿童、防范校园枪击案有着极高价值。自他就职以来,人工智能在跟进一条线索、阻止北卡罗来纳州以及“另外六个州”发生枪击事件的过程中发挥了关键作用。 帕特尔所说的 AI 使用规模提升接近七倍,具体所指并不明确。目前几乎没有确凿公开数据,可以说明 FBI 究竟在多大范围、以哪些方式引入人工智能。不过仍有部分线索,或许能够佐证他这一说法。 最新相关资料来自一份...

  4. 量子位38

    一张3090就能跑!全栈国产模型,把AI办公搬到企业本地

    AI办公这块蛋糕,中国电信可能要先切走一块了。 这条动态来自 量子位,可重点关注模型能力与工程。

    推荐理由:来自量子位的《一张3090就能跑!全栈国产模型,把AI办公搬到企业本地》。重点看模型能力与工程。摘要提到:AI办公这块蛋糕,中国电信可能要先切走一块了。 这条动态来自 量子位,可重点关注模型能力与工程。

  5. IT之家 AI70

    断网仍可作战:AI 模型加持的无人机可实现战场自主识别、打击目标

    IT之家 9 月 20 日消息,据 Arstechnica 报道,随着欧洲各国军队开始适应现代战争当中人工智能与无人机的应用,一家获得北约支持的初创企业正在协助部署由 AI 驱动的目标探测与筛选系统。这套系统可以直接在小型无人机上运行,用于侦察以及打击任务。 据IT之家了解,这家名为斯凯奥特系统(Scaleout Systems)的公司,由瑞典乌普萨拉大学的研究人员于 2018 年创立。公司早期的业务重心,是直接在商用卡车以及其他车辆的硬件上完成机器学习模型的训练与部署。但 2022 年俄乌战争爆发之后,该公司调整方向,转向防务领域。 “乌克兰战事爆发,加之全球局势发生转变,我们意识到这项技术十分重要。借助它,边缘端的数据与传感器数据就可以投入机器学习运算,从而帮助北约盟国建立战略优势。”斯凯奥特系统联合创始人兼首席执行官安德烈亚斯 · 赫兰德(Andreas Hellander)在接受采访时表示。 斯凯奥特并没有选用 Open...

    推荐理由:来自IT之家 AI的《断网仍可作战:AI 模型加持的无人机可实现战场自主识别、打击目标》。重点看模型能力与工程。摘要提到:IT之家 9 月 20 日消息,据 Arstechnica 报道,随着欧洲各国军队开始适应现代战争当中人工智能与无人机的应用,一家获得北约支持的初创企业正在协助部署由 AI 驱动的目标探测与筛选系统。这套系统可以直接在小型无人机上运行,用于侦察以及打击任务。 据IT之家了解,这家名为斯凯奥特系统(Scaleout Systems)的公司,由瑞典乌普萨拉大学的研究人员于 2018 年创立。公司早期的业务重心,是直接在商用卡车以及其他车辆的硬件上完成机器学习模型的训练与部署。但 2022 年俄乌战争爆发之后,该公司调整方向,转向防务领域。 “乌克兰战事爆发,加之全球局势发生转变,我们意识到这项技术十分重要。借助它,边缘端的数据与传感器数据就可以投入机器学习运算,从而帮助北约盟国建立战略优势。”斯凯奥特系统联合创始人兼首席执行官安德烈亚斯 · 赫兰德(Andreas Hellander)在接受采访时表示。 斯凯奥特并没有选用 Open...

  6. 量子位70

    APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策

    事实摘要:APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策 9月19日,中国人工智能企业APUS旗下 AI 实验室公布了全球最早一批针对Jev的独立开源复现成果 这条动态来自 量子位,可重点关注模型能力与工程、开源生态。 APUS 开源国内首批Jev跨平台复现:国产模型实现秒级决策 9月19日,中国人工智能企业APUS旗下 AI 实验室公布了全球最早一批针。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. IT之家 AI74

    消息称 Anthropic 拟于 IPO 前推出新 AI 模型,以应对 OpenAI GPT-6 Astra 竞争压力

    IT之家 9 月 20 日消息,据路透社报道,三位消息人士透露,Anthropic 正考虑推出一款全新人工智能模型,以此应对 OpenAI 发布 GPT‑6 Astra 之后的强劲发展势头。此事发生在该公司筹备 IPO(首次公开募股)前夕;就在此前,其首席执行官还呼吁整个 AI 行业放缓技术迭代的脚步。 消息人士称,此番计划发布新模型,意在直面来自直接竞争对手的竞争压力。而在此之前,Anthropic 首席执行官达里奥 · 阿莫代伊(Dario Amodei)已经向全球 AI 业界发声,呼吁行业放慢新能力的发布节奏,妥善处理安全风险。 “我们必须放缓 AI 模型能力迭代的速度。”阿莫代伊在 9 月 12 日一篇长达 3800 字的文章中写道。 这篇文章描绘了一幅不容乐观的前景:大批 AI 智能体席卷互联网,发展速度超出人类管控范围。该观点得到 OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX ...

    推荐理由:来自IT之家 AI的《消息称 Anthropic 拟于 IPO 前推出新 AI 模型,以应对 OpenAI GPT-6 Astra 竞争压力》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 20 日消息,据路透社报道,三位消息人士透露,Anthropic 正考虑推出一款全新人工智能模型,以此应对 OpenAI 发布 GPT‑6 Astra 之后的强劲发展势头。此事发生在该公司筹备 IPO(首次公开募股)前夕;就在此前,其首席执行官还呼吁整个 AI 行业放缓技术迭代的脚步。 消息人士称,此番计划发布新模型,意在直面来自直接竞争对手的竞争压力。而在此之前,Anthropic 首席执行官达里奥 · 阿莫代伊(Dario Amodei)已经向全球 AI 业界发声,呼吁行业放慢新能力的发布节奏,妥善处理安全风险。 “我们必须放缓 AI 模型能力迭代的速度。”阿莫代伊在 9 月 12 日一篇长达 3800 字的文章中写道。 这篇文章描绘了一幅不容乐观的前景:大批 AI 智能体席卷互联网,发展速度超出人类管控范围。该观点得到 OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX ...

  8. 极客公园70

    机器人如何自进化,乐享科技走了一条新路

    作者|Li Yuan 编辑|郑玄 最近,乐享科技因为一个颇大胆的 claim,引发了不少关注:它提出,其具身智能模型以太大模型能够在部署和执行过程中持续更新,并将这种能力概括为「自进化」,是全球首个能自进化的具身智能模型。 自进化是一个容易引起争议的说法。「进化」究竟是模型参数发生了变化,还是进行了任务的临时调整?在多大程度上这样的调整能够变成可迁移的新能力?一个模型能够适配不同场景和不同身体,又应该被理解为工程层面的泛化,还是更强意义上的持续成长?在机器人行业仍然需要解决稳定执行问题的阶段,「自进化」显然是一个需要被谨慎对待的判断。 近日,乐享科技又进行了一场户外直播。按照直播前公布的目标,搭载 Aether 以太大模型的机器人要在户外接受随机点单,完成包括食材和工具处理、烤制、翻面、上菜在内的烧烤任务,并应对临时打断、需求临时增加和场景变化。 在现场超 30 位专业媒体和线上超 550 万观众的见证下,实际呈现的过程并非每一...

    推荐理由:来自极客公园的《机器人如何自进化,乐享科技走了一条新路》。重点看模型能力与工程。摘要提到:作者|Li Yuan 编辑|郑玄 最近,乐享科技因为一个颇大胆的 claim,引发了不少关注:它提出,其具身智能模型以太大模型能够在部署和执行过程中持续更新,并将这种能力概括为「自进化」,是全球首个能自进化的具身智能模型。 自进化是一个容易引起争议的说法。「进化」究竟是模型参数发生了变化,还是进行了任务的临时调整?在多大程度上这样的调整能够变成可迁移的新能力?一个模型能够适配不同场景和不同身体,又应该被理解为工程层面的泛化,还是更强意义上的持续成长?在机器人行业仍然需要解决稳定执行问题的阶段,「自进化」显然是一个需要被谨慎对待的判断。 近日,乐享科技又进行了一场户外直播。按照直播前公布的目标,搭载 Aether 以太大模型的机器人要在户外接受随机点单,完成包括食材和工具处理、烤制、翻面、上菜在内的烧烤任务,并应对临时打断、需求临时增加和场景变化。 在现场超 30 位专业媒体和线上超 550 万观众的见证下,实际呈现的过程并非每一...

  9. IT之家 AI70

    工信部副部长辛国斌:大力发展开源基座模型和垂类模型,深入推进 AI+ 制造

    IT之家 9 月 20 日消息,据财联社消息,2026 世界制造业大会今日开幕,工业和信息化部副部长辛国斌在开幕式致辞中表示, 工信部将以新一代智能制造为主攻方向 ,不断提升制造业创新力、竞争力、综合实力, 塑造中国制造新优势 。 辛国斌在致辞中提出四点主张,IT之家附详情如下: 一是要提升产业创新体系效能。加强原始创新和关键核心技术攻关,强化企业科技创新主体地位,优化产业创新平台布局建设,推动更多科技创新转化为现实生产力。 二是促进先进制造业扩容提质, 统筹推进传统产业转型升级 、新型产业壮大、未来产业培育,建设一批世界级先进制造业集群。 三是增强先进制造能力, 深入推进人工智能 + 制造 ,梯度培育智能工厂, 大力发展开源基座模型和垂类模型 ,夯实新一代智能制造软硬件基础,全面推动制造业绿色低碳转型,创新发展服务型制造。 四是培育优质企业群体,不断优化创新创业环境,加快建设世界一流企业,促进中小企业专精特新发展,催生更多的“...

    推荐理由:来自IT之家 AI的《工信部副部长辛国斌:大力发展开源基座模型和垂类模型,深入推进 AI+ 制造》。重点看模型能力与工程、开源生态。摘要提到:IT之家 9 月 20 日消息,据财联社消息,2026 世界制造业大会今日开幕,工业和信息化部副部长辛国斌在开幕式致辞中表示, 工信部将以新一代智能制造为主攻方向 ,不断提升制造业创新力、竞争力、综合实力, 塑造中国制造新优势 。 辛国斌在致辞中提出四点主张,IT之家附详情如下: 一是要提升产业创新体系效能。加强原始创新和关键核心技术攻关,强化企业科技创新主体地位,优化产业创新平台布局建设,推动更多科技创新转化为现实生产力。 二是促进先进制造业扩容提质, 统筹推进传统产业转型升级 、新型产业壮大、未来产业培育,建设一批世界级先进制造业集群。 三是增强先进制造能力, 深入推进人工智能 + 制造 ,梯度培育智能工厂, 大力发展开源基座模型和垂类模型 ,夯实新一代智能制造软硬件基础,全面推动制造业绿色低碳转型,创新发展服务型制造。 四是培育优质企业群体,不断优化创新创业环境,加快建设世界一流企业,促进中小企业专精特新发展,催生更多的“...

  10. IT之家 AI74

    B站上线“AI 无限竞技场”LLM 测评榜:号称“全球百大模型同场竞技”、GPT-6 现居榜首

    IT之家 9 月 20 日消息,B站宣布上线“AI 无限竞技场”大模型测评榜,同步公布了首轮模型排行榜,其中 GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得榜首次数冠军;前五名中,国产大模型占据三席。IT之家附榜单地址( https://www.bilibili.com/blackboard/era/aiarena.html ?bsource=market_aiarena_sns_02 )。 据B站介绍,“AI 无限竞技场”是一个汇集了B站 UP 主 AI 大模型测评的竞技广场,由各领域 UP 主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同于传统跑分评测,B站 AI 无限竞技场不设主题或测评维度限制,来自各个分区的 UP 主们以真实工作流、专业应用、趣味脑洞等自主命题,在同题 PK 中直观呈现各模型的实际表现差异。榜单涵盖 DeepSeek、Kimi...

    推荐理由:来自IT之家 AI的《B站上线“AI 无限竞技场”LLM 测评榜:号称“全球百大模型同场竞技”、GPT-6 现居榜首》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 20 日消息,B站宣布上线“AI 无限竞技场”大模型测评榜,同步公布了首轮模型排行榜,其中 GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得榜首次数冠军;前五名中,国产大模型占据三席。IT之家附榜单地址( https://www.bilibili.com/blackboard/era/aiarena.html ?bsource=market_aiarena_sns_02 )。 据B站介绍,“AI 无限竞技场”是一个汇集了B站 UP 主 AI 大模型测评的竞技广场,由各领域 UP 主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。 不同于传统跑分评测,B站 AI 无限竞技场不设主题或测评维度限制,来自各个分区的 UP 主们以真实工作流、专业应用、趣味脑洞等自主命题,在同题 PK 中直观呈现各模型的实际表现差异。榜单涵盖 DeepSeek、Kimi...

  11. 爱范儿68

    体验完 Step 5 Preview,我发现阶跃重新坐上国产大模型主桌

    模型入海,阶跃走向人群 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

    推荐理由:来自爱范儿的《体验完 Step 5 Preview,我发现阶跃重新坐上国产大模型主桌》。重点看模型能力与工程。摘要提到:模型入海,阶跃走向人群 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

  12. IT之家 AI78

    阶跃发布旗舰模型 Step 5 Preview:跻身 AA 榜单全球开源模型前三,10 月 15 日开源

    IT之家 9 月 20 日消息,阶跃今天宣布推出旗舰模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作、金融等场景,提升模型执行真实世界 Agentic 任务表现,10 月 15 日开源完整权重。 据介绍,该模型采用稀疏 MoE 混合专家架构, 总参数量 600B 、激活参数仅 27B,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入。 在全球人工智能权威榜单 Artificial Analysis Intelligence Index(IT之家注:AA 综合智能指数)中,该模型得分 44 分, 位居全球开源模型前三 。与此同时,该模型的单任务成本仅为 Anthropic Claude Opus 5 的 1/8。 优化方面,阶跃为该模型建立了 StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域和 33 种编程语言。在测试中,Step 5 Preview...

    推荐理由:来自IT之家 AI的《阶跃发布旗舰模型 Step 5 Preview:跻身 AA 榜单全球开源模型前三,10 月 15 日开源》。重点看智能体工作流、模型能力与工程、文化创意。摘要提到:IT之家 9 月 20 日消息,阶跃今天宣布推出旗舰模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识工作、金融等场景,提升模型执行真实世界 Agentic 任务表现,10 月 15 日开源完整权重。 据介绍,该模型采用稀疏 MoE 混合专家架构, 总参数量 600B 、激活参数仅 27B,支持 100 万 Token 上下文窗口,原生支持文本与视觉输入。 在全球人工智能权威榜单 Artificial Analysis Intelligence Index(IT之家注:AA 综合智能指数)中,该模型得分 44 分, 位居全球开源模型前三 。与此同时,该模型的单任务成本仅为 Anthropic Claude Opus 5 的 1/8。 优化方面,阶跃为该模型建立了 StepCodeBench,覆盖 553 个独立代码仓库、9 类任务、20 个应用领域和 33 种编程语言。在测试中,Step 5 Preview...

  13. Simon Willison40

    datasette-explain 0.2.2

    事实摘要:datasette-explain 0.2.2 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:datasette-explain 0.2.2 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:datasette-explain 0.2.2 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:datasette-explain 。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. Simon Willison80

    datasette-auth-github 1.0

    事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:datasette-auth-github 1.0 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:datasette-auth-github 1.0 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:datasette-auth-github 1.0 事实摘要:。影响判断:它可能改变智能体工作流、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月19日周六
  1. Interconnects77

    Why I still haven’t bought into true RSI

    这条英文动态主要涉及模型能力与工程。原文要点:An “AI moderate’s” view on recent events and the trajectory of frontier models.

    推荐理由:来自Interconnects的《Why I still haven’t bought into true RSI》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:An “AI moderate’s” view on recent events and the trajectory of frontier models.

  2. 量子位35

    27B模型分分钟交付网页,Qwen 3.8还是太能了

    事实摘要:27B模型分分钟交付网页,Qwen 3.8还是太能了 设计、前端一口气全干了,结果后端没来上班 这条动态来自 量子位,可重点关注模型能力与工程。 27B模型分分钟交付网页,Qwen 3.8还是太能了 设计、前端一口气全干了,结果后端没来上班。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI72

    SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型:错误率降低约一半,价格保持不变

    IT之家 9 月 19 日消息,当地时间 9 月 18 日,SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型,在保持价格不变的前提下,错误率降低约一半。 官方表示,Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。目前,Grok Voice 已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时的视频旁白,并驱动实体硬件中的各类语音智能体 —— 其中包括特斯拉车辆中搭载的 Grok 助手。 在 Artificial Analysis 榜单中, Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率高居榜首 。 除公开基准外,SpaceXAI 基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别涵盖:客服电话音频、与 Grok 的日常对话(英语)、电话号码、邮箱、地...

    推荐理由:来自IT之家 AI的《SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型:错误率降低约一半,价格保持不变》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 19 日消息,当地时间 9 月 18 日,SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型,在保持价格不变的前提下,错误率降低约一半。 官方表示,Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。目前,Grok Voice 已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时的视频旁白,并驱动实体硬件中的各类语音智能体 —— 其中包括特斯拉车辆中搭载的 Grok 助手。 在 Artificial Analysis 榜单中, Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率高居榜首 。 除公开基准外,SpaceXAI 基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别涵盖:客服电话音频、与 Grok 的日常对话(英语)、电话号码、邮箱、地...

  4. IT之家 AI74

    中国电信开源首个全栈国产轻量级智能体大模型 Xing4.0-29B-A4B

    IT之家 9 月 19 日消息,中国电信于 9 月 17 日发布新一代星辰大模型 Xing4.0-29B-A4B,该模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K, 是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型 。 官方表示,从训练芯片到推理部署, 全栈国产 —— 昇腾训练、国产框架适配、自研架构、开源生态,一条路走通。 从 SuperCLUE 评测结果来看,在智能体能力方面,Xing4.0-29B-A4B 得分 93.52,位列第 3 名,与两款头部 Qwen 模型的差距均不足 1 分。 据介绍,Xing4.0-29B-A4B 通过 4-bit 量化后显存占用降低至 15GB(比 FP16 省约 75%),RTX 3090、RTX 4090 这类 24G 消费级显卡就能本地跑长上下文任务。 Xing4.0-29B-A4B 延续星辰大模型的开源路线,对...

    推荐理由:来自IT之家 AI的《中国电信开源首个全栈国产轻量级智能体大模型 Xing4.0-29B-A4B》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 19 日消息,中国电信于 9 月 17 日发布新一代星辰大模型 Xing4.0-29B-A4B,该模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K, 是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型 。 官方表示,从训练芯片到推理部署, 全栈国产 —— 昇腾训练、国产框架适配、自研架构、开源生态,一条路走通。 从 SuperCLUE 评测结果来看,在智能体能力方面,Xing4.0-29B-A4B 得分 93.52,位列第 3 名,与两款头部 Qwen 模型的差距均不足 1 分。 据介绍,Xing4.0-29B-A4B 通过 4-bit 量化后显存占用降低至 15GB(比 FP16 省约 75%),RTX 3090、RTX 4090 这类 24G 消费级显卡就能本地跑长上下文任务。 Xing4.0-29B-A4B 延续星辰大模型的开源路线,对...

  5. IT之家 AI70

    DeepSeek:调休上班的周末、中国法定节假日全天均按空闲时段计费

    IT之家 9 月 19 日消息,DeepSeek 今日发布 API 峰谷时间说明:调休上班的周末、中国法定节假日全天均按空闲时段计费。 IT之家查询获悉,根据此前发布的《国务院办公厅关于 2026 年部分节假日安排的通知》,2026 年 中秋、国庆具体放假日期如下: 中秋节:9 月 25 日(周五)至 27 日(周日)放假,共 3 天。 国庆节:10 月 1 日(周四)至 7 日(周三)放假调休,共 7 天 。9 月 20 日(周日)、10 月 10 日(周六)上班 。 IT之家注意到,DeepSeek 于 8 月 17 日正式实施的峰谷定价机制,8 月 23 日 00:00 起调整 API 计费规则:周六、周日全天不再区分峰谷时段,统一按低谷时段价格收取调用费用。具体如下: 模型 deepseek-flash deepseek-v4-pro BASE URL (OpenAI 格式) https://api.deepseek.c...

    推荐理由:来自IT之家 AI的《DeepSeek:调休上班的周末、中国法定节假日全天均按空闲时段计费》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 19 日消息,DeepSeek 今日发布 API 峰谷时间说明:调休上班的周末、中国法定节假日全天均按空闲时段计费。 IT之家查询获悉,根据此前发布的《国务院办公厅关于 2026 年部分节假日安排的通知》,2026 年 中秋、国庆具体放假日期如下: 中秋节:9 月 25 日(周五)至 27 日(周日)放假,共 3 天。 国庆节:10 月 1 日(周四)至 7 日(周三)放假调休,共 7 天 。9 月 20 日(周日)、10 月 10 日(周六)上班 。 IT之家注意到,DeepSeek 于 8 月 17 日正式实施的峰谷定价机制,8 月 23 日 00:00 起调整 API 计费规则:周六、周日全天不再区分峰谷时段,统一按低谷时段价格收取调用费用。具体如下: 模型 deepseek-flash deepseek-v4-pro BASE URL (OpenAI 格式) https://api.deepseek.c...

  6. IT之家 AI68

    阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,支持原文译文同帧同出

    IT之家 9 月 19 日消息,阿里千问今日发布同声传译大模型 Qwen3.8-LiveTranslate ,模型以 Interleave 架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。 官方表示,在 支持 60 种语言 的基础上,Qwen3.8-LiveTranslate 新增三项能力 让同传更广泛的应用于真实场景中: 实时说话人分离 ,每句话归属清晰,音色复刻更稳定; 原文译文同帧同出 ,双语同屏; 长上下文消歧 ,联系前文读懂当下,人名术语翻译更精准。 Qwen3.8-LiveTranslate 采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计,通过 Interleave 方式衔接流式理解、文本输出与语音生成。其中,Thinker 把视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,让理解与翻译在单一序列内完成;Tal...

    推荐理由:来自IT之家 AI的《阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,支持原文译文同帧同出》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 19 日消息,阿里千问今日发布同声传译大模型 Qwen3.8-LiveTranslate ,模型以 Interleave 架构重构实时同传,准确度、流畅度、简洁度全面提升,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。 官方表示,在 支持 60 种语言 的基础上,Qwen3.8-LiveTranslate 新增三项能力 让同传更广泛的应用于真实场景中: 实时说话人分离 ,每句话归属清晰,音色复刻更稳定; 原文译文同帧同出 ,双语同屏; 长上下文消歧 ,联系前文读懂当下,人名术语翻译更精准。 Qwen3.8-LiveTranslate 采用基于 Hybrid MoE 的 Thinker–Talker 双模块设计,通过 Interleave 方式衔接流式理解、文本输出与语音生成。其中,Thinker 把视频、音频、原文与译文编排进同一条因果序列,按时序交替排列、端到端产出,让理解与翻译在单一序列内完成;Tal...

  7. IT之家 AI36

    研究显示:格陵兰和南极冰盖 1979~2023 年损失约 11.3 万亿吨冰

    IT之家 9 月 19 日消息,据央视报道,一项基于卫星数据的最新国际研究显示,1979 年至 2023 年,格陵兰和南极冰盖合计损失约 11.3 万亿吨冰,对应全球平均海平面上升 3.14 厘米。 该研究由冰盖质量平衡比对计划(IMBIE)团队完成,相关论文已于 9 月 16 日发表在《自然》子刊《Scientific Data》上。 瑞典乌普萨拉大学研究员约翰 · 尼尔松参与了研究并提供卫星数据。研究汇集 27 项卫星任务数据,结合区域气候模型,对两大冰盖质量变化进行系统分析,共包括 42 项独立估算结果,其中 23 项涉及格陵兰,19 项涉及南极。卫星数据最早可追溯至 1972 年的格陵兰和 1979 年的南极,监测持续至 2023 年。 研究显示,两大冰盖的冰量损失速度在过去数十年明显加快。20 世纪 70 年代,格陵兰冰盖总体接近质量平衡,降雪带来的冰量增加与损失冰量大致相当。 20 世纪 80 年代,格陵兰冰盖年均冰...

    推荐理由:来自IT之家 AI的《研究显示:格陵兰和南极冰盖 1979~2023 年损失约 11.3 万亿吨冰》。重点看模型能力与工程。摘要提到:IT之家 9 月 19 日消息,据央视报道,一项基于卫星数据的最新国际研究显示,1979 年至 2023 年,格陵兰和南极冰盖合计损失约 11.3 万亿吨冰,对应全球平均海平面上升 3.14 厘米。 该研究由冰盖质量平衡比对计划(IMBIE)团队完成,相关论文已于 9 月 16 日发表在《自然》子刊《Scientific Data》上。 瑞典乌普萨拉大学研究员约翰 · 尼尔松参与了研究并提供卫星数据。研究汇集 27 项卫星任务数据,结合区域气候模型,对两大冰盖质量变化进行系统分析,共包括 42 项独立估算结果,其中 23 项涉及格陵兰,19 项涉及南极。卫星数据最早可追溯至 1972 年的格陵兰和 1979 年的南极,监测持续至 2023 年。 研究显示,两大冰盖的冰量损失速度在过去数十年明显加快。20 世纪 70 年代,格陵兰冰盖总体接近质量平衡,降雪带来的冰量增加与损失冰量大致相当。 20 世纪 80 年代,格陵兰冰盖年均冰...

  8. IT之家 AI70

    微软 Word 接入 ChatGPT,用户可 AI 起草、改写与校对文档

    IT之家 9 月 19 日消息,科技媒体 NeoWin 今天(9 月 19 日)发布博文,报道称 OpenAI 开放 ChatGPT for Microsoft Word, 免费用户也可在 Word 侧边栏调用 ChatGPT。 IT之家附上相关截图如下: 在适用范围上,现在所有 ChatGPT 套餐(包括免费版)均可使用。用户安装后,可在 Word 内看到 ChatGPT 侧边栏。 该插件可读取当前打开的文档作为上下文,用户可据此生成草稿、概括文档、改写选中文本、校对内容,并调整标题和格式。 OpenAI 还开展了一项限时促销活动,ChatGPT Business 和 Enterprise 客户可以从 9 月 17 日至 9 月 30 日免费在 Microsoft Word 中使用 GPT-5.6 Sol 模型,预览期间的使用量不会计入其正常的使用限制。

    推荐理由:来自IT之家 AI的《微软 Word 接入 ChatGPT,用户可 AI 起草、改写与校对文档》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 19 日消息,科技媒体 NeoWin 今天(9 月 19 日)发布博文,报道称 OpenAI 开放 ChatGPT for Microsoft Word, 免费用户也可在 Word 侧边栏调用 ChatGPT。 IT之家附上相关截图如下: 在适用范围上,现在所有 ChatGPT 套餐(包括免费版)均可使用。用户安装后,可在 Word 内看到 ChatGPT 侧边栏。 该插件可读取当前打开的文档作为上下文,用户可据此生成草稿、概括文档、改写选中文本、校对内容,并调整标题和格式。 OpenAI 还开展了一项限时促销活动,ChatGPT Business 和 Enterprise 客户可以从 9 月 17 日至 9 月 30 日免费在 Microsoft Word 中使用 GPT-5.6 Sol 模型,预览期间的使用量不会计入其正常的使用限制。

  9. 量子位37

    陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划”

    事实摘要:陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划” 让开放模型与可负担的算力成为数学研究的共享基石 这条动态来自 量子位,可重点关注模型能力与工程。 陶哲轩代表SAIR Foundation宣布正式启动“开放数学模型计划” 让开放模型与可负担的算力成为数学研究的共享基石。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. IT之家 AI70

    OpenAI 示警:先进 AI 可在 2 台相邻物理隔离 PC 间“对话”

    IT之家 9 月 19 日消息,科技媒体 Wccftech 昨日(9 月 18 日)发布博文,报道称在先进 AI 模型交互方面,物理隔离电脑未必能完全阻断两台相邻计算机间的信息交换。 OpenAI 研究员诺姆 · 布朗(Noam Brown)表示:“ 人类绝对不要低估 AI 的能力 ”,基于学术研究成果,发现相邻的物理隔离计算机可借 CPU 升温与温度传感器读数,形成低带宽隐蔽通信通道,充当“摩斯电码”通信。 IT之家注:物理隔离(Air Gap)指切断计算机或网络与其他系统之间的网络连接和数据链路。该措施常用于隔绝外部网络访问与数据外传路径。 研究报告指出,一台设备通过提高 CPU 负载推高温度,另一台设备读取环境或硬件温度变化。发送端可按预设节奏改变热量输出,接收端将温度波动解读为编码信息,由此形成极低带宽的隐蔽信道。 而现代 CPU、GPU 及主板普遍装有温度传感器。此类传感器主要服务于散热管理,例如调高风扇转速、降低芯片...

    推荐理由:来自IT之家 AI的《OpenAI 示警:先进 AI 可在 2 台相邻物理隔离 PC 间“对话”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 19 日消息,科技媒体 Wccftech 昨日(9 月 18 日)发布博文,报道称在先进 AI 模型交互方面,物理隔离电脑未必能完全阻断两台相邻计算机间的信息交换。 OpenAI 研究员诺姆 · 布朗(Noam Brown)表示:“ 人类绝对不要低估 AI 的能力 ”,基于学术研究成果,发现相邻的物理隔离计算机可借 CPU 升温与温度传感器读数,形成低带宽隐蔽通信通道,充当“摩斯电码”通信。 IT之家注:物理隔离(Air Gap)指切断计算机或网络与其他系统之间的网络连接和数据链路。该措施常用于隔绝外部网络访问与数据外传路径。 研究报告指出,一台设备通过提高 CPU 负载推高温度,另一台设备读取环境或硬件温度变化。发送端可按预设节奏改变热量输出,接收端将温度波动解读为编码信息,由此形成极低带宽的隐蔽信道。 而现代 CPU、GPU 及主板普遍装有温度传感器。此类传感器主要服务于散热管理,例如调高风扇转速、降低芯片...

  11. IT之家 AI74

    OpenAI 研究员示警:AI 能力越强,越容易“隐藏内心想法”

    IT之家 9 月 19 日消息,OpenAI 研究员诺姆 · 布朗(Noam Brown)最新表示,伴随着 AI 模型能力越来越强, 模型的思维链可监测性正逐渐下降,未来开发者可能无法有效、可靠地发现、解释并约束 AI 的风险行为。 IT之家查询公开资料,布朗目前在 OpenAI 公司担任研究科学家(Research Scientist),同时也是推理模型 o1、o3 系列的核心贡献者,目前领导多智能体研究团队。 因其创新性的工作,他被《麻省理工科技评论》(MIT Tech Review) 评为“35 位 35 岁以下创新者” (35 Innovators Under 35) 之一。 布朗表示:“思维链可监测性下降已成为主要问题,我们正努力寻找问题根源,从而扭转这种局势,但是我们发现 AI 模型能愈发自如地控制其思维链表达”。 研究人员原本希望从模型展示的中间推理中,看出它是否正在走向欺骗、规避规则或错误目标;但如果模型学会“隐...

    推荐理由:来自IT之家 AI的《OpenAI 研究员示警:AI 能力越强,越容易“隐藏内心想法”》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 19 日消息,OpenAI 研究员诺姆 · 布朗(Noam Brown)最新表示,伴随着 AI 模型能力越来越强, 模型的思维链可监测性正逐渐下降,未来开发者可能无法有效、可靠地发现、解释并约束 AI 的风险行为。 IT之家查询公开资料,布朗目前在 OpenAI 公司担任研究科学家(Research Scientist),同时也是推理模型 o1、o3 系列的核心贡献者,目前领导多智能体研究团队。 因其创新性的工作,他被《麻省理工科技评论》(MIT Tech Review) 评为“35 位 35 岁以下创新者” (35 Innovators Under 35) 之一。 布朗表示:“思维链可监测性下降已成为主要问题,我们正努力寻找问题根源,从而扭转这种局势,但是我们发现 AI 模型能愈发自如地控制其思维链表达”。 研究人员原本希望从模型展示的中间推理中,看出它是否正在走向欺骗、规避规则或错误目标;但如果模型学会“隐...

  12. IT之家 AI64

    微软发布 Win11 26H2 评估版 ISO 镜像:用于企业 IT 管理员测试新系统,可免费试用 90 天

    IT之家 9 月 19 日消息,微软现已开始发布基于 Windows 11 26H2 的评估版 ISO 镜像,用户可以免费下载并免费试用 90 天,无需激活。 IT之家注:评估版 ISO 主要面向企业 IT 管理员,用于提前测试评估新版本系统是否适合现有 IT 环境,微软并不建议普通家庭用户使用这一版本,目前提供的 ISO 基于最新的 KB5129195 OOB 更新,系统版本号为 Build 26300.9457:“ 26300.9457.260913-1737.26h2_ge_release_svc_refresh_CLIENTENTERPRISEEVAL_OEMRET_x64FRE_en-us.iso ”,IT之家附地址( 点此访问 )。 对于普通家庭用户,如果只是希望体验 Windows 11 26H2,微软已经更新 Media Creation Tool,因此使用该工具安装正式面向消费者的版本会更加便利。当然,如果只是...

    推荐理由:来自IT之家 AI的《微软发布 Win11 26H2 评估版 ISO 镜像:用于企业 IT 管理员测试新系统,可免费试用 90 天》。重点看评测与基准、产品发布。摘要提到:IT之家 9 月 19 日消息,微软现已开始发布基于 Windows 11 26H2 的评估版 ISO 镜像,用户可以免费下载并免费试用 90 天,无需激活。 IT之家注:评估版 ISO 主要面向企业 IT 管理员,用于提前测试评估新版本系统是否适合现有 IT 环境,微软并不建议普通家庭用户使用这一版本,目前提供的 ISO 基于最新的 KB5129195 OOB 更新,系统版本号为 Build 26300.9457:“ 26300.9457.260913-1737.26h2_ge_release_svc_refresh_CLIENTENTERPRISEEVAL_OEMRET_x64FRE_en-us.iso ”,IT之家附地址( 点此访问 )。 对于普通家庭用户,如果只是希望体验 Windows 11 26H2,微软已经更新 Media Creation Tool,因此使用该工具安装正式面向消费者的版本会更加便利。当然,如果只是...

  13. Claude Code Releases80

    Claude Code Releases v2.1.278:Changed auto mode for Claude API and Enterprise users, and...

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.278:Changed auto mode for Claude API and Enterprise users, and... 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.278:Cha。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. Simon Willison83

    Gemini Hacked Three Companies in First Known Breakout by Google’s AI

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Gemini Hacked Three Companies in First Known Breakout by Google’s AI 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Gemini Hacked Three Companies in Fir。影响判断:它可能改变模型能力与工程、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  15. Simon Willison81

    Note on 18th September 2026

    这条英文动态主要涉及模型能力与工程。原文要点:Being a computer scientist who refuses to find anything about LLMs interesting right now is a bit like being a geneticist who refuses to find anything interesting about the recently opened Jurassic Park. Skeptical geneticist: "pfft, it's just frog DNA. And they deliberately let them eat people for the marketing." Tags: llms , ai , generative-ai

    推荐理由:来自Simon Willison的《Note on 18th September 2026》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Being a computer scientist who refuses to find anything about LLMs interesting right now is a bit like being a geneticist who refuses to find anything interesting about the recently opened Jurassic Park. Skeptical geneticist: "pfft, it's just frog DNA. And they deliberately let them eat people for the marketing." Tags: llms , ai , generative-ai

  16. GitHub Changelog90

    Upcoming deprecation of selected GitHub Copilot models in mid-October

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Upcoming deprecation of selected GitHub Copilot models in mid-October 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Upcoming deprecation of selecte。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  17. Claude Code Releases84

    Claude Code Releases v2.1.277:Added AGENTS.md support: in a project with no CLAUDE.md, C...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.277:Added AGENTS.md support: in a project with no CLAUDE.md, C... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月18日周五
  1. IT之家 AI72

    全面追赶 OpenAI,消息称 Anthropic 计划在今年年底前拥有约 5 吉瓦可用算力、明年年底翻倍

    IT之家 9 月 18 日消息,在争夺顶尖模型性能的较量中,OpenAI 与 Anthropic 的竞争已进入白热化阶段。而这场较量的核心,正是训练与部署这些模型不可或缺的基础设施 —— 算力。 据纽约时报消息,过去几年里,OpenAI 在可用算力规模上始终占据领跑地位。据知情人士透露,截至去年,Anthropic 在可用算力储备上仍处于下风,其规模约为 1.5 吉瓦(GW),而 OpenAI 则已达到约 2 吉瓦。 消息称 Anthropic 已经制定了全面的追赶计划。多位知情人士表示,该 AI 实验室已告知投资者, 计划在今年年底前储备约 5 吉瓦规模的可用算力 ,并预计到明年年底将这一容量再度翻倍 。 而据掌握 OpenAI 内部预估数据的人士称,这一节奏已与 OpenAI 的扩容路径大体持平 —— 后者同样计划在今年达到约 5 吉瓦的算力规模,并在明年拓展至约 10 吉瓦。 IT之家注意到,在巨额算力支出的态度上,Ant...

    推荐理由:来自IT之家 AI的《全面追赶 OpenAI,消息称 Anthropic 计划在今年年底前拥有约 5 吉瓦可用算力、明年年底翻倍》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,在争夺顶尖模型性能的较量中,OpenAI 与 Anthropic 的竞争已进入白热化阶段。而这场较量的核心,正是训练与部署这些模型不可或缺的基础设施 —— 算力。 据纽约时报消息,过去几年里,OpenAI 在可用算力规模上始终占据领跑地位。据知情人士透露,截至去年,Anthropic 在可用算力储备上仍处于下风,其规模约为 1.5 吉瓦(GW),而 OpenAI 则已达到约 2 吉瓦。 消息称 Anthropic 已经制定了全面的追赶计划。多位知情人士表示,该 AI 实验室已告知投资者, 计划在今年年底前储备约 5 吉瓦规模的可用算力 ,并预计到明年年底将这一容量再度翻倍 。 而据掌握 OpenAI 内部预估数据的人士称,这一节奏已与 OpenAI 的扩容路径大体持平 —— 后者同样计划在今年达到约 5 吉瓦的算力规模,并在明年拓展至约 10 吉瓦。 IT之家注意到,在巨额算力支出的态度上,Ant...

  2. IT之家 AI68

    北京发布“词元经济十条”:高标准建设词元工厂,推动关键核心技术攻关

    IT之家 9 月 18 日消息,北京市经济和信息化局今日宣布, 北京市“词元经济十条”正式发布。 为贯彻落实《国务院关于深入实施“人工智能+”行动的意见》(国发〔2025〕11 号),率先培育智能经济新形态,以词元(Token)为抓手,发展词元经济新增量,制定 《 北京市加快词元经济发展的行动方案(2026—2028 年) 》 (IT之家注:以下简称《行动方案》)。 《行动方案》提出, 高标准建设词元工厂。 制定北京市词元工厂分级评价标准,覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、电能利用效率(PUE)等核心技术指标,优化土地资源、能耗指标、通信网络等要素保障,对具有行业引领力的词元工厂给予支持。 推动关键核心技术攻关。 加快基础模型技术迭代,提升模型智能上限水平。推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,高水平建设、调用智算资源,全面提升词元生产能力。 建立词元质量评测体系。 支持...

    推荐理由:来自IT之家 AI的《北京发布“词元经济十条”:高标准建设词元工厂,推动关键核心技术攻关》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 18 日消息,北京市经济和信息化局今日宣布, 北京市“词元经济十条”正式发布。 为贯彻落实《国务院关于深入实施“人工智能+”行动的意见》(国发〔2025〕11 号),率先培育智能经济新形态,以词元(Token)为抓手,发展词元经济新增量,制定 《 北京市加快词元经济发展的行动方案(2026—2028 年) 》 (IT之家注:以下简称《行动方案》)。 《行动方案》提出, 高标准建设词元工厂。 制定北京市词元工厂分级评价标准,覆盖模型适配数量、词元吞吐速度、首字延迟、缓存命中率、电能利用效率(PUE)等核心技术指标,优化土地资源、能耗指标、通信网络等要素保障,对具有行业引领力的词元工厂给予支持。 推动关键核心技术攻关。 加快基础模型技术迭代,提升模型智能上限水平。推动模型与芯片适配调优,支持推理专用芯片、模型轻量化、边缘端部署等技术攻关,高水平建设、调用智算资源,全面提升词元生产能力。 建立词元质量评测体系。 支持...

  3. 量子位66

    AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢

    事实摘要:AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 LimiX让模型理解数据背后的因果机制 这条动态来自 量子位,可重点关注模型能力与工程。 AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 LimiX让模型理解数据背后的因果机制。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI70

    消息称 Anthropic 低调建立生物实验室,借 AI 推进药学研究

    IT之家 9 月 18 日消息,路透社今天(18 日)晚间援引知情人士消息称,Anthropic 在旧金山湾区低调建立了一座湿实验室,把 AI 业务进一步延伸到 需要实际动手操作的生物学研究和药物科学领域 。 知情人士透露,在公众对 AI 风险愈发担忧之际,Anthropic 开始在湿实验室进行实体实验。Anthropic 此前提出,希望借助 AI 推动罕见病治疗方法的发展 ,公司的生物学研究也从“计算机模拟”和计算机评估进一步走向真实实验。 IT之家注:湿实验室是一个科学概念,与“干实验室”相对。相比干实验室,湿实验室在实验中需要 用到较多的化学试剂 。相比之下,干实验室则注重 通过各种仪器进行计算 ,以归纳出实验材料的物理模型。 Anthropic 生命科学负责人埃里克 · 考德勒-艾布拉姆斯证实了湿实验室的存在。“我们认为,生物学研究最终还是要 接受真实实验室工作的检验 ,而且未来一段时间都会如此。我们现在确实在做这些工作...

    推荐理由:来自IT之家 AI的《消息称 Anthropic 低调建立生物实验室,借 AI 推进药学研究》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,路透社今天(18 日)晚间援引知情人士消息称,Anthropic 在旧金山湾区低调建立了一座湿实验室,把 AI 业务进一步延伸到 需要实际动手操作的生物学研究和药物科学领域 。 知情人士透露,在公众对 AI 风险愈发担忧之际,Anthropic 开始在湿实验室进行实体实验。Anthropic 此前提出,希望借助 AI 推动罕见病治疗方法的发展 ,公司的生物学研究也从“计算机模拟”和计算机评估进一步走向真实实验。 IT之家注:湿实验室是一个科学概念,与“干实验室”相对。相比干实验室,湿实验室在实验中需要 用到较多的化学试剂 。相比之下,干实验室则注重 通过各种仪器进行计算 ,以归纳出实验材料的物理模型。 Anthropic 生命科学负责人埃里克 · 考德勒-艾布拉姆斯证实了湿实验室的存在。“我们认为,生物学研究最终还是要 接受真实实验室工作的检验 ,而且未来一段时间都会如此。我们现在确实在做这些工作...

  5. IT之家 AI70

    腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用

    IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBuddy 全栈「网页应用」生成,包括以下核心能力: 一站式制作发布: 页面生成、数据配置、上线发布闭环在 WorkBuddy 免部署: 不用买服务器、不配环境,发布即得访问链接 云数据库: 结构化数据存云端,支持增删改查,可配权限规则控制谁能读写 文件存储: 图片、附件等文件上传到云端并在应用内调用 注册登录: 内置身份认证,用户可注册登录,数据按用户隔离 免密钥 AI 调用: 直接调用大模型,不用自己申请和管理 API Key 运营数据统计: 上线后可查看用户数量、注册增长 IT之家注意到,随着 WorkBuddy 的资料库与「应用」(使用到云服务能力的应用)生成能力的上线,WorkBuddy...

    推荐理由:来自IT之家 AI的《腾讯 WorkBuddy 5.5.6 上线全栈网页应用生成能力,自带云数据库、文件存储、注册登录和 AI 调用》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 18 日消息,腾讯 WorkBuddy 宣布,WorkBuddy 5.5.6 上线全栈「应用」生成能力,首期支持全栈网页应用生成: 自带云数据库、文件存储、注册登录和 AI 调用 ,免部署,发布即用。 据介绍,WorkBuddy 全栈「网页应用」生成,包括以下核心能力: 一站式制作发布: 页面生成、数据配置、上线发布闭环在 WorkBuddy 免部署: 不用买服务器、不配环境,发布即得访问链接 云数据库: 结构化数据存云端,支持增删改查,可配权限规则控制谁能读写 文件存储: 图片、附件等文件上传到云端并在应用内调用 注册登录: 内置身份认证,用户可注册登录,数据按用户隔离 免密钥 AI 调用: 直接调用大模型,不用自己申请和管理 API Key 运营数据统计: 上线后可查看用户数量、注册增长 IT之家注意到,随着 WorkBuddy 的资料库与「应用」(使用到云服务能力的应用)生成能力的上线,WorkBuddy...

  6. IT之家 AI74

    消息称 Anthropic 和 OpenAI 正寻求规模较小的数据中心交易,争夺 AI 算力部署能力

    IT之家 9 月 18 日消息,据 CNBC 消息,知情人士透露,随着部署模型工作负载所需基础设施的争夺日趋白热化,Anthropic 和 OpenAI 正在寻求规模更小的人工智能数据中心合作。 过去一年中,这两家 AI 实验室曾就容量达数百兆瓦乃至吉瓦级的超大规模设施签署过重磅协议;但消息人士表示, 两家公司目前也开始寻求针对 20 至 30 兆瓦这一更小部署规模的算力合作 。 知情人士透露,Anthropic 已就该容量区间的协议在英国及北欧地区展开接触试探,OpenAI 也一直在北欧评估这类小容量部署的可行方案。此外,Anthropic 和 OpenAI 同样在美国针对该规模的算力部署展开过磋商。 IT之家注意到,在过去一年里,为了持续训练自身模型并向终端用户提供在线推理服务,两家公司密集公布了一系列 AI 基础设施协议。在当前的 AI 发展浪潮下,锁定规模更小的算力资源,有助于企业大幅缩短工作负载的落地交付周期。 Ope...

    推荐理由:来自IT之家 AI的《消息称 Anthropic 和 OpenAI 正寻求规模较小的数据中心交易,争夺 AI 算力部署能力》。重点看模型能力与工程。摘要提到:IT之家 9 月 18 日消息,据 CNBC 消息,知情人士透露,随着部署模型工作负载所需基础设施的争夺日趋白热化,Anthropic 和 OpenAI 正在寻求规模更小的人工智能数据中心合作。 过去一年中,这两家 AI 实验室曾就容量达数百兆瓦乃至吉瓦级的超大规模设施签署过重磅协议;但消息人士表示, 两家公司目前也开始寻求针对 20 至 30 兆瓦这一更小部署规模的算力合作 。 知情人士透露,Anthropic 已就该容量区间的协议在英国及北欧地区展开接触试探,OpenAI 也一直在北欧评估这类小容量部署的可行方案。此外,Anthropic 和 OpenAI 同样在美国针对该规模的算力部署展开过磋商。 IT之家注意到,在过去一年里,为了持续训练自身模型并向终端用户提供在线推理服务,两家公司密集公布了一系列 AI 基础设施协议。在当前的 AI 发展浪潮下,锁定规模更小的算力资源,有助于企业大幅缩短工作负载的落地交付周期。 Ope...