跳到正文
9月8日周二
  1. OpenAI News73

    1Password increases engineering productivity 21% with Codex

    这条英文动态主要涉及产品发布。原文要点:Engineers at 1Password use Codex to rapidly build new features and internal tools, reaching production-readiness while maintaining rigorous security policies.

    推荐理由:来自OpenAI News的《1Password increases engineering productivity 21% with Codex》。重点看产品发布。摘要提到:这条英文动态主要涉及产品发布。原文要点:Engineers at 1Password use Codex to rapidly build new features and internal tools, reaching production-readiness while maintaining rigorous security policies.

  2. Simon Willison82

    Video compressor

    事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显示:Video compressor 事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显示:Video compressor 事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显示:Video compressor 事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显。影响判断:它可能改变智能体工作流、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. Simon Willison79

    Mercator ↔ Equal Earth

    事实摘要:Mercator ↔ Equal Earth 事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显示:Mercator ↔ Equal Earth 事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显示:Mercator ↔ Equal Earth 事实摘要:这条英文动态主要涉及智能体工作流、文化创意,原文信息显示:Mercator 。影响判断:它可能改变智能体工作流、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月7日周一
  1. IT之家 AI74

    OpenAI GPT-6 Astra 模型自主通关 3D 解谜游戏《传送门》:耗时 24 小时,成本 571 美元

    IT之家 9 月 7 日消息,一名 AI 和大语言模型爱好者近日进行了一项实验,让 OpenAI 的新模型 GPT-6 Astra 自主通关了 Valve 旗下 3D 解谜游戏《传送门》。 从结果来看,这对大语言模型而言无疑是极具突破性的进步,也是对多模态“AI 智能”的一次颇具说服力的展示。不久之前,AI 甚至还会在 Atari 2600 国际象棋游戏中输掉比赛,而如今已经能够自主通关整个 3D 解谜游戏。 这次《传送门》通关过程共进行了 3336 次工具调用,按照 API 价格计算,成本达 571.18 美元 (IT之家注:现汇率约合 3,838 元人民币) 。 实验发起者 CozyBlaze 随后澄清称,这些成本实际上由其每月 200 美元 (现汇率约合 1,344 元人民币) 的 Codex Pro 订阅服务覆盖。 CozyBlaze 解释称:“模型通过 MCP,也就是 Model Context Protocol,以及...

    推荐理由:来自IT之家 AI的《OpenAI GPT-6 Astra 模型自主通关 3D 解谜游戏《传送门》:耗时 24 小时,成本 571 美元》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 7 日消息,一名 AI 和大语言模型爱好者近日进行了一项实验,让 OpenAI 的新模型 GPT-6 Astra 自主通关了 Valve 旗下 3D 解谜游戏《传送门》。 从结果来看,这对大语言模型而言无疑是极具突破性的进步,也是对多模态“AI 智能”的一次颇具说服力的展示。不久之前,AI 甚至还会在 Atari 2600 国际象棋游戏中输掉比赛,而如今已经能够自主通关整个 3D 解谜游戏。 这次《传送门》通关过程共进行了 3336 次工具调用,按照 API 价格计算,成本达 571.18 美元 (IT之家注:现汇率约合 3,838 元人民币) 。 实验发起者 CozyBlaze 随后澄清称,这些成本实际上由其每月 200 美元 (现汇率约合 1,344 元人民币) 的 Codex Pro 订阅服务覆盖。 CozyBlaze 解释称:“模型通过 MCP,也就是 Model Context Protocol,以及...

  2. IT之家 AI72

    一天烧 7000 美元!OpenAI 研究员疯狂用 AI 写代码

    IT之家 9 月 7 日消息,OpenAI 首次披露了旗下研究人员在 AI 编程智能体上的使用规模和成本。 这家 AI 公司当地时间上周日发布博客文章称,在 OpenAI 的研究人员中,使用 AI 编程智能体最频繁的一批用户,如今每天消耗的词元(Token)价值已经超过 7,000 美元 (IT之家注:现汇率约合 47,036 元人民币) 。Token 是 AI 模型读取和生成文本时使用的基本单位。 OpenAI 表示,在过去一年中,这项技术已经显著改变了公司研究人员的工作方式。员工编写和交付代码的速度更快,能够开展更多实验,同时也开始将越来越高级、更复杂的任务交给 AI 编程智能体完成。 该公司表示,过去三个月,研究人员使用 AI 编程智能体的规模出现爆发式增长,增长速度甚至超过 OpenAI 内部其他团队。 根据 OpenAI 公布的数据,截至 8 月中旬,该公司研究部门一名普通研究人员每天使用的 Token 价值中位数已经...

    推荐理由:来自IT之家 AI的《一天烧 7000 美元!OpenAI 研究员疯狂用 AI 写代码》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 7 日消息,OpenAI 首次披露了旗下研究人员在 AI 编程智能体上的使用规模和成本。 这家 AI 公司当地时间上周日发布博客文章称,在 OpenAI 的研究人员中,使用 AI 编程智能体最频繁的一批用户,如今每天消耗的词元(Token)价值已经超过 7,000 美元 (IT之家注:现汇率约合 47,036 元人民币) 。Token 是 AI 模型读取和生成文本时使用的基本单位。 OpenAI 表示,在过去一年中,这项技术已经显著改变了公司研究人员的工作方式。员工编写和交付代码的速度更快,能够开展更多实验,同时也开始将越来越高级、更复杂的任务交给 AI 编程智能体完成。 该公司表示,过去三个月,研究人员使用 AI 编程智能体的规模出现爆发式增长,增长速度甚至超过 OpenAI 内部其他团队。 根据 OpenAI 公布的数据,截至 8 月中旬,该公司研究部门一名普通研究人员每天使用的 Token 价值中位数已经...

  3. 极客公园74

    判断用不用你的软件,Agent 只需 500 个 Token

    作者|宇航猿 编辑|靖宇 现在几乎每个开发者都在用 AI Agent 干活。Cursor、Claude Code、Windsurf、Gemini CLI,各种 Coding Agent 已经深度嵌入了日常工作流。一个普遍的体验是,让 Agent 去调某些 API 或者集成某个服务,有些丝滑得像开了挂,有些则反复报错,甚至直接编造出一个根本不存在的接口。 大多数人把这归结为: 「 模型还不够聪明 」。 但如果反过来想, 不是 Agent 不够聪明,而是有些产品天然对 Agent 友好,有些则天然对 Agent 充满敌意 。 这像极了十几年前的 SEO。你觉得自己的网站内容很好,但 Google 就是不收录,问题不在 Google 的算法,而在于你的网站没有做搜索引擎优化。 今天同样的事情正在 Agent 身上重演,只不过这一次,大多数产品甚至不知道自己正在被「审判」。 Google Cloud AI 工程总监 Addy Osman...

    推荐理由:来自极客公园的《判断用不用你的软件,Agent 只需 500 个 Token》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:作者|宇航猿 编辑|靖宇 现在几乎每个开发者都在用 AI Agent 干活。Cursor、Claude Code、Windsurf、Gemini CLI,各种 Coding Agent 已经深度嵌入了日常工作流。一个普遍的体验是,让 Agent 去调某些 API 或者集成某个服务,有些丝滑得像开了挂,有些则反复报错,甚至直接编造出一个根本不存在的接口。 大多数人把这归结为: 「 模型还不够聪明 」。 但如果反过来想, 不是 Agent 不够聪明,而是有些产品天然对 Agent 友好,有些则天然对 Agent 充满敌意 。 这像极了十几年前的 SEO。你觉得自己的网站内容很好,但 Google 就是不收录,问题不在 Google 的算法,而在于你的网站没有做搜索引擎优化。 今天同样的事情正在 Agent 身上重演,只不过这一次,大多数产品甚至不知道自己正在被「审判」。 Google Cloud AI 工程总监 Addy Osman...

  4. IT之家 AI70

    科大讯飞星火 X2.5 模型正式发布:293B-A30B MoE,全国产平台训练

    IT之家 9 月 7 日消息,科大讯飞 (iFlytek) 今日正式发布星火 Spark-X2.5 多语言文本生成模型。该模型 基于全国产平台训练 ,采用 MoE 框架,模型参数 293B-A30B,支持 256K 上下文。 星火 X2.5 全面提升代码和智能体能力 ,同时覆盖 200 余种语言,在语言理解、答题、推理等通用任务上保持优异的效果。 这款模型目前已在讯飞星辰 MaaS 平台上线,定价如下: 输入:1.6 元人民币 / 百万词元 (Token); 输入缓存命中:0.24 元人民币 / 百万词元; 输出:6 元人民币 / 百万词元。

    推荐理由:来自IT之家 AI的《科大讯飞星火 X2.5 模型正式发布:293B-A30B MoE,全国产平台训练》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 7 日消息,科大讯飞 (iFlytek) 今日正式发布星火 Spark-X2.5 多语言文本生成模型。该模型 基于全国产平台训练 ,采用 MoE 框架,模型参数 293B-A30B,支持 256K 上下文。 星火 X2.5 全面提升代码和智能体能力 ,同时覆盖 200 余种语言,在语言理解、答题、推理等通用任务上保持优异的效果。 这款模型目前已在讯飞星辰 MaaS 平台上线,定价如下: 输入:1.6 元人民币 / 百万词元 (Token); 输入缓存命中:0.24 元人民币 / 百万词元; 输出:6 元人民币 / 百万词元。

9月6日周日
  1. IT之家 AI70

    微软借力 AI 重塑 Win11 应用生态:30 分钟即可生成 WinUI 原生应用

    IT之家 9 月 6 日消息,在普遍认为企业还不知道该如何真正利用 AI 的当下,微软却已经制定了一套计划:借助 AI,让更多原生 WinUI 应用进入 Microsoft Store。 IT之家注意到,微软近日发布了一份新的快速入门指南,帮助开发者利用 AI、VS Code 和自家的 winapp CLI,从一个空文件夹开始,一步步创建并发布 WinUI 3 应用。微软表示,整个流程大约只需要 30 分钟,而且无需安装 Visual Studio,使用的工具也都是免费的,包括 GitHub Copilot 的免费版本。 这份简单的 30 分钟指南,本质上是在吸引初学者为 Windows 11 开发应用,而且不必再经历传统开发中那些“繁重”的编码工作。 现在,任何人都可以借助 AI 创建一个新的 WinUI 应用,让 AI 智能体添加功能、测试结果,将应用打包成 MSIX,然后提交到 Microsoft Store,整个过程免费...

    推荐理由:来自IT之家 AI的《微软借力 AI 重塑 Win11 应用生态:30 分钟即可生成 WinUI 原生应用》。重点看智能体工作流、开源生态、产品发布。摘要提到:IT之家 9 月 6 日消息,在普遍认为企业还不知道该如何真正利用 AI 的当下,微软却已经制定了一套计划:借助 AI,让更多原生 WinUI 应用进入 Microsoft Store。 IT之家注意到,微软近日发布了一份新的快速入门指南,帮助开发者利用 AI、VS Code 和自家的 winapp CLI,从一个空文件夹开始,一步步创建并发布 WinUI 3 应用。微软表示,整个流程大约只需要 30 分钟,而且无需安装 Visual Studio,使用的工具也都是免费的,包括 GitHub Copilot 的免费版本。 这份简单的 30 分钟指南,本质上是在吸引初学者为 Windows 11 开发应用,而且不必再经历传统开发中那些“繁重”的编码工作。 现在,任何人都可以借助 AI 创建一个新的 WinUI 应用,让 AI 智能体添加功能、测试结果,将应用打包成 MSIX,然后提交到 Microsoft Store,整个过程免费...

  2. OpenAI News83

    Research acceleration: The view inside OpenAI

    这条英文动态主要涉及智能体工作流、产品发布。原文要点:Inside OpenAI, coding agents are reshaping AI research. Explore early data on agent usage, experiment velocity, task complexity, and research acceleration.

    推荐理由:来自OpenAI News的《Research acceleration: The view inside OpenAI》。重点看智能体工作流、产品发布。摘要提到:这条英文动态主要涉及智能体工作流、产品发布。原文要点:Inside OpenAI, coding agents are reshaping AI research. Explore early data on agent usage, experiment velocity, task complexity, and research acceleration.

  3. Claude Code Releases82

    Claude Code Releases v2.1.263:Bug fixes and reliability improvements

    这条英文动态讨论了 AI 领域的新进展。原文要点:What's changed Bug fixes and reliability improvements

    推荐理由:来自Claude Code Releases的《Claude Code Releases v2.1.263:Bug fixes and reliability improvements》。重点看模型发布、编码。摘要提到:这条英文动态讨论了 AI 领域的新进展。原文要点:What's changed Bug fixes and reliability improvements

  4. IT之家 AI72

    开源安卓应用商店 F-Droid 考虑效仿 Debian AI 政策:允许使用 AI,最终责任由贡献者承担

    IT之家 9 月 6 日消息,Debian 社区大语言模型投票议案上周迎来表决。投票结果显示,大部分开发者支持负责任地使用生成式 AI,如今开源安卓应用商店项目 F-Droid 也考虑采用类似的 AI 政策。 参考IT之家先前报道,本次投票一共有 9 种选项,范围从完全禁止大语言模型辅助开发,到允许特定条件使用 AI。投票结果将影响 Debian 开发者工作方式,以及开发组未来如何应对新 AI 工具。该投票采用孔多塞投票制,第 5 个选项“负责任地使用生成式 AI”最终胜出。 Debian 新政策并不禁止软件开发、文档编写流程使用生成式 AI。但是所有 AI 辅助生成的代码和文档,必须满足质量、法律合规要求,最终责任由人类开发者承担。Debian 不强制贡献者标注其代码是否使用 AI。虽然官方鼓励披露,但并不要求必须注明。 如今 F-Droid 社区也在考虑采用类似 Debian 的 AI 政策。当前阶段的拟议政策直接拷贝了 D...

    推荐理由:来自IT之家 AI的《开源安卓应用商店 F-Droid 考虑效仿 Debian AI 政策:允许使用 AI,最终责任由贡献者承担》。重点看模型能力与工程、开源生态。摘要提到:IT之家 9 月 6 日消息,Debian 社区大语言模型投票议案上周迎来表决。投票结果显示,大部分开发者支持负责任地使用生成式 AI,如今开源安卓应用商店项目 F-Droid 也考虑采用类似的 AI 政策。 参考IT之家先前报道,本次投票一共有 9 种选项,范围从完全禁止大语言模型辅助开发,到允许特定条件使用 AI。投票结果将影响 Debian 开发者工作方式,以及开发组未来如何应对新 AI 工具。该投票采用孔多塞投票制,第 5 个选项“负责任地使用生成式 AI”最终胜出。 Debian 新政策并不禁止软件开发、文档编写流程使用生成式 AI。但是所有 AI 辅助生成的代码和文档,必须满足质量、法律合规要求,最终责任由人类开发者承担。Debian 不强制贡献者标注其代码是否使用 AI。虽然官方鼓励披露,但并不要求必须注明。 如今 F-Droid 社区也在考虑采用类似 Debian 的 AI 政策。当前阶段的拟议政策直接拷贝了 D...

  5. Simon Willison89

    Introducing GPT-6 Astra for developers

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意,原文信息显示:Introducing GPT-6 Astra for developers 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意,原文信息显示:Introducing GPT-6 Astra for developers 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意,原文信息显示:In。影响判断:它可能改变模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. IT之家 AI66

    微软杰出工程师称手搓代码时代已结束,Win11 开发模式已迎巨变

    IT之家 9 月 6 日消息,在微软工作 18 年的杰出工程师大卫 · 福勒(David Fowler)前天在 X 平台表示,手搓代码的时代已经结束了。 据IT之家了解,大卫 · 福勒的这句话并不是在危言耸听。他曾开发过 SignalR、NuGet、Kudu 等项目,同时参与了 ASP.NET Core 核心部分的开发工作。当前阶段他正在微软负责 Aspire 项目。 并且这名微软员工并不是说开发者将不再阅读代码,也不是说传统软件工程职业彻底被摧毁。他想表达的是, 在 IDE 里手动敲代码 , 正成为软件开发工作中最没有吸引力的部分 。他目前参与的 Aspire 项目本身,也已经围绕 AI Coding 进行重新设计。 同时,大卫 · 福勒还在之前说过“Win11 原生应用正在回归”。后来我们可以看到,微软确实大力重拾 WinUI3 自带应用开发工作,而不是继续搞 Electron。 如今微软自己已经将 WinUI 3 列为新 ...

    推荐理由:来自IT之家 AI的《微软杰出工程师称手搓代码时代已结束,Win11 开发模式已迎巨变》。重点看编码、部署/工程。摘要提到:IT之家 9 月 6 日消息,在微软工作 18 年的杰出工程师大卫 · 福勒(David Fowler)前天在 X 平台表示,手搓代码的时代已经结束了。 据IT之家了解,大卫 · 福勒的这句话并不是在危言耸听。他曾开发过 SignalR、NuGet、Kudu 等项目,同时参与了 ASP.NET Core 核心部分的开发工作。当前阶段他正在微软负责 Aspire 项目。 并且这名微软员工并不是说开发者将不再阅读代码,也不是说传统软件工程职业彻底被摧毁。他想表达的是, 在 IDE 里手动敲代码 , 正成为软件开发工作中最没有吸引力的部分 。他目前参与的 Aspire 项目本身,也已经围绕 AI Coding 进行重新设计。 同时,大卫 · 福勒还在之前说过“Win11 原生应用正在回归”。后来我们可以看到,微软确实大力重拾 WinUI3 自带应用开发工作,而不是继续搞 Electron。 如今微软自己已经将 WinUI 3 列为新 ...

9月5日周六
  1. Simon Willison81

    Using Blender with coding agents on macOS

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:Using Blender with coding agents on macOS 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:Using Blender with coding agents on macOS 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. IT之家 AI36

    剧情推进约 67 年:暴雪《星际争霸》游戏新作线索曝光

    IT之家 9 月 5 日消息,科技媒体 NeoWin 昨日(9 月 4 日)发布博文,报道称暴雪娱乐旗下《星际争霸》(StarCraft)游戏官网近日出现画面与文字闪烁、失真的异常效果, 网友深入挖掘后发现多段隐藏信息。 在 2026 年暴雪嘉年华开幕(当地时间 9 月 12~13 日,北京时间 13~14 日)前约 1 周,网友访问《星际争霸》官方网站,发现网站图像和文本开始出现闪烁与故障化效果。报道称这种效果会随时间加重,呈现出新信号正在接入的视觉暗示。 IT之家援引博文介绍,这些“故障”引发玩家的探索欲望,随后网友 u/RaiausderDose 和 u/beyond1sgrasp 梳理了相关信息,发现官网代码出现替代现实游戏(Alternate Reality Game,ARG,也称侵入式虚拟现实互动游戏)相关内容。 页面信息显示,通讯记录的时间戳位于 2575 年 8 月至 9 月;若以《星际争霸 II:虚空之遗》约 ...

    推荐理由:来自IT之家 AI的《剧情推进约 67 年:暴雪《星际争霸》游戏新作线索曝光》。重点看产品发布。摘要提到:IT之家 9 月 5 日消息,科技媒体 NeoWin 昨日(9 月 4 日)发布博文,报道称暴雪娱乐旗下《星际争霸》(StarCraft)游戏官网近日出现画面与文字闪烁、失真的异常效果, 网友深入挖掘后发现多段隐藏信息。 在 2026 年暴雪嘉年华开幕(当地时间 9 月 12~13 日,北京时间 13~14 日)前约 1 周,网友访问《星际争霸》官方网站,发现网站图像和文本开始出现闪烁与故障化效果。报道称这种效果会随时间加重,呈现出新信号正在接入的视觉暗示。 IT之家援引博文介绍,这些“故障”引发玩家的探索欲望,随后网友 u/RaiausderDose 和 u/beyond1sgrasp 梳理了相关信息,发现官网代码出现替代现实游戏(Alternate Reality Game,ARG,也称侵入式虚拟现实互动游戏)相关内容。 页面信息显示,通讯记录的时间戳位于 2575 年 8 月至 9 月;若以《星际争霸 II:虚空之遗》约 ...

  3. IT之家 AI70

    匿名 AI 模型再现:又一 Alpha 上线 OpenCode,线索指向智谱

    IT之家 9 月 5 日消息, 在 Ox Alpha 确认为 GLM-5.3-Flash 原生多模态模型后 ,又一款名为 Omen Alpha 的模型昨日(9 月 4 日)上线 OpenCode Go 订阅计划 ,种种线索表明同样来自智谱公司。 费用方面,该模型目前仅对 OpenCode Go 订阅用户开放,月费 10 美元 (IT之家注:现汇率约合 67.4 元人民币) ,但单独提供 100 美元 (现汇率约合 673.6 元人民币) 的 Omen Alpha 用量额度。 平台设定了分层使用上限,每 5 小时请求数为 11,600,每周请求数为 29,000,而每月请求数为 57,900。每次请求 300 个输入 token,40,000 个缓存 token,100 个输出 token。 根据 OpenCode 的官网参考价格,Omen Alpha 的参考定价为输入 0.20 美元 (现汇率约合 1.3 元人民币) / 百万 ...

    推荐理由:来自IT之家 AI的《匿名 AI 模型再现:又一 Alpha 上线 OpenCode,线索指向智谱》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 5 日消息, 在 Ox Alpha 确认为 GLM-5.3-Flash 原生多模态模型后 ,又一款名为 Omen Alpha 的模型昨日(9 月 4 日)上线 OpenCode Go 订阅计划 ,种种线索表明同样来自智谱公司。 费用方面,该模型目前仅对 OpenCode Go 订阅用户开放,月费 10 美元 (IT之家注:现汇率约合 67.4 元人民币) ,但单独提供 100 美元 (现汇率约合 673.6 元人民币) 的 Omen Alpha 用量额度。 平台设定了分层使用上限,每 5 小时请求数为 11,600,每周请求数为 29,000,而每月请求数为 57,900。每次请求 300 个输入 token,40,000 个缓存 token,100 个输出 token。 根据 OpenCode 的官网参考价格,Omen Alpha 的参考定价为输入 0.20 美元 (现汇率约合 1.3 元人民币) / 百万 ...

  4. GitHub Changelog92

    GitHub Copilot weekly releases — August 31

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GitHub Copilot weekly releases — August 31 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GitHub Copilot weekly releases — August 31 事实摘要:这条英文动态主要涉及。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. Claude Code Releases88

    Claude Code Releases v2.1.261:Added an "Organization policy" line to /status and claude ...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.261:Added an "Organization policy" line to /status and claude ... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. GitHub Changelog93

    GPT-6 Astra is generally available in GitHub Copilot

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6 Astra is generally available in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6 Astra is generally available in GitHub Cop。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月4日周五
  1. IT之家 AI34

    苹果最强家庭影院方案曝光,4 台 HomePod 联动打造低延迟环绕声

    IT之家 9 月 4 日消息,网友 pdfu 昨日(9 月 3 日)在 MacRumors 论坛发帖,在 audioOS 27 系统的调音文件中, 发现苹果正在测试由 4 台 HomePod 组成的家庭影院方案。 IT之家注:帖子中的“audioOS”并非官方名称,是指运行在 HomePod 上的软件系统,负责播放、设备配对、房间声学分析和智能家居相关功能。 消息源称苹果公司在 audioOS 27 Beta 8(版本号为 24J5360a)中加入全新的调音文件,将扬声器划分为前左、前右、后左、后右 4 个角色,并为各位置提供独立声音处理。 前置扬声器将采用左右声道专属处理,并针对靠墙或角落摆放补偿声音表现。后置扬声器则采用全向声场处理,目标是覆盖听者身后及周围区域。 系统还计划管理每台设备的低音单元与高音单元,并控制低音、均衡器、同步和校准数据。HomePod 已可借助麦克风分析房间环境并校准单台或立体声组合;新代码把这一机制...

    推荐理由:来自IT之家 AI的《苹果最强家庭影院方案曝光,4 台 HomePod 联动打造低延迟环绕声》。重点看多模态、编码。摘要提到:IT之家 9 月 4 日消息,网友 pdfu 昨日(9 月 3 日)在 MacRumors 论坛发帖,在 audioOS 27 系统的调音文件中, 发现苹果正在测试由 4 台 HomePod 组成的家庭影院方案。 IT之家注:帖子中的“audioOS”并非官方名称,是指运行在 HomePod 上的软件系统,负责播放、设备配对、房间声学分析和智能家居相关功能。 消息源称苹果公司在 audioOS 27 Beta 8(版本号为 24J5360a)中加入全新的调音文件,将扬声器划分为前左、前右、后左、后右 4 个角色,并为各位置提供独立声音处理。 前置扬声器将采用左右声道专属处理,并针对靠墙或角落摆放补偿声音表现。后置扬声器则采用全向声场处理,目标是覆盖听者身后及周围区域。 系统还计划管理每台设备的低音单元与高音单元,并控制低音、均衡器、同步和校准数据。HomePod 已可借助麦克风分析房间环境并校准单台或立体声组合;新代码把这一机制...

  2. OpenAI News78

    GPT-6 Astra: A new generation of intelligence

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意,原文信息显示:GPT-6 Astra: A new generation of intelligence 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意,原文信息显示:GPT-6 Astra: A new generation of intelligence 事实摘要:这条英文动态主要涉及模型能力与工程、。影响判断:它可能改变模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. Claude Code Releases84

    Claude Code Releases v2.1.260:Added a diff panel that opens beside the conversation in f...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.260:Added a diff panel that opens beside the conversation in f... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI72

    智谱 GLM-5.3-Flash 夜间免费用:9 月 3 日至 20 日、每天 23 时至次日 9 时额度全免

    IT之家 9 月 4 日消息,智谱 AI 昨日宣布,旗下 GLM Coding Plan 正式推出“Flash × ZCode”夜间畅用活动。 即日起至 9 月 20 日,每晚 23:00 至次日 9:00,所有付费套餐用户无需手动开启,系统将自动生效优惠。活动期间,GLM Coding Plan 套餐中的 GLM-5.3-Flash 模型额度消耗规则如下: 通过智谱官方编程工具 ZCode 使用时,额度消耗为 0,实现完全免费畅用。 通过套餐支持的其他 Agent 使用时,可用额度翻倍(×2)。 IT之家提醒:本次活动仅针对 GLM-5.3-Flash 模型,错峰时段内若选用 GLM-5.3,仍按套餐标准规则消耗额度。活动时间以北京时间(UTC+8)为准,含周末及公共假日。 GLM-5.3-Flash 是 GLM-5 系列的首个原生多模态模型,支持 100 万 token 上下文窗口及文本、图像与视频多模态输入。 该模型一度以...

    推荐理由:来自IT之家 AI的《智谱 GLM-5.3-Flash 夜间免费用:9 月 3 日至 20 日、每天 23 时至次日 9 时额度全免》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 9 月 4 日消息,智谱 AI 昨日宣布,旗下 GLM Coding Plan 正式推出“Flash × ZCode”夜间畅用活动。 即日起至 9 月 20 日,每晚 23:00 至次日 9:00,所有付费套餐用户无需手动开启,系统将自动生效优惠。活动期间,GLM Coding Plan 套餐中的 GLM-5.3-Flash 模型额度消耗规则如下: 通过智谱官方编程工具 ZCode 使用时,额度消耗为 0,实现完全免费畅用。 通过套餐支持的其他 Agent 使用时,可用额度翻倍(×2)。 IT之家提醒:本次活动仅针对 GLM-5.3-Flash 模型,错峰时段内若选用 GLM-5.3,仍按套餐标准规则消耗额度。活动时间以北京时间(UTC+8)为准,含周末及公共假日。 GLM-5.3-Flash 是 GLM-5 系列的首个原生多模态模型,支持 100 万 token 上下文窗口及文本、图像与视频多模态输入。 该模型一度以...

  5. GitHub Changelog90

    Upcoming deprecation of selected GitHub Copilot models

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Upcoming deprecation of selected GitHub Copilot models 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Upcoming deprecation of selected GitHub Copilo。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. GitHub Changelog90

    Gemini 3.8 Flash is now available in GitHub Copilot

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Gemini 3.8 Flash is now available in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Gemini 3.8 Flash is now available in GitHub Copilot 事实摘要:这条英文动态。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月3日周四
  1. IT之家 AI74

    (更新:已恢复正常)ChatGPT、Grok、Claude、Cursor 集体突发故障

    【9 月 4 日 1:13 更新】目前文中提到的模型 / AI 工具官网“Status”主页均显示已经恢复正常。 IT之家 9 月 3 日消息,据IT之家网友投稿反馈,ChatGPT、Grok、Claude、Cursor 等多款 AI 模型今晚突发故障。此外,用户请求 Codex 会出现“404 Not Found”错误。 IT之家查询 Downdetector 报告获悉,美国用户使用 OpenAI、Claude、Grok、Cursor 服务时均出现问题。目前已有超过 12,000 份用户报告指出 OpenAI 存在问题,关于 Claude 的问题报告约有 1,200 份,关于 Grok 的问题报告约有 1,000 份。 各方回应: OpenAI:ChatGPT 和 Codex 目前正出现问题。 Anthropic:正在调查 Claude 出现的错误,将致力于修复工作。 SpaceXAI:Grok 目前出现故障,正在调查服务中断...

    推荐理由:来自IT之家 AI的《(更新:已恢复正常)ChatGPT、Grok、Claude、Cursor 集体突发故障》。重点看模型能力与工程。摘要提到:【9 月 4 日 1:13 更新】目前文中提到的模型 / AI 工具官网“Status”主页均显示已经恢复正常。 IT之家 9 月 3 日消息,据IT之家网友投稿反馈,ChatGPT、Grok、Claude、Cursor 等多款 AI 模型今晚突发故障。此外,用户请求 Codex 会出现“404 Not Found”错误。 IT之家查询 Downdetector 报告获悉,美国用户使用 OpenAI、Claude、Grok、Cursor 服务时均出现问题。目前已有超过 12,000 份用户报告指出 OpenAI 存在问题,关于 Claude 的问题报告约有 1,200 份,关于 Grok 的问题报告约有 1,000 份。 各方回应: OpenAI:ChatGPT 和 Codex 目前正出现问题。 Anthropic:正在调查 Claude 出现的错误,将致力于修复工作。 SpaceXAI:Grok 目前出现故障,正在调查服务中断...

  2. GitHub Changelog51

    CodeQL 2.26.4 improves GitHub actions security detections

    事实摘要:这条英文动态主要涉及开源生态,原文信息显示:CodeQL 2.26.4 improves GitHub actions security detections 事实摘要:这条英文动态主要涉及开源生态,原文信息显示:CodeQL 2.26.4 improves GitHub actions security detections 事实摘要:这条英文动态主要涉及。影响判断:它可能改变开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI66

    继鸿蒙之后,腾讯 WorkBuddy 再上线银河麒麟、统信操作系统

    IT之家 9 月 3 日消息,今日,腾讯 WorkBuddy 登陆银河麒麟操作系统和统信操作系统 UOS ,并上架其应用商店;同时也上架了 openKylin 社区和 deepin 社区的软件商店。 ▲ 银河麒麟软件商店 ▲ 统信应用商店 据介绍,此次对银河麒麟和统信 UOS 的适配并非简单的代码迁移。WorkBuddy 团队联合国产操作系统协同攻坚,围绕系统登录联动、设备互联交互、智能技能调用、任务成果预览等核心业务链路,进行全场景、定制化适配打磨,达成原生级运行效果。对用户而言,这意味着在 国产 Linux 操作系统 上,也能获得与其他主流平台一致且顺畅的完整体验。 用户在上述操作系统应用商店搜索“ WorkBuddy ”,即可一键下载安装,开箱即用,无需任何额外配置,WorkBuddy 新用户同样可享受 2000 免费积分。 值得一提的是,今年 7 月,WorkBuddy 鸿蒙 PC 版发布,成为鸿蒙平台首个桌面办公智能体...

    推荐理由:来自IT之家 AI的《继鸿蒙之后,腾讯 WorkBuddy 再上线银河麒麟、统信操作系统》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 3 日消息,今日,腾讯 WorkBuddy 登陆银河麒麟操作系统和统信操作系统 UOS ,并上架其应用商店;同时也上架了 openKylin 社区和 deepin 社区的软件商店。 ▲ 银河麒麟软件商店 ▲ 统信应用商店 据介绍,此次对银河麒麟和统信 UOS 的适配并非简单的代码迁移。WorkBuddy 团队联合国产操作系统协同攻坚,围绕系统登录联动、设备互联交互、智能技能调用、任务成果预览等核心业务链路,进行全场景、定制化适配打磨,达成原生级运行效果。对用户而言,这意味着在 国产 Linux 操作系统 上,也能获得与其他主流平台一致且顺畅的完整体验。 用户在上述操作系统应用商店搜索“ WorkBuddy ”,即可一键下载安装,开箱即用,无需任何额外配置,WorkBuddy 新用户同样可享受 2000 免费积分。 值得一提的是,今年 7 月,WorkBuddy 鸿蒙 PC 版发布,成为鸿蒙平台首个桌面办公智能体...

  4. IT之家 AI68

    图像编辑器 Paint.NET 首次登陆 Linux:开发者称 AI 辅助 3 周进展超 12 年总和

    IT之家 9 月 3 日消息,开发者里克 · 布鲁斯特(Rick Brewster)于 9 月 1 日在 X 平台发布推文,宣布发布 Paint.NET 5.2 Build 9739 版, 通过 Wine 首次实验性支持 Linux 平台。 布鲁斯特表示在开发过程中,遇到的最大障碍在于 Direct2D,这是微软专为 Windows 系统打造的 2D 图形 API,而 Paint.NET 长期依赖其完成界面与图像渲染。 由于 Wine 对 Direct2D 的原生支持并不完善,Brewster 没有选择等待,而是自行开发了内部替代方案,实现了软件所需的核心图形 API 功能。 布鲁斯特透露,得益于 AI 编程工具 Claude Code 的协助,此次 Linux 移植工作仅耗时约 3 周,取得的进展超过此前 12 年间历次尝试的总和。 尽管取得阶段性突破,布鲁斯特坦言当前实现仍存在运行缓慢、bug 频发,对于普通用户而言,目前还...

    推荐理由:来自IT之家 AI的《图像编辑器 Paint.NET 首次登陆 Linux:开发者称 AI 辅助 3 周进展超 12 年总和》。重点看产品发布。摘要提到:IT之家 9 月 3 日消息,开发者里克 · 布鲁斯特(Rick Brewster)于 9 月 1 日在 X 平台发布推文,宣布发布 Paint.NET 5.2 Build 9739 版, 通过 Wine 首次实验性支持 Linux 平台。 布鲁斯特表示在开发过程中,遇到的最大障碍在于 Direct2D,这是微软专为 Windows 系统打造的 2D 图形 API,而 Paint.NET 长期依赖其完成界面与图像渲染。 由于 Wine 对 Direct2D 的原生支持并不完善,Brewster 没有选择等待,而是自行开发了内部替代方案,实现了软件所需的核心图形 API 功能。 布鲁斯特透露,得益于 AI 编程工具 Claude Code 的协助,此次 Linux 移植工作仅耗时约 3 周,取得的进展超过此前 12 年间历次尝试的总和。 尽管取得阶段性突破,布鲁斯特坦言当前实现仍存在运行缓慢、bug 频发,对于普通用户而言,目前还...

  5. IT之家 AI68

    Anthropic 升级 Claude Code / Cowork,可后台操控用户 Mac

    IT之家 9 月 3 日消息,Anthropic 今天(9 月 3 日)在 X 平台发布推文, 宣布升级 Claude Cowork 和 Claude Code 的电脑控制功能,可以在后台操控用户 Mac。 在适配要求方面,官方要求使用 macOS 15 以及更高系统版本,桌面必须保持唤醒状态,Claude Desktop 应用需保持打开。IT之家附上相关截图如下: 在本次更新之后,在 macOS 平台上,用户在处理其它工作的同时,Claude 可以在后台通过屏幕交互完成点击、输入和导航操作。如需 Claude 接管全屏,可在设置中调整为“完全控制”模式。 该功能同时服务于 Claude Cowork 和 Claude Code 两个产品。Cowork 面向文档处理、文件整理、研究综合等知识工作,Code 专注开发任务。 目前仅限 Pro 和 Max 个人订阅用户,Team 和 Enterprise 计划尚未开放。Linux 版...

    推荐理由:来自IT之家 AI的《Anthropic 升级 Claude Code / Cowork,可后台操控用户 Mac》。重点看产品发布。摘要提到:IT之家 9 月 3 日消息,Anthropic 今天(9 月 3 日)在 X 平台发布推文, 宣布升级 Claude Cowork 和 Claude Code 的电脑控制功能,可以在后台操控用户 Mac。 在适配要求方面,官方要求使用 macOS 15 以及更高系统版本,桌面必须保持唤醒状态,Claude Desktop 应用需保持打开。IT之家附上相关截图如下: 在本次更新之后,在 macOS 平台上,用户在处理其它工作的同时,Claude 可以在后台通过屏幕交互完成点击、输入和导航操作。如需 Claude 接管全屏,可在设置中调整为“完全控制”模式。 该功能同时服务于 Claude Cowork 和 Claude Code 两个产品。Cowork 面向文档处理、文件整理、研究综合等知识工作,Code 专注开发任务。 目前仅限 Pro 和 Max 个人订阅用户,Team 和 Enterprise 计划尚未开放。Linux 版...

  6. IT之家 AI76

    欧洲最强 AI:西班牙公司推出 Quasar 438B 模型,1M 词元上下文

    IT之家 9 月 3 日消息,西班牙 AI 公司 Multiverse Computing 最新推出 Quasar 438B 模型,根据 Artificial Analysis 得分, 该模型 Intelligence Index v4.1.1 得分为 43,在参与比较的欧洲模型中排名最高。 IT之家注:该指数综合 9 项评测,覆盖智能体、代码、科学推理、通用知识和长上下文推理,是评估模型能力的主要基准之一。作为对比,Mistral Medium 3.5 得分为 30,NVIDIA Nemotron 3 Ultra 得分为 38。 该模型拥有 4,380 亿参数,定位为推理模型,主要面向企业级智能体、软件开发和复杂多步任务。Quasar 438B 支持英语和西班牙语,并已通过 CompactifAI API 提供访问。 在官方 X 推文下方的“背景信息”中,补充表示该模型可能基于智谱的 GLM5.2 模型制作。 该模型目前属于专...

    推荐理由:来自IT之家 AI的《欧洲最强 AI:西班牙公司推出 Quasar 438B 模型,1M 词元上下文》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 3 日消息,西班牙 AI 公司 Multiverse Computing 最新推出 Quasar 438B 模型,根据 Artificial Analysis 得分, 该模型 Intelligence Index v4.1.1 得分为 43,在参与比较的欧洲模型中排名最高。 IT之家注:该指数综合 9 项评测,覆盖智能体、代码、科学推理、通用知识和长上下文推理,是评估模型能力的主要基准之一。作为对比,Mistral Medium 3.5 得分为 30,NVIDIA Nemotron 3 Ultra 得分为 38。 该模型拥有 4,380 亿参数,定位为推理模型,主要面向企业级智能体、软件开发和复杂多步任务。Quasar 438B 支持英语和西班牙语,并已通过 CompactifAI API 提供访问。 在官方 X 推文下方的“背景信息”中,补充表示该模型可能基于智谱的 GLM5.2 模型制作。 该模型目前属于专...

  7. Claude Code Releases84

    Claude Code Releases v2.1.259:Added managedMcpServers managed setting: organizations can...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.259:Added managedMcpServers managed setting: organizations can... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. GitHub Blog AI53

    Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my!

    这条英文动态主要涉及开源生态。原文要点:From loop engineering to harnesses, squads, and open weights, the GitHub Podcast breaks down the AI terms showing up in developer conversations. The post Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my! appeared first on The GitHub Blog .

    推荐理由:来自GitHub Blog AI的《Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my!》。重点看开源生态。摘要提到:这条英文动态主要涉及开源生态。原文要点:From loop engineering to harnesses, squads, and open weights, the GitHub Podcast breaks down the AI terms showing up in developer conversations. The post Decoding the new AI lingo: Loops, harnesses, squads, hill climbing… oh my! appeared first on The GitHub Blog .

  9. GitHub Blog AI84

    How we make AI coding more cost efficient without sacrificing task quality

    事实摘要:这条英文动态主要涉及智能体工作流、文化创意、开源生态,原文信息显示:How we make AI coding more cost efficient without sacrificing task quality 事实摘要:这条英文动态主要涉及智能体工作流、文化创意、开源生态,原文信息显示:How we make AI coding more cost 。影响判断:它可能改变智能体工作流、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. IT之家 AI70

    谷歌推出 Gemini 3.8 Flash Cyber 模型,内部已全面部署用于代码安全防护

    IT之家 9 月 3 日消息,当地时间 9 月 2 日,谷歌宣布推出 Gemini 3.8 Flash Cyber 模型,通过 Fairwind 计划面向首批受信任的安全防护团队开放。 官方表示,在针对漏洞挖掘的行业权威基准测试 CyberGym 上,Gemini 3.8 Flash Cyber 展现出了顶尖水平的自主漏洞挖掘能力。不仅超越了前代 3.5 Flash Cyber,还将多款体量显著更大的前沿模型甩在身后。 谷歌在更全面的内部基准测试中对 Gemini 3.8 Flash Cyber 进行了评测。该测试要求模型在涵盖 20 种编程语言的复杂代码工程中,挖掘各类型的安全漏洞。结果表明,该模型相较于谷歌此前的模型实现了大幅跨越,漏洞挖掘成功率突破了 70%。 谷歌表示,在研发 Gemini 3.8 Flash Cyber 时,其核心目标是为安全防御方赋予专业级能力,使其在面对攻击方时能够占据主导优势。正因如此,谷歌从一开...

    推荐理由:来自IT之家 AI的《谷歌推出 Gemini 3.8 Flash Cyber 模型,内部已全面部署用于代码安全防护》。重点看模型能力与工程、评测与基准。摘要提到:IT之家 9 月 3 日消息,当地时间 9 月 2 日,谷歌宣布推出 Gemini 3.8 Flash Cyber 模型,通过 Fairwind 计划面向首批受信任的安全防护团队开放。 官方表示,在针对漏洞挖掘的行业权威基准测试 CyberGym 上,Gemini 3.8 Flash Cyber 展现出了顶尖水平的自主漏洞挖掘能力。不仅超越了前代 3.5 Flash Cyber,还将多款体量显著更大的前沿模型甩在身后。 谷歌在更全面的内部基准测试中对 Gemini 3.8 Flash Cyber 进行了评测。该测试要求模型在涵盖 20 种编程语言的复杂代码工程中,挖掘各类型的安全漏洞。结果表明,该模型相较于谷歌此前的模型实现了大幅跨越,漏洞挖掘成功率突破了 70%。 谷歌表示,在研发 Gemini 3.8 Flash Cyber 时,其核心目标是为安全防御方赋予专业级能力,使其在面对攻击方时能够占据主导优势。正因如此,谷歌从一开...

9月2日周三
  1. IT之家 AI74

    谷歌 Gemini 3.8 Flash 模型上线,适用软件工程、智能体任务等场景

    IT之家 9 月 2 日消息,谷歌今天(2 日)在 Google DeepMind 网站低调上线了 Gemini 3.8 Flash 模型。其基于 Gemini 3.7 Flash,拥有在软件工程和智能体知识工作流方面的性能提升,并持续支持可定制的努力水平,以控制质量、成本和延迟的组合。 不过截至IT之家发稿,谷歌官方暂未通过新闻稿或社媒平台官宣这一模型的存在。 Gemini 3.8 Flash 基于 Gemini 3.7 Flash,具有最高 1M 的 token 上下文窗口,文本支持 64K token 输出。官方还公布了多项基准测试评估结果,涵盖编程、知识处理、多模态处理能力、长上下文处理、计算机使用能力以及科学推理能力。 截至 2026 年 9 月的结果如下: 根据介绍,Gemini 3.8 Flash 面向个人用户、开发者和企业,适合以较低成本大规模部署通用型、可直接用于生产环境的智能体,典型用途包括 软件工程、智能体...

    推荐理由:来自IT之家 AI的《谷歌 Gemini 3.8 Flash 模型上线,适用软件工程、智能体任务等场景》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 2 日消息,谷歌今天(2 日)在 Google DeepMind 网站低调上线了 Gemini 3.8 Flash 模型。其基于 Gemini 3.7 Flash,拥有在软件工程和智能体知识工作流方面的性能提升,并持续支持可定制的努力水平,以控制质量、成本和延迟的组合。 不过截至IT之家发稿,谷歌官方暂未通过新闻稿或社媒平台官宣这一模型的存在。 Gemini 3.8 Flash 基于 Gemini 3.7 Flash,具有最高 1M 的 token 上下文窗口,文本支持 64K token 输出。官方还公布了多项基准测试评估结果,涵盖编程、知识处理、多模态处理能力、长上下文处理、计算机使用能力以及科学推理能力。 截至 2026 年 9 月的结果如下: 根据介绍,Gemini 3.8 Flash 面向个人用户、开发者和企业,适合以较低成本大规模部署通用型、可直接用于生产环境的智能体,典型用途包括 软件工程、智能体...

  2. Simon Willison83

    Claude's new system prompt really doesn't want to reproduce song lyrics

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude's new system prompt really doesn't want to reproduce song lyrics 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude's new system prompt re。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI76

    Kimi API 已原生支持 Codex 和 Claude Code

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程,原文信息显示:Kimi API 已原生支持 Codex 和 Claude Code IT之家 9 月 2 日消息,月之暗面宣布,为满足大家在 Codex 和 Claude Code 中接入 Kimi API 的需求,Kimi API 现已支持 OpenAI 的 Responses API 格式,base_ur。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI76

    AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜

    IT之家 9 月 2 日消息,Arena( arena.ai )平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。 国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 ...

    推荐理由:来自IT之家 AI的《AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,Arena( arena.ai )平台发布 2026 年第 35 周(8 月 24 日 ~8 月 30 日)AI 大模型盲测排行榜,本期有多款国产新模型亮相,且取得亮眼排名。 国产 GLM-5.3-Flash 首次进入代码榜 Top 10,Qwen3.8-Max-0902 首次入榜即登顶前端开发榜榜首,Kimi-K3-Max 稳定守住综合榜 Top 10 位置,整体来看国产模型在细分领域继续保持竞争力。 IT之家注 :本榜单基于 Arena( arena.ai )平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。 综合榜 本周综合榜头部格局稳定,Claude-Fable-5 以 1508 分蝉联榜首,Anthropic 多款模型占据前七位,排名变化均在 ...

  5. 量子位36

    阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一

    阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一 这条动态来自 量子位,可重点关注模型能力与工程。

    推荐理由:来自量子位的《阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一》。重点看模型能力与工程。摘要提到:阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一 这条动态来自 量子位,可重点关注模型能力与工程。