跳到正文
9月2日周三
  1. IT之家 AI70

    阿里千问 Qwen3.8-Max-0902 版本模型发布,拿下前端编程总榜冠军

    IT之家 9 月 2 日消息,阿里千问今日宣布 Qwen3.8-Max 模型升级到 0902 版本。 官方围绕编程(Coding)和专业办公(Cowork),对 Qwen3.8-Max 进行了进一步的后训练,使得模型整体性能再度突破, 更适合企业真实复杂任务、科研、长周期任务等 。 在 CodeArena 前端编程总榜中, Qwen3.8-Max 提升 22 分至 1691 分夺得冠军 。这说明,Qwen3.8-Max 拥有更强的智能体编程能力,在多步推理、工具调用、端到端 app 生成方面均刷新了全球模型的新上限。 同时,CodeArena 更新的模型性价比榜单(帕累托前沿)显示, Qwen3.8-Max-0902 新版本每百万 Tokens 综合平均价格为 5 美元 (IT之家注:现汇率约合 33.7 元人民币) ,而当前性能排名第二和第三的模型百万 Tokens 综合价格分别为 20 美元 (现汇率约合 134.7 元人民...

    推荐理由:来自IT之家 AI的《阿里千问 Qwen3.8-Max-0902 版本模型发布,拿下前端编程总榜冠军》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,阿里千问今日宣布 Qwen3.8-Max 模型升级到 0902 版本。 官方围绕编程(Coding)和专业办公(Cowork),对 Qwen3.8-Max 进行了进一步的后训练,使得模型整体性能再度突破, 更适合企业真实复杂任务、科研、长周期任务等 。 在 CodeArena 前端编程总榜中, Qwen3.8-Max 提升 22 分至 1691 分夺得冠军 。这说明,Qwen3.8-Max 拥有更强的智能体编程能力,在多步推理、工具调用、端到端 app 生成方面均刷新了全球模型的新上限。 同时,CodeArena 更新的模型性价比榜单(帕累托前沿)显示, Qwen3.8-Max-0902 新版本每百万 Tokens 综合平均价格为 5 美元 (IT之家注:现汇率约合 33.7 元人民币) ,而当前性能排名第二和第三的模型百万 Tokens 综合价格分别为 20 美元 (现汇率约合 134.7 元人民...

  2. IT之家 AI74

    编程能力追赶 OpenAI 与 Anthropic:谷歌 Gemini 3.8 Flash 最快当地时间周三上线,内部代号“Skimaki”

    IT之家 9 月 2 日消息,据《华尔街日报》当地时间 9 月 1 日报道,谷歌即将发布一款编程能力大幅升级的新模型 Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三上线。 在谷歌内部编程工具 Jetski 的对比测试中,工程师对 Gemini 3.8 Flash 的偏好程度超过了 Anthropic 的 Opus 模型。内部测试结果显示,Gemini 3.8 Flash 在编程方面显著缩小了谷歌与 Anthropic 和 OpenAI 之间的差距。 Gemini 3.8 Flash 的发布正值谷歌 DeepMind 经历重大人事调整之际。上月,DeepMind 联合创始人 Demis Hassabis 卸下日常管理职责,转任部门主席及 Alphabet 首席科学家。长期担任其副手的 Koray Kavukcuoglu 升任 DeepMind 高级副总裁,全面接手日常运营。Kavukc...

    推荐理由:来自IT之家 AI的《编程能力追赶 OpenAI 与 Anthropic:谷歌 Gemini 3.8 Flash 最快当地时间周三上线,内部代号“Skimaki”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 2 日消息,据《华尔街日报》当地时间 9 月 1 日报道,谷歌即将发布一款编程能力大幅升级的新模型 Gemini 3.8 Flash,内部代号为“Skimaki”。该模型最早可能于当地时间周三上线。 在谷歌内部编程工具 Jetski 的对比测试中,工程师对 Gemini 3.8 Flash 的偏好程度超过了 Anthropic 的 Opus 模型。内部测试结果显示,Gemini 3.8 Flash 在编程方面显著缩小了谷歌与 Anthropic 和 OpenAI 之间的差距。 Gemini 3.8 Flash 的发布正值谷歌 DeepMind 经历重大人事调整之际。上月,DeepMind 联合创始人 Demis Hassabis 卸下日常管理职责,转任部门主席及 Alphabet 首席科学家。长期担任其副手的 Koray Kavukcuoglu 升任 DeepMind 高级副总裁,全面接手日常运营。Kavukc...

  3. Simon Willison79

    Claude Fable 5.1 made me a really nice animated pelican

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Claude Fable 5.1 made me a really nice animated pelican 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Claude Fable 5.1 made me a really nice anim。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. Claude Code Releases82

    Claude Code Releases v2.1.258:Fixed Claude Code failing to launch on macOS 12 (Monterey)...

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.258:Fixed Claude Code failing to launch on macOS 12 (Monterey)... 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.258:Fix。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. IT之家 AI76

    Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75%

    IT之家 9 月 2 日消息,当地时间 9 月 1 日,Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1 模型。该公司称这两款模型为“全球最先进的编程与知识工作模型”。 Fable 5.1 与 Mythos 5.1 采用相同的基础模型,区别在于安全防护等级不同 ——Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过可信访问计划向经过审核的网络安全和生命科学领域的机构提供。 性能方面,Anthropic 披露的基准测试数据显示,Fable 5.1 在多项测试中超过了前代 Fable 5、Opus 5 以及 OpenAI 的 GPT-5.6 Sol。 在智能体科学研究基准 Terminal-Bench-Science 0.1 中,Fable 5.1 得分为 52.6%,而 Fable 5 为 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 为 2...

    推荐理由:来自IT之家 AI的《Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1:性能超越前代,缓存读取费用下调 75%》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 2 日消息,当地时间 9 月 1 日,Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1 模型。该公司称这两款模型为“全球最先进的编程与知识工作模型”。 Fable 5.1 与 Mythos 5.1 采用相同的基础模型,区别在于安全防护等级不同 ——Fable 5.1 面向所有用户开放,Mythos 5.1 仅通过可信访问计划向经过审核的网络安全和生命科学领域的机构提供。 性能方面,Anthropic 披露的基准测试数据显示,Fable 5.1 在多项测试中超过了前代 Fable 5、Opus 5 以及 OpenAI 的 GPT-5.6 Sol。 在智能体科学研究基准 Terminal-Bench-Science 0.1 中,Fable 5.1 得分为 52.6%,而 Fable 5 为 24.7%、Opus 5 为 29.0%、GPT-5.6 Sol 为 2...

  6. GitHub Changelog82

    Copilot code review can now approve pull requests

    事实摘要:Copilot code review can now approve pull requests。影响判断:It may change the way developers evaluate and approve pull requests in open-source projects.。场景价值:Tracking open-source project development direction, identifying competitors, or approving pull request decisions.。

    推荐理由:This feature allows developers to quickly approve pull requests based on their code review status.

  7. Simon Willison81

    Codex bundles LibreOffice

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Codex bundles LibreOffice 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Codex bundles LibreOffice 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Codex bundles LibreOffice 事实。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. Simon Willison77

    GeoJSON Map Viewer

    事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GeoJSON Map Viewer 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GeoJSON Map Viewer 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GeoJSON Map Viewer 事实摘要:这条英文动态主要涉及智能体工作流、开源生态。影响判断:它可能改变智能体工作流、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. Claude Code Releases86

    Claude Code Releases v2.1.257:Added Claude Fable 5.1 ( claude-fable-5-1 ), now the defau...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.257:Added Claude Fable 5.1 ( claude-fable-5-1 ), now the defau... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月1日周二
  1. Simon Willison83

    Python 3.15.0 candidate 2 is here!

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Python 3.15.0 candidate 2 is here! 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Python 3.15.0 candidate 2 is here! 事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文。影响判断:它可能改变模型能力与工程、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. GitHub Changelog89

    Claude Fable 5.1 is generally available in GitHub Copilot

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Fable 5.1 is generally available in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Fable 5.1 is generally available in GitHub Copilot。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI66

    安全公司曝光黑客组织 Aurora 内部信息:利用 Cursor AI 制定攻击计划、使用 Zig 语言开发勒索软件

    IT之家 9 月 1 日消息,安全公司 CloudSEK 发布报告,披露了黑客组织 Aurora(Aur0ra)近期攻击活动及内部细节。 IT之家参考通报获悉,CloudSEK 研究人员成功潜入了黑客配置错误的服务器,获取了黑客团队内部使用的攻击工具、借助 AI 制定攻击计划的记录,以及用于与受害者协商赎金的管理界面。 CloudSEK 研究人员进一步调查发现,相应黑客主要利用 AI 编程助手 Cursor 协助规划攻击行动,并未利用 AI 打造勒索软件。黑客自家的勒索软件主要利用 Zig 编程语言开发,目前拥有 Windows 以及 Linux / ESXi 版本。黑客将相应勒索软件部署于 Cloudflare R2 公开存储桶中,利用 SCP 协议将相关文件传输至受害主机。 公开信息显示,黑客组织 Aurora 从今年 4 月开始活跃,截至 7 月,已经有来自 9 个国家的 20 多家企业和组织遭到攻击。

    推荐理由:来自IT之家 AI的《安全公司曝光黑客组织 Aurora 内部信息:利用 Cursor AI 制定攻击计划、使用 Zig 语言开发勒索软件》。重点看产品发布。摘要提到:IT之家 9 月 1 日消息,安全公司 CloudSEK 发布报告,披露了黑客组织 Aurora(Aur0ra)近期攻击活动及内部细节。 IT之家参考通报获悉,CloudSEK 研究人员成功潜入了黑客配置错误的服务器,获取了黑客团队内部使用的攻击工具、借助 AI 制定攻击计划的记录,以及用于与受害者协商赎金的管理界面。 CloudSEK 研究人员进一步调查发现,相应黑客主要利用 AI 编程助手 Cursor 协助规划攻击行动,并未利用 AI 打造勒索软件。黑客自家的勒索软件主要利用 Zig 编程语言开发,目前拥有 Windows 以及 Linux / ESXi 版本。黑客将相应勒索软件部署于 Cloudflare R2 公开存储桶中,利用 SCP 协议将相关文件传输至受害主机。 公开信息显示,黑客组织 Aurora 从今年 4 月开始活跃,截至 7 月,已经有来自 9 个国家的 20 多家企业和组织遭到攻击。

  4. IT之家 AI70

    Meta AI 编程工具 Muse Code 结束测试,新增多项功能并开启订阅服务

    IT之家 9 月 1 日消息,Meta 今日宣布,旗下 AI 编程工具 Muse Code 已正式结束 Beta 测试,并推出多项新功能,包括会话间消息传递、工作流以及命令行界面的“回退”功能。同时,Meta 还发布了 SDK 开发者预览版,并开始推出订阅套餐,希望让用户能够更方便地上手使用。 Meta 表示,正式版 Muse Code 现在能够处理更加复杂的多会话、多智能体工程任务,并支持更多开发方式。 在 macOS 和 Linux 上安装 Muse Code 的过程非常简单,只需在终端中运行以下命令: curl -fsSL https://dev.meta.ai/install.sh | bash 安装完成后,用户可以通过 muse 命令启动该工具,并使用 Meta Model API 账户登录。不过,如果电脑不符合兼容性要求,则无法运行 Muse Code。 随着此次正式版更新,Muse Code 还加入了会话间消息传递...

    推荐理由:来自IT之家 AI的《Meta AI 编程工具 Muse Code 结束测试,新增多项功能并开启订阅服务》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 1 日消息,Meta 今日宣布,旗下 AI 编程工具 Muse Code 已正式结束 Beta 测试,并推出多项新功能,包括会话间消息传递、工作流以及命令行界面的“回退”功能。同时,Meta 还发布了 SDK 开发者预览版,并开始推出订阅套餐,希望让用户能够更方便地上手使用。 Meta 表示,正式版 Muse Code 现在能够处理更加复杂的多会话、多智能体工程任务,并支持更多开发方式。 在 macOS 和 Linux 上安装 Muse Code 的过程非常简单,只需在终端中运行以下命令: curl -fsSL https://dev.meta.ai/install.sh | bash 安装完成后,用户可以通过 muse 命令启动该工具,并使用 Meta Model API 账户登录。不过,如果电脑不符合兼容性要求,则无法运行 Muse Code。 随着此次正式版更新,Muse Code 还加入了会话间消息传递...

  5. IT之家 AI72

    端侧唯一百万 Token 上下文模型开源:科大讯飞词元星火 X2.5-4B&1.7B 正式发布

    IT之家 9 月 1 日消息,科大讯飞旗下词元星火今日宣布推出并开源星火 X2.5-4B 和星火 X2.5-1.7B 两款端侧通用大模型。 据介绍,两款模型原生支持最长 100 万 Token 上下文窗口,是目前端侧模型中唯一支持该量级上下文的产品。 两款模型采用混合注意力架构,围绕智能体、代码、数学和指令遵循等核心能力进行优化。基于全国产算力平台完成全流程训练,使用约 20 万亿 Token 多样化数据进行预训练。 以产品售后场景为例,用户可将完整售后手册导入模型,针对“购买 10 天后设备故障且使用过第三方耗材”等复杂问题,模型能够关联跨章节规定给出综合判断,并在新增条件下保持前文情境持续提供建议。 在个人办公场景中,星火 X2.5-4B 可完成从原始数据分析到双语报告交付的全流程。在 Domux 智能家居测试集上,星火 X2.5-1.7B 控制指令端到端执行正确率达 90.3%,平均响应时间 0.85 秒。模型还适用于机器...

    推荐理由:来自IT之家 AI的《端侧唯一百万 Token 上下文模型开源:科大讯飞词元星火 X2.5-4B&1.7B 正式发布》。重点看智能体工作流、模型能力与工程、开源生态。摘要提到:IT之家 9 月 1 日消息,科大讯飞旗下词元星火今日宣布推出并开源星火 X2.5-4B 和星火 X2.5-1.7B 两款端侧通用大模型。 据介绍,两款模型原生支持最长 100 万 Token 上下文窗口,是目前端侧模型中唯一支持该量级上下文的产品。 两款模型采用混合注意力架构,围绕智能体、代码、数学和指令遵循等核心能力进行优化。基于全国产算力平台完成全流程训练,使用约 20 万亿 Token 多样化数据进行预训练。 以产品售后场景为例,用户可将完整售后手册导入模型,针对“购买 10 天后设备故障且使用过第三方耗材”等复杂问题,模型能够关联跨章节规定给出综合判断,并在新增条件下保持前文情境持续提供建议。 在个人办公场景中,星火 X2.5-4B 可完成从原始数据分析到双语报告交付的全流程。在 Domux 智能家居测试集上,星火 X2.5-1.7B 控制指令端到端执行正确率达 90.3%,平均响应时间 0.85 秒。模型还适用于机器...

  6. GitHub Changelog80

    Selected GitHub Copilot models deprecated

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Selected GitHub Copilot models deprecated 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:Selected GitHub Copilot models deprecated 事实摘要:这条英文动态主要涉及智能。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. Claude Code Releases82

    Claude Code Releases v2.1.252:Fixed Bash commands failing with "task output swap refused...

    事实摘要:这条英文动态主要涉及智能体工作流,原文信息显示:Claude Code Releases v2.1.252:Fixed Bash commands failing with "task output swap refused... 事实摘要:这条英文动态主要涉及智能体工作流,原文信息显示:Claude Code Releases v2.1.252:Fixed。影响判断:它可能改变智能体工作流相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

8月31日周一
  1. GitHub Changelog82

    GitHub Copilot in VS Code, August 2026 releases

    事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GitHub Copilot in VS Code, August 2026 releases 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GitHub Copilot in VS Code, August 2026 releases 事实摘要:这条英文动态主要涉及智能体工作流。影响判断:它可能改变智能体工作流、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. IT之家 AI34

    Linux 7.3-rc1 发布,代码总行数达 4098 万行

    IT之家 8 月 31 日消息,Linus Torvalds 刚刚宣布,Linux 7.3-rc1 现已发布。他表示,这次更新并没有什么特别突出的内容,唯一明显的特点就是“体积很大”。 Linux 7.3-rc1 是在为期两周的合并窗口结束后推出的首个候选版本。在这两周时间里,大量新功能被并入 Linux 内核。接下来,Linux 7.3 将进入测试和修复阶段,预计还会经历 6 至 7 个候选版本,之后才会迎来正式稳定版。 Linux 7.3-rc1 体积明显增大的一个重要原因,是 AMD 提交了一大批 GPU 寄存器相关代码,这次主要涉及 AMD DCN6 的寄存器头文件。同时,与 AMD DCN6 相关的配套代码也进一步增加了此次更新的规模。 Torvalds 表示,仅 AMD GPU 相关代码和头文件的这次大规模提交,就占到了整个 Linux 7.3-rc1 补丁内容的约三分之一。 如果暂时不考虑这部分内容,Linux 7...

    推荐理由:来自IT之家 AI的《Linux 7.3-rc1 发布,代码总行数达 4098 万行》。重点看产品发布。摘要提到:IT之家 8 月 31 日消息,Linus Torvalds 刚刚宣布,Linux 7.3-rc1 现已发布。他表示,这次更新并没有什么特别突出的内容,唯一明显的特点就是“体积很大”。 Linux 7.3-rc1 是在为期两周的合并窗口结束后推出的首个候选版本。在这两周时间里,大量新功能被并入 Linux 内核。接下来,Linux 7.3 将进入测试和修复阶段,预计还会经历 6 至 7 个候选版本,之后才会迎来正式稳定版。 Linux 7.3-rc1 体积明显增大的一个重要原因,是 AMD 提交了一大批 GPU 寄存器相关代码,这次主要涉及 AMD DCN6 的寄存器头文件。同时,与 AMD DCN6 相关的配套代码也进一步增加了此次更新的规模。 Torvalds 表示,仅 AMD GPU 相关代码和头文件的这次大规模提交,就占到了整个 Linux 7.3-rc1 补丁内容的约三分之一。 如果暂时不考虑这部分内容,Linux 7...

  3. OpenAI News80

    Polimill builds Japan's next-generation public AI infrastructure

    这条英文动态主要涉及模型能力与工程。原文要点:Polimill uses OpenAI GPT models and Codex to help municipalities search and use administrative knowledge while accelerating development.

    推荐理由:来自OpenAI News的《Polimill builds Japan's next-generation public AI infrastructure》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Polimill uses OpenAI GPT models and Codex to help municipalities search and use administrative knowledge while accelerating development.

8月30日周日
  1. IT之家 AI70

    消息称字节跳动豆包大模型 2.2 将推迟发布,原计划 8 月推出

    IT之家 8 月 30 日消息,据白鲸实验室消息,字节跳动原计划于 8 月推出的豆包大模型 2.2 将推迟面世。 多位接近字节的人士称,延期的原因是,字节内部希望通过更充分的预训练和后训练,把编程、工具调用和 Agent 能力拉上去。 用更长的研发周期换一次更明显的能力提升 。 Seed 现在同时面对两件事,一边要推进下一代超大模型,一边又不能停止现有模型的正常迭代。所以, 2.2 更像是夹在两代模型之间的一次关键补强 。它既不能等到下一代超大模型完成再解决 Coding,也不能再用过去的方式简单迭代一次。 Coding 能力跻身第一梯队,是 Seed 团队在 2026 年的主要目标之一。报道称字节希望 Seed 模型的 Coding 能力在年底之前能产生类似智谱 GLM-5.2 和 Kimi-K3 的行业冲击力。 据 The Information 8 月 5 日报道,字节跳动创始人张一鸣在上个月的 Seed 团队全体会议上明...

    推荐理由:来自IT之家 AI的《消息称字节跳动豆包大模型 2.2 将推迟发布,原计划 8 月推出》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 8 月 30 日消息,据白鲸实验室消息,字节跳动原计划于 8 月推出的豆包大模型 2.2 将推迟面世。 多位接近字节的人士称,延期的原因是,字节内部希望通过更充分的预训练和后训练,把编程、工具调用和 Agent 能力拉上去。 用更长的研发周期换一次更明显的能力提升 。 Seed 现在同时面对两件事,一边要推进下一代超大模型,一边又不能停止现有模型的正常迭代。所以, 2.2 更像是夹在两代模型之间的一次关键补强 。它既不能等到下一代超大模型完成再解决 Coding,也不能再用过去的方式简单迭代一次。 Coding 能力跻身第一梯队,是 Seed 团队在 2026 年的主要目标之一。报道称字节希望 Seed 模型的 Coding 能力在年底之前能产生类似智谱 GLM-5.2 和 Kimi-K3 的行业冲击力。 据 The Information 8 月 5 日报道,字节跳动创始人张一鸣在上个月的 Seed 团队全体会议上明...

  2. IT之家 AI70

    日均峰值 11.3 起:报告称 2026 年已记录 1664 起 AI 失控事件,7 月环比增 93.76%

    IT之家 8 月 30 日消息,英国长期韧性中心(CLTR)于 8 月 28 日发布报告, 称其“失控观察站”在 2026 年 7 月共记录 306 起 AI 安全事件,比 6 月(158 起)增涨 93.67%。 “失控观察站”成立于 2026 年 2 月,获英国人工智能安全研究所资助,借助开源情报追踪 AI 系统违背操作者意图的案例。 报告列举的案例包括:智能体在对话中插入伪造用户消息以模拟同意、仿照用户写作风格编造删除源代码目录的指令、伪造“人工必须批准”规则下的授权信息并执行任务。 CLTR 表示,多数记录事件尚未导致重大伤害,但呈现出无视直接指令、规避防护、误导用户或以单一目标驱动有害操作等特征。 截至 2026 年 8 月 9 日,该观察站已识别 1664 起现实世界 AI 失控事件。 截至 8 月 7 日的 30 天内,观察站记录 338 起事件,日均 11.3 起,超过 2026 年 3 月创下的日均 10.5 ...

    推荐理由:来自IT之家 AI的《日均峰值 11.3 起:报告称 2026 年已记录 1664 起 AI 失控事件,7 月环比增 93.76%》。重点看智能体工作流、开源生态、产品发布。摘要提到:IT之家 8 月 30 日消息,英国长期韧性中心(CLTR)于 8 月 28 日发布报告, 称其“失控观察站”在 2026 年 7 月共记录 306 起 AI 安全事件,比 6 月(158 起)增涨 93.67%。 “失控观察站”成立于 2026 年 2 月,获英国人工智能安全研究所资助,借助开源情报追踪 AI 系统违背操作者意图的案例。 报告列举的案例包括:智能体在对话中插入伪造用户消息以模拟同意、仿照用户写作风格编造删除源代码目录的指令、伪造“人工必须批准”规则下的授权信息并执行任务。 CLTR 表示,多数记录事件尚未导致重大伤害,但呈现出无视直接指令、规避防护、误导用户或以单一目标驱动有害操作等特征。 截至 2026 年 8 月 9 日,该观察站已识别 1664 起现实世界 AI 失控事件。 截至 8 月 7 日的 30 天内,观察站记录 338 起事件,日均 11.3 起,超过 2026 年 3 月创下的日均 10.5 ...

  3. IT之家 AI68

    9 月 14 日起,Pro / Max / Team 用户 Claude Code 标准周限额永久 +25%

    IT之家 8 月 30 日消息,@ClaudeDevs 今天(8 月 30 日)在 X 平台发布推文,宣布自 2026 年 9 月 14 日起,针对 Pro、Max、Team 及按席位计费企业版用户, 将 Claude Code 标准计划的“标准周限额”永久上调 25%。 IT之家附上相关截图如下: 官方表示当前正在执行的临时 50% 增幅将延续至 9 月 13 日,随后被新的永久基准取代。以“原始标准限额 = 100%”为参照:当前临时政策下用户可用额度为 150%;9 月 14 日起将调整为 125%。 该媒体指出相对于“本周仍享受 50% 增幅”的状态,新限额意味着周可用容量下降约 17%((150−125)/150≈16.7%)。 相关阅读: 《 Anthropic 延长 Claude Code 每周使用额度 50% 加成至 8 月 31 日 》 《 Pro、Max 和 Team 用户 8 月 14 日起 Claude ...

    推荐理由:来自IT之家 AI的《9 月 14 日起,Pro / Max / Team 用户 Claude Code 标准周限额永久 +25%》。重点看评测与基准、产品发布。摘要提到:IT之家 8 月 30 日消息,@ClaudeDevs 今天(8 月 30 日)在 X 平台发布推文,宣布自 2026 年 9 月 14 日起,针对 Pro、Max、Team 及按席位计费企业版用户, 将 Claude Code 标准计划的“标准周限额”永久上调 25%。 IT之家附上相关截图如下: 官方表示当前正在执行的临时 50% 增幅将延续至 9 月 13 日,随后被新的永久基准取代。以“原始标准限额 = 100%”为参照:当前临时政策下用户可用额度为 150%;9 月 14 日起将调整为 125%。 该媒体指出相对于“本周仍享受 50% 增幅”的状态,新限额意味着周可用容量下降约 17%((150−125)/150≈16.7%)。 相关阅读: 《 Anthropic 延长 Claude Code 每周使用额度 50% 加成至 8 月 31 日 》 《 Pro、Max 和 Team 用户 8 月 14 日起 Claude ...

  4. IT之家 AI34

    微软 Win11 26H2 预览:174KB 启用包推送,任务栏可四边移动等

    IT之家 8 月 30 日消息,科技媒体 Windows Latest 昨日(8 月 29 日)发布博文,报道称微软已邀请 Release Preview 通道用户, 测试 Windows 11 26H2 更新,首个版本号为 26300.9278。 一、更新方式 Windows 11 26H2 通过启用包(enablement package)方式推送,体积约 174KB,与 24H2、25H2 共用同一服务分支,用户若从 23H2 升级,仍需下载接近 6.5GB 的完整系统更新。 Windows 11 26H2、25H2 和 24H2 功能更新均基于 Germanium 系列分支,微软此前已通过每月累积更新方式,提前向设备推送相关功能,只是默认处于关闭状态。 Windows 11 源代码分支的图形化表示 Windows 11 版本跃迁情况,图源:微软 版本变更方面,Windows 11 26H2 将启用 26300 前缀,首个...

    推荐理由:来自IT之家 AI的《微软 Win11 26H2 预览:174KB 启用包推送,任务栏可四边移动等》。重点看产品发布。摘要提到:IT之家 8 月 30 日消息,科技媒体 Windows Latest 昨日(8 月 29 日)发布博文,报道称微软已邀请 Release Preview 通道用户, 测试 Windows 11 26H2 更新,首个版本号为 26300.9278。 一、更新方式 Windows 11 26H2 通过启用包(enablement package)方式推送,体积约 174KB,与 24H2、25H2 共用同一服务分支,用户若从 23H2 升级,仍需下载接近 6.5GB 的完整系统更新。 Windows 11 26H2、25H2 和 24H2 功能更新均基于 Germanium 系列分支,微软此前已通过每月累积更新方式,提前向设备推送相关功能,只是默认处于关闭状态。 Windows 11 源代码分支的图形化表示 Windows 11 版本跃迁情况,图源:微软 版本变更方面,Windows 11 26H2 将启用 26300 前缀,首个...

  5. IT之家 AI70

    谷歌确认开发 WSL 支持:Antigravity 将直连 Win11 Linux 环境

    IT之家 8 月 30 日消息,科技媒体 Windows Latest 昨日(8 月 29 日)发布博文,报道称 谷歌计划为其 AI 编程智能体工具 Antigravity 扩展支持 WSL ,完善对 Windows 10、Windows 11 系统原生支持。 IT之家注:WSL 全称是 The Windows Subsystem for Linux,不需要安装双系统,可以让用户在 Windows 平台上调用 Linux 命令行、软件包与开发工具。 在已落地的产品侧,GitHub Copilot 桌面端于 8 月 26 日宣布实验性支持 WSL。用户可在“设置 → 实验性功能”中启用“WSL hosts(预览)”,连接已通过 wsl.exe 安装的 WSL 2 发行版,并使用 Linux 绝对路径注册项目。 谷歌 Antigravity 与 DeepMind 团队的高级开发者关系工程师 Rody Davis 发布推文,表示谷歌正...

    推荐理由:来自IT之家 AI的《谷歌确认开发 WSL 支持:Antigravity 将直连 Win11 Linux 环境》。重点看智能体工作流、开源生态、产品发布。摘要提到:IT之家 8 月 30 日消息,科技媒体 Windows Latest 昨日(8 月 29 日)发布博文,报道称 谷歌计划为其 AI 编程智能体工具 Antigravity 扩展支持 WSL ,完善对 Windows 10、Windows 11 系统原生支持。 IT之家注:WSL 全称是 The Windows Subsystem for Linux,不需要安装双系统,可以让用户在 Windows 平台上调用 Linux 命令行、软件包与开发工具。 在已落地的产品侧,GitHub Copilot 桌面端于 8 月 26 日宣布实验性支持 WSL。用户可在“设置 → 实验性功能”中启用“WSL hosts(预览)”,连接已通过 wsl.exe 安装的 WSL 2 发行版,并使用 Linux 绝对路径注册项目。 谷歌 Antigravity 与 DeepMind 团队的高级开发者关系工程师 Rody Davis 发布推文,表示谷歌正...

8月29日周六
  1. 量子位65

    Coding不再是程序员专属!阿里Qoder这波有点绝

    Coding正在变成Al世界的数字执行力 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

    推荐理由:来自量子位的《Coding不再是程序员专属!阿里Qoder这波有点绝》。重点看编码。摘要提到:Coding正在变成Al世界的数字执行力 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

  2. IT之家 AI68

    OpenAI ChatGPT、Codex 现已支持连接多个谷歌 Gmail 账号

    IT之家 8 月 29 日消息,OpenAI 开发者体验工程师 Gabriel Chua 今日确认, ChatGPT 和 Codex 用户现可连接多个谷歌 Gmail 和日历账号 。 据官方介绍,许多用户由于个人和工作安排,可能拥有多个 Gmail 或日历账户。此前 ChatGPT 和 Codex 只能连接一个 Google 账户,对用户来说较为不便。 如今 ChatGPT 和 Codex 支持多账户连接后,用户可以打开侧边栏的“插件”,找到 Gmail、Google 日历或 Google 联系人,然后添加多个账户。 IT之家注意到,ChatGPT 还可以在需要时,从多个已连接账户中提取相关信息,获得更加完整的通信、联系人关系和日程信息,据此提供更有用、更具上下文关联的回答。

    推荐理由:来自IT之家 AI的《OpenAI ChatGPT、Codex 现已支持连接多个谷歌 Gmail 账号》。重点看编码、部署/工程。摘要提到:IT之家 8 月 29 日消息,OpenAI 开发者体验工程师 Gabriel Chua 今日确认, ChatGPT 和 Codex 用户现可连接多个谷歌 Gmail 和日历账号 。 据官方介绍,许多用户由于个人和工作安排,可能拥有多个 Gmail 或日历账户。此前 ChatGPT 和 Codex 只能连接一个 Google 账户,对用户来说较为不便。 如今 ChatGPT 和 Codex 支持多账户连接后,用户可以打开侧边栏的“插件”,找到 Gmail、Google 日历或 Google 联系人,然后添加多个账户。 IT之家注意到,ChatGPT 还可以在需要时,从多个已连接账户中提取相关信息,获得更加完整的通信、联系人关系和日程信息,据此提供更有用、更具上下文关联的回答。

  3. IT之家 AI68

    Anthropic 官宣 Claude Code 打通桌面端与终端

    (原标题《 终于,Claude Code 打通了桌面端与终端! 》) 终端里干到一半的活,换个窗口就得从头再干一遍。今天,这事结束了。 就在刚刚,Anthropic 官宣, Claude Code 桌面端打通了终端会话! 在桌面端敲下 /resume ,历史会话列表就弹出来,点击任意一个之前在 CLI 终端里开过的工作会话,原样拉进桌面接着干。 完整对话记录、代码片段、之前一起理清的来龙去脉,一个不落地跟着搬。 更扎眼的是官方演示视频里的那张 Dashboard。 Claude Code 团队自己的工程师 Lydia Hallie,会话统计 1240 次、162.4M tokens,也就是 1.624 亿 Token 。 开发这个工具的人,自己攒下的会话已经是一笔沉甸甸的资产。 而在昨夜之前,就连她自己也被跨端的围墙卡着。 每天都在交的隐形税 泡在 Claude Code 里的人,都交过这笔税。 你在终端里起了个活,写到一半走开...

    推荐理由:来自IT之家 AI的《Anthropic 官宣 Claude Code 打通桌面端与终端》。重点看多模态、编码、部署/工程。摘要提到:(原标题《 终于,Claude Code 打通了桌面端与终端! 》) 终端里干到一半的活,换个窗口就得从头再干一遍。今天,这事结束了。 就在刚刚,Anthropic 官宣, Claude Code 桌面端打通了终端会话! 在桌面端敲下 /resume ,历史会话列表就弹出来,点击任意一个之前在 CLI 终端里开过的工作会话,原样拉进桌面接着干。 完整对话记录、代码片段、之前一起理清的来龙去脉,一个不落地跟着搬。 更扎眼的是官方演示视频里的那张 Dashboard。 Claude Code 团队自己的工程师 Lydia Hallie,会话统计 1240 次、162.4M tokens,也就是 1.624 亿 Token 。 开发这个工具的人,自己攒下的会话已经是一笔沉甸甸的资产。 而在昨夜之前,就连她自己也被跨端的围墙卡着。 每天都在交的隐形税 泡在 Claude Code 里的人,都交过这笔税。 你在终端里起了个活,写到一半走开...

  4. 极客公园72

    腾讯重金投入 AI 之后,混元 Hy4 preview 交出了什么答卷

    8 月 28 日,腾讯发布并开源混元 Hy4 preview。 这是继 Hy3 正式版之后,腾讯推出的新一代大模型:总参数从 295B 增加到 770B,激活参数从 21B 增加到 49B,上下文长度也从 256K 扩展至 1M。模型已经同步进入 WorkBuddy、CodeBuddy、元宝和 ima,并可通过腾讯云 TokenHub 及 OpenRouter 调用。 此外,Hy4 preview 继续走普惠的高性价比路线。根据公布的价格信息,Hy4 preview 输入 6 元/百万 tokens,输出 18 元/百万 tokens,缓存命中 0.3 元/百万 tokens。 Hy3 此前已经替腾讯验证过一次产品化路径。它在 7 月发布后迅速进入腾讯的办公、编程和内容产品;腾讯披露,其 API 调用量在发布一周后达到上一代模型的 68 倍以上。Hy3 的优势是实用和高性价比:降低幻觉与常识错误,改善工具调用和多轮承接,让网页、...

    推荐理由:来自极客公园的《腾讯重金投入 AI 之后,混元 Hy4 preview 交出了什么答卷》。重点看模型能力与工程、开源生态、产品发布。摘要提到:8 月 28 日,腾讯发布并开源混元 Hy4 preview。 这是继 Hy3 正式版之后,腾讯推出的新一代大模型:总参数从 295B 增加到 770B,激活参数从 21B 增加到 49B,上下文长度也从 256K 扩展至 1M。模型已经同步进入 WorkBuddy、CodeBuddy、元宝和 ima,并可通过腾讯云 TokenHub 及 OpenRouter 调用。 此外,Hy4 preview 继续走普惠的高性价比路线。根据公布的价格信息,Hy4 preview 输入 6 元/百万 tokens,输出 18 元/百万 tokens,缓存命中 0.3 元/百万 tokens。 Hy3 此前已经替腾讯验证过一次产品化路径。它在 7 月发布后迅速进入腾讯的办公、编程和内容产品;腾讯披露,其 API 调用量在发布一周后达到上一代模型的 68 倍以上。Hy3 的优势是实用和高性价比:降低幻觉与常识错误,改善工具调用和多轮承接,让网页、...

  5. IT之家 AI68

    Meta 为 Quest 头显推出 XR Operator 开发者工具,利用 AI 智能体快速测试 VR 游戏

    IT之家 8 月 29 日消息,Meta 宣布推出一款名为 Meta XR Operator 的实验性开发者工具,旨在让 AI 智能体测试 VR 应用,目前相应工具已集成在 Meta XR SDK v205 中,便于开发者调用。 Meta 表示,相应工具中的 AI 智能体可以基于开发者项目自主启动、截取画面、发现问题、修改代码并再次验证修复结果,从而形成完整的“构建 — 测试 — 验证”流程,这样开发者就不需要进行繁琐的摘下 / 戴上头显调试过程。 除了快速迭代调试外,XR Operator 还支持利用自然语言进行命令控制。开发者只需描述测试场景,AI 智能体就能自动执行测试,并通过截图等证据返回测试通过或失败的结果。 不过,XR Operator 目前还无法听取应用中的音频效果,亦无法准确评估动画运动效果及细微的视觉缺陷,因此 Meta 建议优先用于“静态且确定性较高的场景”。

    推荐理由:来自IT之家 AI的《Meta 为 Quest 头显推出 XR Operator 开发者工具,利用 AI 智能体快速测试 VR 游戏》。重点看智能体工作流。摘要提到:IT之家 8 月 29 日消息,Meta 宣布推出一款名为 Meta XR Operator 的实验性开发者工具,旨在让 AI 智能体测试 VR 应用,目前相应工具已集成在 Meta XR SDK v205 中,便于开发者调用。 Meta 表示,相应工具中的 AI 智能体可以基于开发者项目自主启动、截取画面、发现问题、修改代码并再次验证修复结果,从而形成完整的“构建 — 测试 — 验证”流程,这样开发者就不需要进行繁琐的摘下 / 戴上头显调试过程。 除了快速迭代调试外,XR Operator 还支持利用自然语言进行命令控制。开发者只需描述测试场景,AI 智能体就能自动执行测试,并通过截图等证据返回测试通过或失败的结果。 不过,XR Operator 目前还无法听取应用中的音频效果,亦无法准确评估动画运动效果及细微的视觉缺陷,因此 Meta 建议优先用于“静态且确定性较高的场景”。

  6. GitHub Changelog89

    GitHub Copilot in Visual Studio — August update

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GitHub Copilot in Visual Studio — August update 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GitHub Copilot in Visual Studio — August update 事实摘要:。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. Claude Code Releases93

    Claude Code Releases v2.1.251:Added PreModelSwitch and PostModelSwitch hook events (bloc...

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Code Releases v2.1.251:Added PreModelSwitch and PostModelSwitch hook events (bloc... 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Claude Co。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

8月28日周五
  1. IT之家 AI78

    OpenAI 开发“持久模式”智能体,Codex 将能够主动、长时间干活

    IT之家 8 月 28 日消息,当地时间 27 日,据《连线》杂志报道,OpenAI 在开发一种更主动、能够长时间持续工作的 Codex,希望让旗舰 AI 智能体不再局限于等待用户下达任务。 《连线》检查 Codex 近期的代码变更后发现,OpenAI 近几天开始在 Codex 命令行版本中 加入“持久模式” 。Codex 命令行工具的代码改动默认公开,OpenAI 的新功能通常也会先在这里出现,之后再扩展到 Codex 桌面应用和 ChatGPT Work 等产品。 持久模式目前仍处于测试阶段,尚未大范围开放,也没有正式发布。OpenAI 发言人也已确认,公司确实在测试该功能,但近期没有上线计划。 OpenAI 核心产品负责人蒂博 · 索蒂奥表示:“OpenAI 的文化非常自下而上,大家会在开源代码库里尝试很多不同的东西,那里有点像我们共同的试验场。” 持久模式出现在 Codex 的“推理强度”菜单中,用户可以 在模型回答问题...

    推荐理由:来自IT之家 AI的《OpenAI 开发“持久模式”智能体,Codex 将能够主动、长时间干活》。重点看智能体工作流、模型能力与工程、文化创意。摘要提到:IT之家 8 月 28 日消息,当地时间 27 日,据《连线》杂志报道,OpenAI 在开发一种更主动、能够长时间持续工作的 Codex,希望让旗舰 AI 智能体不再局限于等待用户下达任务。 《连线》检查 Codex 近期的代码变更后发现,OpenAI 近几天开始在 Codex 命令行版本中 加入“持久模式” 。Codex 命令行工具的代码改动默认公开,OpenAI 的新功能通常也会先在这里出现,之后再扩展到 Codex 桌面应用和 ChatGPT Work 等产品。 持久模式目前仍处于测试阶段,尚未大范围开放,也没有正式发布。OpenAI 发言人也已确认,公司确实在测试该功能,但近期没有上线计划。 OpenAI 核心产品负责人蒂博 · 索蒂奥表示:“OpenAI 的文化非常自下而上,大家会在开源代码库里尝试很多不同的东西,那里有点像我们共同的试验场。” 持久模式出现在 Codex 的“推理强度”菜单中,用户可以 在模型回答问题...