跳到正文
10月4日周日
  1. 极客公园78

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...

    推荐理由:来自极客公园的《Jev 之后,中国团队开始深挖 AI 的「直觉层」》。重点看模型能力与工程、评测与基准、文化创意。摘要提到:作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...

  2. IT之家 AI72

    OpenAI GPT-6 Astra 破解拿破仑 1809 年密信,揭示 217 年前军事部署

    IT之家 10 月 4 日消息,一名 AI 研究人员借助 OpenAI GPT-6 Astra 成功破解了一封拿破仑 · 波拿巴写于 1809 年的加密军事信件。这封信此前因密码本遗失,在过去 217 年里始终未能被完整解读。 该破解工作由 SentinelOne 员工、AI 工程师卡特 · 丘奇(Carter Church)完成。他表示,他使用 GPT-6 Astra 模型,从一张历史文献扫描图像开始,对信件进行文字识别和密码分析,整个过程约耗时 6 小时。 这封信写于 1809 年 3 月 16 日,当时奥地利正准备对法国开战。拿破仑致信自己的继子、意大利总督欧仁 · 德 · 博阿尔内(Eugène de Beauharnais),要求其通过加密信件向法国将领奥古斯特 · 德 · 马尔蒙(Auguste de Marmont)传递军事信息。现存文件开头包含一行普通法语,随后则是 24 行由数字、字母及自创符号组成的加密文本。...

    推荐理由:来自IT之家 AI的《OpenAI GPT-6 Astra 破解拿破仑 1809 年密信,揭示 217 年前军事部署》。重点看模型能力与工程、文化创意。摘要提到:IT之家 10 月 4 日消息,一名 AI 研究人员借助 OpenAI GPT-6 Astra 成功破解了一封拿破仑 · 波拿巴写于 1809 年的加密军事信件。这封信此前因密码本遗失,在过去 217 年里始终未能被完整解读。 该破解工作由 SentinelOne 员工、AI 工程师卡特 · 丘奇(Carter Church)完成。他表示,他使用 GPT-6 Astra 模型,从一张历史文献扫描图像开始,对信件进行文字识别和密码分析,整个过程约耗时 6 小时。 这封信写于 1809 年 3 月 16 日,当时奥地利正准备对法国开战。拿破仑致信自己的继子、意大利总督欧仁 · 德 · 博阿尔内(Eugène de Beauharnais),要求其通过加密信件向法国将领奥古斯特 · 德 · 马尔蒙(Auguste de Marmont)传递军事信息。现存文件开头包含一行普通法语,随后则是 24 行由数字、字母及自创符号组成的加密文本。...

10月3日周六
  1. IT之家 AI72

    如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等

    IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol⁠ 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna⁠适合大规模处理特定任务,以及目标明...

    推荐理由:来自IT之家 AI的《如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol⁠ 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna⁠适合大规模处理特定任务,以及目标明...

  2. IT之家 AI72

    OpenAI 披露:澳大利亚又一政府机构遭失控智能体入侵

    IT之家 10 月 3 日消息,据澳大利亚广播公司当地时间 10 月 2 日报道,澳大利亚新南威尔士州政府网站遭到了失控的 OpenAI 智能体侵入。 当地政府与 OpenAI 双方均证实,在此次发生于今年 6 月的事件中,并没有任何公众信息被读取。不过,官方直到本周才收到正式通报。 OpenAI 发言人在声明中称:“在察觉到这一异常活动后…… 我们立即组织了紧急的内部技术与法律审查,旨在结合当时正在推进的具体研究项目,彻查该行为的根本性质。” 审查一经结束,我们便向新南威尔士州州长办公室进行了情况汇报,并通报了澳大利亚信号局。 新南威尔士州州长和内阁部表示,该模型侵入的是国家公园和野生动物服务局的一个网页端应用程序,其中包含历史档案及火情监测数据。 IT之家注意到,在此之前,OpenAI 刚因非法渗入澳大利亚国民医疗保险门户网站一事公开致歉,并声称希望借此“重构与澳大利亚公众之间的信任”。 相关阅读: 《 已证实首例:澳大利亚...

    推荐理由:来自IT之家 AI的《OpenAI 披露:澳大利亚又一政府机构遭失控智能体入侵》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 3 日消息,据澳大利亚广播公司当地时间 10 月 2 日报道,澳大利亚新南威尔士州政府网站遭到了失控的 OpenAI 智能体侵入。 当地政府与 OpenAI 双方均证实,在此次发生于今年 6 月的事件中,并没有任何公众信息被读取。不过,官方直到本周才收到正式通报。 OpenAI 发言人在声明中称:“在察觉到这一异常活动后…… 我们立即组织了紧急的内部技术与法律审查,旨在结合当时正在推进的具体研究项目,彻查该行为的根本性质。” 审查一经结束,我们便向新南威尔士州州长办公室进行了情况汇报,并通报了澳大利亚信号局。 新南威尔士州州长和内阁部表示,该模型侵入的是国家公园和野生动物服务局的一个网页端应用程序,其中包含历史档案及火情监测数据。 IT之家注意到,在此之前,OpenAI 刚因非法渗入澳大利亚国民医疗保险门户网站一事公开致歉,并声称希望借此“重构与澳大利亚公众之间的信任”。 相关阅读: 《 已证实首例:澳大利亚...

10月2日周五
  1. IT之家 AI72

    OpenAI 通报逾百家第三方机构,自家智能体存在失控风险

    IT之家 10 月 2 日消息,当地时间 9 月 30 日晚,OpenAI 披露,旗下 AI 智能体或曾擅自尝试绕过安全防护, 或对百余家机构的系统造成负面影响 。 OpenAI 此次披露的信息显示,已知的 AI 智能体失控行为 涉及范围进一步扩大 。公司已向 100 多家第三方机构发出通知,告知这些机构发现了“智能体偏离预期的行为”。 目前,OpenAI 已对约 50PB 数据启动筛查,以了解其恶意智能体活动的全部范围。 IT之家获悉,具体情况包括 AI 智能体试图 让网站执行非预期命令、把网站当作共享留言板使用 ,以及绕过某些安全检查。 OpenAI 强调,收到通知 并不代表系统一定遭到入侵 。这些活动更接近于试探一扇上锁的门,而非真正破门而入。 OpenAI 表示,公司希望向受影响的第三方提供必要信息,以便调查和处理潜在的安全或其他技术问题。OpenAI 还承诺公开分享对模型行为、安全防护中新型薄弱环节的研究结果,帮助更广...

    推荐理由:来自IT之家 AI的《OpenAI 通报逾百家第三方机构,自家智能体存在失控风险》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 2 日消息,当地时间 9 月 30 日晚,OpenAI 披露,旗下 AI 智能体或曾擅自尝试绕过安全防护, 或对百余家机构的系统造成负面影响 。 OpenAI 此次披露的信息显示,已知的 AI 智能体失控行为 涉及范围进一步扩大 。公司已向 100 多家第三方机构发出通知,告知这些机构发现了“智能体偏离预期的行为”。 目前,OpenAI 已对约 50PB 数据启动筛查,以了解其恶意智能体活动的全部范围。 IT之家获悉,具体情况包括 AI 智能体试图 让网站执行非预期命令、把网站当作共享留言板使用 ,以及绕过某些安全检查。 OpenAI 强调,收到通知 并不代表系统一定遭到入侵 。这些活动更接近于试探一扇上锁的门,而非真正破门而入。 OpenAI 表示,公司希望向受影响的第三方提供必要信息,以便调查和处理潜在的安全或其他技术问题。OpenAI 还承诺公开分享对模型行为、安全防护中新型薄弱环节的研究结果,帮助更广...

  2. IT之家 AI74

    AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”

    IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...

    推荐理由:来自IT之家 AI的《AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...

  3. Apple Machine Learning Research54

    Language Discrimination Improves Linguistic Learning in Multilingual Speech Models

    这条英文动态主要涉及模型能力与工程。原文要点:Multilingual self-supervised speech models can benefit from sharing information across languages, but under a matched total pretraining data budget they still fall short of monolingual models. We show that strengthening the model’s ability to discriminate languages during pretraining reduces and, on some measures, closes this multilingual gap on continuous phonetic and higher-level linguistic measures, while preservi...

    推荐理由:来自Apple Machine Learning Research的《Language Discrimination Improves Linguistic Learning in Multilingual Speech Models》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Multilingual self-supervised speech models can benefit from sharing information across languages, but under a matched total pretraining data budget they still fall short of monolingual models. We show that strengthening the model’s ability to discriminate languages during pretraining reduces and, on some measures, closes this multilingual gap on continuous phonetic and higher-level linguistic m...

  4. Apple Machine Learning Research79

    Limits of Confidence in Diffusion

    这条英文动态主要涉及模型能力与工程。原文要点:Discrete diffusion, including remasking and uniform-state samplers, generate a sequence by writing multiple token positions per step, drawing each from a per-position distribution and choosing which positions to write from those same distributions. For domains of general interest (pixels, phonemes, or words) there are inherent dependencies between tokens. We show that a step matches the training distribution only whe...

    推荐理由:来自Apple Machine Learning Research的《Limits of Confidence in Diffusion》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Discrete diffusion, including remasking and uniform-state samplers, generate a sequence by writing multiple token positions per step, drawing each from a per-position distribution and choosing which positions to write from those same distributions. For domains of general interest (pixels, phonemes, or words) there are inherent dependencies between tokens. We show that a step matches the trainin...

  5. IT之家 AI72

    因违反敏感信息访问和共享规定,OpenAI 与三名研究人员终止合作

    IT之家 10 月 2 日消息,当地时间 1 日,根据《华尔街日报》报道,OpenAI 宣布与三名研究人员终止合作,原因是三人违反了 敏感信息访问和共享规定 。 OpenAI 发言人在声明中说:“我们已与三名违反公司敏感信息访问和处理规定的人员解除关系。调查确认,这些人员 绕过公司既定流程,不当处理敏感信息 ,不仅违反了公司规定,也破坏了我们工作所必需的信任。” 三人名叫贾斯敏 · 王、托梅克 · 科尔巴克和米基塔 · 巴莱斯尼。 遭解雇的托梅克 · 科尔巴克是 OpenAI 安全团队成员。他曾称,在 Redwood Research 和非营利组织 METR 调查 Hugging Face 事件期间,自己担任 OpenAI 方面的技术联系人。 另外两名遭解雇员工贾斯敏 · 王和米基塔 · 巴莱斯尼从事模型对齐研究,主要研究如何让 OpenAI 的模型按照人类意图行事。 据IT之家了解,涉事员工被指将公司机密信息 提供给一家第三方...

    推荐理由:来自IT之家 AI的《因违反敏感信息访问和共享规定,OpenAI 与三名研究人员终止合作》。重点看模型能力与工程。摘要提到:IT之家 10 月 2 日消息,当地时间 1 日,根据《华尔街日报》报道,OpenAI 宣布与三名研究人员终止合作,原因是三人违反了 敏感信息访问和共享规定 。 OpenAI 发言人在声明中说:“我们已与三名违反公司敏感信息访问和处理规定的人员解除关系。调查确认,这些人员 绕过公司既定流程,不当处理敏感信息 ,不仅违反了公司规定,也破坏了我们工作所必需的信任。” 三人名叫贾斯敏 · 王、托梅克 · 科尔巴克和米基塔 · 巴莱斯尼。 遭解雇的托梅克 · 科尔巴克是 OpenAI 安全团队成员。他曾称,在 Redwood Research 和非营利组织 METR 调查 Hugging Face 事件期间,自己担任 OpenAI 方面的技术联系人。 另外两名遭解雇员工贾斯敏 · 王和米基塔 · 巴莱斯尼从事模型对齐研究,主要研究如何让 OpenAI 的模型按照人类意图行事。 据IT之家了解,涉事员工被指将公司机密信息 提供给一家第三方...

  6. GitHub Changelog86

    GitHub Copilot in VS Code, September 2026 releases

    事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GitHub Copilot in VS Code, September 2026 releases 事实摘要:这条英文动态主要涉及智能体工作流、开源生态,原文信息显示:GitHub Copilot in VS Code, September 2026 releases 事实摘要:这条英文动态主要涉及。影响判断:它可能改变智能体工作流、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

10月1日周四
  1. GitHub Changelog51

    Actions Runner Controller release 0.15.0

    事实摘要:这条英文动态主要涉及开源生态,原文信息显示:Actions Runner Controller release 0.15.0 事实摘要:这条英文动态主要涉及开源生态,原文信息显示:Actions Runner Controller release 0.15.0 事实摘要:这条英文动态主要涉及开源生态,原文信息显示:Actions Runner Control。影响判断:它可能改变开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. IT之家 AI74

    微软更新 1.140 版 VS Code:多文件夹会话、远程 AI Agent 任务委派等

    IT之家 10 月 1 日消息,微软昨日(9 月 30 日)更新推出 1.140 稳定版 Visual Studio Code,本次更新重点围绕 GitHub Copilot Agent 工作流展开, 新增多文件夹会话、远程任务委派、模型协同编排及企业级 AI 管理能力。 VS Code 1.140 引入实验性多文件夹会话功能。同一 Agent 会话中的不同聊天,可以分别绑定到不同代码仓库或 Git worktree,彼此之间的终端、任务、代码变更、Pull Request 和合并状态相互隔离,避免修改意外串联。 本次更新还增强 Copilot harness,由 Copilot SDK 提供支持,在基于智能体主机协议 (AHP) 的专用智能体主机进程中运行,统一 VS Code、Copilot 应用和 Copilot CLI 的 Agent 行为。 本次更新还以研究预览形式,推出 HydraFusion 模型编排,自动选择模型...

    推荐理由:来自IT之家 AI的《微软更新 1.140 版 VS Code:多文件夹会话、远程 AI Agent 任务委派等》。重点看智能体工作流、模型能力与工程、开源生态。摘要提到:IT之家 10 月 1 日消息,微软昨日(9 月 30 日)更新推出 1.140 稳定版 Visual Studio Code,本次更新重点围绕 GitHub Copilot Agent 工作流展开, 新增多文件夹会话、远程任务委派、模型协同编排及企业级 AI 管理能力。 VS Code 1.140 引入实验性多文件夹会话功能。同一 Agent 会话中的不同聊天,可以分别绑定到不同代码仓库或 Git worktree,彼此之间的终端、任务、代码变更、Pull Request 和合并状态相互隔离,避免修改意外串联。 本次更新还增强 Copilot harness,由 Copilot SDK 提供支持,在基于智能体主机协议 (AHP) 的专用智能体主机进程中运行,统一 VS Code、Copilot 应用和 Copilot CLI 的 Agent 行为。 本次更新还以研究预览形式,推出 HydraFusion 模型编排,自动选择模型...

  3. IT之家 AI72

    旗下智能体被指试图入侵加拿大政府网站,OpenAI 回应称正审查并已通报

    IT之家 10 月 1 日消息,据《华盛顿邮报》今天(1 日)上午报道,研究人员披露,AI 智能体曾在没有收到指令的情况下试图入侵加拿大政府网站。 目前的类似事件不断增加,许多与 OpenAI 有关的 AI 智能体都曾自行探测或入侵企业及政府的计算机系统。 AI 研究非营利机构 Transluce 指出,这些智能体能够直接操作计算机和互联网,曾尝试访问加拿大图书档案馆。 研究人员无法确认这些智能体是否出自 OpenAI,然而其行为 与已确认来自 OpenAI 的智能体相似 。Transluce 判断,此次入侵尝试没有成功。 IT之家从报道中获悉,当地时间 9 月 30 日,研究人员 向加拿大政府通报了情况 。加拿大联邦网络安全机构回应称,目前已注意到有关可疑 AI 活动的报告,但没有迹象显示政府系统遭到入侵。 OpenAI 发言人回应称:“我们注意到有关 OpenAI 模型试图访问加拿大政府网站公开信息的报告。我们正在审查这些发...

    推荐理由:来自IT之家 AI的《旗下智能体被指试图入侵加拿大政府网站,OpenAI 回应称正审查并已通报》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 1 日消息,据《华盛顿邮报》今天(1 日)上午报道,研究人员披露,AI 智能体曾在没有收到指令的情况下试图入侵加拿大政府网站。 目前的类似事件不断增加,许多与 OpenAI 有关的 AI 智能体都曾自行探测或入侵企业及政府的计算机系统。 AI 研究非营利机构 Transluce 指出,这些智能体能够直接操作计算机和互联网,曾尝试访问加拿大图书档案馆。 研究人员无法确认这些智能体是否出自 OpenAI,然而其行为 与已确认来自 OpenAI 的智能体相似 。Transluce 判断,此次入侵尝试没有成功。 IT之家从报道中获悉,当地时间 9 月 30 日,研究人员 向加拿大政府通报了情况 。加拿大联邦网络安全机构回应称,目前已注意到有关可疑 AI 活动的报告,但没有迹象显示政府系统遭到入侵。 OpenAI 发言人回应称:“我们注意到有关 OpenAI 模型试图访问加拿大政府网站公开信息的报告。我们正在审查这些发...

  4. Apple Machine Learning Research85

    How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?

    这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Recent autonomous machine learning engineering (MLE) agents have made significant progress on public leaderboards. Often motivated by progress stagnation over long-horizon cycles and limited Large Language Model (LLM) primitives, modern MLE agents are deployed on top of increasingly elaborate machinery: multi-agent orchestrators, dedicated retrieval subagents, and more. While such harnesses expand, the use of more pr...

    推荐理由:来自Apple Machine Learning Research的《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Recent autonomous machine learning engineering (MLE) agents have made significant progress on public leaderboards. Often motivated by progress stagnation over long-horizon cycles and limited Large Language Model (LLM) primitives, modern MLE agents are deployed on top of increasingly elaborate machinery: multi-agent orchestrators, dedicated retrieval subagents, and more. While such ...

9月30日周三
  1. GitHub Changelog87

    HydraFusion in VS Code and the GitHub Copilot app

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:HydraFusion in VS Code and the GitHub Copilot app 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:HydraFusion in VS Code and the GitHub Copilot app 事实摘要:这条英文动态主要涉及。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. 量子位76

    OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜

    事实摘要:OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜 千禧年难题的突破,10000个Agent最多占了10%的功劳。 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程。 OpenAI推理之父最新访谈!数学只是多智能体时代的开胃菜 千禧年难题的突破,10000个Agent最多占了10%的功劳。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI70

    蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数

    IT之家 9 月 30 日消息,蚂蚁百灵今日发布 Ling-3.1-flash 模型,拥有约 560B 总参数,每个 Token 激活约 25B 参数; 模型上下文窗口上限为 1M ,可容纳更长的文档、代码和任务历史。 官方表示,在研发过程中,围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景持续提升模型能力。 此外, Ling-3.1-flash 将开放为期两周的免费体验 ;考虑到综合服务成本,免费体验期间模型服务长度为 256K。 免费体验期结束并转为付费服务后,计划开放 1M 上下文。届时, 团队也计划同步开源 ,并继续更新模型性能。 IT之家附这款模型在多个任务评测中得分如下:

    推荐理由:来自IT之家 AI的《蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 30 日消息,蚂蚁百灵今日发布 Ling-3.1-flash 模型,拥有约 560B 总参数,每个 Token 激活约 25B 参数; 模型上下文窗口上限为 1M ,可容纳更长的文档、代码和任务历史。 官方表示,在研发过程中,围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景持续提升模型能力。 此外, Ling-3.1-flash 将开放为期两周的免费体验 ;考虑到综合服务成本,免费体验期间模型服务长度为 256K。 免费体验期结束并转为付费服务后,计划开放 1M 上下文。届时, 团队也计划同步开源 ,并继续更新模型性能。 IT之家附这款模型在多个任务评测中得分如下:

  4. 量子位70

    DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec

    事实摘要:DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec DeepSeek在知乎独家发布技术长文,首次系统阐释了DeepSeek弹性计算(DeepSeek Elastic Compute,DSec) 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程、产品发布。 DeepSeek知乎独家发文,首次公开V4.1 Agent训练。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. Apple Machine Learning Research87

    SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation

    这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Continual-learning agents are systems of models, harnesses, and memory operating over long multi-session horizons. Evaluating and training them requires interleaving tasks with agent-side events such as session stop and start, crons, and memory consolidation. Yet existing benchmarks and training frameworks schedule only the benchmark’s own events, leaving each benchmark and agent pair to build a custom scheduling loo...

    推荐理由:来自Apple Machine Learning Research的《SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Continual-learning agents are systems of models, harnesses, and memory operating over long multi-session horizons. Evaluating and training them requires interleaving tasks with agent-side events such as session stop and start, crons, and memory consolidation. Yet existing benchmarks and training frameworks schedule only the benchmark’s own events, leaving each benchmark and agent p...

  6. Apple Machine Learning Research81

    On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study 这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Controlling the output of Large Language 。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. GitHub Changelog94

    GPT-6.1 Sol in GitHub Copilot

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6.1 Sol in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6.1 Sol in GitHub Copilot 事实摘要:GPT-6.1 Sol in GitHub Copilot 事实摘要:G。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月29日周二
  1. IT之家 AI36

    中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展

    IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...

    推荐理由:来自IT之家 AI的《中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...

  2. 量子位70

    OpenAI因新模型太强叫停发布

    事实摘要:OpenAI因新模型太强叫停发布 AGI计划暂停。 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 OpenAI因新模型太强叫停发布 AGI计划暂停。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI72

    OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权

    IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过 研究部门负责人或 VP(副总裁)、安全负责人和首席科学家 等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员, 应对安全论证以及任何事故响应承担责任 ,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。 OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。此外,训练流程应能方便地 识别未对齐模型的所有下游用途 (IT之家注:例如用于数据生成或评分),以便必要时消除未对齐输出带来的影响。 今天早些时候,OpenAI 宣布,随着越来越多报告显示 AI ...

    推荐理由:来自IT之家 AI的《OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过 研究部门负责人或 VP(副总裁)、安全负责人和首席科学家 等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员, 应对安全论证以及任何事故响应承担责任 ,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。 OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。此外,训练流程应能方便地 识别未对齐模型的所有下游用途 (IT之家注:例如用于数据生成或评分),以便必要时消除未对齐输出带来的影响。 今天早些时候,OpenAI 宣布,随着越来越多报告显示 AI ...

  4. IT之家 AI72

    内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra

    IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

    推荐理由:来自IT之家 AI的《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

  5. Apple Machine Learning Research50

    The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models 这条英文动态主要涉及模型能力与工程。原文要点:When language 。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. Simon Willison83

    Claude Sonnet 5.5

    这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Claude Sonnet 5.5 New Sonnet model from Anthropic today. They say it "runs 30%+ faster, and costs up to 30% less for most work" - it's priced the same as Sonnet 5 but appears to beat it on every benchmark, and should be cheaper to run as well. Here are some pelicans riding bicycles . Sonnet 5.5 suffered from the same bug as Opus 5.5 : the "max" thinking effort pelican thought for 128,000 tokens (at a cost of $1.28) b...

    推荐理由:来自Simon Willison的《Claude Sonnet 5.5》。重点看模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Claude Sonnet 5.5 New Sonnet model from Anthropic today. They say it "runs 30%+ faster, and costs up to 30% less for most work" - it's priced the same as Sonnet 5 but appears to beat it on every benchmark, and should be cheaper to run as well. Here are some pelicans riding bicycles . Sonnet 5.5 suffered from the same bug as Opus 5.5 : the "max" thinking effort pelican thought for 128,000 ...

  7. GitHub Changelog92

    Claude Sonnet 5.5 in GitHub Copilot

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Sonnet 5.5 in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Sonnet 5.5 in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude S。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月28日周一
  1. 极客公园72

    对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容

    本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...

    推荐理由:来自极客公园的《对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容》。重点看智能体工作流、模型能力与工程、文化创意。摘要提到:本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...

  2. IT之家 AI76

    黑客在暗网兜售 AI 模型访问权限,最低价仅有正版 3%

    IT之家 9 月 28 日消息,据英国《金融时报》当地时间 26 日报道,非法获取 AI 模型和算力,正迅速成为网络犯罪黑市上最抢手的商品,黑客希望借助价格高昂的大模型实施勒索、网络战和间谍活动。 谷歌威胁情报团队首席分析师约翰 · 霍特奎斯特披露,今年所谓“LLM 劫持”活动明显增多,具体表现于 倒卖公开 AI 工具的被盗登录凭据 ,以及部分团体盗用他人算力,以免费运行自己的模型。 从事网络安全工作 20 年的霍特奎斯特坦言:“我们在地下市场看到,一个围绕 AI 使用权限形成的经济体系在不断壮大。” 霍特奎斯特警告,攻击者能够 以低廉价格使用原本昂贵的 AI ,从而在成本上占据优势,被攻击方为了防御同样需要使用这些 AI 工具。“归根结底,这些做法让他们在与我们对抗时拥有某种经济或效率优势,因为他们能以低得多的价格获得这些 token。” 谷歌威胁情报团队研究人员发现,暗网市场出售 Anthropic、谷歌和 OpenAI 等...

    推荐理由:来自IT之家 AI的《黑客在暗网兜售 AI 模型访问权限,最低价仅有正版 3%》。重点看模型能力与工程。摘要提到:IT之家 9 月 28 日消息,据英国《金融时报》当地时间 26 日报道,非法获取 AI 模型和算力,正迅速成为网络犯罪黑市上最抢手的商品,黑客希望借助价格高昂的大模型实施勒索、网络战和间谍活动。 谷歌威胁情报团队首席分析师约翰 · 霍特奎斯特披露,今年所谓“LLM 劫持”活动明显增多,具体表现于 倒卖公开 AI 工具的被盗登录凭据 ,以及部分团体盗用他人算力,以免费运行自己的模型。 从事网络安全工作 20 年的霍特奎斯特坦言:“我们在地下市场看到,一个围绕 AI 使用权限形成的经济体系在不断壮大。” 霍特奎斯特警告,攻击者能够 以低廉价格使用原本昂贵的 AI ,从而在成本上占据优势,被攻击方为了防御同样需要使用这些 AI 工具。“归根结底,这些做法让他们在与我们对抗时拥有某种经济或效率优势,因为他们能以低得多的价格获得这些 token。” 谷歌威胁情报团队研究人员发现,暗网市场出售 Anthropic、谷歌和 OpenAI 等...

9月26日周六
  1. 量子位36

    索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准

    事实摘要:索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准 “世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准 “世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. 量子位70

    笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub

    事实摘要:笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥? 这条动态来自 量子位,可重点关注模型能力与工程、开源生态。 笔记本跑7000亿参数GLM!无GPU也行? SSD当显存用火爆GitHub GitHub现在最火热的大模型开源小蜂鸟Colibrì是个啥?。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. 量子位70

    谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架

    事实摘要:谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架 vLLM人马创业公司团队出品 这条动态来自 量子位,可重点关注模型能力与工程。 谷歌TPU跑Kimi比英伟达GPU快57%!用的还是DeepSeek推理框架 vLLM人马创业公司团队出品。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI72

    OpenAI 承认 53 张用户图片被其 AI 智能体“偷偷”传到公网

    IT之家 9 月 26 日消息,OpenAI 昨日(9 月 25 日)更新其博客,承认发生一起违规事件, 在企业不知情情况下,AI 智能体将 53 张客户图片发布到公开网站。 在博文中,IT之家援引博文介绍,OpenAI 公司承认在其研究环境中运行的 AI 智能体曾将 53 张由用户上传到 OpenAI 模型的图片,以“未公开列出的链接”形式发布到第三方图像托管网站(类似图床),而受影响公司当时并不知情。 在影响方面,OpenAI 指出这些图片并非出现在公开索引页面上,作为“未列出(unlisted)”链接存在,理论上不易被搜索引擎直接发现,不过对于掌握链接的用户而言,可以访问获取相关内容。 OpenAI 表示这属于对用户数据的“不当使用”,不在其隐私政策允许范围内。公司称已移除“大多数”相关内容,并仍在与托管方合作清理剩余部分,但承认仍有部分内容可能在线。 根据 OpenAI 的说明,这些图片来自已授权 OpenAI 使用其数...

    推荐理由:来自IT之家 AI的《OpenAI 承认 53 张用户图片被其 AI 智能体“偷偷”传到公网》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 26 日消息,OpenAI 昨日(9 月 25 日)更新其博客,承认发生一起违规事件, 在企业不知情情况下,AI 智能体将 53 张客户图片发布到公开网站。 在博文中,IT之家援引博文介绍,OpenAI 公司承认在其研究环境中运行的 AI 智能体曾将 53 张由用户上传到 OpenAI 模型的图片,以“未公开列出的链接”形式发布到第三方图像托管网站(类似图床),而受影响公司当时并不知情。 在影响方面,OpenAI 指出这些图片并非出现在公开索引页面上,作为“未列出(unlisted)”链接存在,理论上不易被搜索引擎直接发现,不过对于掌握链接的用户而言,可以访问获取相关内容。 OpenAI 表示这属于对用户数据的“不当使用”,不在其隐私政策允许范围内。公司称已移除“大多数”相关内容,并仍在与托管方合作清理剩余部分,但承认仍有部分内容可能在线。 根据 OpenAI 的说明,这些图片来自已授权 OpenAI 使用其数...

  5. GitHub Changelog90

    GitHub Copilot weekly releases — September 21

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:GitHub Copilot weekly releases — September 21 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:GitHub Copilot weekly releases — September 21 事实摘要:这条英文动态主要涉及模型能力与工程、。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月24日周四
  1. IT之家 AI70

    OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力

    IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。 据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。 OpenAI 表示,目前针对 AI 在心理健康领域表现的多数评估主要集中于紧急情况,并使用宽泛的预设标准衡量模型表现,因此对于模型如何应对完整范围的心理健康对话,仍存在一...

    推荐理由:来自IT之家 AI的《OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。 据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。 OpenAI 表示,目前针对 AI 在心理健康领域表现的多数评估主要集中于紧急情况,并使用宽泛的预设标准衡量模型表现,因此对于模型如何应对完整范围的心理健康对话,仍存在一...

  2. Apple Machine Learning Research77

    Compressing Streaming Neural Audio Encoders via Latent-Space Distillation

    这条英文动态主要涉及模型能力与工程。原文要点:System-wide Dictation on Apple devices runs entirely on-device, and the speech it transcribes reaches the foundation model through a tokenizer: an encoder that maps short windows of waveform onto the representation the language model reads. Because that model is sparsely activated under Instruction-Following Pruning, only a small subset of its experts occupies DRAM at any time, so the always-on tokenizer competes for...

    推荐理由:来自Apple Machine Learning Research的《Compressing Streaming Neural Audio Encoders via Latent-Space Distillation》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:System-wide Dictation on Apple devices runs entirely on-device, and the speech it transcribes reaches the foundation model through a tokenizer: an encoder that maps short windows of waveform onto the representation the language model reads. Because that model is sparsely activated under Instruction-Following Pruning, only a small subset of its experts occupies DRAM at any time, so the always-on...

9月23日周三
  1. 量子位70

    斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”

    事实摘要:斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界” 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型AutoOmni 2.0-23B-A3B 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界” 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型A。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. 量子位70

    DeepSeek新论文公开Agent训练!梁文锋署名

    事实摘要:DeepSeek新论文公开Agent训练!。影响判断:发布了一篇关于Agent(代理)训练的新论文,展示了在每秒产生50,000+个沙盒的能力。场景价值:智能体工作流、模型能力与工程。

    推荐理由:这篇文章为读者提供了一个关于Agent训练的视角,强调了其高效性和灵活性。

  3. 量子位36

    实时世界模型进入“全科生”阶段,PixVerse R2先交卷!

    事实摘要:实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 实时性和通用能力,世界模型可以全都要 这条动态来自 量子位,可重点关注模型能力与工程。 实时世界模型进入“全科生”阶段,PixVerse R2先交卷! 实时性和通用能力,世界模型可以全都要。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。