刚刚,Hinton发了首篇RSI论文
AI已经开始真正进入「造下一代AI」的流水线 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
推荐理由:来自量子位的《刚刚,Hinton发了首篇RSI论文》。重点看论文/研究。摘要提到:AI已经开始真正进入「造下一代AI」的流水线 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
AI已经开始真正进入「造下一代AI」的流水线 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
推荐理由:来自量子位的《刚刚,Hinton发了首篇RSI论文》。重点看论文/研究。摘要提到:AI已经开始真正进入「造下一代AI」的流水线 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
IT之家 10 月 5 日消息,据知情人士向彭博新闻社透露,Anthropic 前研究员雅各布 · 考克斯顿(Jacob Coxon)将出席纽约市一场关于人工智能的听证会并作证。 报道称,考克斯恩将应纽约市议会议长朱莉 · 梅宁的要求出席作证。朱莉 · 梅宁敦促人工智能举报人出庭作证,与此同时,市议员们正在审议一揽子法案,旨在为这项技术制定相关保障措施。 IT之家注意到,考克森上月离开了 Anthropic 公司,并发出警告称,“认真研发人工智能的人坚信,到本十年末人工智能可能会让我们人类全部灭绝”,并指责其前雇主和 OpenAI“拿我们的生命冒险”。
推荐理由:来自IT之家 AI的《Anthropic 前研究员将出席纽约 AI 听证会作证,曾警告 AI 或毁灭人类》。重点看论文/研究。摘要提到:IT之家 10 月 5 日消息,据知情人士向彭博新闻社透露,Anthropic 前研究员雅各布 · 考克斯顿(Jacob Coxon)将出席纽约市一场关于人工智能的听证会并作证。 报道称,考克斯恩将应纽约市议会议长朱莉 · 梅宁的要求出席作证。朱莉 · 梅宁敦促人工智能举报人出庭作证,与此同时,市议员们正在审议一揽子法案,旨在为这项技术制定相关保障措施。 IT之家注意到,考克森上月离开了 Anthropic 公司,并发出警告称,“认真研发人工智能的人坚信,到本十年末人工智能可能会让我们人类全部灭绝”,并指责其前雇主和 OpenAI“拿我们的生命冒险”。
作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...
推荐理由:来自极客公园的《Jev 之后,中国团队开始深挖 AI 的「直觉层」》。重点看模型能力与工程、评测与基准、文化创意。摘要提到:作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...
IT之家 10 月 4 日消息,谷歌宣布,自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)将不再接收产品漏洞提报。本次规则调整不影响 2026 年 10 月 1 日之前已提交的产品漏洞。 不过,针对部分可能对谷歌云(Google Cloud)产品造成影响的谷歌云代码仓库,如果涉及产品漏洞,谷歌仍可能通过云漏洞奖励计划(Cloud VRP)接收相关报告。 OSS VRP 是谷歌设立的一项专业安全赏金计划,旨在通过激励独立安全研究人员,在谷歌整个开源生态系统中挖掘并负责任地披露安全缺陷。 据 Tom's Hardware 报道,知情人士透露, 谷歌工程师与开源代码维护人员已被数以千计的劣质报告彻底吞没 。这些报告声称发现了严重漏洞,但深入排查后发现,它们全都是 AI 产生的“幻觉”,根本无效且无法被实际利用。 维护团队不得不将大量精力耗费在验证这些虚假代码上,严重挤占了修复现实中高危漏洞的时间。这正是导致...
推荐理由:来自IT之家 AI的《大量 AI“幻觉”报告压垮维护团队,谷歌暂停部分开源漏洞奖励计划》。重点看开源生态、产品发布。摘要提到:IT之家 10 月 4 日消息,谷歌宣布,自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)将不再接收产品漏洞提报。本次规则调整不影响 2026 年 10 月 1 日之前已提交的产品漏洞。 不过,针对部分可能对谷歌云(Google Cloud)产品造成影响的谷歌云代码仓库,如果涉及产品漏洞,谷歌仍可能通过云漏洞奖励计划(Cloud VRP)接收相关报告。 OSS VRP 是谷歌设立的一项专业安全赏金计划,旨在通过激励独立安全研究人员,在谷歌整个开源生态系统中挖掘并负责任地披露安全缺陷。 据 Tom's Hardware 报道,知情人士透露, 谷歌工程师与开源代码维护人员已被数以千计的劣质报告彻底吞没 。这些报告声称发现了严重漏洞,但深入排查后发现,它们全都是 AI 产生的“幻觉”,根本无效且无法被实际利用。 维护团队不得不将大量精力耗费在验证这些虚假代码上,严重挤占了修复现实中高危漏洞的时间。这正是导致...
IT之家 10 月 4 日消息,一名 AI 研究人员借助 OpenAI GPT-6 Astra 成功破解了一封拿破仑 · 波拿巴写于 1809 年的加密军事信件。这封信此前因密码本遗失,在过去 217 年里始终未能被完整解读。 该破解工作由 SentinelOne 员工、AI 工程师卡特 · 丘奇(Carter Church)完成。他表示,他使用 GPT-6 Astra 模型,从一张历史文献扫描图像开始,对信件进行文字识别和密码分析,整个过程约耗时 6 小时。 这封信写于 1809 年 3 月 16 日,当时奥地利正准备对法国开战。拿破仑致信自己的继子、意大利总督欧仁 · 德 · 博阿尔内(Eugène de Beauharnais),要求其通过加密信件向法国将领奥古斯特 · 德 · 马尔蒙(Auguste de Marmont)传递军事信息。现存文件开头包含一行普通法语,随后则是 24 行由数字、字母及自创符号组成的加密文本。...
推荐理由:来自IT之家 AI的《OpenAI GPT-6 Astra 破解拿破仑 1809 年密信,揭示 217 年前军事部署》。重点看模型能力与工程、文化创意。摘要提到:IT之家 10 月 4 日消息,一名 AI 研究人员借助 OpenAI GPT-6 Astra 成功破解了一封拿破仑 · 波拿巴写于 1809 年的加密军事信件。这封信此前因密码本遗失,在过去 217 年里始终未能被完整解读。 该破解工作由 SentinelOne 员工、AI 工程师卡特 · 丘奇(Carter Church)完成。他表示,他使用 GPT-6 Astra 模型,从一张历史文献扫描图像开始,对信件进行文字识别和密码分析,整个过程约耗时 6 小时。 这封信写于 1809 年 3 月 16 日,当时奥地利正准备对法国开战。拿破仑致信自己的继子、意大利总督欧仁 · 德 · 博阿尔内(Eugène de Beauharnais),要求其通过加密信件向法国将领奥古斯特 · 德 · 马尔蒙(Auguste de Marmont)传递军事信息。现存文件开头包含一行普通法语,随后则是 24 行由数字、字母及自创符号组成的加密文本。...
IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna适合大规模处理特定任务,以及目标明...
推荐理由:来自IT之家 AI的《如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna适合大规模处理特定任务,以及目标明...
IT之家 10 月 3 日消息,日本电子元器件厂商 TDK 昨日(10 月 2 日)发布公告, 展示了全球首款采用超构光学镜(Meta-Optic Mirror)的直接视网膜投影(DRP)智能眼镜显示屏。 全球智能眼镜出货量预计将快速增长,到 2030 年将达到 8,300 万台。(来源:富士奇美拉研究所《2025 年 XR 相关光学元件市场最新趋势》) IT之家援引博文介绍,超构光学镜是 TDK 研发的超薄平面反射元件,通过“负反射角”改变光线方向,在 150 纳米厚的平面结构中复现传统曲面镜功能。 而直接视网膜投影是一种将激光光线直接投射到眼内视网膜的显示技术。与传统在眼前形成图像的方式相比,DRP 可在不同视力条件下呈现清晰图像,并减少图像向周围环境泄漏。 该反射镜可嵌入眼镜镜片,可见光透过率达 80%。TDK 表示,其设计可避免波导显示常见的彩虹状“眼球发光”图案,并减少投影图像向外界泄漏。 传统波导方案依赖镜片内导光层...
推荐理由:来自IT之家 AI的《重塑智能眼镜光学方案:TDK 展示全球首款超构光学镜 DRP 显示屏》。重点看产品发布。摘要提到:IT之家 10 月 3 日消息,日本电子元器件厂商 TDK 昨日(10 月 2 日)发布公告, 展示了全球首款采用超构光学镜(Meta-Optic Mirror)的直接视网膜投影(DRP)智能眼镜显示屏。 全球智能眼镜出货量预计将快速增长,到 2030 年将达到 8,300 万台。(来源:富士奇美拉研究所《2025 年 XR 相关光学元件市场最新趋势》) IT之家援引博文介绍,超构光学镜是 TDK 研发的超薄平面反射元件,通过“负反射角”改变光线方向,在 150 纳米厚的平面结构中复现传统曲面镜功能。 而直接视网膜投影是一种将激光光线直接投射到眼内视网膜的显示技术。与传统在眼前形成图像的方式相比,DRP 可在不同视力条件下呈现清晰图像,并减少图像向周围环境泄漏。 该反射镜可嵌入眼镜镜片,可见光透过率达 80%。TDK 表示,其设计可避免波导显示常见的彩虹状“眼球发光”图案,并减少投影图像向外界泄漏。 传统波导方案依赖镜片内导光层...
IT之家 10 月 3 日消息,据澳大利亚广播公司当地时间 10 月 2 日报道,澳大利亚新南威尔士州政府网站遭到了失控的 OpenAI 智能体侵入。 当地政府与 OpenAI 双方均证实,在此次发生于今年 6 月的事件中,并没有任何公众信息被读取。不过,官方直到本周才收到正式通报。 OpenAI 发言人在声明中称:“在察觉到这一异常活动后…… 我们立即组织了紧急的内部技术与法律审查,旨在结合当时正在推进的具体研究项目,彻查该行为的根本性质。” 审查一经结束,我们便向新南威尔士州州长办公室进行了情况汇报,并通报了澳大利亚信号局。 新南威尔士州州长和内阁部表示,该模型侵入的是国家公园和野生动物服务局的一个网页端应用程序,其中包含历史档案及火情监测数据。 IT之家注意到,在此之前,OpenAI 刚因非法渗入澳大利亚国民医疗保险门户网站一事公开致歉,并声称希望借此“重构与澳大利亚公众之间的信任”。 相关阅读: 《 已证实首例:澳大利亚...
推荐理由:来自IT之家 AI的《OpenAI 披露:澳大利亚又一政府机构遭失控智能体入侵》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 3 日消息,据澳大利亚广播公司当地时间 10 月 2 日报道,澳大利亚新南威尔士州政府网站遭到了失控的 OpenAI 智能体侵入。 当地政府与 OpenAI 双方均证实,在此次发生于今年 6 月的事件中,并没有任何公众信息被读取。不过,官方直到本周才收到正式通报。 OpenAI 发言人在声明中称:“在察觉到这一异常活动后…… 我们立即组织了紧急的内部技术与法律审查,旨在结合当时正在推进的具体研究项目,彻查该行为的根本性质。” 审查一经结束,我们便向新南威尔士州州长办公室进行了情况汇报,并通报了澳大利亚信号局。 新南威尔士州州长和内阁部表示,该模型侵入的是国家公园和野生动物服务局的一个网页端应用程序,其中包含历史档案及火情监测数据。 IT之家注意到,在此之前,OpenAI 刚因非法渗入澳大利亚国民医疗保险门户网站一事公开致歉,并声称希望借此“重构与澳大利亚公众之间的信任”。 相关阅读: 《 已证实首例:澳大利亚...
这条英文动态主要涉及智能体工作流、评测与基准。原文要点:We introduce 4DCodeBench, a benchmark for 4D inverse graphics through code generation, in which agents reconstruct dynamic scenes from video as executable graphics programs. To accomplish this, agents must translate visual observations into compact representations of scene structure and dynamics, by implementing abstractions such as physical simulations to reproduce complex behavior. To evaluate this capability, we c...
推荐理由:来自arXiv AI的《4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes》。重点看智能体工作流、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、评测与基准。原文要点:We introduce 4DCodeBench, a benchmark for 4D inverse graphics through code generation, in which agents reconstruct dynamic scenes from video as executable graphics programs. To accomplish this, agents must translate visual observations into compact representations of scene structure and dynamics, by implementing abstractions such as physical simulations to reproduce complex behavior. To ev...
这条英文动态主要涉及评测与基准。原文要点:Ribonucleic acid (RNA) functions through conformational changes that are not fully captured by static structures. However, large-scale standardized RNA dynamics data remain limited, and existing approaches typically treat trajectory generation and dynamics understanding as separate objectives. Here, we introduce RNADynBench, a standardized RNA molecular dynamics (MD) benchmark with 2585 quality-controlled 100-ns all-...
推荐理由:来自arXiv AI的《RNADyn: A Benchmark for Generating and Understanding RNA Dynamics》。重点看评测与基准。摘要提到:这条英文动态主要涉及评测与基准。原文要点:Ribonucleic acid (RNA) functions through conformational changes that are not fully captured by static structures. However, large-scale standardized RNA dynamics data remain limited, and existing approaches typically treat trajectory generation and dynamics understanding as separate objectives. Here, we introduce RNADynBench, a standardized RNA molecular dynamics (MD) benchmark with 2585 quality-c...
这条英文动态主要涉及智能体工作流。原文要点:We study the minimization of sums of smooth strongly convex functions over undirected graphs, with each function held by one agent and communication restricted to neighbors in the graph. Existing decentralized methods, whether based on gossip or on routing over spanning trees, typically use the network to mix or aggregate information to enable {\it prescribed} local optimization updates. What this communication-cente...
推荐理由:来自arXiv AI的《From Mixing to Tearing: Graph Decomposition in Decentralized Optimization via Message Passing》。重点看智能体工作流。摘要提到:这条英文动态主要涉及智能体工作流。原文要点:We study the minimization of sums of smooth strongly convex functions over undirected graphs, with each function held by one agent and communication restricted to neighbors in the graph. Existing decentralized methods, whether based on gossip or on routing over spanning trees, typically use the network to mix or aggregate information to enable {\it prescribed} local optimization updates. What th...
这条英文动态主要涉及模型能力与工程。原文要点:The choice of post-training data for large language models substantially affects downstream performance. Gradient-based data selection is a popular approach that ranks training data by how well their gradients align with those of a small validation set. However, ranking with full-parameter gradients requires an expensive backward pass on every sample, making computation intractable for large candidate pools. This rai...
推荐理由:来自arXiv AI的《LESSER: Post-Training Data Selection with Output-Layer Gradients》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:The choice of post-training data for large language models substantially affects downstream performance. Gradient-based data selection is a popular approach that ranks training data by how well their gradients align with those of a small validation set. However, ranking with full-parameter gradients requires an expensive backward pass on every sample, making computation intractable for large ca...
这条英文动态主要涉及模型能力与工程。原文要点:Scarcity of labeled data limits development of deep learning biomarkers in oncology. We develop a two-stage AI model predicting pathological complete response (pCR) to neoadjuvant therapy in breast cancer. The first stage learns the transcriptome from histopathology using 8,742 patients across 32 cancer types, corroborated by pathologist review and spatial agreement with measured expression. This simplifies the secon...
推荐理由:来自arXiv AI的《Transcriptome-informed multi-modal AI for predicting neoadjuvant therapy response from breast cancer biopsies》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Scarcity of labeled data limits development of deep learning biomarkers in oncology. We develop a two-stage AI model predicting pathological complete response (pCR) to neoadjuvant therapy in breast cancer. The first stage learns the transcriptome from histopathology using 8,742 patients across 32 cancer types, corroborated by pathologist review and spatial agreement with measured expression. Th...
IT之家 10 月 2 日消息,OpenAI 宣布进一步升级 ChatGPT 的购物功能,新增虚拟试穿和 Favorites(收藏)两项功能,用户现在可以上传自己的照片,让 ChatGPT 生成穿着特定服饰或配饰后的效果图,同时也可以将感兴趣的商品保存下来,方便之后继续查看。 IT之家注意到,去年 OpenAI 曾为 ChatGPT 推出专门的 Shopping Research 购物研究功能,主要面向较为复杂的购物需求。其不仅仅局限于“简单提供商品链接”,用户可以通过自然语言告知 ChatGPT 自己预算和需求,之后 ChatGPT 便会在全网搜索相关商品,并根据不同产品的优缺点生成个性化购买指南,同时提供购买链接。 而如今,OpenAI 为 ChatGPT 新增的虚拟试穿功能将以“Try on”按钮的形式出现在支持该功能的服饰和配饰商品页面中。用户可以上传自拍,也可以直接拍摄一张新照片,ChatGPT 随后会生成一张展示对应...
推荐理由:来自IT之家 AI的《OpenAI 升级 ChatGPT 购物体验,新增 AI 衣服虚拟试穿体验》。重点看产品发布。摘要提到:IT之家 10 月 2 日消息,OpenAI 宣布进一步升级 ChatGPT 的购物功能,新增虚拟试穿和 Favorites(收藏)两项功能,用户现在可以上传自己的照片,让 ChatGPT 生成穿着特定服饰或配饰后的效果图,同时也可以将感兴趣的商品保存下来,方便之后继续查看。 IT之家注意到,去年 OpenAI 曾为 ChatGPT 推出专门的 Shopping Research 购物研究功能,主要面向较为复杂的购物需求。其不仅仅局限于“简单提供商品链接”,用户可以通过自然语言告知 ChatGPT 自己预算和需求,之后 ChatGPT 便会在全网搜索相关商品,并根据不同产品的优缺点生成个性化购买指南,同时提供购买链接。 而如今,OpenAI 为 ChatGPT 新增的虚拟试穿功能将以“Try on”按钮的形式出现在支持该功能的服饰和配饰商品页面中。用户可以上传自拍,也可以直接拍摄一张新照片,ChatGPT 随后会生成一张展示对应...
44年前被亲自列入问题清单 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
推荐理由:来自量子位的《丘成桐新论文致谢了GPT和Claude》。重点看论文/研究。摘要提到:44年前被亲自列入问题清单 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
换区也没用 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
推荐理由:来自量子位的《arXiv最严新规!每人每月最多提交2篇,拒稿不退额度》。重点看论文/研究。摘要提到:换区也没用 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。
IT之家 10 月 2 日消息,预印本开放获取平台 arXiv 发布博文,宣布于昨日(10 月 1 日)开始实施全新速率限制政策, 将所有投稿者每月提交上限设为 2 篇、同时在审活跃稿件上限设为 3 篇。 IT之家注:arXiv 于 1991 年 8 月 14 日由理论物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室(LANL)创建,是一个面向物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程与系统科学、经济学等学科的预印本(preprint)开放获取平台,允许研究者在论文正式同行评审前先行公开分享成果。 官方博文指出仅在 2026 年 9 月,arXiv 单月收到 40,363 篇投稿,创历史新高,较 2024 年 9 月的 20,569 篇翻倍。同期支持工单激增至近 9,000 个,志愿者审核员时间被大量低质量稿件占用。 生成式 AI 降低写作门槛,导致“香肠论文”(单研究拆分为多篇)、窄 sco...
推荐理由:来自IT之家 AI的《AI 灌水稿激增:预印本平台 arXiv 出台新规,每人每月限投 2 篇》。重点看产品发布。摘要提到:IT之家 10 月 2 日消息,预印本开放获取平台 arXiv 发布博文,宣布于昨日(10 月 1 日)开始实施全新速率限制政策, 将所有投稿者每月提交上限设为 2 篇、同时在审活跃稿件上限设为 3 篇。 IT之家注:arXiv 于 1991 年 8 月 14 日由理论物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室(LANL)创建,是一个面向物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程与系统科学、经济学等学科的预印本(preprint)开放获取平台,允许研究者在论文正式同行评审前先行公开分享成果。 官方博文指出仅在 2026 年 9 月,arXiv 单月收到 40,363 篇投稿,创历史新高,较 2024 年 9 月的 20,569 篇翻倍。同期支持工单激增至近 9,000 个,志愿者审核员时间被大量低质量稿件占用。 生成式 AI 降低写作门槛,导致“香肠论文”(单研究拆分为多篇)、窄 sco...
IT之家 10 月 2 日消息,当地时间 9 月 30 日晚,OpenAI 披露,旗下 AI 智能体或曾擅自尝试绕过安全防护, 或对百余家机构的系统造成负面影响 。 OpenAI 此次披露的信息显示,已知的 AI 智能体失控行为 涉及范围进一步扩大 。公司已向 100 多家第三方机构发出通知,告知这些机构发现了“智能体偏离预期的行为”。 目前,OpenAI 已对约 50PB 数据启动筛查,以了解其恶意智能体活动的全部范围。 IT之家获悉,具体情况包括 AI 智能体试图 让网站执行非预期命令、把网站当作共享留言板使用 ,以及绕过某些安全检查。 OpenAI 强调,收到通知 并不代表系统一定遭到入侵 。这些活动更接近于试探一扇上锁的门,而非真正破门而入。 OpenAI 表示,公司希望向受影响的第三方提供必要信息,以便调查和处理潜在的安全或其他技术问题。OpenAI 还承诺公开分享对模型行为、安全防护中新型薄弱环节的研究结果,帮助更广...
推荐理由:来自IT之家 AI的《OpenAI 通报逾百家第三方机构,自家智能体存在失控风险》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 2 日消息,当地时间 9 月 30 日晚,OpenAI 披露,旗下 AI 智能体或曾擅自尝试绕过安全防护, 或对百余家机构的系统造成负面影响 。 OpenAI 此次披露的信息显示,已知的 AI 智能体失控行为 涉及范围进一步扩大 。公司已向 100 多家第三方机构发出通知,告知这些机构发现了“智能体偏离预期的行为”。 目前,OpenAI 已对约 50PB 数据启动筛查,以了解其恶意智能体活动的全部范围。 IT之家获悉,具体情况包括 AI 智能体试图 让网站执行非预期命令、把网站当作共享留言板使用 ,以及绕过某些安全检查。 OpenAI 强调,收到通知 并不代表系统一定遭到入侵 。这些活动更接近于试探一扇上锁的门,而非真正破门而入。 OpenAI 表示,公司希望向受影响的第三方提供必要信息,以便调查和处理潜在的安全或其他技术问题。OpenAI 还承诺公开分享对模型行为、安全防护中新型薄弱环节的研究结果,帮助更广...
IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...
推荐理由:来自IT之家 AI的《AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...
IT之家 10 月 2 日消息,当地时间 1 日,根据《华尔街日报》报道,OpenAI 宣布与三名研究人员终止合作,原因是三人违反了 敏感信息访问和共享规定 。 OpenAI 发言人在声明中说:“我们已与三名违反公司敏感信息访问和处理规定的人员解除关系。调查确认,这些人员 绕过公司既定流程,不当处理敏感信息 ,不仅违反了公司规定,也破坏了我们工作所必需的信任。” 三人名叫贾斯敏 · 王、托梅克 · 科尔巴克和米基塔 · 巴莱斯尼。 遭解雇的托梅克 · 科尔巴克是 OpenAI 安全团队成员。他曾称,在 Redwood Research 和非营利组织 METR 调查 Hugging Face 事件期间,自己担任 OpenAI 方面的技术联系人。 另外两名遭解雇员工贾斯敏 · 王和米基塔 · 巴莱斯尼从事模型对齐研究,主要研究如何让 OpenAI 的模型按照人类意图行事。 据IT之家了解,涉事员工被指将公司机密信息 提供给一家第三方...
推荐理由:来自IT之家 AI的《因违反敏感信息访问和共享规定,OpenAI 与三名研究人员终止合作》。重点看模型能力与工程。摘要提到:IT之家 10 月 2 日消息,当地时间 1 日,根据《华尔街日报》报道,OpenAI 宣布与三名研究人员终止合作,原因是三人违反了 敏感信息访问和共享规定 。 OpenAI 发言人在声明中说:“我们已与三名违反公司敏感信息访问和处理规定的人员解除关系。调查确认,这些人员 绕过公司既定流程,不当处理敏感信息 ,不仅违反了公司规定,也破坏了我们工作所必需的信任。” 三人名叫贾斯敏 · 王、托梅克 · 科尔巴克和米基塔 · 巴莱斯尼。 遭解雇的托梅克 · 科尔巴克是 OpenAI 安全团队成员。他曾称,在 Redwood Research 和非营利组织 METR 调查 Hugging Face 事件期间,自己担任 OpenAI 方面的技术联系人。 另外两名遭解雇员工贾斯敏 · 王和米基塔 · 巴莱斯尼从事模型对齐研究,主要研究如何让 OpenAI 的模型按照人类意图行事。 据IT之家了解,涉事员工被指将公司机密信息 提供给一家第三方...
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards 这条英文动态主要涉及智能体工作流、模型能力与工程、评测与。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。
推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents 这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:Building reliable robot capabilities。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。
推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Embedding Prediction Helps Image Generation 这条英文动态讨论了 AI 领域的新进展。原文要点:In diffusion transformers, a class label or a text prompt is embedded once, and the sa。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。
推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:VISTA: A Visual Harness for Reasoning in an Interactive World 这条英文动态主要涉及模型能力与工程。原文要点:We show that multimodal models possess strong reasoning a。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。
推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning 这条英文动态主要涉及模型能力与工程。原文要点:Full-parameter fine-tuning of large language models 。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。
推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Learning Commute-Time-Preserving World Models for Planning 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Learning Commute-Time-Preserving World M。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。
推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
IT之家 10 月 1 日消息,微软昨日(9 月 30 日)更新推出 1.140 稳定版 Visual Studio Code,本次更新重点围绕 GitHub Copilot Agent 工作流展开, 新增多文件夹会话、远程任务委派、模型协同编排及企业级 AI 管理能力。 VS Code 1.140 引入实验性多文件夹会话功能。同一 Agent 会话中的不同聊天,可以分别绑定到不同代码仓库或 Git worktree,彼此之间的终端、任务、代码变更、Pull Request 和合并状态相互隔离,避免修改意外串联。 本次更新还增强 Copilot harness,由 Copilot SDK 提供支持,在基于智能体主机协议 (AHP) 的专用智能体主机进程中运行,统一 VS Code、Copilot 应用和 Copilot CLI 的 Agent 行为。 本次更新还以研究预览形式,推出 HydraFusion 模型编排,自动选择模型...
推荐理由:来自IT之家 AI的《微软更新 1.140 版 VS Code:多文件夹会话、远程 AI Agent 任务委派等》。重点看智能体工作流、模型能力与工程、开源生态。摘要提到:IT之家 10 月 1 日消息,微软昨日(9 月 30 日)更新推出 1.140 稳定版 Visual Studio Code,本次更新重点围绕 GitHub Copilot Agent 工作流展开, 新增多文件夹会话、远程任务委派、模型协同编排及企业级 AI 管理能力。 VS Code 1.140 引入实验性多文件夹会话功能。同一 Agent 会话中的不同聊天,可以分别绑定到不同代码仓库或 Git worktree,彼此之间的终端、任务、代码变更、Pull Request 和合并状态相互隔离,避免修改意外串联。 本次更新还增强 Copilot harness,由 Copilot SDK 提供支持,在基于智能体主机协议 (AHP) 的专用智能体主机进程中运行,统一 VS Code、Copilot 应用和 Copilot CLI 的 Agent 行为。 本次更新还以研究预览形式,推出 HydraFusion 模型编排,自动选择模型...
IT之家 10 月 1 日消息,据《华盛顿邮报》今天(1 日)上午报道,研究人员披露,AI 智能体曾在没有收到指令的情况下试图入侵加拿大政府网站。 目前的类似事件不断增加,许多与 OpenAI 有关的 AI 智能体都曾自行探测或入侵企业及政府的计算机系统。 AI 研究非营利机构 Transluce 指出,这些智能体能够直接操作计算机和互联网,曾尝试访问加拿大图书档案馆。 研究人员无法确认这些智能体是否出自 OpenAI,然而其行为 与已确认来自 OpenAI 的智能体相似 。Transluce 判断,此次入侵尝试没有成功。 IT之家从报道中获悉,当地时间 9 月 30 日,研究人员 向加拿大政府通报了情况 。加拿大联邦网络安全机构回应称,目前已注意到有关可疑 AI 活动的报告,但没有迹象显示政府系统遭到入侵。 OpenAI 发言人回应称:“我们注意到有关 OpenAI 模型试图访问加拿大政府网站公开信息的报告。我们正在审查这些发...
推荐理由:来自IT之家 AI的《旗下智能体被指试图入侵加拿大政府网站,OpenAI 回应称正审查并已通报》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 1 日消息,据《华盛顿邮报》今天(1 日)上午报道,研究人员披露,AI 智能体曾在没有收到指令的情况下试图入侵加拿大政府网站。 目前的类似事件不断增加,许多与 OpenAI 有关的 AI 智能体都曾自行探测或入侵企业及政府的计算机系统。 AI 研究非营利机构 Transluce 指出,这些智能体能够直接操作计算机和互联网,曾尝试访问加拿大图书档案馆。 研究人员无法确认这些智能体是否出自 OpenAI,然而其行为 与已确认来自 OpenAI 的智能体相似 。Transluce 判断,此次入侵尝试没有成功。 IT之家从报道中获悉,当地时间 9 月 30 日,研究人员 向加拿大政府通报了情况 。加拿大联邦网络安全机构回应称,目前已注意到有关可疑 AI 活动的报告,但没有迹象显示政府系统遭到入侵。 OpenAI 发言人回应称:“我们注意到有关 OpenAI 模型试图访问加拿大政府网站公开信息的报告。我们正在审查这些发...
IT之家 9 月 30 日消息,据科技媒体 TechRadar 今天报道,网络安全研究机构 Glow Security 近日发现,多个 AI 智能体创建的公开 GitHub 仓库存在超 1.3 万张屏幕截图, 其中部分截图包含各种科技公司的敏感信息 。 IT之家从原报道获悉,这种泄密方式被称为“PixelLeak”。研究人员解释称,人类有时候可能会要求 AI 智能体提供项目修改前后的对比图,这时智能体需要截取屏幕。而 GitHub 官方确实提供了图片托管服务, 因此智能体很可能无意间将截图上传到公开仓库 。 该研究人员表示:“例如 internal_sweeper 是私有仓库,GitHub 无法在 PR 中渲染私有仓库图片。因此智能体这时就只能将 PNG 图片托管到其他地方,这样就新建了公开仓库 sweeper-demo / pr-assets,并将两张截图固定到一个 commit SHA 上。” 同时该机构发现,目前有 343...
推荐理由:来自IT之家 AI的《Glow Security:AI 智能体无意间泄露企业敏感信息,超 1.3 万张截图被放在 GitHub 公开仓库》。重点看智能体工作流、开源生态。摘要提到:IT之家 9 月 30 日消息,据科技媒体 TechRadar 今天报道,网络安全研究机构 Glow Security 近日发现,多个 AI 智能体创建的公开 GitHub 仓库存在超 1.3 万张屏幕截图, 其中部分截图包含各种科技公司的敏感信息 。 IT之家从原报道获悉,这种泄密方式被称为“PixelLeak”。研究人员解释称,人类有时候可能会要求 AI 智能体提供项目修改前后的对比图,这时智能体需要截取屏幕。而 GitHub 官方确实提供了图片托管服务, 因此智能体很可能无意间将截图上传到公开仓库 。 该研究人员表示:“例如 internal_sweeper 是私有仓库,GitHub 无法在 PR 中渲染私有仓库图片。因此智能体这时就只能将 PNG 图片托管到其他地方,这样就新建了公开仓库 sweeper-demo / pr-assets,并将两张截图固定到一个 commit SHA 上。” 同时该机构发现,目前有 343...
事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:HydraFusion in VS Code and the GitHub Copilot app 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:HydraFusion in VS Code and the GitHub Copilot app 事实摘要:这条英文动态主要涉及。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。
推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。
这条英文动态主要涉及智能体工作流。原文要点:Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…
推荐理由:来自MIT Technology Review AI的《“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer》。重点看智能体工作流。摘要提到:这条英文动态主要涉及智能体工作流。原文要点:Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…
IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...
推荐理由:来自IT之家 AI的《中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...
IT之家 9 月 29 日消息,中国科学院今日在北京举行新闻发布会,发布“科学前沿极限突破计划”及首批项目。首批启动的 10 个项目聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划同时在科研项目管理与评价方式上提出一系列关键改革举措。 中国科学院在发布会上还发布了下一批拟重点关注的领域方向清单,重点支持物质科学、生命科学、地球系统科学、空间科学等领域。计划力求在关系国计民生和国家长远发展的关键领域产出具有世界影响的重大原创成果。 中国科学院副院长、党组成员周琪表示,计划聚焦引领科研范式变革、开辟新前沿新方向的重大科学问题。中国科学院计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,组织优势力量进行系统化、建制化科技攻关。支撑科学家在重大科学前沿问题和关键核心技术上取得原创性、引领性突破。 在管理评价方面,计划鼓励院内外乃至全球优秀科学家,以首批项目为标杆,依托香山科学会议等平台...
推荐理由:来自IT之家 AI的《中国科学院发布科学前沿极限突破计划:首批 10 个项目启动,聚焦新元素合成、暗物质暗能量等问题》。重点看产品发布。摘要提到:IT之家 9 月 29 日消息,中国科学院今日在北京举行新闻发布会,发布“科学前沿极限突破计划”及首批项目。首批启动的 10 个项目聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划同时在科研项目管理与评价方式上提出一系列关键改革举措。 中国科学院在发布会上还发布了下一批拟重点关注的领域方向清单,重点支持物质科学、生命科学、地球系统科学、空间科学等领域。计划力求在关系国计民生和国家长远发展的关键领域产出具有世界影响的重大原创成果。 中国科学院副院长、党组成员周琪表示,计划聚焦引领科研范式变革、开辟新前沿新方向的重大科学问题。中国科学院计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,组织优势力量进行系统化、建制化科技攻关。支撑科学家在重大科学前沿问题和关键核心技术上取得原创性、引领性突破。 在管理评价方面,计划鼓励院内外乃至全球优秀科学家,以首批项目为标杆,依托香山科学会议等平台...
IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过 研究部门负责人或 VP(副总裁)、安全负责人和首席科学家 等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员, 应对安全论证以及任何事故响应承担责任 ,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。 OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。此外,训练流程应能方便地 识别未对齐模型的所有下游用途 (IT之家注:例如用于数据生成或评分),以便必要时消除未对齐输出带来的影响。 今天早些时候,OpenAI 宣布,随着越来越多报告显示 AI ...
推荐理由:来自IT之家 AI的《OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过 研究部门负责人或 VP(副总裁)、安全负责人和首席科学家 等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员, 应对安全论证以及任何事故响应承担责任 ,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。 OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。此外,训练流程应能方便地 识别未对齐模型的所有下游用途 (IT之家注:例如用于数据生成或评分),以便必要时消除未对齐输出带来的影响。 今天早些时候,OpenAI 宣布,随着越来越多报告显示 AI ...
IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...
推荐理由:来自IT之家 AI的《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...
IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究...
推荐理由:来自IT之家 AI的《从沙箱逃逸到 AI“蠕虫”,OpenAI 上线新站披露多起智能体失控事件》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究...
本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...
推荐理由:来自极客公园的《对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容》。重点看智能体工作流、模型能力与工程、文化创意。摘要提到:本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...
IT之家 9 月 28 日消息,中科宇航今日宣布与广州实验室围绕太空制药载荷开展联合研制攻关,并拟联合开展太空制药场景验证。 首批载荷计划于 2027 年第一季度搭乘力鸿二号可重复使用运载器开展亚轨道飞行验证 ,实施蛋白质和小分子药物结晶实验,开展太空制药装备的前期技术验证。 此次合作中,广州实验室提出药物结晶的科学问题,负责实验方案、样品、地面对照和结果分析。其核心合作团队 —— 徐强研究员团队长期从事高端医疗器械、MEMS 传感和显微成像技术研究,把成熟的生物医药自动化功能和原位观测能力转化为载荷能力。中科宇航负责航天平台、实验环境保障、系统接口、发射返回和任务组织, 双方共同开展太空制药载荷工程设计 。 在装备研制方面,双方将重点提升实验操作和过程观测的自动化水平。以面向太空生物实验的全视场细胞成像仪为例,团队已开展小型化、轻量化和低功耗设计,并通过自动对焦、连续成像和图像分析等功能, 提升设备自主运行和数据获取能力 。这...
推荐理由:来自IT之家 AI的《中科宇航深化太空制药合作,力鸿二号计划 2027 年携医药载荷首飞》。重点看多模态、论文/研究、部署/工程。摘要提到:IT之家 9 月 28 日消息,中科宇航今日宣布与广州实验室围绕太空制药载荷开展联合研制攻关,并拟联合开展太空制药场景验证。 首批载荷计划于 2027 年第一季度搭乘力鸿二号可重复使用运载器开展亚轨道飞行验证 ,实施蛋白质和小分子药物结晶实验,开展太空制药装备的前期技术验证。 此次合作中,广州实验室提出药物结晶的科学问题,负责实验方案、样品、地面对照和结果分析。其核心合作团队 —— 徐强研究员团队长期从事高端医疗器械、MEMS 传感和显微成像技术研究,把成熟的生物医药自动化功能和原位观测能力转化为载荷能力。中科宇航负责航天平台、实验环境保障、系统接口、发射返回和任务组织, 双方共同开展太空制药载荷工程设计 。 在装备研制方面,双方将重点提升实验操作和过程观测的自动化水平。以面向太空生物实验的全视场细胞成像仪为例,团队已开展小型化、轻量化和低功耗设计,并通过自动对焦、连续成像和图像分析等功能, 提升设备自主运行和数据获取能力 。这...
IT之家 9 月 28 日消息,据外媒 The Verge 今天(28 日)凌晨报道,安全研究人员罗文 · 霍华德-琼斯称,今年 4 月至 6 月,OpenAI 智能体对联合国贸易和发展会议(UNCTAD)的统计网站发起了 超过 16000 次扫描 。 这起事件还没有严重到 Hugging Face 遭黑客攻击或近期美国政府网站遇袭的程度,却再次引发了一个令人担忧的问题:AI 智能体为了完成任务, 会突破通常的行为边界 。 霍华德-琼斯称,这些智能体很可能承担了通过 UNCTADstat API 获取生产能力指数(PCI)公开数据的任务。但智能体 或无法直接调用 API ,同时受 HTTP 工具本身的限制,也难以从 UNCTADstat 提取所需数据。 据悉,智能体最终找到了绕过限制、从网站获取数据的方法,过程中仍出现了一些错误。随后,AI 的做法从寻找变通方案 转向掩饰行为 。智能体误以为这些错误来自一个并不存在的过滤器,认为...
推荐理由:来自IT之家 AI的《得不到就强攻?曝 OpenAI 智能体曾尝试“暴力破解”联合国机构网站》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 28 日消息,据外媒 The Verge 今天(28 日)凌晨报道,安全研究人员罗文 · 霍华德-琼斯称,今年 4 月至 6 月,OpenAI 智能体对联合国贸易和发展会议(UNCTAD)的统计网站发起了 超过 16000 次扫描 。 这起事件还没有严重到 Hugging Face 遭黑客攻击或近期美国政府网站遇袭的程度,却再次引发了一个令人担忧的问题:AI 智能体为了完成任务, 会突破通常的行为边界 。 霍华德-琼斯称,这些智能体很可能承担了通过 UNCTADstat API 获取生产能力指数(PCI)公开数据的任务。但智能体 或无法直接调用 API ,同时受 HTTP 工具本身的限制,也难以从 UNCTADstat 提取所需数据。 据悉,智能体最终找到了绕过限制、从网站获取数据的方法,过程中仍出现了一些错误。随后,AI 的做法从寻找变通方案 转向掩饰行为 。智能体误以为这些错误来自一个并不存在的过滤器,认为...
消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」,预计将在 9 月 29 日的 OpenAI DevDay 推出。 据报道,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置「-o」的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与「Aeon」有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。(来源...
推荐理由:来自极客公园的《传 OpenAI 29 日推个人 AI 助手;AI 专家偏远地区买地,担心「AI 失控」;挖掘机能自动「挖沟」,网友:蓝翔还能开几年?》。重点看智能体工作流、产品发布。摘要提到:消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」,预计将在 9 月 29 日的 OpenAI DevDay 推出。 据报道,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置「-o」的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与「Aeon」有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。(来源...