跳到正文
今天10月5日周一2 条
  1. 量子位66

    刚刚,Hinton发了首篇RSI论文

    AI已经开始真正进入「造下一代AI」的流水线 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

    推荐理由:来自量子位的《刚刚,Hinton发了首篇RSI论文》。重点看论文/研究。摘要提到:AI已经开始真正进入「造下一代AI」的流水线 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

  2. IT之家 AI70

    Anthropic 前研究员将出席纽约 AI 听证会作证,曾警告 AI 或毁灭人类

    IT之家 10 月 5 日消息,据知情人士向彭博新闻社透露,Anthropic 前研究员雅各布 · 考克斯顿(Jacob Coxon)将出席纽约市一场关于人工智能的听证会并作证。 报道称,考克斯恩将应纽约市议会议长朱莉 · 梅宁的要求出席作证。朱莉 · 梅宁敦促人工智能举报人出庭作证,与此同时,市议员们正在审议一揽子法案,旨在为这项技术制定相关保障措施。 IT之家注意到,考克森上月离开了 Anthropic 公司,并发出警告称,“认真研发人工智能的人坚信,到本十年末人工智能可能会让我们人类全部灭绝”,并指责其前雇主和 OpenAI“拿我们的生命冒险”。

    推荐理由:来自IT之家 AI的《Anthropic 前研究员将出席纽约 AI 听证会作证,曾警告 AI 或毁灭人类》。重点看论文/研究。摘要提到:IT之家 10 月 5 日消息,据知情人士向彭博新闻社透露,Anthropic 前研究员雅各布 · 考克斯顿(Jacob Coxon)将出席纽约市一场关于人工智能的听证会并作证。 报道称,考克斯恩将应纽约市议会议长朱莉 · 梅宁的要求出席作证。朱莉 · 梅宁敦促人工智能举报人出庭作证,与此同时,市议员们正在审议一揽子法案,旨在为这项技术制定相关保障措施。 IT之家注意到,考克森上月离开了 Anthropic 公司,并发出警告称,“认真研发人工智能的人坚信,到本十年末人工智能可能会让我们人类全部灭绝”,并指责其前雇主和 OpenAI“拿我们的生命冒险”。

10月4日周日
  1. 极客公园78

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...

    推荐理由:来自极客公园的《Jev 之后,中国团队开始深挖 AI 的「直觉层」》。重点看模型能力与工程、评测与基准、文化创意。摘要提到:作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...

  2. IT之家 AI38

    大量 AI“幻觉”报告压垮维护团队,谷歌暂停部分开源漏洞奖励计划

    IT之家 10 月 4 日消息,谷歌宣布,自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)将不再接收产品漏洞提报。本次规则调整不影响 2026 年 10 月 1 日之前已提交的产品漏洞。 不过,针对部分可能对谷歌云(Google Cloud)产品造成影响的谷歌云代码仓库,如果涉及产品漏洞,谷歌仍可能通过云漏洞奖励计划(Cloud VRP)接收相关报告。 OSS VRP 是谷歌设立的一项专业安全赏金计划,旨在通过激励独立安全研究人员,在谷歌整个开源生态系统中挖掘并负责任地披露安全缺陷。 据 Tom's Hardware 报道,知情人士透露, 谷歌工程师与开源代码维护人员已被数以千计的劣质报告彻底吞没 。这些报告声称发现了严重漏洞,但深入排查后发现,它们全都是 AI 产生的“幻觉”,根本无效且无法被实际利用。 维护团队不得不将大量精力耗费在验证这些虚假代码上,严重挤占了修复现实中高危漏洞的时间。这正是导致...

    推荐理由:来自IT之家 AI的《大量 AI“幻觉”报告压垮维护团队,谷歌暂停部分开源漏洞奖励计划》。重点看开源生态、产品发布。摘要提到:IT之家 10 月 4 日消息,谷歌宣布,自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)将不再接收产品漏洞提报。本次规则调整不影响 2026 年 10 月 1 日之前已提交的产品漏洞。 不过,针对部分可能对谷歌云(Google Cloud)产品造成影响的谷歌云代码仓库,如果涉及产品漏洞,谷歌仍可能通过云漏洞奖励计划(Cloud VRP)接收相关报告。 OSS VRP 是谷歌设立的一项专业安全赏金计划,旨在通过激励独立安全研究人员,在谷歌整个开源生态系统中挖掘并负责任地披露安全缺陷。 据 Tom's Hardware 报道,知情人士透露, 谷歌工程师与开源代码维护人员已被数以千计的劣质报告彻底吞没 。这些报告声称发现了严重漏洞,但深入排查后发现,它们全都是 AI 产生的“幻觉”,根本无效且无法被实际利用。 维护团队不得不将大量精力耗费在验证这些虚假代码上,严重挤占了修复现实中高危漏洞的时间。这正是导致...

  3. IT之家 AI72

    OpenAI GPT-6 Astra 破解拿破仑 1809 年密信,揭示 217 年前军事部署

    IT之家 10 月 4 日消息,一名 AI 研究人员借助 OpenAI GPT-6 Astra 成功破解了一封拿破仑 · 波拿巴写于 1809 年的加密军事信件。这封信此前因密码本遗失,在过去 217 年里始终未能被完整解读。 该破解工作由 SentinelOne 员工、AI 工程师卡特 · 丘奇(Carter Church)完成。他表示,他使用 GPT-6 Astra 模型,从一张历史文献扫描图像开始,对信件进行文字识别和密码分析,整个过程约耗时 6 小时。 这封信写于 1809 年 3 月 16 日,当时奥地利正准备对法国开战。拿破仑致信自己的继子、意大利总督欧仁 · 德 · 博阿尔内(Eugène de Beauharnais),要求其通过加密信件向法国将领奥古斯特 · 德 · 马尔蒙(Auguste de Marmont)传递军事信息。现存文件开头包含一行普通法语,随后则是 24 行由数字、字母及自创符号组成的加密文本。...

    推荐理由:来自IT之家 AI的《OpenAI GPT-6 Astra 破解拿破仑 1809 年密信,揭示 217 年前军事部署》。重点看模型能力与工程、文化创意。摘要提到:IT之家 10 月 4 日消息,一名 AI 研究人员借助 OpenAI GPT-6 Astra 成功破解了一封拿破仑 · 波拿巴写于 1809 年的加密军事信件。这封信此前因密码本遗失,在过去 217 年里始终未能被完整解读。 该破解工作由 SentinelOne 员工、AI 工程师卡特 · 丘奇(Carter Church)完成。他表示,他使用 GPT-6 Astra 模型,从一张历史文献扫描图像开始,对信件进行文字识别和密码分析,整个过程约耗时 6 小时。 这封信写于 1809 年 3 月 16 日,当时奥地利正准备对法国开战。拿破仑致信自己的继子、意大利总督欧仁 · 德 · 博阿尔内(Eugène de Beauharnais),要求其通过加密信件向法国将领奥古斯特 · 德 · 马尔蒙(Auguste de Marmont)传递军事信息。现存文件开头包含一行普通法语,随后则是 24 行由数字、字母及自创符号组成的加密文本。...

10月3日周六
  1. IT之家 AI72

    如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等

    IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol⁠ 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna⁠适合大规模处理特定任务,以及目标明...

    推荐理由:来自IT之家 AI的《如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol⁠ 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna⁠适合大规模处理特定任务,以及目标明...

  2. IT之家 AI34

    重塑智能眼镜光学方案:TDK 展示全球首款超构光学镜 DRP 显示屏

    IT之家 10 月 3 日消息,日本电子元器件厂商 TDK 昨日(10 月 2 日)发布公告, 展示了全球首款采用超构光学镜(Meta-Optic Mirror)的直接视网膜投影(DRP)智能眼镜显示屏。 全球智能眼镜出货量预计将快速增长,到 2030 年将达到 8,300 万台。(来源:富士奇美拉研究所《2025 年 XR 相关光学元件市场最新趋势》) IT之家援引博文介绍,超构光学镜是 TDK 研发的超薄平面反射元件,通过“负反射角”改变光线方向,在 150 纳米厚的平面结构中复现传统曲面镜功能。 而直接视网膜投影是一种将激光光线直接投射到眼内视网膜的显示技术。与传统在眼前形成图像的方式相比,DRP 可在不同视力条件下呈现清晰图像,并减少图像向周围环境泄漏。 该反射镜可嵌入眼镜镜片,可见光透过率达 80%。TDK 表示,其设计可避免波导显示常见的彩虹状“眼球发光”图案,并减少投影图像向外界泄漏。 传统波导方案依赖镜片内导光层...

    推荐理由:来自IT之家 AI的《重塑智能眼镜光学方案:TDK 展示全球首款超构光学镜 DRP 显示屏》。重点看产品发布。摘要提到:IT之家 10 月 3 日消息,日本电子元器件厂商 TDK 昨日(10 月 2 日)发布公告, 展示了全球首款采用超构光学镜(Meta-Optic Mirror)的直接视网膜投影(DRP)智能眼镜显示屏。 全球智能眼镜出货量预计将快速增长,到 2030 年将达到 8,300 万台。(来源:富士奇美拉研究所《2025 年 XR 相关光学元件市场最新趋势》) IT之家援引博文介绍,超构光学镜是 TDK 研发的超薄平面反射元件,通过“负反射角”改变光线方向,在 150 纳米厚的平面结构中复现传统曲面镜功能。 而直接视网膜投影是一种将激光光线直接投射到眼内视网膜的显示技术。与传统在眼前形成图像的方式相比,DRP 可在不同视力条件下呈现清晰图像,并减少图像向周围环境泄漏。 该反射镜可嵌入眼镜镜片,可见光透过率达 80%。TDK 表示,其设计可避免波导显示常见的彩虹状“眼球发光”图案,并减少投影图像向外界泄漏。 传统波导方案依赖镜片内导光层...

  3. IT之家 AI72

    OpenAI 披露:澳大利亚又一政府机构遭失控智能体入侵

    IT之家 10 月 3 日消息,据澳大利亚广播公司当地时间 10 月 2 日报道,澳大利亚新南威尔士州政府网站遭到了失控的 OpenAI 智能体侵入。 当地政府与 OpenAI 双方均证实,在此次发生于今年 6 月的事件中,并没有任何公众信息被读取。不过,官方直到本周才收到正式通报。 OpenAI 发言人在声明中称:“在察觉到这一异常活动后…… 我们立即组织了紧急的内部技术与法律审查,旨在结合当时正在推进的具体研究项目,彻查该行为的根本性质。” 审查一经结束,我们便向新南威尔士州州长办公室进行了情况汇报,并通报了澳大利亚信号局。 新南威尔士州州长和内阁部表示,该模型侵入的是国家公园和野生动物服务局的一个网页端应用程序,其中包含历史档案及火情监测数据。 IT之家注意到,在此之前,OpenAI 刚因非法渗入澳大利亚国民医疗保险门户网站一事公开致歉,并声称希望借此“重构与澳大利亚公众之间的信任”。 相关阅读: 《 已证实首例:澳大利亚...

    推荐理由:来自IT之家 AI的《OpenAI 披露:澳大利亚又一政府机构遭失控智能体入侵》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 3 日消息,据澳大利亚广播公司当地时间 10 月 2 日报道,澳大利亚新南威尔士州政府网站遭到了失控的 OpenAI 智能体侵入。 当地政府与 OpenAI 双方均证实,在此次发生于今年 6 月的事件中,并没有任何公众信息被读取。不过,官方直到本周才收到正式通报。 OpenAI 发言人在声明中称:“在察觉到这一异常活动后…… 我们立即组织了紧急的内部技术与法律审查,旨在结合当时正在推进的具体研究项目,彻查该行为的根本性质。” 审查一经结束,我们便向新南威尔士州州长办公室进行了情况汇报,并通报了澳大利亚信号局。 新南威尔士州州长和内阁部表示,该模型侵入的是国家公园和野生动物服务局的一个网页端应用程序,其中包含历史档案及火情监测数据。 IT之家注意到,在此之前,OpenAI 刚因非法渗入澳大利亚国民医疗保险门户网站一事公开致歉,并声称希望借此“重构与澳大利亚公众之间的信任”。 相关阅读: 《 已证实首例:澳大利亚...

  4. arXiv AI38

    4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes

    这条英文动态主要涉及智能体工作流、评测与基准。原文要点:We introduce 4DCodeBench, a benchmark for 4D inverse graphics through code generation, in which agents reconstruct dynamic scenes from video as executable graphics programs. To accomplish this, agents must translate visual observations into compact representations of scene structure and dynamics, by implementing abstractions such as physical simulations to reproduce complex behavior. To evaluate this capability, we c...

    推荐理由:来自arXiv AI的《4DCodeBench: Benchmarking Agents on Inverse Graphics of Dynamic Scenes》。重点看智能体工作流、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、评测与基准。原文要点:We introduce 4DCodeBench, a benchmark for 4D inverse graphics through code generation, in which agents reconstruct dynamic scenes from video as executable graphics programs. To accomplish this, agents must translate visual observations into compact representations of scene structure and dynamics, by implementing abstractions such as physical simulations to reproduce complex behavior. To ev...

  5. arXiv AI36

    RNADyn: A Benchmark for Generating and Understanding RNA Dynamics

    这条英文动态主要涉及评测与基准。原文要点:Ribonucleic acid (RNA) functions through conformational changes that are not fully captured by static structures. However, large-scale standardized RNA dynamics data remain limited, and existing approaches typically treat trajectory generation and dynamics understanding as separate objectives. Here, we introduce RNADynBench, a standardized RNA molecular dynamics (MD) benchmark with 2585 quality-controlled 100-ns all-...

    推荐理由:来自arXiv AI的《RNADyn: A Benchmark for Generating and Understanding RNA Dynamics》。重点看评测与基准。摘要提到:这条英文动态主要涉及评测与基准。原文要点:Ribonucleic acid (RNA) functions through conformational changes that are not fully captured by static structures. However, large-scale standardized RNA dynamics data remain limited, and existing approaches typically treat trajectory generation and dynamics understanding as separate objectives. Here, we introduce RNADynBench, a standardized RNA molecular dynamics (MD) benchmark with 2585 quality-c...

  6. arXiv AI38

    From Mixing to Tearing: Graph Decomposition in Decentralized Optimization via Message Passing

    这条英文动态主要涉及智能体工作流。原文要点:We study the minimization of sums of smooth strongly convex functions over undirected graphs, with each function held by one agent and communication restricted to neighbors in the graph. Existing decentralized methods, whether based on gossip or on routing over spanning trees, typically use the network to mix or aggregate information to enable {\it prescribed} local optimization updates. What this communication-cente...

    推荐理由:来自arXiv AI的《From Mixing to Tearing: Graph Decomposition in Decentralized Optimization via Message Passing》。重点看智能体工作流。摘要提到:这条英文动态主要涉及智能体工作流。原文要点:We study the minimization of sums of smooth strongly convex functions over undirected graphs, with each function held by one agent and communication restricted to neighbors in the graph. Existing decentralized methods, whether based on gossip or on routing over spanning trees, typically use the network to mix or aggregate information to enable {\it prescribed} local optimization updates. What th...

  7. arXiv AI42

    LESSER: Post-Training Data Selection with Output-Layer Gradients

    这条英文动态主要涉及模型能力与工程。原文要点:The choice of post-training data for large language models substantially affects downstream performance. Gradient-based data selection is a popular approach that ranks training data by how well their gradients align with those of a small validation set. However, ranking with full-parameter gradients requires an expensive backward pass on every sample, making computation intractable for large candidate pools. This rai...

    推荐理由:来自arXiv AI的《LESSER: Post-Training Data Selection with Output-Layer Gradients》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:The choice of post-training data for large language models substantially affects downstream performance. Gradient-based data selection is a popular approach that ranks training data by how well their gradients align with those of a small validation set. However, ranking with full-parameter gradients requires an expensive backward pass on every sample, making computation intractable for large ca...

  8. arXiv AI42

    Transcriptome-informed multi-modal AI for predicting neoadjuvant therapy response from breast cancer biopsies

    这条英文动态主要涉及模型能力与工程。原文要点:Scarcity of labeled data limits development of deep learning biomarkers in oncology. We develop a two-stage AI model predicting pathological complete response (pCR) to neoadjuvant therapy in breast cancer. The first stage learns the transcriptome from histopathology using 8,742 patients across 32 cancer types, corroborated by pathologist review and spatial agreement with measured expression. This simplifies the secon...

    推荐理由:来自arXiv AI的《Transcriptome-informed multi-modal AI for predicting neoadjuvant therapy response from breast cancer biopsies》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Scarcity of labeled data limits development of deep learning biomarkers in oncology. We develop a two-stage AI model predicting pathological complete response (pCR) to neoadjuvant therapy in breast cancer. The first stage learns the transcriptome from histopathology using 8,742 patients across 32 cancer types, corroborated by pathologist review and spatial agreement with measured expression. Th...

10月2日周五
  1. IT之家 AI68

    OpenAI 升级 ChatGPT 购物体验,新增 AI 衣服虚拟试穿体验

    IT之家 10 月 2 日消息,OpenAI 宣布进一步升级 ChatGPT 的购物功能,新增虚拟试穿和 Favorites(收藏)两项功能,用户现在可以上传自己的照片,让 ChatGPT 生成穿着特定服饰或配饰后的效果图,同时也可以将感兴趣的商品保存下来,方便之后继续查看。 IT之家注意到,去年 OpenAI 曾为 ChatGPT 推出专门的 Shopping Research 购物研究功能,主要面向较为复杂的购物需求。其不仅仅局限于“简单提供商品链接”,用户可以通过自然语言告知 ChatGPT 自己预算和需求,之后 ChatGPT 便会在全网搜索相关商品,并根据不同产品的优缺点生成个性化购买指南,同时提供购买链接。 而如今,OpenAI 为 ChatGPT 新增的虚拟试穿功能将以“Try on”按钮的形式出现在支持该功能的服饰和配饰商品页面中。用户可以上传自拍,也可以直接拍摄一张新照片,ChatGPT 随后会生成一张展示对应...

    推荐理由:来自IT之家 AI的《OpenAI 升级 ChatGPT 购物体验,新增 AI 衣服虚拟试穿体验》。重点看产品发布。摘要提到:IT之家 10 月 2 日消息,OpenAI 宣布进一步升级 ChatGPT 的购物功能,新增虚拟试穿和 Favorites(收藏)两项功能,用户现在可以上传自己的照片,让 ChatGPT 生成穿着特定服饰或配饰后的效果图,同时也可以将感兴趣的商品保存下来,方便之后继续查看。 IT之家注意到,去年 OpenAI 曾为 ChatGPT 推出专门的 Shopping Research 购物研究功能,主要面向较为复杂的购物需求。其不仅仅局限于“简单提供商品链接”,用户可以通过自然语言告知 ChatGPT 自己预算和需求,之后 ChatGPT 便会在全网搜索相关商品,并根据不同产品的优缺点生成个性化购买指南,同时提供购买链接。 而如今,OpenAI 为 ChatGPT 新增的虚拟试穿功能将以“Try on”按钮的形式出现在支持该功能的服饰和配饰商品页面中。用户可以上传自拍,也可以直接拍摄一张新照片,ChatGPT 随后会生成一张展示对应...

  2. 量子位67

    丘成桐新论文致谢了GPT和Claude

    44年前被亲自列入问题清单 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

    推荐理由:来自量子位的《丘成桐新论文致谢了GPT和Claude》。重点看论文/研究。摘要提到:44年前被亲自列入问题清单 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

  3. 量子位66

    arXiv最严新规!每人每月最多提交2篇,拒稿不退额度

    换区也没用 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

    推荐理由:来自量子位的《arXiv最严新规!每人每月最多提交2篇,拒稿不退额度》。重点看论文/研究。摘要提到:换区也没用 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。

  4. IT之家 AI68

    AI 灌水稿激增:预印本平台 arXiv 出台新规,每人每月限投 2 篇

    IT之家 10 月 2 日消息,预印本开放获取平台 arXiv 发布博文,宣布于昨日(10 月 1 日)开始实施全新速率限制政策, 将所有投稿者每月提交上限设为 2 篇、同时在审活跃稿件上限设为 3 篇。 IT之家注:arXiv 于 1991 年 8 月 14 日由理论物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室(LANL)创建,是一个面向物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程与系统科学、经济学等学科的预印本(preprint)开放获取平台,允许研究者在论文正式同行评审前先行公开分享成果。 官方博文指出仅在 2026 年 9 月,arXiv 单月收到 40,363 篇投稿,创历史新高,较 2024 年 9 月的 20,569 篇翻倍。同期支持工单激增至近 9,000 个,志愿者审核员时间被大量低质量稿件占用。 生成式 AI 降低写作门槛,导致“香肠论文”(单研究拆分为多篇)、窄 sco...

    推荐理由:来自IT之家 AI的《AI 灌水稿激增:预印本平台 arXiv 出台新规,每人每月限投 2 篇》。重点看产品发布。摘要提到:IT之家 10 月 2 日消息,预印本开放获取平台 arXiv 发布博文,宣布于昨日(10 月 1 日)开始实施全新速率限制政策, 将所有投稿者每月提交上限设为 2 篇、同时在审活跃稿件上限设为 3 篇。 IT之家注:arXiv 于 1991 年 8 月 14 日由理论物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室(LANL)创建,是一个面向物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程与系统科学、经济学等学科的预印本(preprint)开放获取平台,允许研究者在论文正式同行评审前先行公开分享成果。 官方博文指出仅在 2026 年 9 月,arXiv 单月收到 40,363 篇投稿,创历史新高,较 2024 年 9 月的 20,569 篇翻倍。同期支持工单激增至近 9,000 个,志愿者审核员时间被大量低质量稿件占用。 生成式 AI 降低写作门槛,导致“香肠论文”(单研究拆分为多篇)、窄 sco...

  5. IT之家 AI72

    OpenAI 通报逾百家第三方机构,自家智能体存在失控风险

    IT之家 10 月 2 日消息,当地时间 9 月 30 日晚,OpenAI 披露,旗下 AI 智能体或曾擅自尝试绕过安全防护, 或对百余家机构的系统造成负面影响 。 OpenAI 此次披露的信息显示,已知的 AI 智能体失控行为 涉及范围进一步扩大 。公司已向 100 多家第三方机构发出通知,告知这些机构发现了“智能体偏离预期的行为”。 目前,OpenAI 已对约 50PB 数据启动筛查,以了解其恶意智能体活动的全部范围。 IT之家获悉,具体情况包括 AI 智能体试图 让网站执行非预期命令、把网站当作共享留言板使用 ,以及绕过某些安全检查。 OpenAI 强调,收到通知 并不代表系统一定遭到入侵 。这些活动更接近于试探一扇上锁的门,而非真正破门而入。 OpenAI 表示,公司希望向受影响的第三方提供必要信息,以便调查和处理潜在的安全或其他技术问题。OpenAI 还承诺公开分享对模型行为、安全防护中新型薄弱环节的研究结果,帮助更广...

    推荐理由:来自IT之家 AI的《OpenAI 通报逾百家第三方机构,自家智能体存在失控风险》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 2 日消息,当地时间 9 月 30 日晚,OpenAI 披露,旗下 AI 智能体或曾擅自尝试绕过安全防护, 或对百余家机构的系统造成负面影响 。 OpenAI 此次披露的信息显示,已知的 AI 智能体失控行为 涉及范围进一步扩大 。公司已向 100 多家第三方机构发出通知,告知这些机构发现了“智能体偏离预期的行为”。 目前,OpenAI 已对约 50PB 数据启动筛查,以了解其恶意智能体活动的全部范围。 IT之家获悉,具体情况包括 AI 智能体试图 让网站执行非预期命令、把网站当作共享留言板使用 ,以及绕过某些安全检查。 OpenAI 强调,收到通知 并不代表系统一定遭到入侵 。这些活动更接近于试探一扇上锁的门,而非真正破门而入。 OpenAI 表示,公司希望向受影响的第三方提供必要信息,以便调查和处理潜在的安全或其他技术问题。OpenAI 还承诺公开分享对模型行为、安全防护中新型薄弱环节的研究结果,帮助更广...

  6. IT之家 AI74

    AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”

    IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...

    推荐理由:来自IT之家 AI的《AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...

  7. IT之家 AI72

    因违反敏感信息访问和共享规定,OpenAI 与三名研究人员终止合作

    IT之家 10 月 2 日消息,当地时间 1 日,根据《华尔街日报》报道,OpenAI 宣布与三名研究人员终止合作,原因是三人违反了 敏感信息访问和共享规定 。 OpenAI 发言人在声明中说:“我们已与三名违反公司敏感信息访问和处理规定的人员解除关系。调查确认,这些人员 绕过公司既定流程,不当处理敏感信息 ,不仅违反了公司规定,也破坏了我们工作所必需的信任。” 三人名叫贾斯敏 · 王、托梅克 · 科尔巴克和米基塔 · 巴莱斯尼。 遭解雇的托梅克 · 科尔巴克是 OpenAI 安全团队成员。他曾称,在 Redwood Research 和非营利组织 METR 调查 Hugging Face 事件期间,自己担任 OpenAI 方面的技术联系人。 另外两名遭解雇员工贾斯敏 · 王和米基塔 · 巴莱斯尼从事模型对齐研究,主要研究如何让 OpenAI 的模型按照人类意图行事。 据IT之家了解,涉事员工被指将公司机密信息 提供给一家第三方...

    推荐理由:来自IT之家 AI的《因违反敏感信息访问和共享规定,OpenAI 与三名研究人员终止合作》。重点看模型能力与工程。摘要提到:IT之家 10 月 2 日消息,当地时间 1 日,根据《华尔街日报》报道,OpenAI 宣布与三名研究人员终止合作,原因是三人违反了 敏感信息访问和共享规定 。 OpenAI 发言人在声明中说:“我们已与三名违反公司敏感信息访问和处理规定的人员解除关系。调查确认,这些人员 绕过公司既定流程,不当处理敏感信息 ,不仅违反了公司规定,也破坏了我们工作所必需的信任。” 三人名叫贾斯敏 · 王、托梅克 · 科尔巴克和米基塔 · 巴莱斯尼。 遭解雇的托梅克 · 科尔巴克是 OpenAI 安全团队成员。他曾称,在 Redwood Research 和非营利组织 METR 调查 Hugging Face 事件期间,自己担任 OpenAI 方面的技术联系人。 另外两名遭解雇员工贾斯敏 · 王和米基塔 · 巴莱斯尼从事模型对齐研究,主要研究如何让 OpenAI 的模型按照人类意图行事。 据IT之家了解,涉事员工被指将公司机密信息 提供给一家第三方...

  8. arXiv AI Education40

    On-Premises Multi-Course RAG Tutoring for Business Education: Hardware-Software Trade-offs in a Campus AI Tutor

    这条英文动态主要涉及评测与基准、教育应用。原文要点:Campus AI tutors based on retrieval-augmented generation (RAG) must ground answers in assigned course materials while keeping textbooks and student dialogue on institutional infrastructure. We present CourseChat, an on-premises, multi-course RAG tutor for undergraduate business education, deployed behind a campus web gateway and intended for use embedded in Moodle. Six isolated course offerings, each keyed by its own...

    推荐理由:来自arXiv AI Education的《On-Premises Multi-Course RAG Tutoring for Business Education: Hardware-Software Trade-offs in a Campus AI Tutor》。重点看评测与基准、教育应用。摘要提到:这条英文动态主要涉及评测与基准、教育应用。原文要点:Campus AI tutors based on retrieval-augmented generation (RAG) must ground answers in assigned course materials while keeping textbooks and student dialogue on institutional infrastructure. We present CourseChat, an on-premises, multi-course RAG tutor for undergraduate business education, deployed behind a campus web gateway and intended for use embedded in Moodle. Six isolated course offeri...

  9. arXiv AI Education40

    CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking

    这条英文动态主要涉及智能体工作流、评测与基准。原文要点:Recent benchmarks rely on user simulators to evaluate AI agents in multi-turn interaction. While existing simulation techniques demonstrate surface fidelity to human style and behavior, ecologically valid interactive benchmarking also requires alignment in when and how agents fail across simulated and real user populations. We find that existing simulators lack outcome calibration: agreement with observed success rat...

    推荐理由:来自arXiv AI Education的《CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking》。重点看智能体工作流、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、评测与基准。原文要点:Recent benchmarks rely on user simulators to evaluate AI agents in multi-turn interaction. While existing simulation techniques demonstrate surface fidelity to human style and behavior, ecologically valid interactive benchmarking also requires alignment in when and how agents fail across simulated and real user populations. We find that existing simulators lack outcome calibration: agreeme...

  10. arXiv AI59

    KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards 这条英文动态主要涉及智能体工作流、模型能力与工程、评测与。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  11. arXiv AI59

    Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents 这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:Building reliable robot capabilities。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  12. arXiv AI55

    Embedding Prediction Helps Image Generation

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:Embedding Prediction Helps Image Generation 这条英文动态讨论了 AI 领域的新进展。原文要点:In diffusion transformers, a class label or a text prompt is embedded once, and the sa。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  13. arXiv AI57

    ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research 这条英文动态主要涉及评测与基准、文化创意。原文要点:What makes great scientists great? Even。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  14. arXiv AI57

    VISTA: A Visual Harness for Reasoning in an Interactive World

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:VISTA: A Visual Harness for Reasoning in an Interactive World 这条英文动态主要涉及模型能力与工程。原文要点:We show that multimodal models possess strong reasoning a。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  15. arXiv AI57

    TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning 这条英文动态主要涉及模型能力与工程。原文要点:Full-parameter fine-tuning of large language models 。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

10月1日周四
  1. arXiv AI61

    Gacha Decoding: Eliciting Diverse Generations Through Instruction Following

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Gacha Decoding: Eliciting Diverse Generations Through Instruction Following 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:Gacha Decoding: Eliciting。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. arXiv AI57

    Learning Commute-Time-Preserving World Models for Planning

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Learning Commute-Time-Preserving World Models for Planning 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准,原文信息显示:Learning Commute-Time-Preserving World M。影响判断:它可能改变智能体工作流、模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. arXiv AI61

    LLM-Driven Multi-Agent Control for Skill-Based Smart Manufacturing

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:LLM-Driven Multi-Agent Control for Skill-Based Smart Manufacturing 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、文化创意,原文信息显示:LLM-Driven Multi-Agent Control for。影响判断:它可能改变智能体工作流、模型能力与工程、文化创意相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、文化创意方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、文化创意直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI74

    微软更新 1.140 版 VS Code:多文件夹会话、远程 AI Agent 任务委派等

    IT之家 10 月 1 日消息,微软昨日(9 月 30 日)更新推出 1.140 稳定版 Visual Studio Code,本次更新重点围绕 GitHub Copilot Agent 工作流展开, 新增多文件夹会话、远程任务委派、模型协同编排及企业级 AI 管理能力。 VS Code 1.140 引入实验性多文件夹会话功能。同一 Agent 会话中的不同聊天,可以分别绑定到不同代码仓库或 Git worktree,彼此之间的终端、任务、代码变更、Pull Request 和合并状态相互隔离,避免修改意外串联。 本次更新还增强 Copilot harness,由 Copilot SDK 提供支持,在基于智能体主机协议 (AHP) 的专用智能体主机进程中运行,统一 VS Code、Copilot 应用和 Copilot CLI 的 Agent 行为。 本次更新还以研究预览形式,推出 HydraFusion 模型编排,自动选择模型...

    推荐理由:来自IT之家 AI的《微软更新 1.140 版 VS Code:多文件夹会话、远程 AI Agent 任务委派等》。重点看智能体工作流、模型能力与工程、开源生态。摘要提到:IT之家 10 月 1 日消息,微软昨日(9 月 30 日)更新推出 1.140 稳定版 Visual Studio Code,本次更新重点围绕 GitHub Copilot Agent 工作流展开, 新增多文件夹会话、远程任务委派、模型协同编排及企业级 AI 管理能力。 VS Code 1.140 引入实验性多文件夹会话功能。同一 Agent 会话中的不同聊天,可以分别绑定到不同代码仓库或 Git worktree,彼此之间的终端、任务、代码变更、Pull Request 和合并状态相互隔离,避免修改意外串联。 本次更新还增强 Copilot harness,由 Copilot SDK 提供支持,在基于智能体主机协议 (AHP) 的专用智能体主机进程中运行,统一 VS Code、Copilot 应用和 Copilot CLI 的 Agent 行为。 本次更新还以研究预览形式,推出 HydraFusion 模型编排,自动选择模型...

  5. IT之家 AI72

    旗下智能体被指试图入侵加拿大政府网站,OpenAI 回应称正审查并已通报

    IT之家 10 月 1 日消息,据《华盛顿邮报》今天(1 日)上午报道,研究人员披露,AI 智能体曾在没有收到指令的情况下试图入侵加拿大政府网站。 目前的类似事件不断增加,许多与 OpenAI 有关的 AI 智能体都曾自行探测或入侵企业及政府的计算机系统。 AI 研究非营利机构 Transluce 指出,这些智能体能够直接操作计算机和互联网,曾尝试访问加拿大图书档案馆。 研究人员无法确认这些智能体是否出自 OpenAI,然而其行为 与已确认来自 OpenAI 的智能体相似 。Transluce 判断,此次入侵尝试没有成功。 IT之家从报道中获悉,当地时间 9 月 30 日,研究人员 向加拿大政府通报了情况 。加拿大联邦网络安全机构回应称,目前已注意到有关可疑 AI 活动的报告,但没有迹象显示政府系统遭到入侵。 OpenAI 发言人回应称:“我们注意到有关 OpenAI 模型试图访问加拿大政府网站公开信息的报告。我们正在审查这些发...

    推荐理由:来自IT之家 AI的《旗下智能体被指试图入侵加拿大政府网站,OpenAI 回应称正审查并已通报》。重点看智能体工作流、模型能力与工程。摘要提到:IT之家 10 月 1 日消息,据《华盛顿邮报》今天(1 日)上午报道,研究人员披露,AI 智能体曾在没有收到指令的情况下试图入侵加拿大政府网站。 目前的类似事件不断增加,许多与 OpenAI 有关的 AI 智能体都曾自行探测或入侵企业及政府的计算机系统。 AI 研究非营利机构 Transluce 指出,这些智能体能够直接操作计算机和互联网,曾尝试访问加拿大图书档案馆。 研究人员无法确认这些智能体是否出自 OpenAI,然而其行为 与已确认来自 OpenAI 的智能体相似 。Transluce 判断,此次入侵尝试没有成功。 IT之家从报道中获悉,当地时间 9 月 30 日,研究人员 向加拿大政府通报了情况 。加拿大联邦网络安全机构回应称,目前已注意到有关可疑 AI 活动的报告,但没有迹象显示政府系统遭到入侵。 OpenAI 发言人回应称:“我们注意到有关 OpenAI 模型试图访问加拿大政府网站公开信息的报告。我们正在审查这些发...

  6. Apple Machine Learning Research85

    RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback

    这条英文动态主要涉及智能体工作流、模型能力与工程、教育应用。原文要点:The common paradigm of reinforcement learning with verifiable rewards (RLVR) is to let agents make multiple attempts at a task, and optimize towards the successful ones. This becomes problematic in the realms of self-improvement, where tasks are so difficult that the agent has a low or even no chance of success, and where there are no teacher models or example solutions to distill from. In this paper, we introduce RL...

    推荐理由:来自Apple Machine Learning Research的《RLTL;DR: Self-Improvement by Internalizing Self-Generated Feedback》。重点看智能体工作流、模型能力与工程、教育应用。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程、教育应用。原文要点:The common paradigm of reinforcement learning with verifiable rewards (RLVR) is to let agents make multiple attempts at a task, and optimize towards the successful ones. This becomes problematic in the realms of self-improvement, where tasks are so difficult that the agent has a low or even no chance of success, and where there are no teacher models or example solutions to distill f...

9月30日周三
  1. IT之家 AI68

    Glow Security:AI 智能体无意间泄露企业敏感信息,超 1.3 万张截图被放在 GitHub 公开仓库

    IT之家 9 月 30 日消息,据科技媒体 TechRadar 今天报道,网络安全研究机构 Glow Security 近日发现,多个 AI 智能体创建的公开 GitHub 仓库存在超 1.3 万张屏幕截图, 其中部分截图包含各种科技公司的敏感信息 。 IT之家从原报道获悉,这种泄密方式被称为“PixelLeak”。研究人员解释称,人类有时候可能会要求 AI 智能体提供项目修改前后的对比图,这时智能体需要截取屏幕。而 GitHub 官方确实提供了图片托管服务, 因此智能体很可能无意间将截图上传到公开仓库 。 该研究人员表示:“例如 internal_sweeper 是私有仓库,GitHub 无法在 PR 中渲染私有仓库图片。因此智能体这时就只能将 PNG 图片托管到其他地方,这样就新建了公开仓库 sweeper-demo / pr-assets,并将两张截图固定到一个 commit SHA 上。” 同时该机构发现,目前有 343...

    推荐理由:来自IT之家 AI的《Glow Security:AI 智能体无意间泄露企业敏感信息,超 1.3 万张截图被放在 GitHub 公开仓库》。重点看智能体工作流、开源生态。摘要提到:IT之家 9 月 30 日消息,据科技媒体 TechRadar 今天报道,网络安全研究机构 Glow Security 近日发现,多个 AI 智能体创建的公开 GitHub 仓库存在超 1.3 万张屏幕截图, 其中部分截图包含各种科技公司的敏感信息 。 IT之家从原报道获悉,这种泄密方式被称为“PixelLeak”。研究人员解释称,人类有时候可能会要求 AI 智能体提供项目修改前后的对比图,这时智能体需要截取屏幕。而 GitHub 官方确实提供了图片托管服务, 因此智能体很可能无意间将截图上传到公开仓库 。 该研究人员表示:“例如 internal_sweeper 是私有仓库,GitHub 无法在 PR 中渲染私有仓库图片。因此智能体这时就只能将 PNG 图片托管到其他地方,这样就新建了公开仓库 sweeper-demo / pr-assets,并将两张截图固定到一个 commit SHA 上。” 同时该机构发现,目前有 343...

  2. GitHub Changelog87

    HydraFusion in VS Code and the GitHub Copilot app

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:HydraFusion in VS Code and the GitHub Copilot app 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:HydraFusion in VS Code and the GitHub Copilot app 事实摘要:这条英文动态主要涉及。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. MIT Technology Review AI85

    “We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer

    这条英文动态主要涉及智能体工作流。原文要点:Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…

    推荐理由:来自MIT Technology Review AI的《“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer》。重点看智能体工作流。摘要提到:这条英文动态主要涉及智能体工作流。原文要点:Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…

  4. IT之家 AI72

    微软推出实验性多模态 AI 研究系统 Project Quine,有望大幅加速药物发现

    IT之家 9 月 30 日消息,当地时间 29 日,微软研究院推出了实验性多模态 AI 研究系统 Project Quine。据悉,Project Quine 是一套 用于生物学研究的“世界模型” ,目标是把计算生物学建模与实际湿实验衔接起来。 Project Quine 由微软研究院与哈佛大学和麻省理工学院博德研究所共同开发。系统将覆盖 基因组学、蛋白质、化学、细胞状态和生物成像 的联合表征世界模型,与交互式推理框架结合起来。为了让科研人员尽早使用 Project Quine,微软开放了首届 Quine Fellows 项目申请。未来,微软还计划通过 Microsoft Discovery 等产品逐步扩大商业化开放范围。 Project Quine 并不局限于某一个研究领域,而是能够 同时处理上述多个领域的信息 ,从而进行综合性的跨模型分析。借助这种架构,传统药物发现中的部分瓶颈有望得到突破:科研人员可以先通过计算方法预筛候选...

    推荐理由:来自IT之家 AI的《微软推出实验性多模态 AI 研究系统 Project Quine,有望大幅加速药物发现》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 30 日消息,当地时间 29 日,微软研究院推出了实验性多模态 AI 研究系统 Project Quine。据悉,Project Quine 是一套 用于生物学研究的“世界模型” ,目标是把计算生物学建模与实际湿实验衔接起来。 Project Quine 由微软研究院与哈佛大学和麻省理工学院博德研究所共同开发。系统将覆盖 基因组学、蛋白质、化学、细胞状态和生物成像 的联合表征世界模型,与交互式推理框架结合起来。为了让科研人员尽早使用 Project Quine,微软开放了首届 Quine Fellows 项目申请。未来,微软还计划通过 Microsoft Discovery 等产品逐步扩大商业化开放范围。 Project Quine 并不局限于某一个研究领域,而是能够 同时处理上述多个领域的信息 ,从而进行综合性的跨模型分析。借助这种架构,传统药物发现中的部分瓶颈有望得到突破:科研人员可以先通过计算方法预筛候选...

9月29日周二
  1. IT之家 AI66

    我国科学家提出单光束多维光存储新方案:DVD 尺寸容量可达 0.4 Pb

    IT之家 9 月 29 日消息,上海理工大学智能科技学院顾敏院士、张启明教授团队今日在《自然 · 光子学》在线发表研究成果,自主研发单光束多维光存储技术。 该技术使单个三维存储点可区分 1024 种状态,对应 10 bit 信息容量,并实现高速写入和宽场并行读取。DVD 尺寸介质的理论存储容量约 0.4 Pb,数据读取可靠性超过 99.99%。 ▲ 论文原理图 传统二进制存储中,一个记录单元通常只有“0”和“1”两种状态。张启明表示,新技术让一个记录单元拥有 1024 种可区分状态。 过去需要多个记录单元承载的信息,现在可通过提高单个记录点信息容量完成。光存储提升容量不再只靠缩小记录点或增加层数。 以 8K 灰度图像为例,一个像素有 256 种灰度取值,需 8 个二进制单元保存。10 bit 存储点完成 8 bit 灰度后,多出 2 bit 可为原位光学 AI 训练提供编码空间。 传统超分辨光存储路线常需双束光协同写入和读取,带...

    推荐理由:来自IT之家 AI的《我国科学家提出单光束多维光存储新方案:DVD 尺寸容量可达 0.4 Pb》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,上海理工大学智能科技学院顾敏院士、张启明教授团队今日在《自然 · 光子学》在线发表研究成果,自主研发单光束多维光存储技术。 该技术使单个三维存储点可区分 1024 种状态,对应 10 bit 信息容量,并实现高速写入和宽场并行读取。DVD 尺寸介质的理论存储容量约 0.4 Pb,数据读取可靠性超过 99.99%。 ▲ 论文原理图 传统二进制存储中,一个记录单元通常只有“0”和“1”两种状态。张启明表示,新技术让一个记录单元拥有 1024 种可区分状态。 过去需要多个记录单元承载的信息,现在可通过提高单个记录点信息容量完成。光存储提升容量不再只靠缩小记录点或增加层数。 以 8K 灰度图像为例,一个像素有 256 种灰度取值,需 8 个二进制单元保存。10 bit 存储点完成 8 bit 灰度后,多出 2 bit 可为原位光学 AI 训练提供编码空间。 传统超分辨光存储路线常需双束光协同写入和读取,带...

  2. IT之家 AI36

    中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展

    IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...

    推荐理由:来自IT之家 AI的《中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...