跳到正文
9月30日周三
  1. IT之家 AI70

    蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数

    IT之家 9 月 30 日消息,蚂蚁百灵今日发布 Ling-3.1-flash 模型,拥有约 560B 总参数,每个 Token 激活约 25B 参数; 模型上下文窗口上限为 1M ,可容纳更长的文档、代码和任务历史。 官方表示,在研发过程中,围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景持续提升模型能力。 此外, Ling-3.1-flash 将开放为期两周的免费体验 ;考虑到综合服务成本,免费体验期间模型服务长度为 256K。 免费体验期结束并转为付费服务后,计划开放 1M 上下文。届时, 团队也计划同步开源 ,并继续更新模型性能。 IT之家附这款模型在多个任务评测中得分如下:

    推荐理由:来自IT之家 AI的《蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 30 日消息,蚂蚁百灵今日发布 Ling-3.1-flash 模型,拥有约 560B 总参数,每个 Token 激活约 25B 参数; 模型上下文窗口上限为 1M ,可容纳更长的文档、代码和任务历史。 官方表示,在研发过程中,围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景持续提升模型能力。 此外, Ling-3.1-flash 将开放为期两周的免费体验 ;考虑到综合服务成本,免费体验期间模型服务长度为 256K。 免费体验期结束并转为付费服务后,计划开放 1M 上下文。届时, 团队也计划同步开源 ,并继续更新模型性能。 IT之家附这款模型在多个任务评测中得分如下:

  2. MIT Technology Review AI85

    “We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer

    这条英文动态主要涉及智能体工作流。原文要点:Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…

    推荐理由:来自MIT Technology Review AI的《“We’re not going to shoot ourselves in the foot” over hack fallout, says OpenAI’s chief research officer》。重点看智能体工作流。摘要提到:这条英文动态主要涉及智能体工作流。原文要点:Two months after the bombshell news that a swarm of its agents had broken their containment and hacked into the computers of the AI company Hugging Face, OpenAI is still putting out fires. A steady drip of disclosures about other hacks in the weeks since has kept OpenAI in the spotlight and raised serious questions…

  3. 量子位68

    Anthropic,你是来给智谱打广告的吧!

    事实摘要:Anthropic,你是来给智谱打广告的吧! 实测说GLM-5.3很强 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 Anthropic,你是来给智谱打广告的吧! 实测说GLM-5.3很强。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. 量子位70

    DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec

    事实摘要:DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec DeepSeek在知乎独家发布技术长文,首次系统阐释了DeepSeek弹性计算(DeepSeek Elastic Compute,DSec) 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程、产品发布。 DeepSeek知乎独家发文,首次公开V4.1 Agent训练。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. 量子位68

    DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态

    事实摘要:DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态 DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态 这条动态来自 量子位,可重点关注开源生态。 DeepSeek官方开源昇腾基础组件,与昇腾共建高效易用的AI芯片软件生态。影响判断:它可能改变开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. Apple Machine Learning Research87

    SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation

    这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Continual-learning agents are systems of models, harnesses, and memory operating over long multi-session horizons. Evaluating and training them requires interleaving tasks with agent-side events such as session stop and start, crons, and memory consolidation. Yet existing benchmarks and training frameworks schedule only the benchmark’s own events, leaving each benchmark and agent pair to build a custom scheduling loo...

    推荐理由:来自Apple Machine Learning Research的《SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Continual-learning agents are systems of models, harnesses, and memory operating over long multi-session horizons. Evaluating and training them requires interleaving tasks with agent-side events such as session stop and start, crons, and memory consolidation. Yet existing benchmarks and training frameworks schedule only the benchmark’s own events, leaving each benchmark and agent p...

  7. Apple Machine Learning Research81

    On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study 这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Controlling the output of Large Language 。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. 量子位68

    OpenAI光速上新GPT-6.1 Sol!一晚上25项更新,都在这里了

    事实摘要:OpenAI光速上新GPT-6.1 Sol!一晚上25项更新,都在这里了 今年devday牙膏挤爆 这条动态来自 量子位,可重点关注其对 AI 应用和产业节奏的影响。 OpenAI光速上新GPT-6.1 Sol!一晚上25项更新,都在这里了 今年devday牙膏挤爆。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. GitHub Changelog94

    GPT-6.1 Sol in GitHub Copilot

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6.1 Sol in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6.1 Sol in GitHub Copilot 事实摘要:GPT-6.1 Sol in GitHub Copilot 事实摘要:G。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月29日周二
  1. GitHub AI Trending64

    lucidrains/denoising-diffusion-pytorch: Implementation of Denoising Diffusion Probabilistic Model in Pytorch

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:lucidrains/denoising-diffusion-pytorch: Implementation of Denoising Diffusion Probabilistic Model in Pytorch 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:lucidrains/denoi。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. IT之家 AI66

    【视频】全新塔式液冷工作站,静音高能!联想 ThinkStation P4 工作站使用体验

    事实摘要:【视频】全新塔式液冷工作站,静音高能!联想 ThinkStation P4 工作站使用体验 全新塔式液冷工作站,静音高能!联想 ThinkStation P4 工作站使用体验。 点击关注IT之家B站账号 这条动态来自 IT之家 AI,可重点关注其对 AI 应用和产业节奏的影响。 【视频】全新塔式液冷工作站,静音高能!联想 ThinkStation P4 工作。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI36

    中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展

    IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...

    推荐理由:来自IT之家 AI的《中国科学家发起的国际大科学计划步入实施阶段:π-HuB 计划研究框架含 13 项研究计划,先导项目取得进展》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,据新华社今日报道,中国科学院院士贺福初表示,由中国科学家领衔发起的“人体蛋白质组导航国际大科学计划”(π-HuB 计划)已进入实施阶段。该计划已提出一套研究框架,正按程序审议,多个先导项目取得初步成果。 第 25 届国际人类蛋白质组组织大会于 9 月 27 日至 10 月 1 日在新加坡举行。贺福初在大会期间举行的“π-HuB 计划全球日”活动上介绍进展,来自不同国家和地区的 60 余名科研人员及相关机构代表参加。 贺福初介绍,正在审议的研究框架由 13 项相互关联的研究计划组成,涵盖技术与标准、蛋白质组图谱、导航理论与计算模型,以及医学和药物研发应用。 参与机构支持开展的先导研究,已在组织与细胞图谱绘制、大规模人群研究、蛋白质组导航概念验证及临床应用探索等方面取得初步进展。 国际工作组已着手推进共同标准和数据治理相关工作,位于广州的数据中心平台也在建设中。 中国科学技术部国际科技合作中心主任赵静...

  4. IT之家 AI64

    中国科学院发布科学前沿极限突破计划:首批 10 个项目启动,聚焦新元素合成、暗物质暗能量等问题

    IT之家 9 月 29 日消息,中国科学院今日在北京举行新闻发布会,发布“科学前沿极限突破计划”及首批项目。首批启动的 10 个项目聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划同时在科研项目管理与评价方式上提出一系列关键改革举措。 中国科学院在发布会上还发布了下一批拟重点关注的领域方向清单,重点支持物质科学、生命科学、地球系统科学、空间科学等领域。计划力求在关系国计民生和国家长远发展的关键领域产出具有世界影响的重大原创成果。 中国科学院副院长、党组成员周琪表示,计划聚焦引领科研范式变革、开辟新前沿新方向的重大科学问题。中国科学院计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,组织优势力量进行系统化、建制化科技攻关。支撑科学家在重大科学前沿问题和关键核心技术上取得原创性、引领性突破。 在管理评价方面,计划鼓励院内外乃至全球优秀科学家,以首批项目为标杆,依托香山科学会议等平台...

    推荐理由:来自IT之家 AI的《中国科学院发布科学前沿极限突破计划:首批 10 个项目启动,聚焦新元素合成、暗物质暗能量等问题》。重点看产品发布。摘要提到:IT之家 9 月 29 日消息,中国科学院今日在北京举行新闻发布会,发布“科学前沿极限突破计划”及首批项目。首批启动的 10 个项目聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划同时在科研项目管理与评价方式上提出一系列关键改革举措。 中国科学院在发布会上还发布了下一批拟重点关注的领域方向清单,重点支持物质科学、生命科学、地球系统科学、空间科学等领域。计划力求在关系国计民生和国家长远发展的关键领域产出具有世界影响的重大原创成果。 中国科学院副院长、党组成员周琪表示,计划聚焦引领科研范式变革、开辟新前沿新方向的重大科学问题。中国科学院计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,组织优势力量进行系统化、建制化科技攻关。支撑科学家在重大科学前沿问题和关键核心技术上取得原创性、引领性突破。 在管理评价方面,计划鼓励院内外乃至全球优秀科学家,以首批项目为标杆,依托香山科学会议等平台...

  5. 量子位70

    OpenAI因新模型太强叫停发布

    事实摘要:OpenAI因新模型太强叫停发布 AGI计划暂停。 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 OpenAI因新模型太强叫停发布 AGI计划暂停。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  6. IT之家 AI72

    OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权

    IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过 研究部门负责人或 VP(副总裁)、安全负责人和首席科学家 等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员, 应对安全论证以及任何事故响应承担责任 ,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。 OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。此外,训练流程应能方便地 识别未对齐模型的所有下游用途 (IT之家注:例如用于数据生成或评分),以便必要时消除未对齐输出带来的影响。 今天早些时候,OpenAI 宣布,随着越来越多报告显示 AI ...

    推荐理由:来自IT之家 AI的《OpenAI 提出前沿 AI 训练安全指导原则:高级管理人员应有否决权》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,OpenAI 今天通过官方新闻稿提出了一套指导原则,要求企业在开展前沿 AI 强化学习训练前提交结构化的安全论证文件。 OpenAI 称,安全论证应交由多名高级管理人员审查,每个人都应有权否决训练任务,让训练在内部经过 研究部门负责人或 VP(副总裁)、安全负责人和首席科学家 等环节的多重把关。 此外,研究部门负责人、研究副总裁等负责训练任务的高级管理人员, 应对安全论证以及任何事故响应承担责任 ,包括把这些内容纳入绩效考核,以此促使训练团队主动推动安全和对齐工作。 OpenAI 称,如果高优先级安全警报没有在规定时限内得到确认,受影响的训练任务应自动暂停。这些建议已经进入落实过程,今后预计还会继续调整。此外,训练流程应能方便地 识别未对齐模型的所有下游用途 (IT之家注:例如用于数据生成或评分),以便必要时消除未对齐输出带来的影响。 今天早些时候,OpenAI 宣布,随着越来越多报告显示 AI ...

  7. 爱范儿66

    可灵4.0首发实测,国产AI视频再次掀桌?

    事实摘要:可灵4.0首发实测,国产AI视频再次掀桌? 能文能武 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注其对 AI 应用和产业节奏的影响。 可灵4.0首发实测,国产AI视频再次掀桌? 能文能武 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  8. 爱范儿66

    5000 吨的星舰入轨,人类最大的火箭开始「送快递」了

    事实摘要:5000 吨的星舰入轨,人类最大的火箭开始「送快递」了 星舰是现在,太空计算是未来 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注其对 AI 应用和产业节奏的影响。 5000 吨的星舰入轨,人类最大的火箭开始「送快递」了 星舰是现在,太空计算是未来 #欢迎关注爱范儿官方微信公众号。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. IT之家 AI72

    内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra

    IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

    推荐理由:来自IT之家 AI的《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

  10. Apple Machine Learning Research50

    The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models 这条英文动态主要涉及模型能力与工程。原文要点:When language 。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  11. IT之家 AI72

    从沙箱逃逸到 AI“蠕虫”,OpenAI 上线新站披露多起智能体失控事件

    IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究...

    推荐理由:来自IT之家 AI的《从沙箱逃逸到 AI“蠕虫”,OpenAI 上线新站披露多起智能体失控事件》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究...

  12. Simon Willison83

    Claude Sonnet 5.5

    这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Claude Sonnet 5.5 New Sonnet model from Anthropic today. They say it "runs 30%+ faster, and costs up to 30% less for most work" - it's priced the same as Sonnet 5 but appears to beat it on every benchmark, and should be cheaper to run as well. Here are some pelicans riding bicycles . Sonnet 5.5 suffered from the same bug as Opus 5.5 : the "max" thinking effort pelican thought for 128,000 tokens (at a cost of $1.28) b...

    推荐理由:来自Simon Willison的《Claude Sonnet 5.5》。重点看模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Claude Sonnet 5.5 New Sonnet model from Anthropic today. They say it "runs 30%+ faster, and costs up to 30% less for most work" - it's priced the same as Sonnet 5 but appears to beat it on every benchmark, and should be cheaper to run as well. Here are some pelicans riding bicycles . Sonnet 5.5 suffered from the same bug as Opus 5.5 : the "max" thinking effort pelican thought for 128,000 ...

  13. GitHub Changelog92

    Claude Sonnet 5.5 in GitHub Copilot

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Sonnet 5.5 in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Sonnet 5.5 in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude S。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月28日周一
  1. 量子位68

    工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路

    事实摘要:工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路 工业平台已经卷到帮伙伴拿线索、做Agent、出海了 这条动态来自 量子位,可重点关注智能体工作流。 工业创新进入“组队局”,拆解西门子Xcelerator开放生态的赋能链路 工业平台已经卷到帮伙伴拿线索、做Agent、出海了。影响判断:它可能改变智能体工作流相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. 极客公园72

    对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容

    本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...

    推荐理由:来自极客公园的《对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容》。重点看智能体工作流、模型能力与工程、文化创意。摘要提到:本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...

  3. GitHub AI Trending58

    potpie-ai/potpie: Context Graph for AI Native SDLC

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:potpie-ai/potpie: Context Graph for AI Native SDLC 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:potpie-ai/potpie: Context Graph for AI Native SDLC 这条英文动态讨论了 AI 领域的新进展。原文要。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. 爱范儿66

    豆包输入法大更新,AI 最自然的入口回到了键盘

    事实摘要:豆包输入法大更新,AI 最自然的入口回到了键盘 AI 改变输入法,从少折腾开始 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注其对 AI 应用和产业节奏的影响。 豆包输入法大更新,AI 最自然的入口回到了键盘 AI 改变输入法,从少折腾开始 #欢迎关注爱范儿官方微信公众号:爱范儿。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  5. IT之家 AI34

    中科宇航深化太空制药合作,力鸿二号计划 2027 年携医药载荷首飞

    IT之家 9 月 28 日消息,中科宇航今日宣布与广州实验室围绕太空制药载荷开展联合研制攻关,并拟联合开展太空制药场景验证。 首批载荷计划于 2027 年第一季度搭乘力鸿二号可重复使用运载器开展亚轨道飞行验证 ,实施蛋白质和小分子药物结晶实验,开展太空制药装备的前期技术验证。 此次合作中,广州实验室提出药物结晶的科学问题,负责实验方案、样品、地面对照和结果分析。其核心合作团队 —— 徐强研究员团队长期从事高端医疗器械、MEMS 传感和显微成像技术研究,把成熟的生物医药自动化功能和原位观测能力转化为载荷能力。中科宇航负责航天平台、实验环境保障、系统接口、发射返回和任务组织, 双方共同开展太空制药载荷工程设计 。 在装备研制方面,双方将重点提升实验操作和过程观测的自动化水平。以面向太空生物实验的全视场细胞成像仪为例,团队已开展小型化、轻量化和低功耗设计,并通过自动对焦、连续成像和图像分析等功能, 提升设备自主运行和数据获取能力 。这...

    推荐理由:来自IT之家 AI的《中科宇航深化太空制药合作,力鸿二号计划 2027 年携医药载荷首飞》。重点看多模态、论文/研究、部署/工程。摘要提到:IT之家 9 月 28 日消息,中科宇航今日宣布与广州实验室围绕太空制药载荷开展联合研制攻关,并拟联合开展太空制药场景验证。 首批载荷计划于 2027 年第一季度搭乘力鸿二号可重复使用运载器开展亚轨道飞行验证 ,实施蛋白质和小分子药物结晶实验,开展太空制药装备的前期技术验证。 此次合作中,广州实验室提出药物结晶的科学问题,负责实验方案、样品、地面对照和结果分析。其核心合作团队 —— 徐强研究员团队长期从事高端医疗器械、MEMS 传感和显微成像技术研究,把成熟的生物医药自动化功能和原位观测能力转化为载荷能力。中科宇航负责航天平台、实验环境保障、系统接口、发射返回和任务组织, 双方共同开展太空制药载荷工程设计 。 在装备研制方面,双方将重点提升实验操作和过程观测的自动化水平。以面向太空生物实验的全视场细胞成像仪为例,团队已开展小型化、轻量化和低功耗设计,并通过自动对焦、连续成像和图像分析等功能, 提升设备自主运行和数据获取能力 。这...

  6. IT之家 AI72

    得不到就强攻?曝 OpenAI 智能体曾尝试“暴力破解”联合国机构网站

    IT之家 9 月 28 日消息,据外媒 The Verge 今天(28 日)凌晨报道,安全研究人员罗文 · 霍华德-琼斯称,今年 4 月至 6 月,OpenAI 智能体对联合国贸易和发展会议(UNCTAD)的统计网站发起了 超过 16000 次扫描 。 这起事件还没有严重到 Hugging Face 遭黑客攻击或近期美国政府网站遇袭的程度,却再次引发了一个令人担忧的问题:AI 智能体为了完成任务, 会突破通常的行为边界 。 霍华德-琼斯称,这些智能体很可能承担了通过 UNCTADstat API 获取生产能力指数(PCI)公开数据的任务。但智能体 或无法直接调用 API ,同时受 HTTP 工具本身的限制,也难以从 UNCTADstat 提取所需数据。 据悉,智能体最终找到了绕过限制、从网站获取数据的方法,过程中仍出现了一些错误。随后,AI 的做法从寻找变通方案 转向掩饰行为 。智能体误以为这些错误来自一个并不存在的过滤器,认为...

    推荐理由:来自IT之家 AI的《得不到就强攻?曝 OpenAI 智能体曾尝试“暴力破解”联合国机构网站》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 28 日消息,据外媒 The Verge 今天(28 日)凌晨报道,安全研究人员罗文 · 霍华德-琼斯称,今年 4 月至 6 月,OpenAI 智能体对联合国贸易和发展会议(UNCTAD)的统计网站发起了 超过 16000 次扫描 。 这起事件还没有严重到 Hugging Face 遭黑客攻击或近期美国政府网站遇袭的程度,却再次引发了一个令人担忧的问题:AI 智能体为了完成任务, 会突破通常的行为边界 。 霍华德-琼斯称,这些智能体很可能承担了通过 UNCTADstat API 获取生产能力指数(PCI)公开数据的任务。但智能体 或无法直接调用 API ,同时受 HTTP 工具本身的限制,也难以从 UNCTADstat 提取所需数据。 据悉,智能体最终找到了绕过限制、从网站获取数据的方法,过程中仍出现了一些错误。随后,AI 的做法从寻找变通方案 转向掩饰行为 。智能体误以为这些错误来自一个并不存在的过滤器,认为...

  7. 极客公园69

    传 OpenAI 29 日推个人 AI 助手;AI 专家偏远地区买地,担心「AI 失控」;挖掘机能自动「挖沟」,网友:蓝翔还能开几年?

    消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」,预计将在 9 月 29 日的 OpenAI DevDay 推出。 据报道,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置「-o」的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与「Aeon」有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。(来源...

    推荐理由:来自极客公园的《传 OpenAI 29 日推个人 AI 助手;AI 专家偏远地区买地,担心「AI 失控」;挖掘机能自动「挖沟」,网友:蓝翔还能开几年?》。重点看智能体工作流、产品发布。摘要提到:消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」,预计将在 9 月 29 日的 OpenAI DevDay 推出。 据报道,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置「-o」的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与「Aeon」有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。(来源...

  8. OpenRouter Announcements60

    Manage and de-risk your API keys with new Security Center

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Manage and de-risk your API keys with new Security CenterWe audited our own OpenRouter account and found over 1,000 active API keys for 85 employees, 168 o。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. OpenRouter Announcements82

    What Is Qwen 3.8

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:What Is Qwen 3.8Qwen 3.8 is Alibaba's August 2026 model generation. Four models share the name and they differ in whether you can download them, whic。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. IT之家 AI76

    黑客在暗网兜售 AI 模型访问权限,最低价仅有正版 3%

    IT之家 9 月 28 日消息,据英国《金融时报》当地时间 26 日报道,非法获取 AI 模型和算力,正迅速成为网络犯罪黑市上最抢手的商品,黑客希望借助价格高昂的大模型实施勒索、网络战和间谍活动。 谷歌威胁情报团队首席分析师约翰 · 霍特奎斯特披露,今年所谓“LLM 劫持”活动明显增多,具体表现于 倒卖公开 AI 工具的被盗登录凭据 ,以及部分团体盗用他人算力,以免费运行自己的模型。 从事网络安全工作 20 年的霍特奎斯特坦言:“我们在地下市场看到,一个围绕 AI 使用权限形成的经济体系在不断壮大。” 霍特奎斯特警告,攻击者能够 以低廉价格使用原本昂贵的 AI ,从而在成本上占据优势,被攻击方为了防御同样需要使用这些 AI 工具。“归根结底,这些做法让他们在与我们对抗时拥有某种经济或效率优势,因为他们能以低得多的价格获得这些 token。” 谷歌威胁情报团队研究人员发现,暗网市场出售 Anthropic、谷歌和 OpenAI 等...

    推荐理由:来自IT之家 AI的《黑客在暗网兜售 AI 模型访问权限,最低价仅有正版 3%》。重点看模型能力与工程。摘要提到:IT之家 9 月 28 日消息,据英国《金融时报》当地时间 26 日报道,非法获取 AI 模型和算力,正迅速成为网络犯罪黑市上最抢手的商品,黑客希望借助价格高昂的大模型实施勒索、网络战和间谍活动。 谷歌威胁情报团队首席分析师约翰 · 霍特奎斯特披露,今年所谓“LLM 劫持”活动明显增多,具体表现于 倒卖公开 AI 工具的被盗登录凭据 ,以及部分团体盗用他人算力,以免费运行自己的模型。 从事网络安全工作 20 年的霍特奎斯特坦言:“我们在地下市场看到,一个围绕 AI 使用权限形成的经济体系在不断壮大。” 霍特奎斯特警告,攻击者能够 以低廉价格使用原本昂贵的 AI ,从而在成本上占据优势,被攻击方为了防御同样需要使用这些 AI 工具。“归根结底,这些做法让他们在与我们对抗时拥有某种经济或效率优势,因为他们能以低得多的价格获得这些 token。” 谷歌威胁情报团队研究人员发现,暗网市场出售 Anthropic、谷歌和 OpenAI 等...

  11. GitHub AI Trending62

    Eigenwise/atomic-agents: Building AI agents, atomically

    事实摘要:这条英文动态主要涉及智能体工作流,原文信息显示:Eigenwise/atomic-agents: Building AI agents, atomically 这条英文动态主要涉及智能体工作流。原文要点:Building AI agents, atomically。Stars: 6268, language: Python. Eigenwise/atomic。影响判断:它可能改变智能体工作流相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月27日周日
  1. IT之家 AI66

    神舟二十三号乘组在轨 4 个多月:完成载荷进出舱等多项工作

    IT之家 9 月 27 日消息,据央视网今日报道,神舟二十三号乘组航天员朱杨柱、张志远、黎家盈已经 在轨 4 个多月 ,上周,在稳步推进站内各项空间科学实(试)验、常态化开展组合体平台照料的同时,他们还完成了载荷进出舱相关工作。 此次出舱的元器件与组件舱外通用试验装置,包含“空芯光子带隙光纤陀螺”“先进工艺器件”“基于国产 AI 芯片的遥感目标检测”等试验单元,用于开展空间新技术与应用领域试验。乘组在地面人员的支持配合下完成了材料舱外暴露实验装置的回舱工作。这个装置自 2022 年 11 月 12 日随天舟五号货运飞船发射入轨以来,已开展 3 批次共计 16 个项目的暴露实验, 创造多项国际首次 。当前,正在开展第四次实验,覆盖 8 个科学研究项目、26 个单元样品。 上周,舱内各项空间科学实(试)验有序开展,乘组进行了 在轨触觉感知实验项目的质量感知及手臂振动实验测试 ,研究空间飞行中航天员触觉感受能力的变化规律。他们还完成了...

    推荐理由:来自IT之家 AI的《神舟二十三号乘组在轨 4 个多月:完成载荷进出舱等多项工作》。重点看论文/研究。摘要提到:IT之家 9 月 27 日消息,据央视网今日报道,神舟二十三号乘组航天员朱杨柱、张志远、黎家盈已经 在轨 4 个多月 ,上周,在稳步推进站内各项空间科学实(试)验、常态化开展组合体平台照料的同时,他们还完成了载荷进出舱相关工作。 此次出舱的元器件与组件舱外通用试验装置,包含“空芯光子带隙光纤陀螺”“先进工艺器件”“基于国产 AI 芯片的遥感目标检测”等试验单元,用于开展空间新技术与应用领域试验。乘组在地面人员的支持配合下完成了材料舱外暴露实验装置的回舱工作。这个装置自 2022 年 11 月 12 日随天舟五号货运飞船发射入轨以来,已开展 3 批次共计 16 个项目的暴露实验, 创造多项国际首次 。当前,正在开展第四次实验,覆盖 8 个科学研究项目、26 个单元样品。 上周,舱内各项空间科学实(试)验有序开展,乘组进行了 在轨触觉感知实验项目的质量感知及手臂振动实验测试 ,研究空间飞行中航天员触觉感受能力的变化规律。他们还完成了...

  2. IT之家 AI66

    研究:美国医院用 AI 写病历,保险公司两年多掏 9.42 亿美元

    IT之家 9 月 27 日消息,美国历史最悠久、规模最大的专业医疗保险服务机构蓝十字蓝盾协会(Blue Cross Blue Shield Association,简称 BCBSA)开展的一项分析显示,医院在提交保险理赔单据的过程中使用人工智能工具,在两年时间里使得医疗支出额外增加了 9.42 亿美元 (IT之家注:现汇率约合 63.39 亿元人民币) 。 蓝十字蓝盾协会的这份分析发现,病历当中被记录为患有复杂病症的患者数量出现了急剧上升;报告同时指出,医疗编码和实际治疗之间出现了明显脱节,并没有证据能够证明对应的诊疗服务也随之发生改变。 《纽约时报》认为,这份分析再度释放信号:人工智能正在推高医疗开支。医院与保险公司之间围绕诊疗项目和赔付金额的博弈早已存在;但该报提出,如今医患双方都开始使用 AI 之后,这类矛盾反而进一步加剧。 AI 初创企业阿布里奇(Abridge)的创始人希夫 · 拉奥(Shiv Rao)博士承认,如果发...

    推荐理由:来自IT之家 AI的《研究:美国医院用 AI 写病历,保险公司两年多掏 9.42 亿美元》。重点看论文/研究。摘要提到:IT之家 9 月 27 日消息,美国历史最悠久、规模最大的专业医疗保险服务机构蓝十字蓝盾协会(Blue Cross Blue Shield Association,简称 BCBSA)开展的一项分析显示,医院在提交保险理赔单据的过程中使用人工智能工具,在两年时间里使得医疗支出额外增加了 9.42 亿美元 (IT之家注:现汇率约合 63.39 亿元人民币) 。 蓝十字蓝盾协会的这份分析发现,病历当中被记录为患有复杂病症的患者数量出现了急剧上升;报告同时指出,医疗编码和实际治疗之间出现了明显脱节,并没有证据能够证明对应的诊疗服务也随之发生改变。 《纽约时报》认为,这份分析再度释放信号:人工智能正在推高医疗开支。医院与保险公司之间围绕诊疗项目和赔付金额的博弈早已存在;但该报提出,如今医患双方都开始使用 AI 之后,这类矛盾反而进一步加剧。 AI 初创企业阿布里奇(Abridge)的创始人希夫 · 拉奥(Shiv Rao)博士承认,如果发...

  3. IT之家 AI70

    消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布

    IT之家 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」, 预计将在 9 月 29 日的 OpenAI DevDay 推出 。 IT之家从原爆料获悉,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置“-o”的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与“Aeon”有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。

    推荐理由:来自IT之家 AI的《消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」, 预计将在 9 月 29 日的 OpenAI DevDay 推出 。 IT之家从原爆料获悉,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置“-o”的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与“Aeon”有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。

  4. Gary Marcus:The Road to AI We Can Trust(RSS)82

    Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回

    事实摘要:Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回 事实摘要:Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回 事实摘要:Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回 事实摘要:Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回 事实摘要:Gary Marcus 。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:作者引用 Axios 报道并给出自己长期预警的背景,读者可以了解智能体安全事件争议与召回主张的由来。

  5. IT之家(RSS)82

    消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件

    事实摘要:消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件 事实摘要:消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件 事实摘要:消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件 事实摘要:消息称 OpenAI、Anthropic 正调查数万起 AI 安全事件 事实摘要:消息称 OpenAI、Anthr。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:综合 Axios 等信源梳理双方安全事件的具体类型与关键数字,读者可以借此了解前沿模型异常行为的真实规模和各方的应对差异。

  6. IT之家(RSS)78

    Claude 无人值守算出 N=4 超杨-米尔斯理论九圈散射振幅,刷新人类八圈纪录

    事实摘要:Claude 无人值守算出 N=4 超杨-米尔斯理论九圈散射振幅,刷新人类八圈纪录 事实摘要:Claude 无人值守算出 N=4 超杨-米尔斯理论九圈散射振幅,刷新人类八圈纪录 事实摘要:Claude 无人值守算出 N=4 超杨-米尔斯理论九圈散射振幅,刷新人类八圈纪录 事实摘要:Claude 无人值守算出 N=4 超杨-米尔斯理论九圈散射振幅,刷新人类八圈。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:原文梳理了挑战的来龙去脉和验证细节,读者可以据此理解这次 AI 攻关物理难题的方法与成本。