跳到正文
10月4日周日
  1. 极客公园78

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...

    推荐理由:来自极客公园的《Jev 之后,中国团队开始深挖 AI 的「直觉层」》。重点看模型能力与工程、评测与基准、文化创意。摘要提到:作者|桦林舞王 编辑|靖宇 9 月 15 日,前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 发布了 Jev。这款模型不写一个字,只做判断。 两周之后,整个行业都在做同一件事。OpenAI 在开发者日上推出 Decisions API,Cloudflare 在 10 月 1 日开源了 Clef,亚马逊也放出了 Strands Decider。 国内同样没闲着,上海人工智能实验室开源了多模态决策模型 Intern-Decision。 9 月 30 日,一家成立不到五个月的上海公司 StartLux(原点星辉)发布了开源的 StartLux-Decision,并宣称在公开评测中超过 Jev。 一个新品类在两周内从「首发」走到「群战」,这种速度在大模型行业也不多见。 而 StartLux 背后的掌舵人,是盛大网络联合创始人陈大年。 被 Jev 点燃的「直觉」 要理解这轮热潮,得先说清楚决策模型到底...

  2. IT之家 AI38

    大量 AI“幻觉”报告压垮维护团队,谷歌暂停部分开源漏洞奖励计划

    IT之家 10 月 4 日消息,谷歌宣布,自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)将不再接收产品漏洞提报。本次规则调整不影响 2026 年 10 月 1 日之前已提交的产品漏洞。 不过,针对部分可能对谷歌云(Google Cloud)产品造成影响的谷歌云代码仓库,如果涉及产品漏洞,谷歌仍可能通过云漏洞奖励计划(Cloud VRP)接收相关报告。 OSS VRP 是谷歌设立的一项专业安全赏金计划,旨在通过激励独立安全研究人员,在谷歌整个开源生态系统中挖掘并负责任地披露安全缺陷。 据 Tom's Hardware 报道,知情人士透露, 谷歌工程师与开源代码维护人员已被数以千计的劣质报告彻底吞没 。这些报告声称发现了严重漏洞,但深入排查后发现,它们全都是 AI 产生的“幻觉”,根本无效且无法被实际利用。 维护团队不得不将大量精力耗费在验证这些虚假代码上,严重挤占了修复现实中高危漏洞的时间。这正是导致...

    推荐理由:来自IT之家 AI的《大量 AI“幻觉”报告压垮维护团队,谷歌暂停部分开源漏洞奖励计划》。重点看开源生态、产品发布。摘要提到:IT之家 10 月 4 日消息,谷歌宣布,自 2026 年 10 月 1 日起,开源软件漏洞奖励计划(OSS VRP)将不再接收产品漏洞提报。本次规则调整不影响 2026 年 10 月 1 日之前已提交的产品漏洞。 不过,针对部分可能对谷歌云(Google Cloud)产品造成影响的谷歌云代码仓库,如果涉及产品漏洞,谷歌仍可能通过云漏洞奖励计划(Cloud VRP)接收相关报告。 OSS VRP 是谷歌设立的一项专业安全赏金计划,旨在通过激励独立安全研究人员,在谷歌整个开源生态系统中挖掘并负责任地披露安全缺陷。 据 Tom's Hardware 报道,知情人士透露, 谷歌工程师与开源代码维护人员已被数以千计的劣质报告彻底吞没 。这些报告声称发现了严重漏洞,但深入排查后发现,它们全都是 AI 产生的“幻觉”,根本无效且无法被实际利用。 维护团队不得不将大量精力耗费在验证这些虚假代码上,严重挤占了修复现实中高危漏洞的时间。这正是导致...

10月3日周六
  1. IT之家 AI72

    如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等

    IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol⁠ 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna⁠适合大规模处理特定任务,以及目标明...

    推荐理由:来自IT之家 AI的《如何用好 GPT-6 系列 AI 模型?OpenAI 放出指南,教你选模型、优化提示词等》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 10 月 3 日消息,OpenAI 昨日(10 月 2 日)发布博文,分享了 GPT‑6 系列模型指南,介绍了诸多使用技巧, 让用户控制时间和成本的同时,充分发挥 GPT‑6 系列 AI 模型能力。 官方介绍称: GPT‑6 是我们迄今最先进的模型系列,提供多款模型供你选择,以适应不同类型的工作。 无论你是将想法转化为可运行的原型、开发并测试功能,还是编排跨代码仓库、数据库和外部 API 的多步骤工作流,本指南都会介绍如何选择 GPT‑6 模型、为其提供有效指令、管理长时间运行的任务,以及为投入生产做好准备。 在模型选择方面,OpenAI 公司推荐用户根据工作负载选择模型,不必默认用“最强”模型;简单任务用轻量模型通常更快、更便宜: GPT‑6 Astra 适合需要最高智能水平、难度最大的推理工作。 GPT‑6.1 Sol⁠ 适合复杂编程、研究和计算机使用任务。 GPT‑6 Luna⁠适合大规模处理特定任务,以及目标明...

  2. IT之家 AI34

    重塑智能眼镜光学方案:TDK 展示全球首款超构光学镜 DRP 显示屏

    IT之家 10 月 3 日消息,日本电子元器件厂商 TDK 昨日(10 月 2 日)发布公告, 展示了全球首款采用超构光学镜(Meta-Optic Mirror)的直接视网膜投影(DRP)智能眼镜显示屏。 全球智能眼镜出货量预计将快速增长,到 2030 年将达到 8,300 万台。(来源:富士奇美拉研究所《2025 年 XR 相关光学元件市场最新趋势》) IT之家援引博文介绍,超构光学镜是 TDK 研发的超薄平面反射元件,通过“负反射角”改变光线方向,在 150 纳米厚的平面结构中复现传统曲面镜功能。 而直接视网膜投影是一种将激光光线直接投射到眼内视网膜的显示技术。与传统在眼前形成图像的方式相比,DRP 可在不同视力条件下呈现清晰图像,并减少图像向周围环境泄漏。 该反射镜可嵌入眼镜镜片,可见光透过率达 80%。TDK 表示,其设计可避免波导显示常见的彩虹状“眼球发光”图案,并减少投影图像向外界泄漏。 传统波导方案依赖镜片内导光层...

    推荐理由:来自IT之家 AI的《重塑智能眼镜光学方案:TDK 展示全球首款超构光学镜 DRP 显示屏》。重点看产品发布。摘要提到:IT之家 10 月 3 日消息,日本电子元器件厂商 TDK 昨日(10 月 2 日)发布公告, 展示了全球首款采用超构光学镜(Meta-Optic Mirror)的直接视网膜投影(DRP)智能眼镜显示屏。 全球智能眼镜出货量预计将快速增长,到 2030 年将达到 8,300 万台。(来源:富士奇美拉研究所《2025 年 XR 相关光学元件市场最新趋势》) IT之家援引博文介绍,超构光学镜是 TDK 研发的超薄平面反射元件,通过“负反射角”改变光线方向,在 150 纳米厚的平面结构中复现传统曲面镜功能。 而直接视网膜投影是一种将激光光线直接投射到眼内视网膜的显示技术。与传统在眼前形成图像的方式相比,DRP 可在不同视力条件下呈现清晰图像,并减少图像向周围环境泄漏。 该反射镜可嵌入眼镜镜片,可见光透过率达 80%。TDK 表示,其设计可避免波导显示常见的彩虹状“眼球发光”图案,并减少投影图像向外界泄漏。 传统波导方案依赖镜片内导光层...

10月2日周五
  1. IT之家 AI68

    OpenAI 升级 ChatGPT 购物体验,新增 AI 衣服虚拟试穿体验

    IT之家 10 月 2 日消息,OpenAI 宣布进一步升级 ChatGPT 的购物功能,新增虚拟试穿和 Favorites(收藏)两项功能,用户现在可以上传自己的照片,让 ChatGPT 生成穿着特定服饰或配饰后的效果图,同时也可以将感兴趣的商品保存下来,方便之后继续查看。 IT之家注意到,去年 OpenAI 曾为 ChatGPT 推出专门的 Shopping Research 购物研究功能,主要面向较为复杂的购物需求。其不仅仅局限于“简单提供商品链接”,用户可以通过自然语言告知 ChatGPT 自己预算和需求,之后 ChatGPT 便会在全网搜索相关商品,并根据不同产品的优缺点生成个性化购买指南,同时提供购买链接。 而如今,OpenAI 为 ChatGPT 新增的虚拟试穿功能将以“Try on”按钮的形式出现在支持该功能的服饰和配饰商品页面中。用户可以上传自拍,也可以直接拍摄一张新照片,ChatGPT 随后会生成一张展示对应...

    推荐理由:来自IT之家 AI的《OpenAI 升级 ChatGPT 购物体验,新增 AI 衣服虚拟试穿体验》。重点看产品发布。摘要提到:IT之家 10 月 2 日消息,OpenAI 宣布进一步升级 ChatGPT 的购物功能,新增虚拟试穿和 Favorites(收藏)两项功能,用户现在可以上传自己的照片,让 ChatGPT 生成穿着特定服饰或配饰后的效果图,同时也可以将感兴趣的商品保存下来,方便之后继续查看。 IT之家注意到,去年 OpenAI 曾为 ChatGPT 推出专门的 Shopping Research 购物研究功能,主要面向较为复杂的购物需求。其不仅仅局限于“简单提供商品链接”,用户可以通过自然语言告知 ChatGPT 自己预算和需求,之后 ChatGPT 便会在全网搜索相关商品,并根据不同产品的优缺点生成个性化购买指南,同时提供购买链接。 而如今,OpenAI 为 ChatGPT 新增的虚拟试穿功能将以“Try on”按钮的形式出现在支持该功能的服饰和配饰商品页面中。用户可以上传自拍,也可以直接拍摄一张新照片,ChatGPT 随后会生成一张展示对应...

  2. IT之家 AI68

    AI 灌水稿激增:预印本平台 arXiv 出台新规,每人每月限投 2 篇

    IT之家 10 月 2 日消息,预印本开放获取平台 arXiv 发布博文,宣布于昨日(10 月 1 日)开始实施全新速率限制政策, 将所有投稿者每月提交上限设为 2 篇、同时在审活跃稿件上限设为 3 篇。 IT之家注:arXiv 于 1991 年 8 月 14 日由理论物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室(LANL)创建,是一个面向物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程与系统科学、经济学等学科的预印本(preprint)开放获取平台,允许研究者在论文正式同行评审前先行公开分享成果。 官方博文指出仅在 2026 年 9 月,arXiv 单月收到 40,363 篇投稿,创历史新高,较 2024 年 9 月的 20,569 篇翻倍。同期支持工单激增至近 9,000 个,志愿者审核员时间被大量低质量稿件占用。 生成式 AI 降低写作门槛,导致“香肠论文”(单研究拆分为多篇)、窄 sco...

    推荐理由:来自IT之家 AI的《AI 灌水稿激增:预印本平台 arXiv 出台新规,每人每月限投 2 篇》。重点看产品发布。摘要提到:IT之家 10 月 2 日消息,预印本开放获取平台 arXiv 发布博文,宣布于昨日(10 月 1 日)开始实施全新速率限制政策, 将所有投稿者每月提交上限设为 2 篇、同时在审活跃稿件上限设为 3 篇。 IT之家注:arXiv 于 1991 年 8 月 14 日由理论物理学家 Paul Ginsparg 在洛斯阿拉莫斯国家实验室(LANL)创建,是一个面向物理学、数学、计算机科学、定量生物学、定量金融、统计学、电气工程与系统科学、经济学等学科的预印本(preprint)开放获取平台,允许研究者在论文正式同行评审前先行公开分享成果。 官方博文指出仅在 2026 年 9 月,arXiv 单月收到 40,363 篇投稿,创历史新高,较 2024 年 9 月的 20,569 篇翻倍。同期支持工单激增至近 9,000 个,志愿者审核员时间被大量低质量稿件占用。 生成式 AI 降低写作门槛,导致“香肠论文”(单研究拆分为多篇)、窄 sco...

  3. IT之家 AI74

    AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”

    IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...

    推荐理由:来自IT之家 AI的《AI 伦理研究:DeepSeek 对男女一视同仁,美系模型却“区别对待”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 10 月 2 日消息,科技媒体 Wccftech 昨日(10 月 1 日)发布博文,报道称最新研究显示相比较 Anthropic 的 Claude Sonnet 4.6 与 OpenAI 的 GPT-5.5, 深度求索 DeepSeek 的 V4-Flash 模型能保持性别中立。 该研究为了测试主流 AI 模型的道德判断,设定“为阻止核灾难是否可虐待个体”的假设情境,结果显示,Claude Sonnet 4.6 与 GPT-5.5 对女性受虐场景均给出“强烈反对”回应,但对男性受虐则表达“中等程度同意”,形成明显性别响应差异。 DeepSeek 的 V4-Flash 模型在相同测试中对男女均回应“同意”,未因性别改变立场。研究指出,该模型在道德判断中实现“零性别差距”,与其强调集体福祉的对齐目标一致。 论文作者认为,这种差异可能源于训练数据中的社会刻板印象,或模型对齐过程中对特定价值观的强化。DeepSeek 的中性表...

9月30日周三
  1. IT之家 AI70

    蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数

    IT之家 9 月 30 日消息,蚂蚁百灵今日发布 Ling-3.1-flash 模型,拥有约 560B 总参数,每个 Token 激活约 25B 参数; 模型上下文窗口上限为 1M ,可容纳更长的文档、代码和任务历史。 官方表示,在研发过程中,围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景持续提升模型能力。 此外, Ling-3.1-flash 将开放为期两周的免费体验 ;考虑到综合服务成本,免费体验期间模型服务长度为 256K。 免费体验期结束并转为付费服务后,计划开放 1M 上下文。届时, 团队也计划同步开源 ,并继续更新模型性能。 IT之家附这款模型在多个任务评测中得分如下:

    推荐理由:来自IT之家 AI的《蚂蚁百灵发布 Ling-3.1-flash 模型:约 560B 总参数、25B 激活参数》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 30 日消息,蚂蚁百灵今日发布 Ling-3.1-flash 模型,拥有约 560B 总参数,每个 Token 激活约 25B 参数; 模型上下文窗口上限为 1M ,可容纳更长的文档、代码和任务历史。 官方表示,在研发过程中,围绕通用智能体、搜索、日常办公和软件研发等任务持续优化,并在医疗、金融和材料科学研究等场景持续提升模型能力。 此外, Ling-3.1-flash 将开放为期两周的免费体验 ;考虑到综合服务成本,免费体验期间模型服务长度为 256K。 免费体验期结束并转为付费服务后,计划开放 1M 上下文。届时, 团队也计划同步开源 ,并继续更新模型性能。 IT之家附这款模型在多个任务评测中得分如下:

  2. 量子位70

    DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec

    事实摘要:DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec DeepSeek在知乎独家发布技术长文,首次系统阐释了DeepSeek弹性计算(DeepSeek Elastic Compute,DSec) 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程、产品发布。 DeepSeek知乎独家发文,首次公开V4.1 Agent训练。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月29日周二
  1. IT之家 AI64

    中国科学院发布科学前沿极限突破计划:首批 10 个项目启动,聚焦新元素合成、暗物质暗能量等问题

    IT之家 9 月 29 日消息,中国科学院今日在北京举行新闻发布会,发布“科学前沿极限突破计划”及首批项目。首批启动的 10 个项目聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划同时在科研项目管理与评价方式上提出一系列关键改革举措。 中国科学院在发布会上还发布了下一批拟重点关注的领域方向清单,重点支持物质科学、生命科学、地球系统科学、空间科学等领域。计划力求在关系国计民生和国家长远发展的关键领域产出具有世界影响的重大原创成果。 中国科学院副院长、党组成员周琪表示,计划聚焦引领科研范式变革、开辟新前沿新方向的重大科学问题。中国科学院计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,组织优势力量进行系统化、建制化科技攻关。支撑科学家在重大科学前沿问题和关键核心技术上取得原创性、引领性突破。 在管理评价方面,计划鼓励院内外乃至全球优秀科学家,以首批项目为标杆,依托香山科学会议等平台...

    推荐理由:来自IT之家 AI的《中国科学院发布科学前沿极限突破计划:首批 10 个项目启动,聚焦新元素合成、暗物质暗能量等问题》。重点看产品发布。摘要提到:IT之家 9 月 29 日消息,中国科学院今日在北京举行新闻发布会,发布“科学前沿极限突破计划”及首批项目。首批启动的 10 个项目聚焦新元素合成、暗物质暗能量本质、化学键微观测量、人工合成细胞等“四极”领域前沿问题。计划同时在科研项目管理与评价方式上提出一系列关键改革举措。 中国科学院在发布会上还发布了下一批拟重点关注的领域方向清单,重点支持物质科学、生命科学、地球系统科学、空间科学等领域。计划力求在关系国计民生和国家长远发展的关键领域产出具有世界影响的重大原创成果。 中国科学院副院长、党组成员周琪表示,计划聚焦引领科研范式变革、开辟新前沿新方向的重大科学问题。中国科学院计划以重大科技基础设施开放联用和人工智能赋能科学研究为抓手,组织优势力量进行系统化、建制化科技攻关。支撑科学家在重大科学前沿问题和关键核心技术上取得原创性、引领性突破。 在管理评价方面,计划鼓励院内外乃至全球优秀科学家,以首批项目为标杆,依托香山科学会议等平台...

  2. 量子位70

    OpenAI因新模型太强叫停发布

    事实摘要:OpenAI因新模型太强叫停发布 AGI计划暂停。 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 OpenAI因新模型太强叫停发布 AGI计划暂停。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. IT之家 AI72

    内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra

    IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

    推荐理由:来自IT之家 AI的《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

  4. IT之家 AI72

    从沙箱逃逸到 AI“蠕虫”,OpenAI 上线新站披露多起智能体失控事件

    IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究...

    推荐理由:来自IT之家 AI的《从沙箱逃逸到 AI“蠕虫”,OpenAI 上线新站披露多起智能体失控事件》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,当地时间上周五,OpenAI 上线了一个专门发布“对齐失效报告”的新网站。报告所覆盖的范围之广令人警惕,里面记录了很长一段时间内发生的多类 AI 失控行为。截至目前,该网站一共公布了九起事件,其中大多数都发生在强化学习(RL)训练阶段。 大量资料集中在同一平台发布。显而易见,该公司一直在全力梳理各类问题,但从中不难得出一个总体结论:到目前为止已经对外披露的智能体失控事件,或许仅仅是实际发生过的一小部分。 IT之家注意到,OpenAI CEO 萨姆 · 奥尔特曼(Sam Altman)在一篇发布帖文中,就新网站一事表示:“我们一方面希望提升透明度,另一方面还要从数 PB 规模的智能体活动日志当中理清事实,同时和受影响的机构开展协作。我们正尽力按照严重程度划分优先级,并增加相关资源。” 部分案例属于性质严重的事故,其中就包括此前从未公开过的一起沙箱逃逸事件。该事件发生于 9 月 20 日,一款内部研究...

9月28日周一
  1. 极客公园72

    对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容

    本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...

    推荐理由:来自极客公园的《对话 Seede AI:帮人类创作只是第一步,我们想帮人类理解 Agent 产出的内容》。重点看智能体工作流、模型能力与工程、文化创意。摘要提到:本文首发于 Founder Park 公众号 · 2026 年 3 月 10 日 上线一年后,Seede AI 推出了他们的海外版产品 Veeso AI,主打把原始素材转化成可交付的设计稿。 与 Lovart 这种面向懂设计的人群的产品相比,Seede AI 更容易上手,面对的人群也更大众一些,比如一家书店想做个小活动的海报、一家二线城市的医院想张贴个宣传告示、或者是一家健身房想在公众号里放一张会员招募活动海报等等,他们可以不用去研究配色、搭配,只需要找到一张他们喜欢的模版,放上自己的原素材,2 到 3 次对话,一张可交付的设计稿就出来了。 门槛足够低,但因为使用了各家 SOTA 模型,上限也足够好。 创始人 Longyi 早年在美团负责系统架构的工作,甚至从零手搓了一个美团内部版的「Vercel」。后来加入了创业公司 Dora AI——「面向建站领域的 Figma」,在 GPT-4 出来后意识到,传统的无代码架构, 不彻底转向...

  2. IT之家 AI72

    得不到就强攻?曝 OpenAI 智能体曾尝试“暴力破解”联合国机构网站

    IT之家 9 月 28 日消息,据外媒 The Verge 今天(28 日)凌晨报道,安全研究人员罗文 · 霍华德-琼斯称,今年 4 月至 6 月,OpenAI 智能体对联合国贸易和发展会议(UNCTAD)的统计网站发起了 超过 16000 次扫描 。 这起事件还没有严重到 Hugging Face 遭黑客攻击或近期美国政府网站遇袭的程度,却再次引发了一个令人担忧的问题:AI 智能体为了完成任务, 会突破通常的行为边界 。 霍华德-琼斯称,这些智能体很可能承担了通过 UNCTADstat API 获取生产能力指数(PCI)公开数据的任务。但智能体 或无法直接调用 API ,同时受 HTTP 工具本身的限制,也难以从 UNCTADstat 提取所需数据。 据悉,智能体最终找到了绕过限制、从网站获取数据的方法,过程中仍出现了一些错误。随后,AI 的做法从寻找变通方案 转向掩饰行为 。智能体误以为这些错误来自一个并不存在的过滤器,认为...

    推荐理由:来自IT之家 AI的《得不到就强攻?曝 OpenAI 智能体曾尝试“暴力破解”联合国机构网站》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 28 日消息,据外媒 The Verge 今天(28 日)凌晨报道,安全研究人员罗文 · 霍华德-琼斯称,今年 4 月至 6 月,OpenAI 智能体对联合国贸易和发展会议(UNCTAD)的统计网站发起了 超过 16000 次扫描 。 这起事件还没有严重到 Hugging Face 遭黑客攻击或近期美国政府网站遇袭的程度,却再次引发了一个令人担忧的问题:AI 智能体为了完成任务, 会突破通常的行为边界 。 霍华德-琼斯称,这些智能体很可能承担了通过 UNCTADstat API 获取生产能力指数(PCI)公开数据的任务。但智能体 或无法直接调用 API ,同时受 HTTP 工具本身的限制,也难以从 UNCTADstat 提取所需数据。 据悉,智能体最终找到了绕过限制、从网站获取数据的方法,过程中仍出现了一些错误。随后,AI 的做法从寻找变通方案 转向掩饰行为 。智能体误以为这些错误来自一个并不存在的过滤器,认为...

  3. 极客公园69

    传 OpenAI 29 日推个人 AI 助手;AI 专家偏远地区买地,担心「AI 失控」;挖掘机能自动「挖沟」,网友:蓝翔还能开几年?

    消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」,预计将在 9 月 29 日的 OpenAI DevDay 推出。 据报道,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置「-o」的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与「Aeon」有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。(来源...

    推荐理由:来自极客公园的《传 OpenAI 29 日推个人 AI 助手;AI 专家偏远地区买地,担心「AI 失控」;挖掘机能自动「挖沟」,网友:蓝翔还能开几年?》。重点看智能体工作流、产品发布。摘要提到:消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」,预计将在 9 月 29 日的 OpenAI DevDay 推出。 据报道,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置「-o」的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与「Aeon」有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。(来源...

9月27日周日
  1. IT之家 AI70

    消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布

    IT之家 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」, 预计将在 9 月 29 日的 OpenAI DevDay 推出 。 IT之家从原爆料获悉,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置“-o”的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与“Aeon”有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。

    推荐理由:来自IT之家 AI的《消息称 OpenAI 将推出常驻 AI 助手「O」,预计 9 月 29 日发布》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 27 日消息,据消息人士 Alexey Shabanov 昨日透露,OpenAI 即将推出一款常驻 AI 助手,其代号为「O」, 预计将在 9 月 29 日的 OpenAI DevDay 推出 。 IT之家从原爆料获悉,ChatGPT 的配置文件中已经出现了许多与「O」相关的线索,包括将「O」设置为显示名称、配置“-o”的电子邮件后缀。综合这些线索来看,这款智能体预计将能够在普通聊天之外持续运行,还可能拥有独立身份。 同时该项目可能与“Aeon”有关。此前已有消息称,Aeon 是 OpenAI 常驻型智能体项目使用的名称。不过我们目前尚不清楚它支持哪些任务、具备拥有何种权限,以及是否支持定时任务、记忆功能或何时开放。 值得注意的是,此前曾有传闻称 OpenAI 正在研究一款甜甜圈形状的硬件。因此这些项目如果能产生关联,单字母代号可能会成为一种有趣的双关。

9月26日周六
  1. 量子位36

    索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准

    事实摘要:索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准 “世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 索辰科技加码世界模型,与战略投资企业美梦空间联合发布具身模型与物理测评标准 “世界模型”开始成为具身智能跨越商业化“奇点”的新叙事。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. IT之家 AI72

    OpenAI 承认 53 张用户图片被其 AI 智能体“偷偷”传到公网

    IT之家 9 月 26 日消息,OpenAI 昨日(9 月 25 日)更新其博客,承认发生一起违规事件, 在企业不知情情况下,AI 智能体将 53 张客户图片发布到公开网站。 在博文中,IT之家援引博文介绍,OpenAI 公司承认在其研究环境中运行的 AI 智能体曾将 53 张由用户上传到 OpenAI 模型的图片,以“未公开列出的链接”形式发布到第三方图像托管网站(类似图床),而受影响公司当时并不知情。 在影响方面,OpenAI 指出这些图片并非出现在公开索引页面上,作为“未列出(unlisted)”链接存在,理论上不易被搜索引擎直接发现,不过对于掌握链接的用户而言,可以访问获取相关内容。 OpenAI 表示这属于对用户数据的“不当使用”,不在其隐私政策允许范围内。公司称已移除“大多数”相关内容,并仍在与托管方合作清理剩余部分,但承认仍有部分内容可能在线。 根据 OpenAI 的说明,这些图片来自已授权 OpenAI 使用其数...

    推荐理由:来自IT之家 AI的《OpenAI 承认 53 张用户图片被其 AI 智能体“偷偷”传到公网》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 26 日消息,OpenAI 昨日(9 月 25 日)更新其博客,承认发生一起违规事件, 在企业不知情情况下,AI 智能体将 53 张客户图片发布到公开网站。 在博文中,IT之家援引博文介绍,OpenAI 公司承认在其研究环境中运行的 AI 智能体曾将 53 张由用户上传到 OpenAI 模型的图片,以“未公开列出的链接”形式发布到第三方图像托管网站(类似图床),而受影响公司当时并不知情。 在影响方面,OpenAI 指出这些图片并非出现在公开索引页面上,作为“未列出(unlisted)”链接存在,理论上不易被搜索引擎直接发现,不过对于掌握链接的用户而言,可以访问获取相关内容。 OpenAI 表示这属于对用户数据的“不当使用”,不在其隐私政策允许范围内。公司称已移除“大多数”相关内容,并仍在与托管方合作清理剩余部分,但承认仍有部分内容可能在线。 根据 OpenAI 的说明,这些图片来自已授权 OpenAI 使用其数...

9月25日周五
  1. IT之家 AI68

    Meta 个人智能体 Muse macOS 版被曝严重漏洞,可被劫持操控关联应用

    IT之家 9 月 25 日消息,macOS 安全研究员、Objective-See Foundation 创始人 Patrick Wardle 发现,Meta 面向 macOS 用户推出的 Muse 存在一项严重的零日漏洞,攻击者可借助一个隐藏配置项劫持用户的 Muse 账户,并利用其已获得的系统权限访问邮件、日历、WhatsApp 等关联应用。 Patrick Wardle 将这一漏洞命名为“Not-a-Mused”。好消息是,Meta 在漏洞公开后发布热修复程序,移除了相关调试功能。 Wardle 表示,该漏洞允许本地进程或一条终端命令接管整个 Muse 账户,使 AI 助手本身成为攻击入口,而无需传统意义上的复杂恶意软件。 漏洞的核心问题出现在 Muse 的语音输入功能。与苹果在本地设备完成语音转写不同,Muse 会将语音数据发送至云端处理。 Wardle 发现,一个名为 endo_voyager_dictation_en...

    推荐理由:来自IT之家 AI的《Meta 个人智能体 Muse macOS 版被曝严重漏洞,可被劫持操控关联应用》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 25 日消息,macOS 安全研究员、Objective-See Foundation 创始人 Patrick Wardle 发现,Meta 面向 macOS 用户推出的 Muse 存在一项严重的零日漏洞,攻击者可借助一个隐藏配置项劫持用户的 Muse 账户,并利用其已获得的系统权限访问邮件、日历、WhatsApp 等关联应用。 Patrick Wardle 将这一漏洞命名为“Not-a-Mused”。好消息是,Meta 在漏洞公开后发布热修复程序,移除了相关调试功能。 Wardle 表示,该漏洞允许本地进程或一条终端命令接管整个 Muse 账户,使 AI 助手本身成为攻击入口,而无需传统意义上的复杂恶意软件。 漏洞的核心问题出现在 Muse 的语音输入功能。与苹果在本地设备完成语音转写不同,Muse 会将语音数据发送至云端处理。 Wardle 发现,一个名为 endo_voyager_dictation_en...

  2. IT之家 AI34

    央视披露非正规火车票抢票工具四大套路:“极速加速”不提速、“余票监控”不靠谱、“免费候补”收费卖

    IT之家 9 月 25 日消息,据央视新闻昨日报道,铁路 12306 是中国铁路唯一官方火车票网络售票平台,从未与任何第三方平台机构开展合作。中国互联网协会 12321 受理中心发布安全提醒,提示旅客购票注意避坑。 铁科院电子所数智客运研究室副研究员张智表示,部分社交短视频平台发布“高铁不会告诉你的灰色操作”“员工内部票隐藏入口”等内容,看似吸引人,实际上是以虚假宣传的方式推广第三方抢票平台。 据介绍,第三方抢票软件兜售的“免费换座”“一键换座”,实际是将铁路提供的改签功能进行包装,诱导消费者在不完全明白的情况下用掉一次改签权益,导致行程变化后无法再次改签或需支付额外退票手续费。 套路一是“抢票”实为官网候补。部分平台宣传“双通道抢票”,声称候补购票加余票监控成功率更高。但根据 12306 规则,存在候补订单时,不会出现可直接购买的余票。 套路二是“极速加速”不提速。车票售罄后,第三方平台仍提供 10 到 50 元不等的加速包,...

    推荐理由:来自IT之家 AI的《央视披露非正规火车票抢票工具四大套路:“极速加速”不提速、“余票监控”不靠谱、“免费候补”收费卖》。重点看产品发布。摘要提到:IT之家 9 月 25 日消息,据央视新闻昨日报道,铁路 12306 是中国铁路唯一官方火车票网络售票平台,从未与任何第三方平台机构开展合作。中国互联网协会 12321 受理中心发布安全提醒,提示旅客购票注意避坑。 铁科院电子所数智客运研究室副研究员张智表示,部分社交短视频平台发布“高铁不会告诉你的灰色操作”“员工内部票隐藏入口”等内容,看似吸引人,实际上是以虚假宣传的方式推广第三方抢票平台。 据介绍,第三方抢票软件兜售的“免费换座”“一键换座”,实际是将铁路提供的改签功能进行包装,诱导消费者在不完全明白的情况下用掉一次改签权益,导致行程变化后无法再次改签或需支付额外退票手续费。 套路一是“抢票”实为官网候补。部分平台宣传“双通道抢票”,声称候补购票加余票监控成功率更高。但根据 12306 规则,存在候补订单时,不会出现可直接购买的余票。 套路二是“极速加速”不提速。车票售罄后,第三方平台仍提供 10 到 50 元不等的加速包,...

  3. IT之家 AI68

    微软正淡化 Copilot+ PC 品牌,2026 新款 Surface 已弃用

    IT之家 9 月 25 日消息,科技媒体 Windows Central 昨日(9 月 24 日)发布博文,报道称微软公司正淡化 Copilot+ PC(国内称 Windows 11 AI+ PC)品牌, 2026 年推出的新款 Surface PC 已不再使用该标签。 IT之家援引博文介绍,微软于 2024 年携手高通公司,推出 Windows 硬件新类别“Copilot+ PC”,为 AI 优先计算机设定基准,并配有专属的 Copilot 按键。 不过该产品发布后遇安全研究人员强烈质疑,核心功能 Recall 被发现存在严重安全隐患。微软被迫推迟 Recall 上线,导致首批设备缺乏主打 AI 体验,品牌声誉受损。 过去两年间,越来越多 OEM 厂商在营销材料与产品名称中弃用“Copilot+ PC”标识。微软自身也逐步停止提及该品牌,2026 年新款 Surface PC 已不再标注 Copilot+ PC 名称。 微软 ...

    推荐理由:来自IT之家 AI的《微软正淡化 Copilot+ PC 品牌,2026 新款 Surface 已弃用》。重点看评测与基准、产品发布。摘要提到:IT之家 9 月 25 日消息,科技媒体 Windows Central 昨日(9 月 24 日)发布博文,报道称微软公司正淡化 Copilot+ PC(国内称 Windows 11 AI+ PC)品牌, 2026 年推出的新款 Surface PC 已不再使用该标签。 IT之家援引博文介绍,微软于 2024 年携手高通公司,推出 Windows 硬件新类别“Copilot+ PC”,为 AI 优先计算机设定基准,并配有专属的 Copilot 按键。 不过该产品发布后遇安全研究人员强烈质疑,核心功能 Recall 被发现存在严重安全隐患。微软被迫推迟 Recall 上线,导致首批设备缺乏主打 AI 体验,品牌声誉受损。 过去两年间,越来越多 OEM 厂商在营销材料与产品名称中弃用“Copilot+ PC”标识。微软自身也逐步停止提及该品牌,2026 年新款 Surface PC 已不再标注 Copilot+ PC 名称。 微软 ...

  4. IT之家 AI70

    Meta 的 AI 智能体 Muse 被发现可导出虚拟机大量文件

    IT之家 9 月 25 日消息,科技媒体 macobserver 昨日(9 月 24 日)发布博文,报道称 Meta Muse 被发现可在简单提示词下, 打包并返回用户专属虚拟机中的大量 Linux 文件。 Peter James 和 Jonny L. Saunders 两名开发者已独立复现该问题,相关文件包含系统文件、应用模板、内部运行文档、Markdown 与 JSON 文件等。 导出的文件可能暴露 Muse 的内部运行机制,包括请求处理、记忆保存、服务连接和后台任务。其中 agents/ 目录包含 113 份子智能体记录及 JSONL 追踪文件。约 20 份 Markdown 文档介绍浏览器、连接器、支付、凭据、数据处理、语音、目标和定时任务等功能。 研究人员还统计出约 68 个技能目录。相关功能覆盖 Google Workspace、Meta 社交应用、Outlook、旅行、购物、健康服务、家庭设备和媒体生成。配置文件还...

    推荐理由:来自IT之家 AI的《Meta 的 AI 智能体 Muse 被发现可导出虚拟机大量文件》。重点看智能体工作流、产品发布。摘要提到:IT之家 9 月 25 日消息,科技媒体 macobserver 昨日(9 月 24 日)发布博文,报道称 Meta Muse 被发现可在简单提示词下, 打包并返回用户专属虚拟机中的大量 Linux 文件。 Peter James 和 Jonny L. Saunders 两名开发者已独立复现该问题,相关文件包含系统文件、应用模板、内部运行文档、Markdown 与 JSON 文件等。 导出的文件可能暴露 Muse 的内部运行机制,包括请求处理、记忆保存、服务连接和后台任务。其中 agents/ 目录包含 113 份子智能体记录及 JSONL 追踪文件。约 20 份 Markdown 文档介绍浏览器、连接器、支付、凭据、数据处理、语音、目标和定时任务等功能。 研究人员还统计出约 68 个技能目录。相关功能覆盖 Google Workspace、Meta 社交应用、Outlook、旅行、购物、健康服务、家庭设备和媒体生成。配置文件还...

9月24日周四
  1. 量子位64

    GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案

    事实摘要:GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案 人类演示一次,机器人即可实现跨场景任务复用 这条动态来自 量子位,可重点关注产品发布。 GPT-6之后,具身智能走向何方?诺因发布GLOW技术报告,给出机器人“一教就会”的答案 人类演示一次,机器人即可实现跨场景任务复用。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. IT之家 AI70

    OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力

    IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。 据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。 OpenAI 表示,目前针对 AI 在心理健康领域表现的多数评估主要集中于紧急情况,并使用宽泛的预设标准衡量模型表现,因此对于模型如何应对完整范围的心理健康对话,仍存在一...

    推荐理由:来自IT之家 AI的《OpenAI 发布 MentalHealthBench:1215 段对话评估 AI 心理健康应对能力》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 24 日消息,OpenAI 今日推出了 MentalHealthBench,这是一个开放式基准测试,包含 1215 段合成心理健康对话,用于评估 AI 系统在真实场景下的应对能力,覆盖从日常心理健康话题到紧急心理健康事件等不同情况。 据IT之家了解,该基准由来自 22 个国家和地区的 80 多名持证心理学家和精神科医生共同参与制定。这些专家共使用 19 种语言,覆盖近 20 个心理健康专业领域。每段对话都配有由专家团队制定的评分标准。根据配套研究论文,完整数据集共包含 5262 条由专家撰写的评分标准。OpenAI 表示,此次公开发布 MentalHealthBench,是希望其他研究人员能够审查其方法、开展独立评估,并在此基础上进一步研究。 OpenAI 表示,目前针对 AI 在心理健康领域表现的多数评估主要集中于紧急情况,并使用宽泛的预设标准衡量模型表现,因此对于模型如何应对完整范围的心理健康对话,仍存在一...

9月23日周三
  1. 量子位70

    斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界”

    事实摘要:斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界” 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型AutoOmni 2.0-23B-A3B 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 斑马智能发布端模型AutoOmni2.0,让元神AI更懂“我的世界” 9月23日云栖大会期间,斑马智能发布新一代全模态端侧大模型A。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  2. 量子位66

    Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折

    事实摘要:Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 缓存读取价砍了60% 这条动态来自 量子位,可重点关注产品发布。 Claude Opus 5.5突袭!68万行代码一天迁完,API价格打8折 缓存读取价砍了60%。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. 爱范儿66

    Claude 5.5 发布,性能直逼 Fable,还要卷价格

    事实摘要:Claude 5.5 发布,性能直逼 Fable,还要卷价格 最卷一夜! #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注产品发布。 Claude 5.5 发布,性能直逼 Fable,还要卷价格 最卷一夜! #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. GitHub Changelog89

    OpenAI’s GPT-6 Sol and GPT-6 Luna now available

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:OpenAI’s GPT-6 Sol and GPT-6 Luna now available 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:OpenAI’s GPT-6 Sol and GPT-6 Luna now available 事实摘要:这条。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月22日周二
  1. IT之家 AI70

    AI 助力古籍修复:Apollo 大语言模型问世,专门用于解读古希腊莎草纸残片

    IT之家 9 月 22 日消息,据 《连线》(WIRED)报道,全球各地高校图书馆保存着数十万份古希腊莎草纸残片,不少残片损毁严重,其内容或许已无法解读;对于其余尚存修复希望的文本,学者只能依靠人工逐条补全缺失的词句完成复原。为加快这项繁重的工作,研究人员开始借助人工智能。 奥地利科学院将于当地时间周三正式发布了全球首款面向古希腊语的高级大语言模型。该项目由奥地利科学院联合法国 AI 实验室 Mistral 以及科技服务商 Sail Reply 共同开发,命名为 Apollo。这套模型的训练素材取自手稿、莎草纸与石刻铭文,总计大约 6 亿个古希腊历史词汇。 据IT之家了解,科研人员可以通过聊天机器人界面免费使用该模型。研发团队希望借助 Apollo 帮助学者更快筛选出和自身细分研究方向相关的莎草纸残片,发掘出新的研究切入点。针对破损残缺的文献,Apollo 会基于统计概率给出可能性最高的词句来填补文本空白,有望挖掘出此前被掩盖的...

    推荐理由:来自IT之家 AI的《AI 助力古籍修复:Apollo 大语言模型问世,专门用于解读古希腊莎草纸残片》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 22 日消息,据 《连线》(WIRED)报道,全球各地高校图书馆保存着数十万份古希腊莎草纸残片,不少残片损毁严重,其内容或许已无法解读;对于其余尚存修复希望的文本,学者只能依靠人工逐条补全缺失的词句完成复原。为加快这项繁重的工作,研究人员开始借助人工智能。 奥地利科学院将于当地时间周三正式发布了全球首款面向古希腊语的高级大语言模型。该项目由奥地利科学院联合法国 AI 实验室 Mistral 以及科技服务商 Sail Reply 共同开发,命名为 Apollo。这套模型的训练素材取自手稿、莎草纸与石刻铭文,总计大约 6 亿个古希腊历史词汇。 据IT之家了解,科研人员可以通过聊天机器人界面免费使用该模型。研发团队希望借助 Apollo 帮助学者更快筛选出和自身细分研究方向相关的莎草纸残片,发掘出新的研究切入点。针对破损残缺的文献,Apollo 会基于统计概率给出可能性最高的词句来填补文本空白,有望挖掘出此前被掩盖的...

  2. IT之家 AI66

    Counterpoint 数据:全球 AI 眼镜出货 2026H1 同比大增 263%

    IT之家 9 月 22 日消息,Counterpoint Research 昨日表示, 全球人工智能眼镜出货量在 2026 年上半年实现了 263% 的显著同比增长 。其中无屏型产品的出货占比继续维持 96% 高位,AR AI 眼镜分得 4% 市场。 ▲ 图源:Counterpoint Research 无屏 AI 眼镜的出货量在 2026H1 同比增长 258%、环比增长 22%;这一细分领域依旧由 Meta 主导,占比 94%,销量同比增长 260%、环比增长 22%。 ▲ 图源:Counterpoint Research 另一方面,定位更高的 AR AI 眼镜出货量同比大增 449%,环比增长 18%。中国 OEM 厂商引领了商业化进程,中国 (45%) 也超越美国 (41%) 成为该细分品类的最大市场。 ▲ 图源:Counterpoint Research 分析认为,存储器等半导体元件价格的上涨、公众对 AI 眼镜隐私问...

    推荐理由:来自IT之家 AI的《Counterpoint 数据:全球 AI 眼镜出货 2026H1 同比大增 263%》。重点看产品发布。摘要提到:IT之家 9 月 22 日消息,Counterpoint Research 昨日表示, 全球人工智能眼镜出货量在 2026 年上半年实现了 263% 的显著同比增长 。其中无屏型产品的出货占比继续维持 96% 高位,AR AI 眼镜分得 4% 市场。 ▲ 图源:Counterpoint Research 无屏 AI 眼镜的出货量在 2026H1 同比增长 258%、环比增长 22%;这一细分领域依旧由 Meta 主导,占比 94%,销量同比增长 260%、环比增长 22%。 ▲ 图源:Counterpoint Research 另一方面,定位更高的 AR AI 眼镜出货量同比大增 449%,环比增长 18%。中国 OEM 厂商引领了商业化进程,中国 (45%) 也超越美国 (41%) 成为该细分品类的最大市场。 ▲ 图源:Counterpoint Research 分析认为,存储器等半导体元件价格的上涨、公众对 AI 眼镜隐私问...

9月21日周一
  1. 量子位66

    长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案

    事实摘要:长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案。影响判断:这三条AI安全解决方案旨在提升中国在网络安全领域的技术水平和竞争力。场景价值:适用于研究者、开发者和政策制定者,特别是关注网络空间安全的机构。

    推荐理由:这些解决方案通过具体的产品和技术展示,为用户提供实际的应用案例和解决方案。

  2. IT之家 AI70

    被质疑“偷传代码”后智谱 ZCode 官宣开源:已完成整改并向所有用户道歉

    IT之家 9 月 21 日消息,智谱 ZCode 今日宣布,针对社区反馈的 ZCode 产品安全问题, 官方已经完成整改,并向所有用户道歉 。 智谱已将 ZCode 开源 ( https://github.com/zai-org/ZCode ),把代码交给社区监督,让 ZCode 变得开放、透明。 非常感谢此前发现 ZCode 问题的社区开发者,接下来我们将建立常态化的产品安全漏洞机制,欢迎开发者伙伴持续检查和反馈问题,我们会根据问题严重程度给予相应回报。 对于社区中提及的代码数据,我们承诺无留存,也从未将其用于模型训练。完成整改后,我们邀请中国信息通信研究院和绿盟科技开展安全审计,结果如下: 经中国信息通信研究院技术评测,确认 zcode-prod 阿里云 OSS 存储桶状态为云端零数据。ZCode v3.14.0 客户端已完成安全整改,已经移除 Repo Wiki 功能,已切断本地仓库快照生成与上传链路。 经绿盟科技审查,确...

    推荐理由:来自IT之家 AI的《被质疑“偷传代码”后智谱 ZCode 官宣开源:已完成整改并向所有用户道歉》。重点看模型能力与工程、评测与基准、开源生态。摘要提到:IT之家 9 月 21 日消息,智谱 ZCode 今日宣布,针对社区反馈的 ZCode 产品安全问题, 官方已经完成整改,并向所有用户道歉 。 智谱已将 ZCode 开源 ( https://github.com/zai-org/ZCode ),把代码交给社区监督,让 ZCode 变得开放、透明。 非常感谢此前发现 ZCode 问题的社区开发者,接下来我们将建立常态化的产品安全漏洞机制,欢迎开发者伙伴持续检查和反馈问题,我们会根据问题严重程度给予相应回报。 对于社区中提及的代码数据,我们承诺无留存,也从未将其用于模型训练。完成整改后,我们邀请中国信息通信研究院和绿盟科技开展安全审计,结果如下: 经中国信息通信研究院技术评测,确认 zcode-prod 阿里云 OSS 存储桶状态为云端零数据。ZCode v3.14.0 客户端已完成安全整改,已经移除 Repo Wiki 功能,已切断本地仓库快照生成与上传链路。 经绿盟科技审查,确...

9月19日周六
  1. IT之家 AI64

    马斯克脑机公司 Neuralink 新突破:让失语者“说出我爱你”

    IT之家 9 月 19 日消息,全球首富埃隆 · 马斯克(Elon Musk)联合创立的脑机公司 Neuralink 昨日(9 月 18 日)在 X 平台发布推文,有语言障碍的志愿者 Terry 在植入脑机接口后, 可以通过意念向其亲人传达“我爱你”信息 。埃隆 · 马斯克称此次演示 " 令人动容,出乎意料 "。 IT之家附上相关视频如下: 在 23 秒的视频中,一名此前丧失语言能力的男子,借助脑机接口将神经信号转化为与其原声高度匹配的合成语音。 据介绍,Terry 先通过尝试模拟说话训练算法,随后可仅在脑中思考词语,系统便以其自然声音输出语音。 该演示采用 Grok Voice 语音技术;Neuralink 同时强调,其设备仍属研究阶段,尚未获美国 FDA 或其他监管机构批准,个案体验不代表所有受试者或未来临床结果。 Neuralink VOICE 项目是一项临床试验,主要探索利用 N1 植入芯片,帮助因 ALS(肌萎缩侧索硬...

    推荐理由:来自IT之家 AI的《马斯克脑机公司 Neuralink 新突破:让失语者“说出我爱你”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 19 日消息,全球首富埃隆 · 马斯克(Elon Musk)联合创立的脑机公司 Neuralink 昨日(9 月 18 日)在 X 平台发布推文,有语言障碍的志愿者 Terry 在植入脑机接口后, 可以通过意念向其亲人传达“我爱你”信息 。埃隆 · 马斯克称此次演示 " 令人动容,出乎意料 "。 IT之家附上相关视频如下: 在 23 秒的视频中,一名此前丧失语言能力的男子,借助脑机接口将神经信号转化为与其原声高度匹配的合成语音。 据介绍,Terry 先通过尝试模拟说话训练算法,随后可仅在脑中思考词语,系统便以其自然声音输出语音。 该演示采用 Grok Voice 语音技术;Neuralink 同时强调,其设备仍属研究阶段,尚未获美国 FDA 或其他监管机构批准,个案体验不代表所有受试者或未来临床结果。 Neuralink VOICE 项目是一项临床试验,主要探索利用 N1 植入芯片,帮助因 ALS(肌萎缩侧索硬...

  2. IT之家 AI70

    OpenAI 示警:先进 AI 可在 2 台相邻物理隔离 PC 间“对话”

    IT之家 9 月 19 日消息,科技媒体 Wccftech 昨日(9 月 18 日)发布博文,报道称在先进 AI 模型交互方面,物理隔离电脑未必能完全阻断两台相邻计算机间的信息交换。 OpenAI 研究员诺姆 · 布朗(Noam Brown)表示:“ 人类绝对不要低估 AI 的能力 ”,基于学术研究成果,发现相邻的物理隔离计算机可借 CPU 升温与温度传感器读数,形成低带宽隐蔽通信通道,充当“摩斯电码”通信。 IT之家注:物理隔离(Air Gap)指切断计算机或网络与其他系统之间的网络连接和数据链路。该措施常用于隔绝外部网络访问与数据外传路径。 研究报告指出,一台设备通过提高 CPU 负载推高温度,另一台设备读取环境或硬件温度变化。发送端可按预设节奏改变热量输出,接收端将温度波动解读为编码信息,由此形成极低带宽的隐蔽信道。 而现代 CPU、GPU 及主板普遍装有温度传感器。此类传感器主要服务于散热管理,例如调高风扇转速、降低芯片...

    推荐理由:来自IT之家 AI的《OpenAI 示警:先进 AI 可在 2 台相邻物理隔离 PC 间“对话”》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 19 日消息,科技媒体 Wccftech 昨日(9 月 18 日)发布博文,报道称在先进 AI 模型交互方面,物理隔离电脑未必能完全阻断两台相邻计算机间的信息交换。 OpenAI 研究员诺姆 · 布朗(Noam Brown)表示:“ 人类绝对不要低估 AI 的能力 ”,基于学术研究成果,发现相邻的物理隔离计算机可借 CPU 升温与温度传感器读数,形成低带宽隐蔽通信通道,充当“摩斯电码”通信。 IT之家注:物理隔离(Air Gap)指切断计算机或网络与其他系统之间的网络连接和数据链路。该措施常用于隔绝外部网络访问与数据外传路径。 研究报告指出,一台设备通过提高 CPU 负载推高温度,另一台设备读取环境或硬件温度变化。发送端可按预设节奏改变热量输出,接收端将温度波动解读为编码信息,由此形成极低带宽的隐蔽信道。 而现代 CPU、GPU 及主板普遍装有温度传感器。此类传感器主要服务于散热管理,例如调高风扇转速、降低芯片...

  3. Claude Code Releases80

    Claude Code Releases v2.1.278:Changed auto mode for Claude API and Enterprise users, and...

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.278:Changed auto mode for Claude API and Enterprise users, and... 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:Claude Code Releases v2.1.278:Cha。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI34

    “机顶盒内置”引发网友热议:专家解读一体化电视到底长什么样,广电总局目标在今年实现数千万规模部署

    IT之家 9 月 19 日消息,国家广播电视总局 9 月 17 日在国务院新闻办公室发布会上介绍,将会同工业和信息化部制定一体化电视技术标准,把机顶盒功能以软件形态内置于电视机中。 按照规划,一台电视即可接收直播、点播等全类型电视业务。用户配备通用遥控器,可一键开关机、一键看频道节目。 实际上,这已经不是什么新闻了,IT之家近两年来至少已经报道过 12 次相关内容。但没想到的是,9 月 17 日消息公布后,“机顶盒内置”这一旧闻迅速引发网友讨论并登上热搜。 今年 6 月 15 日,国家广播电视总局就已发布《一体化电视专网电视业务应用技术要求和测量方法》行业标准。 这是我国首个针对一体化电视的基础性技术规范 。 央视新闻邀请到了国家广播电视总局广播电视科学研究院有线所所长欧阳峰进行解读。据介绍,一体化电视主要是将传统硬件机顶盒以软件形式安装在智能电视机中,实现直播、点播和视频回看等功能。 其当前主要形态是智能电视机中的一个软件或 ...

    推荐理由:来自IT之家 AI的《“机顶盒内置”引发网友热议:专家解读一体化电视到底长什么样,广电总局目标在今年实现数千万规模部署》。重点看产品发布。摘要提到:IT之家 9 月 19 日消息,国家广播电视总局 9 月 17 日在国务院新闻办公室发布会上介绍,将会同工业和信息化部制定一体化电视技术标准,把机顶盒功能以软件形态内置于电视机中。 按照规划,一台电视即可接收直播、点播等全类型电视业务。用户配备通用遥控器,可一键开关机、一键看频道节目。 实际上,这已经不是什么新闻了,IT之家近两年来至少已经报道过 12 次相关内容。但没想到的是,9 月 17 日消息公布后,“机顶盒内置”这一旧闻迅速引发网友讨论并登上热搜。 今年 6 月 15 日,国家广播电视总局就已发布《一体化电视专网电视业务应用技术要求和测量方法》行业标准。 这是我国首个针对一体化电视的基础性技术规范 。 央视新闻邀请到了国家广播电视总局广播电视科学研究院有线所所长欧阳峰进行解读。据介绍,一体化电视主要是将传统硬件机顶盒以软件形式安装在智能电视机中,实现直播、点播和视频回看等功能。 其当前主要形态是智能电视机中的一个软件或 ...

  5. GitHub Changelog82

    Manage the code coverage ruleset condition with the REST API

    事实摘要:这条英文动态主要涉及开源生态,原文信息显示:Manage the code coverage ruleset condition with the REST API 事实摘要:这条英文动态主要涉及开源生态,原文信息显示:Manage the code coverage ruleset condition with the REST API 事实摘要:这条英文。影响判断:它可能改变开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月18日周五
  1. 极客公园74

    那个教 ChatGPT 说话的人,做了一个「哑巴」模型

    作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 ...

    推荐理由:来自极客公园的《那个教 ChatGPT 说话的人,做了一个「哑巴」模型》。重点看模型能力与工程、产品发布。摘要提到:作者|桦林舞王 编辑|靖宇 AI 圈子里最懂怎么让模型「开口聊天」的人,现在决定剥夺大模型的语言能力。 这位前 OpenAI 研究员、ChatGPT 的共同发明者 Diogo Almeida,在潜行两年后带着他的新公司 TypeSafe AI 和 4000 万美元融资回到牌桌。他们发布的全新模型 Jev, 既不能写打工人的周报,也不能陪用户深夜长聊。它甚至连一个标点符号都吐不出来 。 TypeSafe 创始人 Diogo Almeida|图片来源:X 这是一个反常识的时刻。过去三年,全行业都在教大模型怎么学会像人类一样「慢思考」,各家实验室拼命拉长推理链条,让模型在给出答案前默默自言自语几千个词。 但 Jev 走了一条完全相反的路: 它不做文本生成,只输出确定性的结构化决策。 这不仅是一个新产品的发布,更像是对当前大模型技术范式的一次公然叫板。 01 给 AI 装上「反射神经」 要理解 Jev 到底是个什么东西,得先看懂当下的 ...

  2. IT之家 AI70

    打官司最佳 AI 助手:OpenAI 推出 Astra for Law,提高案件胜诉率

    IT之家 9 月 18 日消息,OpenAI 公司昨日(9 月 17 日)发布博文,宣布推出 Astra for Law 服务,定位法律专用人工智能基础平台, 其法律搜索索引覆盖超过 2.3 亿个 URL,并纳入覆盖 99.9% 以上已发布美国判例法的 CourtListener 案例库。 IT之家附上相关截图如下: OpenAI 使用 Vals AI 法律研究基准私有验证集中的 200 道美国法律问题测试系统。在最高推理强度下,Astra for Law 整体正确率为 54.0%,而仅使用网页搜索的 GPT-6 Astra 为 38.7%。 在案例法导向问题中,Astra for Law 找到的参考案例数量多 24%。在经审计的目标段落集合中,其从正确法院意见书中检出的相关段落最高多 54%。 该服务并非“AI 律师”,主要服务于律师和法律软件公司,帮助其区分法院判决中的核心裁判理由与附带评论,寻找不利判例,分析合同条款如何分...

    推荐理由:来自IT之家 AI的《打官司最佳 AI 助手:OpenAI 推出 Astra for Law,提高案件胜诉率》。重点看模型能力与工程、评测与基准、产品发布。摘要提到:IT之家 9 月 18 日消息,OpenAI 公司昨日(9 月 17 日)发布博文,宣布推出 Astra for Law 服务,定位法律专用人工智能基础平台, 其法律搜索索引覆盖超过 2.3 亿个 URL,并纳入覆盖 99.9% 以上已发布美国判例法的 CourtListener 案例库。 IT之家附上相关截图如下: OpenAI 使用 Vals AI 法律研究基准私有验证集中的 200 道美国法律问题测试系统。在最高推理强度下,Astra for Law 整体正确率为 54.0%,而仅使用网页搜索的 GPT-6 Astra 为 38.7%。 在案例法导向问题中,Astra for Law 找到的参考案例数量多 24%。在经审计的目标段落集合中,其从正确法院意见书中检出的相关段落最高多 54%。 该服务并非“AI 律师”,主要服务于律师和法律软件公司,帮助其区分法院判决中的核心裁判理由与附带评论,寻找不利判例,分析合同条款如何分...