跳到正文
9月30日周三
  1. OpenAI News83

    Disrupting a coordinated model-distillation campaign

    这条英文动态主要涉及模型能力与工程。原文要点:Learn how OpenAI disrupted a campaign to extract protected model reasoning and is strengthening defenses against adversarial distillation.

    推荐理由:来自OpenAI News的《Disrupting a coordinated model-distillation campaign》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Learn how OpenAI disrupted a campaign to extract protected model reasoning and is strengthening defenses against adversarial distillation.

  2. IT之家 AI76

    中国大模型首次进入 OpenAI 企业付费结算体系,Kimi K3 接入 Codex 企业通道

    IT之家 9 月 30 日消息,美国 AI 基础设施公司 Baseten 今天宣布与 OpenAI 达成合作,成为 OpenAI B2B 市场首批开源模型推理服务提供商之一。企业用户可通过 Codex 使用 Kimi K3 和 GLM 5.3 等开源模型,意味着中国开源模型首次进入 OpenAI 企业采购体系。 IT之家了解到,Kimi K3 是月之暗面开发的大模型。官方宣称其是首个参数规模达 2.8 万亿的开源模型。该模型原生支持视觉能力, 拥有 100 万 Token 的上下文窗口 ,非常适合执行长时间编程、多文档分析等工作。 如今,OpenAI 企业用户可通过 Codex 或 Responses API 调用 Kimi K3 等开源模型,以相同的预算获得更多 AI 能力。Baseten 承诺其提供的所有模型均运行在美国服务器,针对所有提示词实行零数据保留(ZDR)。

    推荐理由:来自IT之家 AI的《中国大模型首次进入 OpenAI 企业付费结算体系,Kimi K3 接入 Codex 企业通道》。重点看模型能力与工程、开源生态、产品发布。摘要提到:IT之家 9 月 30 日消息,美国 AI 基础设施公司 Baseten 今天宣布与 OpenAI 达成合作,成为 OpenAI B2B 市场首批开源模型推理服务提供商之一。企业用户可通过 Codex 使用 Kimi K3 和 GLM 5.3 等开源模型,意味着中国开源模型首次进入 OpenAI 企业采购体系。 IT之家了解到,Kimi K3 是月之暗面开发的大模型。官方宣称其是首个参数规模达 2.8 万亿的开源模型。该模型原生支持视觉能力, 拥有 100 万 Token 的上下文窗口 ,非常适合执行长时间编程、多文档分析等工作。 如今,OpenAI 企业用户可通过 Codex 或 Responses API 调用 Kimi K3 等开源模型,以相同的预算获得更多 AI 能力。Baseten 承诺其提供的所有模型均运行在美国服务器,针对所有提示词实行零数据保留(ZDR)。

  3. OpenAI News92

    Helping small businesses put AI to work

    事实摘要:这条英文动态主要涉及模型能力与工程、文化创意、开源生态,原文信息显示:Helping small businesses put AI to work 这条英文动态主要涉及模型能力与工程、文化创意、开源生态。原文要点:OpenAI is partnering with America’s SBDC to expand hands-on AI training 。影响判断:它可能改变模型能力与工程、文化创意、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、文化创意、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、文化创意、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  4. IT之家 AI68

    OpenClaw Enterprise 官宣:为智能体提供企业级安全与控制功能

    IT之家 9 月 30 日消息,OpenClaw 官方当地时间本月 29 日官宣了 OpenClaw Enterprise,这是一个开源中立的 敏感环境持久性智能体管理平台 。 持久性智能体的部署并未像此前预计的那样快速铺开,而这主要是因为智能体领域目前仍缺乏强大的通用安全、保障、治理标准,让企业和组织难以放心使用。 即将发布 1.0 正式版的 OpenClaw Enterprise 正是为此而生,其为智能体引入了企业级控制平面,支持多租户、严格的安全边界、标准化的智能体原语,在智能体生命周期内增强了治理和审计能力,同时确保核心原语可以替换为第三方解决方案以及内部实现。

    推荐理由:来自IT之家 AI的《OpenClaw Enterprise 官宣:为智能体提供企业级安全与控制功能》。重点看智能体工作流、开源生态、产品发布。摘要提到:IT之家 9 月 30 日消息,OpenClaw 官方当地时间本月 29 日官宣了 OpenClaw Enterprise,这是一个开源中立的 敏感环境持久性智能体管理平台 。 持久性智能体的部署并未像此前预计的那样快速铺开,而这主要是因为智能体领域目前仍缺乏强大的通用安全、保障、治理标准,让企业和组织难以放心使用。 即将发布 1.0 正式版的 OpenClaw Enterprise 正是为此而生,其为智能体引入了企业级控制平面,支持多租户、严格的安全边界、标准化的智能体原语,在智能体生命周期内增强了治理和审计能力,同时确保核心原语可以替换为第三方解决方案以及内部实现。

  5. IT之家 AI72

    微软推出实验性多模态 AI 研究系统 Project Quine,有望大幅加速药物发现

    IT之家 9 月 30 日消息,当地时间 29 日,微软研究院推出了实验性多模态 AI 研究系统 Project Quine。据悉,Project Quine 是一套 用于生物学研究的“世界模型” ,目标是把计算生物学建模与实际湿实验衔接起来。 Project Quine 由微软研究院与哈佛大学和麻省理工学院博德研究所共同开发。系统将覆盖 基因组学、蛋白质、化学、细胞状态和生物成像 的联合表征世界模型,与交互式推理框架结合起来。为了让科研人员尽早使用 Project Quine,微软开放了首届 Quine Fellows 项目申请。未来,微软还计划通过 Microsoft Discovery 等产品逐步扩大商业化开放范围。 Project Quine 并不局限于某一个研究领域,而是能够 同时处理上述多个领域的信息 ,从而进行综合性的跨模型分析。借助这种架构,传统药物发现中的部分瓶颈有望得到突破:科研人员可以先通过计算方法预筛候选...

    推荐理由:来自IT之家 AI的《微软推出实验性多模态 AI 研究系统 Project Quine,有望大幅加速药物发现》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 30 日消息,当地时间 29 日,微软研究院推出了实验性多模态 AI 研究系统 Project Quine。据悉,Project Quine 是一套 用于生物学研究的“世界模型” ,目标是把计算生物学建模与实际湿实验衔接起来。 Project Quine 由微软研究院与哈佛大学和麻省理工学院博德研究所共同开发。系统将覆盖 基因组学、蛋白质、化学、细胞状态和生物成像 的联合表征世界模型,与交互式推理框架结合起来。为了让科研人员尽早使用 Project Quine,微软开放了首届 Quine Fellows 项目申请。未来,微软还计划通过 Microsoft Discovery 等产品逐步扩大商业化开放范围。 Project Quine 并不局限于某一个研究领域,而是能够 同时处理上述多个领域的信息 ,从而进行综合性的跨模型分析。借助这种架构,传统药物发现中的部分瓶颈有望得到突破:科研人员可以先通过计算方法预筛候选...

  6. 量子位70

    DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec

    事实摘要:DeepSeek知乎独家发文,首次公开V4.1 Agent训练“大本营”DSec DeepSeek在知乎独家发布技术长文,首次系统阐释了DeepSeek弹性计算(DeepSeek Elastic Compute,DSec) 这条动态来自 量子位,可重点关注智能体工作流、模型能力与工程、产品发布。 DeepSeek知乎独家发文,首次公开V4.1 Agent训练。影响判断:它可能改变智能体工作流、模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  7. IT之家 AI68

    美议员提出重磅法案:政府出台安全防护机制前,AI 不得进行递归式自我改进

    IT之家 9 月 30 日消息,当地时间 28 日,据美国 CNBC 报道,代表硅谷选区的民主党联邦众议员罗 · 康纳准备提出一项 AI 监管法案,引入严格责任标准, 并禁止 AI 在缺乏政府安全防护机制的情况下进行递归式自我改进 。 康纳在接受采访时坦言:“事实上,存在文明灭绝的风险。既有失去控制的安全风险,也有被滥用的风险,两者都必须认真对待。” 康纳将法案命名为《Human Control Over AI Act(人类控制 AI 法案)》。联邦政府建立防护规则且监管机构批准有关活动前,AI 模型 不得递归式自我改进 ,也不得自主修改自身的核心目标、遏制机制或关停控制。 法案还计划设立一个 新的联邦机构 ,负责制定 AI 安全监管规定,通过许可制度审批模型训练和部署,对前沿 AI 模型开展审计,并制定安全标准,确保模型 持续接受测试并处于有效的人类控制之下 。 每家前沿 AI 实验室 还必须配备独立审计人员 ,由审计人员直接...

    推荐理由:来自IT之家 AI的《美议员提出重磅法案:政府出台安全防护机制前,AI 不得进行递归式自我改进》。重点看模型能力与工程。摘要提到:IT之家 9 月 30 日消息,当地时间 28 日,据美国 CNBC 报道,代表硅谷选区的民主党联邦众议员罗 · 康纳准备提出一项 AI 监管法案,引入严格责任标准, 并禁止 AI 在缺乏政府安全防护机制的情况下进行递归式自我改进 。 康纳在接受采访时坦言:“事实上,存在文明灭绝的风险。既有失去控制的安全风险,也有被滥用的风险,两者都必须认真对待。” 康纳将法案命名为《Human Control Over AI Act(人类控制 AI 法案)》。联邦政府建立防护规则且监管机构批准有关活动前,AI 模型 不得递归式自我改进 ,也不得自主修改自身的核心目标、遏制机制或关停控制。 法案还计划设立一个 新的联邦机构 ,负责制定 AI 安全监管规定,通过许可制度审批模型训练和部署,对前沿 AI 模型开展审计,并制定安全标准,确保模型 持续接受测试并处于有效的人类控制之下 。 每家前沿 AI 实验室 还必须配备独立审计人员 ,由审计人员直接...

  8. Apple Machine Learning Research87

    SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation

    这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Continual-learning agents are systems of models, harnesses, and memory operating over long multi-session horizons. Evaluating and training them requires interleaving tasks with agent-side events such as session stop and start, crons, and memory consolidation. Yet existing benchmarks and training frameworks schedule only the benchmark’s own events, leaving each benchmark and agent pair to build a custom scheduling loo...

    推荐理由:来自Apple Machine Learning Research的《SCLATE: A Substrate for Continual-Learning Agent Training and Evaluation》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程、评测与基准。原文要点:Continual-learning agents are systems of models, harnesses, and memory operating over long multi-session horizons. Evaluating and training them requires interleaving tasks with agent-side events such as session stop and start, crons, and memory consolidation. Yet existing benchmarks and training frameworks schedule only the benchmark’s own events, leaving each benchmark and agent p...

  9. Apple Machine Learning Research81

    On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:On the Effectiveness-Fluency Trade-Off in LLM Conditioning: A Systematic Study 这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Controlling the output of Large Language 。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. GitHub Changelog94

    GPT-6.1 Sol in GitHub Copilot

    事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6.1 Sol in GitHub Copilot 事实摘要:这条英文动态主要涉及智能体工作流、模型能力与工程、开源生态,原文信息显示:GPT-6.1 Sol in GitHub Copilot 事实摘要:GPT-6.1 Sol in GitHub Copilot 事实摘要:G。影响判断:它可能改变智能体工作流、模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪智能体工作流、模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和智能体工作流、模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

9月29日周二
  1. Simon Willison87

    OpenAI DevDay 2026 live blog

    这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:I'm at OpenAI DevDay today, in Fort Mason, San Francisco. Same as last year I'll be live blogging the keynote and some other notes during the day. OpenAI gave me a free ticket and a seat in the "creator" area for the keynote. Tags: ai , openai , generative-ai , llms , coding-agents , live-blog , openai-devday

    推荐理由:来自Simon Willison的《OpenAI DevDay 2026 live blog》。重点看智能体工作流、模型能力与工程。摘要提到:这条英文动态主要涉及智能体工作流、模型能力与工程。原文要点:I'm at OpenAI DevDay today, in Fort Mason, San Francisco. Same as last year I'll be live blogging the keynote and some other notes during the day. OpenAI gave me a free ticket and a seat in the "creator" area for the keynote. Tags: ai , openai , generative-ai , llms , coding-agents , live-blog , openai-devday

  2. GitHub AI Trending64

    lucidrains/denoising-diffusion-pytorch: Implementation of Denoising Diffusion Probabilistic Model in Pytorch

    事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:lucidrains/denoising-diffusion-pytorch: Implementation of Denoising Diffusion Probabilistic Model in Pytorch 事实摘要:这条英文动态主要涉及模型能力与工程,原文信息显示:lucidrains/denoi。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  3. Cloudflare AI84

    We tested our own WAF with frontier AI models. Here’s what we found

    这条英文动态主要涉及模型能力与工程。原文要点:We built a WAF tester that adapted each request based on what the WAF blocked or passed. This helped us explore variations that a fixed test might miss. We ran it across six attack categories on an authorized staging environment and discovered detection gaps worth fixing. Here’s how the loop worked, what got through, and what we did about it.

    推荐理由:来自Cloudflare AI的《We tested our own WAF with frontier AI models. Here’s what we found》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:We built a WAF tester that adapted each request based on what the WAF blocked or passed. This helped us explore variations that a fixed test might miss. We ran it across six attack categories on an authorized staging environment and discovered detection gaps worth fixing. Here’s how the loop worked, what got through, and what we did about it.

  4. MIT Technology Review AI58

    Making AI an asset, not an expense

    这条英文动态主要涉及模型能力与工程、文化创意、产品发布。原文要点:When customers talk about AI costs, the conversation usually starts with token prices and ends with access to the latest, most capable model in the cloud. Do they always need that level of capability? Not necessarily. But that is often where the conversation goes. As AI moves from experimentation to production, model choice is only…

    推荐理由:来自MIT Technology Review AI的《Making AI an asset, not an expense》。重点看模型能力与工程、文化创意、产品发布。摘要提到:这条英文动态主要涉及模型能力与工程、文化创意、产品发布。原文要点:When customers talk about AI costs, the conversation usually starts with token prices and ends with access to the latest, most capable model in the cloud. Do they always need that level of capability? Not necessarily. But that is often where the conversation goes. As AI moves from experimentation to production, model choice is only…

  5. 爱范儿38

    AI 圈杀出新顶流,神秘「太空兔」能用涂鸦做网站

    我又多了一个能当主力的Flash模型 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

    推荐理由:来自爱范儿的《AI 圈杀出新顶流,神秘「太空兔」能用涂鸦做网站》。重点看模型能力与工程。摘要提到:我又多了一个能当主力的Flash模型 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

  6. GitHub AI Trending58

    google-deepmind/sonnet: TensorFlow-based neural network library

    这条英文动态讨论了 AI 领域的新进展。原文要点:TensorFlow-based neural network library。Stars: 9970, language: Python.

    推荐理由:来自GitHub AI Trending的《google-deepmind/sonnet: TensorFlow-based neural network library》。重点看开源/仓库、部署/工程。摘要提到:这条英文动态讨论了 AI 领域的新进展。原文要点:TensorFlow-based neural network library。Stars: 9970, language: Python.

  7. 爱范儿38

    苏姿丰550亿元买下李飞飞世界模型,AI 圈两位女王联手了

    算力焦虑下的双向奔赴 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

    推荐理由:来自爱范儿的《苏姿丰550亿元买下李飞飞世界模型,AI 圈两位女王联手了》。重点看模型能力与工程。摘要提到:算力焦虑下的双向奔赴 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。 这条动态来自 爱范儿,可重点关注模型能力与工程。

  8. 量子位67

    精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!

    事实摘要:精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了! 精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了! 这条动态来自 量子位,可重点关注模型能力与工程。 精准揪出RL训练数据Bug,Prompt直出小游戏,IQuest-Q1夯爆了!。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. 量子位70

    OpenAI因新模型太强叫停发布

    事实摘要:OpenAI因新模型太强叫停发布 AGI计划暂停。 这条动态来自 量子位,可重点关注模型能力与工程、产品发布。 OpenAI因新模型太强叫停发布 AGI计划暂停。影响判断:它可能改变模型能力与工程相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  10. IT之家 AI68

    LPDDR6 内存加持 AI 推理 ASIC,SEMIFIVE 接获规格交接型芯片设计订单

    IT之家 9 月 29 日消息,韩国芯片设计服务企业 SEMIFIVE 当地时间今日宣布,将为一家美国无晶圆厂 AI 设计芯片企业开发一款支持 LPDDR6、PCIe Gen5 的数据中心级“大芯片”推理加速器。 IT之家注意到, 这是高带宽低功耗的 LPDDR6 成为 ASIC 片外缓存选择的早期案例之一 。这颗芯片预计 2027H1 流片,2028 年量产出货。 SEMIFIVE 获得的这份订单采用“规格交接”模式:客户提供核心性能和规格指标,设计服务企业负责从详细设计到封装、测试、量产乃至软件开发的整个流程。 该订单是 SEMIFIVE 在北美市场斩获首个同类型项目。其以约 703 亿韩元 (IT之家注:现汇率约合 3.48 亿元人民币) 的总价成为 SEMIFIVE 历史上最大的单笔合同 ,已高于企业去年订单总额的 40%,约为 2026H1 订单总额的 60%。

    推荐理由:来自IT之家 AI的《LPDDR6 内存加持 AI 推理 ASIC,SEMIFIVE 接获规格交接型芯片设计订单》。重点看模型能力与工程。摘要提到:IT之家 9 月 29 日消息,韩国芯片设计服务企业 SEMIFIVE 当地时间今日宣布,将为一家美国无晶圆厂 AI 设计芯片企业开发一款支持 LPDDR6、PCIe Gen5 的数据中心级“大芯片”推理加速器。 IT之家注意到, 这是高带宽低功耗的 LPDDR6 成为 ASIC 片外缓存选择的早期案例之一 。这颗芯片预计 2027H1 流片,2028 年量产出货。 SEMIFIVE 获得的这份订单采用“规格交接”模式:客户提供核心性能和规格指标,设计服务企业负责从详细设计到封装、测试、量产乃至软件开发的整个流程。 该订单是 SEMIFIVE 在北美市场斩获首个同类型项目。其以约 703 亿韩元 (IT之家注:现汇率约合 3.48 亿元人民币) 的总价成为 SEMIFIVE 历史上最大的单笔合同 ,已高于企业去年订单总额的 40%,约为 2026H1 订单总额的 60%。

  11. IT之家 AI70

    曝影石正在研发主打拍摄的智能眼镜:前镜框可更换,有望搭载阿里千问

    IT之家 9 月 29 日消息,蓝鲸新闻今日援引知情人士消息称, 影石创新正在研发一款主打拍摄的智能眼镜 。与市场上多数以语音 AI 助手为核心卖点的 AI 眼镜不同,这款产品优先满足内容创作者对便捷、高质量、免手持拍摄的需求。 据前述知情人士称:“ 影石这款产品或采用前镜框可换设计 ,功能主要集中在镜腿上。用户可以根据不同场景或穿搭风格更换镜框,让智能眼镜更接近传统眼镜的消费逻辑。”这意味着,影石希望把智能眼镜从“科技硬件”拉向更日常、可搭配的消费电子。 前述知情人士透露,AI 能力方面, 影石大概率会选择搭载阿里千问大模型 。不过,影石并不满足于只调用云端大模型。据影石内部人士透露:“未来公司 AI 的核心方向,还是如何把端侧生成模型直接部署到影石的产品端。另外,影石内部还在研发现有产品形态之外的新产品。”这背后是其更长远的野心 —— 让生成模型在端侧落地。 IT之家注意到,影石创新此前获得了一项名为“可穿戴式眼镜”的实用新...

    推荐理由:来自IT之家 AI的《曝影石正在研发主打拍摄的智能眼镜:前镜框可更换,有望搭载阿里千问》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,蓝鲸新闻今日援引知情人士消息称, 影石创新正在研发一款主打拍摄的智能眼镜 。与市场上多数以语音 AI 助手为核心卖点的 AI 眼镜不同,这款产品优先满足内容创作者对便捷、高质量、免手持拍摄的需求。 据前述知情人士称:“ 影石这款产品或采用前镜框可换设计 ,功能主要集中在镜腿上。用户可以根据不同场景或穿搭风格更换镜框,让智能眼镜更接近传统眼镜的消费逻辑。”这意味着,影石希望把智能眼镜从“科技硬件”拉向更日常、可搭配的消费电子。 前述知情人士透露,AI 能力方面, 影石大概率会选择搭载阿里千问大模型 。不过,影石并不满足于只调用云端大模型。据影石内部人士透露:“未来公司 AI 的核心方向,还是如何把端侧生成模型直接部署到影石的产品端。另外,影石内部还在研发现有产品形态之外的新产品。”这背后是其更长远的野心 —— 让生成模型在端侧落地。 IT之家注意到,影石创新此前获得了一项名为“可穿戴式眼镜”的实用新...

  12. IT之家 AI74

    AI 写作特征减少:Claude Opus 5.5 破折号使用量下降约 95%、分号下降 73%

    IT之家 9 月 29 日消息,@arena 于 9 月 26 日在 X 平台发布推文,通过写作指标测试,发现相比较 Opus 5 模型, Anthropic 的 Claude Opus 5.5 破折号使用量下降约 95%,每 1,000 个单词从 15.2 个降至 0.8 个。 IT之家附上相关截图如下: Arena 分析了 2026 年 8 月和 9 月的 Text Arena 高推理回复。结果显示,12 项写作指标中有 10 项朝 Arena 认定的改善方向变化。 其中最为明显的是大幅减少使用破折号,Claude Opus 5 每 1,000 个单词使用 15.2 个破折号。Opus 5.5 的使用量降至 0.8 个,较前代减少约 95%。 分号使用量也同步下降。Claude Opus 5 每 1,000 个单词使用 6.10 个分号。Opus 5.5 降至 1.64 个,降幅为 73%,显示模型减少了部分容易被识别的标点...

    推荐理由:来自IT之家 AI的《AI 写作特征减少:Claude Opus 5.5 破折号使用量下降约 95%、分号下降 73%》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,@arena 于 9 月 26 日在 X 平台发布推文,通过写作指标测试,发现相比较 Opus 5 模型, Anthropic 的 Claude Opus 5.5 破折号使用量下降约 95%,每 1,000 个单词从 15.2 个降至 0.8 个。 IT之家附上相关截图如下: Arena 分析了 2026 年 8 月和 9 月的 Text Arena 高推理回复。结果显示,12 项写作指标中有 10 项朝 Arena 认定的改善方向变化。 其中最为明显的是大幅减少使用破折号,Claude Opus 5 每 1,000 个单词使用 15.2 个破折号。Opus 5.5 的使用量降至 0.8 个,较前代减少约 95%。 分号使用量也同步下降。Claude Opus 5 每 1,000 个单词使用 6.10 个分号。Opus 5.5 降至 1.64 个,降幅为 73%,显示模型减少了部分容易被识别的标点...

  13. IT之家 AI72

    内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra

    IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

    推荐理由:来自IT之家 AI的《内部测试发现安全隐患,消息称 OpenAI 取消发布 AI 模型 GPT‑6.1 Astra》。重点看模型能力与工程、产品发布。摘要提到:IT之家 9 月 29 日消息,据《华尔街日报》报道,由于内部测试过程中研究人员提出多项安全隐患,OpenAI 决定取消 GPT‑6.1 Astra 的发布。这款下一代 AI 模型原本计划于 10 月正式亮相。 报道称,该模型原定部署于 ChatGPT 以及 Codex 产品当中,设计目标是无需人类协助就可以处理更加复杂的任务。 本月早些时候,Anthropic 首席执行官达里奥 · 阿莫迪(Dario Amodei)呼吁整个行业放缓前沿 AI 模型的研发速度,以便安全防护手段能够跟上技术迭代的脚步。OpenAI 首席执行官萨姆 · 奥尔特曼(Sam Altman)以及 SpaceX 首席执行官埃隆 · 马斯克(Elon Musk)均对这一观点表示认同。 OpenAI 的安全主管萨奇 · 贾因(Saachi Jain)周一在接受《华尔街日报》采访时表示,Astra 在对齐测试当中没有达到公司内部标准;对齐测试用于评估 AI 系统...

  14. Apple Machine Learning Research50

    The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models

    事实摘要:这条英文动态主要涉及模型能力与工程、评测与基准,原文信息显示:The Communication Bottleneck: A Round-Trip Study of Tree-Structured Expression Serialization in Language Models 这条英文动态主要涉及模型能力与工程。原文要点:When language 。影响判断:它可能改变模型能力与工程、评测与基准相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、评测与基准方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、评测与基准直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  15. IT之家 AI74

    Anthropic 发布 Claude Sonnet 5.5:速度提升 30%,智能体编码性能反超 Opus 5.5

    IT之家 9 月 29 日消息,随着 AI 模型竞赛持续升温,Anthropic 推出了旗下中端模型 Sonnet 的最新版本。该公司表示,新版模型运行速度会快得多,使用成本也较上一代大幅降低。 IT之家注意到,这家实验室将 Sonnet 5.5 定位为日常任务的理想助手,适用场景包括编写代码以及制作办公文档。 Sonnet 5.5 的上一代产品 Sonnet 5 是大约三个月前发布的。当时这款模型的主打优势是智能体的高效部署,也就是运行智能体的成本低于竞品。 而 5.5 版本的核心亮点在于速度。Anthropic 称,Sonnet 5.5 的速度比上一代提升 30%,词元(Token)消耗速度也明显更低。 在 Anthropic 的模型产品序列当中,Sonnet 的性能弱于 Opus 模型,但凭借反应灵活的特点,在部分场景下反而更加实用。尤其是 Anthropic 的基准测试结果显示,Sonnet 5.5 在智能体编码任务上的...

    推荐理由:来自IT之家 AI的《Anthropic 发布 Claude Sonnet 5.5:速度提升 30%,智能体编码性能反超 Opus 5.5》。重点看智能体工作流、模型能力与工程、评测与基准。摘要提到:IT之家 9 月 29 日消息,随着 AI 模型竞赛持续升温,Anthropic 推出了旗下中端模型 Sonnet 的最新版本。该公司表示,新版模型运行速度会快得多,使用成本也较上一代大幅降低。 IT之家注意到,这家实验室将 Sonnet 5.5 定位为日常任务的理想助手,适用场景包括编写代码以及制作办公文档。 Sonnet 5.5 的上一代产品 Sonnet 5 是大约三个月前发布的。当时这款模型的主打优势是智能体的高效部署,也就是运行智能体的成本低于竞品。 而 5.5 版本的核心亮点在于速度。Anthropic 称,Sonnet 5.5 的速度比上一代提升 30%,词元(Token)消耗速度也明显更低。 在 Anthropic 的模型产品序列当中,Sonnet 的性能弱于 Opus 模型,但凭借反应灵活的特点,在部分场景下反而更加实用。尤其是 Anthropic 的基准测试结果显示,Sonnet 5.5 在智能体编码任务上的...

  16. Simon Willison83

    Claude Sonnet 5.5

    这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Claude Sonnet 5.5 New Sonnet model from Anthropic today. They say it "runs 30%+ faster, and costs up to 30% less for most work" - it's priced the same as Sonnet 5 but appears to beat it on every benchmark, and should be cheaper to run as well. Here are some pelicans riding bicycles . Sonnet 5.5 suffered from the same bug as Opus 5.5 : the "max" thinking effort pelican thought for 128,000 tokens (at a cost of $1.28) b...

    推荐理由:来自Simon Willison的《Claude Sonnet 5.5》。重点看模型能力与工程、评测与基准。摘要提到:这条英文动态主要涉及模型能力与工程、评测与基准。原文要点:Claude Sonnet 5.5 New Sonnet model from Anthropic today. They say it "runs 30%+ faster, and costs up to 30% less for most work" - it's priced the same as Sonnet 5 but appears to beat it on every benchmark, and should be cheaper to run as well. Here are some pelicans riding bicycles . Sonnet 5.5 suffered from the same bug as Opus 5.5 : the "max" thinking effort pelican thought for 128,000 ...

  17. OpenAI News80

    Towards safety cases for frontier AI training

    这条英文动态主要涉及模型能力与工程。原文要点:Our early guidelines for safety cases in frontier AI training cover technical safeguards, operational practices, and investigating misalignment incidents

    推荐理由:来自OpenAI News的《Towards safety cases for frontier AI training》。重点看模型能力与工程。摘要提到:这条英文动态主要涉及模型能力与工程。原文要点:Our early guidelines for safety cases in frontier AI training cover technical safeguards, operational practices, and investigating misalignment incidents

  18. GitHub Changelog92

    Claude Sonnet 5.5 in GitHub Copilot

    事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Sonnet 5.5 in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude Sonnet 5.5 in GitHub Copilot 事实摘要:这条英文动态主要涉及模型能力与工程、开源生态,原文信息显示:Claude S。影响判断:它可能改变模型能力与工程、开源生态相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪模型能力与工程、开源生态方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和模型能力与工程、开源生态直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  19. Claude Code Releases90

    Claude Code Releases v2.1.284:Added Claude Sonnet 5.5 ( claude-sonnet-5-5 ), now the def...

    这条英文动态主要涉及模型能力与工程、产品发布。原文要点:What's changed Added Claude Sonnet 5.5 ( claude-sonnet-5-5 ), now the default Sonnet model on the Anthropic API — 1M context, $2/$10 per Mtok with $0.20/Mtok cache reads Added a "Yes, but ask again next time" answer to auto mode's prompt before a read outside the working directories, so you can allow that one read and still be asked about later ones Added dollar amounts to the Claude apps gateway spend limit in /usag...

    推荐理由:来自Claude Code Releases的《Claude Code Releases v2.1.284:Added Claude Sonnet 5.5 ( claude-sonnet-5-5 ), now the def...》。重点看模型能力与工程、产品发布。摘要提到:这条英文动态主要涉及模型能力与工程、产品发布。原文要点:What's changed Added Claude Sonnet 5.5 ( claude-sonnet-5-5 ), now the default Sonnet model on the Anthropic API — 1M context, $2/$10 per Mtok with $0.20/Mtok cache reads Added a "Yes, but ask again next time" answer to auto mode's prompt before a read outside the working directories, so you can allow that one read and still be asked about later ones Added dollar amounts to the Claude apps ...

9月28日周一
  1. IT之家 AI74

    月之暗面最强 AI 模型:Kimi K3.1 前端标识泄露,预计将在近期发布

    IT之家 9 月 28 日消息,今日有多名开发者注意到月之暗面 API 平台的后台模型注册表中出现了“kimi-k3-1”标识,该模型标识通过了接口探测并可调用。 今日晚些时候,Kimi 官方开放平台也出现了 K3.1 或 K3 11111 模型的预告,支持 1M tokens 上下文窗口。 Kimi K3.1 预计支持最高 100 万 Token 上下文窗口,并提供 Low、High、Max 三档推理强度选项,可能引入 Agent 智能体模式、Swarm 多智能体协作以及搜索和批处理等任务模式。有开发者分析认为,多档推理强度的设计可能对应不同的算力资源配置与计费模型。 Kimi 开放平台显示,Kimi K3.1 的 API 价格与现有 K3 相同,但也不排除是占位符的可能。 相关阅读: 《 月之暗面最强 AI:消息称 Kimi K3.1 下月登场 》

    推荐理由:来自IT之家 AI的《月之暗面最强 AI 模型:Kimi K3.1 前端标识泄露,预计将在近期发布》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:IT之家 9 月 28 日消息,今日有多名开发者注意到月之暗面 API 平台的后台模型注册表中出现了“kimi-k3-1”标识,该模型标识通过了接口探测并可调用。 今日晚些时候,Kimi 官方开放平台也出现了 K3.1 或 K3 11111 模型的预告,支持 1M tokens 上下文窗口。 Kimi K3.1 预计支持最高 100 万 Token 上下文窗口,并提供 Low、High、Max 三档推理强度选项,可能引入 Agent 智能体模式、Swarm 多智能体协作以及搜索和批处理等任务模式。有开发者分析认为,多档推理强度的设计可能对应不同的算力资源配置与计费模型。 Kimi 开放平台显示,Kimi K3.1 的 API 价格与现有 K3 相同,但也不排除是占位符的可能。 相关阅读: 《 月之暗面最强 AI:消息称 Kimi K3.1 下月登场 》

  2. 极客公园71

    OpenAI o1 团队在线答疑:o1的o指OpenAI,强化后的推理有泛化能力,未来模型思考时间可控!

    本文首发于 Founder Park 公众号 · 2024 年 9 月 14 日 这可能是最有参与感的一次产品问答了。 对于 OpenAI o1 的所有疑问和好奇,由推特的所有网友来提问,OpenAI 的全体技术人 员来回答。数了下,一共有 12 位员工出现,这其中有 各个方向的研究员和研究科学家,以及产品经理、产品主管 。 至于提问,从 模型命名、模型的大小和模态 ,到 提示词、思维链、上下文长度,以及价格 ,可以说,大家关注的问题,基本都在里面了。 参与问答的 OpenAI 人员: Ahmed El-Kishky:OpenAI 研究 员 Łukasz Kondraciuk:草莓训练设施负责人,华沙大学计算机科学,ACM ICPC 2022 银牌 Shengjia Zhao:OpenAI 研究科学家,斯坦福大学博士 Romain Huet:GPT-4o、o1 开发者体验主管,曾任 Stripe、Twitter 产品主管 Hon...

    推荐理由:来自极客公园的《OpenAI o1 团队在线答疑:o1的o指OpenAI,强化后的推理有泛化能力,未来模型思考时间可控!》。重点看模型能力与工程、产品发布。摘要提到:本文首发于 Founder Park 公众号 · 2024 年 9 月 14 日 这可能是最有参与感的一次产品问答了。 对于 OpenAI o1 的所有疑问和好奇,由推特的所有网友来提问,OpenAI 的全体技术人 员来回答。数了下,一共有 12 位员工出现,这其中有 各个方向的研究员和研究科学家,以及产品经理、产品主管 。 至于提问,从 模型命名、模型的大小和模态 ,到 提示词、思维链、上下文长度,以及价格 ,可以说,大家关注的问题,基本都在里面了。 参与问答的 OpenAI 人员: Ahmed El-Kishky:OpenAI 研究 员 Łukasz Kondraciuk:草莓训练设施负责人,华沙大学计算机科学,ACM ICPC 2022 银牌 Shengjia Zhao:OpenAI 研究科学家,斯坦福大学博士 Romain Huet:GPT-4o、o1 开发者体验主管,曾任 Stripe、Twitter 产品主管 Hon...

  3. 极客公园73

    Kimi发力AI搜索,产品形态更加明确,在聊天中探索生产力

    本文首发于 Founder Park 公众号 · 2024 年 10 月 11 日 Kimi 今天发布了 AI 深度搜索功能, Web 端逐渐放量,预计 10 月 14 日全量上线。 产品功能和试用体验我们稍后再谈。 从产品形态上来看,Kimi 可能是国内最接近 ChatGPT 的 AI Native 产品,恰巧近期 OpenAI 的一些动作,我们觉得可以做一些延展的讨论。 关注 Founder Park, 更多 AI 产品 review 01 把模型当成产品 feature 在 AI 产品形态的探索上, 过去两年正在定义行业的 OpenAI 只有一个答案:chatbot。 行业更加关注 OpenAI 在模型上的动作,年初的视频生成 Sora,年中的多模态 4o,以及近期发布的 RL 推理强化模型 o1-preview,都在全行业引起了广泛讨论。 但在模型能力的主线之外,还有另一条也许更重要的主线任务,产品化,在 2024 年尤...

    推荐理由:来自极客公园的《Kimi发力AI搜索,产品形态更加明确,在聊天中探索生产力》。重点看模型能力与工程、产品发布。摘要提到:本文首发于 Founder Park 公众号 · 2024 年 10 月 11 日 Kimi 今天发布了 AI 深度搜索功能, Web 端逐渐放量,预计 10 月 14 日全量上线。 产品功能和试用体验我们稍后再谈。 从产品形态上来看,Kimi 可能是国内最接近 ChatGPT 的 AI Native 产品,恰巧近期 OpenAI 的一些动作,我们觉得可以做一些延展的讨论。 关注 Founder Park, 更多 AI 产品 review 01 把模型当成产品 feature 在 AI 产品形态的探索上, 过去两年正在定义行业的 OpenAI 只有一个答案:chatbot。 行业更加关注 OpenAI 在模型上的动作,年初的视频生成 Sora,年中的多模态 4o,以及近期发布的 RL 推理强化模型 o1-preview,都在全行业引起了广泛讨论。 但在模型能力的主线之外,还有另一条也许更重要的主线任务,产品化,在 2024 年尤...

  4. 极客公园71

    Kimi发布新模型,数学能力超o1,产品重点提升留存率

    本文首发于 Founder Park 公众号 · 2024 年 11 月 17 日 11 月 16 日,在 Kimi 全面上线一周年之际,月之暗面推出了基于推理强化的数学模型 k0-math,以及 Kimio 探索版的一系列新功能,新推出的 k0-math 数学模型测试成绩超越 o1。 官方称,2024 年 10 月,Kimi 智能助手全平台活跃用户超过 3600 万,k0-math 数学模型和 Kimi 探索版的新功能,将陆续上线网页端和 APP。 「AI 领域正在经历新一轮技术范式的变化。 基于强化学习、合成数据和思维链的新技术,可以解决高质量数据缺乏的问题,将提升 AI 在各个领域和场景的推理能力和智能水平上限。 」 针对最近业内讨论的 Scaling Law 撞墙的问题,Kimi 创始人杨植麟也发表了自己的观点。而对于深度推理、Kimi 自身海外业务收缩、以及 Kimi 的广告投放和用户留存问题,他也一并做了回答,我们对...

    推荐理由:来自极客公园的《Kimi发布新模型,数学能力超o1,产品重点提升留存率》。重点看模型能力与工程、产品发布。摘要提到:本文首发于 Founder Park 公众号 · 2024 年 11 月 17 日 11 月 16 日,在 Kimi 全面上线一周年之际,月之暗面推出了基于推理强化的数学模型 k0-math,以及 Kimio 探索版的一系列新功能,新推出的 k0-math 数学模型测试成绩超越 o1。 官方称,2024 年 10 月,Kimi 智能助手全平台活跃用户超过 3600 万,k0-math 数学模型和 Kimi 探索版的新功能,将陆续上线网页端和 APP。 「AI 领域正在经历新一轮技术范式的变化。 基于强化学习、合成数据和思维链的新技术,可以解决高质量数据缺乏的问题,将提升 AI 在各个领域和场景的推理能力和智能水平上限。 」 针对最近业内讨论的 Scaling Law 撞墙的问题,Kimi 创始人杨植麟也发表了自己的观点。而对于深度推理、Kimi 自身海外业务收缩、以及 Kimi 的广告投放和用户留存问题,他也一并做了回答,我们对...

  5. 极客公园76

    OpenClaw 背后核心框架 Pi:好的 Coding Agent 应该让用户来决定需要什么

    本文首发于 Founder Park 公众号 · 2026 年 3 月 17 日 OpenClaw,是当下最火的开源个人 AI 助手。很多人不知道的是,OpenClaw 背后,核心是一个极简框架 Pi-coding-agent。 在 OpenClaw 的系统架构中,Pi agent 是 Gateway 控制层的核心子系统,控制了所有 agent 的推理和工具调用。 和 Claude Code、Cursor、Codex 不同的是,Pi 最大的特点是「做减法」:系统提示词和工具定义加起来不到 1000 tokens,核心只有 read、write、edit、bash 四个工具,没有内置 plan mode,没有 to-do 系统,没有 MCP 支持,没有权限弹窗,甚至没有绑定任何特定模型。 但就是这样一个「什么都没有」的框架,在 Terminal Bench 2.0 上与 Codex、Cursor、Windsurf 一同排进了前五。...

    推荐理由:来自极客公园的《OpenClaw 背后核心框架 Pi:好的 Coding Agent 应该让用户来决定需要什么》。重点看智能体工作流、模型能力与工程、开源生态。摘要提到:本文首发于 Founder Park 公众号 · 2026 年 3 月 17 日 OpenClaw,是当下最火的开源个人 AI 助手。很多人不知道的是,OpenClaw 背后,核心是一个极简框架 Pi-coding-agent。 在 OpenClaw 的系统架构中,Pi agent 是 Gateway 控制层的核心子系统,控制了所有 agent 的推理和工具调用。 和 Claude Code、Cursor、Codex 不同的是,Pi 最大的特点是「做减法」:系统提示词和工具定义加起来不到 1000 tokens,核心只有 read、write、edit、bash 四个工具,没有内置 plan mode,没有 to-do 系统,没有 MCP 支持,没有权限弹窗,甚至没有绑定任何特定模型。 但就是这样一个「什么都没有」的框架,在 Terminal Bench 2.0 上与 Codex、Cursor、Windsurf 一同排进了前五。...

  6. 极客公园70

    给 OpenClaw 做硬件没前途,但给上下文系统做,是值得的

    本文首发于 Founder Park 公众号 · 2026 年 4 月 2 日 一家叫泛灵人工智能的团队,出了一款主打「超级办公助理」的硬件产品。 参数配置很厉害,x86 芯片直接跑本地 Ubuntu,推理芯片可以本地跑 122B 的 MoE 模型 +27B 的稠密模型。支持办公场景的实时会议录音,操作任何设备的录屏,线下开会和外出调研的全记录。 目标是成为「口袋里的全模态超级办公助理」,后 OpenClaw 时代的个人 Agent Native 硬件基座。 初看到这个宣传,会有很多疑问,甚至质疑。 云端模型越来越强大、价格在持续下降的时候,把模型全放在端侧,有价值吗?122B 的模型到底能做啥?又做上下文记录又做任务处理,难道是想做 All in One 吗? 一个小团队,做这么复杂的硬件,今年 9 月份才量产,真的不是噱头吗? 所以今天这篇采访,更多的是好奇和 challenge 的角度,试图去理解他们为什么要用独立的硬件去...

    推荐理由:来自极客公园的《给 OpenClaw 做硬件没前途,但给上下文系统做,是值得的》。重点看智能体工作流、模型能力与工程、产品发布。摘要提到:本文首发于 Founder Park 公众号 · 2026 年 4 月 2 日 一家叫泛灵人工智能的团队,出了一款主打「超级办公助理」的硬件产品。 参数配置很厉害,x86 芯片直接跑本地 Ubuntu,推理芯片可以本地跑 122B 的 MoE 模型 +27B 的稠密模型。支持办公场景的实时会议录音,操作任何设备的录屏,线下开会和外出调研的全记录。 目标是成为「口袋里的全模态超级办公助理」,后 OpenClaw 时代的个人 Agent Native 硬件基座。 初看到这个宣传,会有很多疑问,甚至质疑。 云端模型越来越强大、价格在持续下降的时候,把模型全放在端侧,有价值吗?122B 的模型到底能做啥?又做上下文记录又做任务处理,难道是想做 All in One 吗? 一个小团队,做这么复杂的硬件,今年 9 月份才量产,真的不是噱头吗? 所以今天这篇采访,更多的是好奇和 challenge 的角度,试图去理解他们为什么要用独立的硬件去...

  7. 极客公园72

    OpenAI,经历了最漫长的一天

    当地时间 9 月 25 日,OpenAI 经历了漫长的一天。 当天, OpenAI 的 AI 智能体擅自访问美国政府网站的事被曝光,涉及教育部、商务部和证券交易委员会 ,OpenAI 确认了其中商务部和 SEC 的情况。 同一天,它承认有 53 张用户上传到 ChatGPT 的图片被智能体发布到了外部图床上。还是这一天,一份事故报告的末尾写着,最强模型的全部训练、评估以及涉及工具调用的推理都已暂停。 这一切听上去,像一部 AI 叛逃的惊悚片。 但翻遍这些事件,没有一个 AI 想干坏事。 害 OpenAI 暂停模型研究的任务,仅仅是让 AI 查出一篇博客的作者的简单任务。 01 简单任务 9 月 20 日,一个正处于强化学习训练中的内部模型,拿到了一组人物履历细节和一篇公开博客里的线索,任务是找到那位博主。 它先用博客里的特征短语去搜,结果返回的是音乐和一些不相干的泛泛建议。模型开始怀疑搜索工具坏了,于是在命令行里用 Python...

    推荐理由:来自极客公园的《OpenAI,经历了最漫长的一天》。重点看智能体工作流、模型能力与工程、教育应用。摘要提到:当地时间 9 月 25 日,OpenAI 经历了漫长的一天。 当天, OpenAI 的 AI 智能体擅自访问美国政府网站的事被曝光,涉及教育部、商务部和证券交易委员会 ,OpenAI 确认了其中商务部和 SEC 的情况。 同一天,它承认有 53 张用户上传到 ChatGPT 的图片被智能体发布到了外部图床上。还是这一天,一份事故报告的末尾写着,最强模型的全部训练、评估以及涉及工具调用的推理都已暂停。 这一切听上去,像一部 AI 叛逃的惊悚片。 但翻遍这些事件,没有一个 AI 想干坏事。 害 OpenAI 暂停模型研究的任务,仅仅是让 AI 查出一篇博客的作者的简单任务。 01 简单任务 9 月 20 日,一个正处于强化学习训练中的内部模型,拿到了一组人物履历细节和一篇公开博客里的线索,任务是找到那位博主。 它先用博客里的特征短语去搜,结果返回的是音乐和一些不相干的泛泛建议。模型开始怀疑搜索工具坏了,于是在命令行里用 Python...

  8. GitHub AI Trending58

    potpie-ai/potpie: Context Graph for AI Native SDLC

    事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:potpie-ai/potpie: Context Graph for AI Native SDLC 事实摘要:这条英文动态主要涉及AI 应用价值,原文信息显示:potpie-ai/potpie: Context Graph for AI Native SDLC 这条英文动态讨论了 AI 领域的新进展。原文要。影响判断:它可能改变AI 应用价值相关的产品判断、研究节奏或内容生产方式。场景价值:适合用于跟踪AI 应用价值方向的选题、竞品观察和落地方案筛选。

    推荐理由:它和AI 应用价值直接相关,可能影响产品设计、研究判断、教育/文化场景落地或开发实践。

  9. IT之家 AI70

    谷歌为 Google AI 订阅会员新增 Colab 高级权益,可使用高性能云端计算资源

    IT之家 9 月 28 日消息,谷歌宣布为旗下 Google AI 订阅会员新增 Google Colab 高级权益,符合条件的订阅用户将获得 Colab 计算单元,并可使用性能更高的 GPU、TPU 等云端计算资源。 公开信息显示,Google Colab 是一项无需安装的托管式 Jupyter Notebook 服务,用户可以直接编写和运行 Python 代码,并使用 GPU、TPU 等云端计算资源。 随着 Colab 高级权益加入 Google AI 订阅体系,Google AI Ultra 除了提供 20TB 起步的云端存储空间、最高 20 倍的 Gemini 使用额度以及 YouTube Premium 外,现在还可使用 Premium GPU 和不中断的后台执行功能。用户无需持续保持浏览器标签页开启,即可运行长时间的 AI 模型训练任务。 此外,现有 Colab Pro 和 Pro+ 订阅不受此次调整影响,用户也可以...

    推荐理由:来自IT之家 AI的《谷歌为 Google AI 订阅会员新增 Colab 高级权益,可使用高性能云端计算资源》。重点看模型能力与工程。摘要提到:IT之家 9 月 28 日消息,谷歌宣布为旗下 Google AI 订阅会员新增 Google Colab 高级权益,符合条件的订阅用户将获得 Colab 计算单元,并可使用性能更高的 GPU、TPU 等云端计算资源。 公开信息显示,Google Colab 是一项无需安装的托管式 Jupyter Notebook 服务,用户可以直接编写和运行 Python 代码,并使用 GPU、TPU 等云端计算资源。 随着 Colab 高级权益加入 Google AI 订阅体系,Google AI Ultra 除了提供 20TB 起步的云端存储空间、最高 20 倍的 Gemini 使用额度以及 YouTube Premium 外,现在还可使用 Premium GPU 和不中断的后台执行功能。用户无需持续保持浏览器标签页开启,即可运行长时间的 AI 模型训练任务。 此外,现有 Colab Pro 和 Pro+ 订阅不受此次调整影响,用户也可以...

  10. IT之家 AI74

    华为开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源上线

    IT之家 9 月 28 日消息,华为今日宣布, 开源盘古 openPangu-2.0 的预训练、 SFT 代码和后训练 RL 代码正式开源上线 。 开源盘古 openPangu 是华为开源 AI 模型品牌,致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。 openPangu-2.0 模型相关组件已陆续上线开源平台。IT之家附开源地址如下: https://gitcode.com/ascend-tribe/openPangu-2.0-Training https://gitcode.com/ascend-tribe/openPangu-2.0-RL

    推荐理由:来自IT之家 AI的《华为开源盘古 openPangu-2.0 的预训练、SFT 代码和后训练 RL 代码正式开源上线》。重点看模型能力与工程、开源生态、产品发布。摘要提到:IT之家 9 月 28 日消息,华为今日宣布, 开源盘古 openPangu-2.0 的预训练、 SFT 代码和后训练 RL 代码正式开源上线 。 开源盘古 openPangu 是华为开源 AI 模型品牌,致力于通过昇腾原生训练与推理技术,为业界用好昇腾提供最佳实践参考。 openPangu-2.0 模型相关组件已陆续上线开源平台。IT之家附开源地址如下: https://gitcode.com/ascend-tribe/openPangu-2.0-Training https://gitcode.com/ascend-tribe/openPangu-2.0-RL

  11. GitHub AI Trending74

    liyupi/ai-guide: 程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站

    程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站。Stars: 20533, language: JavaScript.

    推荐理由:来自GitHub AI Trending的《liyupi/ai-guide: 程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI 工具用法(Cursor / Claude Code / TRAE / Codex / Copilot)、AI 开发框架教程(Spring AI / LangChain)、AI 产品变现指南,帮你快速掌握 AI 技术,走在时代前沿。本项目为开源文档 aiguide,已升级为鱼皮 AI 导航网站》。重点看智能体工作流、模型能力与工程、开源生态。摘要提到:程序员鱼皮的 AI 资源大全 + Vibe Coding 零基础教程,分享 OpenClaw 保姆级教程、大模型玩法(DeepSeek / GPT / Gemini / Claude / GLM)、最新 AI 资讯、Prompt 提示词大全、AI 知识百科(Agent Skills / RAG / MCP / A2A)、AI 编程教程(Harness Engineering)、AI