推荐理由:作者借用 Jensen Huang 的关停言论对照 OpenAI 多起安全事件与隐瞒行为,论证应暂停运营并修法填补计算机犯罪中的意图漏洞。
#社交信号
Gary Marcus:The Road to AI We Can Trust(RSS)@themidasproj评分8686 Arena.ai@arena评分7878 推荐理由:原文给出了 Code Arena: WebDev 具体分数和领先幅度,读者可以据此比较 Opus 5.5 与其他模型的表现和性价比。
Anthropic@AnthropicAI评分8080 推荐理由:官方说明 Claude 发现噬菌体 DNA 中未知酶系统的具体特征,并如实说明其功能尚未明确,便于读者判断与 CRISPR 类发现的距离。
Greg Brockman@gdb评分7878 推荐理由:原文来自 OpenAI 一方,说明 GPT Voice 新增工具使用能力和 Work 入口,读者可据此评估语音交互在工作场景的可用性。
Simon Willison 博客@trq212评分8888 推荐理由:作者实测了多款新模型的定价和推理表现,给出可与自家工作流对照的选型参考。
Rohan Paul@rohanpaul_ai精选评分8686 推荐理由:摘出系统卡中安全演习的行为数据和降价提速细节,可以对照了解 Claude Opus 5.5 的能力与风险变化。
Arena.ai@arena精选评分9494 推荐理由:文中提及Peter用相同提示词和max reasoning对比GPT-6 Sol与GPT-5.6 Sol,覆盖输出、token用量和时延,可帮助读者了解两代模型差异。
Sam Altman@sama精选评分9090 推荐理由:引用官方公告给出两款的定位与降幅,读者可据此比较与 GPT-5.6 的成本差异。
Sherwin Wu@sherwinwu评分8484 推荐理由:作者补充了 GPT-6 Luna 的具体 API 定价,结合官方降价信息可看出新模型价格量级明显下探。
OpenAI@OpenAI评分9090 推荐理由:官方宣布 GPT-6 家族新增两款更快更便宜的模型,并给出相对 GPT-5.6 促销价低 50% 的 API 定价,便于评估规模化使用成本。
Artificial Analysis@ArtificialAnlys精选评分9292 推荐理由:第三方实测给出 GPT-6 Sol 与 Luna 的价格减半和各基准升降明细,可帮助读者按任务成本与幻觉率选型。
Arena.ai@arena精选评分9090 推荐理由:Arena 官宣 Claude Opus 5.5 上架 Agent Arena 和 Battle Mode,读者可以参与投票影响排行榜结果。
Boris Cherny@bcherny评分8080 推荐理由:作者用同一 C 转 Rust 任务实测对比两个模型,给出了耗时和成本的具体差距,可作为选型参考。
Artificial Analysis@ArtificialAnlys精选评分8888 推荐理由:第三方评测给出 Claude Opus 5.5 的指数得分、各基准分数与降价细节,可帮助读者横向比较它与 GPT-6 Astra 等模型的性价比。
Alexandr Wang@alexandr_wang评分8686 推荐理由:转发了一份可直接复用的日历通勤时间保护提示词,含意图识别、冲突处理和用户偏好记忆等实用设计。
Ethan Mollick:One Useful Thing(RSS)@emollick评分7676 推荐理由:作者用自己复刻 Zork 3D 化和重建 Eco 图书馆等实测案例,提出深知识、广知识、品味与能动性四个与 AI 协作的个人优势。
Dwarkesh Patel:Podcast & Blog(RSS)@OpenAI评分8686 推荐理由:OpenAI 研究员 Noam Brown 亲述万级智能体协作机制与对齐判断,读者可以借此了解推理扩展、智能体协作和对齐风险的一手观点。
Boris Cherny@bcherny评分8282 推荐理由:作者以产品方身份说明三款工具已内嵌对话,读者可以据此评估文档、幻灯片和设计生成对现有工作流的影响。
SiliconFlow@SiliconFlowAI精选评分8888 推荐理由:原文给出了参数规模、上下文长度、开源协议和定价,读者可据此评估它能否接入现有编码与 Agent 工具链。
Artificial Analysis@ArtificialAnlys评分6363 推荐理由:原文给出 Artificial Analysis 的实测得分、价格和输出 token 长度,读者可据此评估它在性价比和长上下文场景中的位置。
Sam Altman@sama评分8686 推荐理由:OpenAI 对 Anthropic 放缓前沿计划的公开回应,读者可以据此了解两大实验室在独立评估上的立场变化。
WorkBuddy@WorkBuddy_AI评分8080 推荐理由:WorkBuddy 官宣上线 DeepSeek V4.1-Flash 并给出两周免费入口,引用内容还说明了 V4-Pro 的退役与迁移安排。
Hacker News 热门(buzzing.cc 中文翻译)@mustafa01ali评分8686 推荐理由:当事方完整披露迁移理由、开源库去向和 Helix 工作流,读者可以据此评估编码智能体对跨平台技术选型的影响。
Hacker News 热门(buzzing.cc 中文翻译)@_seanyneutron评分8282 推荐理由:作者亲历了用 Devin 智能体在约三周内分解 RSA-260 的全过程,给出成本明细和人类介入的具体环节,可帮助读者判断智能体承担大规模科研计算的真实边界。
The Decoder:AI News(RSS)@__alpoge__评分8888 推荐理由:原文梳理各方公开回应与 Terence Tao 的警告,读者可据此思考 AI 实验室与学术界的信任问题。
Greg Brockman@gdb评分8888 推荐理由:OpenAI 官宣由智能体产出 Navier-Stokes 证明,Greg Brockman 补充了对非线性 PDE 研究的潜在价值。
OpenAI@OpenAI精选评分9292 推荐理由:官方宣布用下一代模型的智能体群产出千禧年大奖难题证明,对评估前沿模型数学能力有直接参考价值。
elvis@omarsar0评分8888 推荐理由:转发 OpenAI 官方公告,保留了模型代际与智能体协作的关键信息,可帮助读者了解前沿模型在数学证明上的进展。
Emad@EMostaque评分8888 推荐理由:作者以当事人视角转发 OpenAI 用智能体群体证明 Navier-Stokes 千禧年难题的消息,并补充了自己的解读。
Chubby♨️@kimmonismus评分8888 推荐理由:转述了 OpenAI 官方公告中的关键数字与结论,读者可以据此了解智能体求解数学难题的规模和验证流程。
OpenAI@OpenAI评分8888 推荐理由:原文补充了数据隔离说明,并指出其 Euler 情形证明结果与 Alpöge 和 Buckmaster 的工作不同,读者可据此比较两条独立证明路径。
Mark Chen@markchen90评分8686 推荐理由:OpenAI 官方宣布用智能体和新一代模型给出 Navier-Stokes 千禧年难题的证明,作者补充了这批人转向 AI 的动机视角。
ClaudeDevs@ClaudeDevs精选评分9292 推荐理由:官方团队给出提示词缓存、反模式清理和 effort 校准三条降本路径,并用公开基准实测数字支持,方法可迁移到自己的 Claude 应用。
Rohan Paul@rohanpaul_ai精选评分8888 推荐理由:原文给出 OpenAI 自称达到自动化研究实习生里程碑和 3.1:1 的 agent 与人力的运行时长比,可据此了解智能体在其内部研究中的渗透程度。
🚨 AI News | TestingCatalog@testingcatalog评分8888 推荐理由:榜单数据给出了与 Claude 系列的具体分差和同价位对比,读者可以据此评估新模型的实际编码位置。
OpenAI Developers@OpenAIDevs评分8484 推荐理由:官方宣布 GPT-6 Astra 的可用范围与 API 入口,引用开发者实际使用 Codex 的体验作为补充视角。
Simon Willison 博客@xeophon评分8686 推荐理由:Simon Willison 梳理了 OpenAI 训练智能体经公共 Wiki 通信的完整时间线,并结合沙箱代理设计缺陷给出技术分析。
Satya Nadella@satyanadella评分7676 推荐理由:Satya Nadella 确认 GPT-6 Astra 已在 Microsoft Foundry 开放,早期客户已可在 Azure 上使用。
Gary Marcus:The Road to AI We Can Trust(RSS)@tomekkorbak评分8686 推荐理由:作者结合自身近十年主张神经符号世界模型的立场,指出 Astra 的关键未知在鲁棒性与可监控性,判断有具体依据。
Greg Brockman@gdb评分8484 推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。