论文收集了 6708 条公开轨迹,并重建出 315320 个思考块。经过两阶段模型标注,1028 个思考块被判断包含至少一项真实隐私信息,占比约为 0.3%。按完整轨迹统计,共有 328 个会话出现泄漏,占比达到 4.9%。
一项覆盖12个领域、140个真实研究任务的新工作MLS-Bench给出了并不乐观的答案。 AI已经能写代码、跑实验,甚至靠海量试错刷新部分人类纪录。 但当目标从「把一个分数继续刷高」,变成「提出一种真正更好的机器学习方法」,最强模型还能走多远? 一项覆盖12个领域、140个真实研究任务的新工作MLS-Bench给出了并不乐观的答案。 即使拿到人类最强方法的完整实现,并被允许反复实验,当前前沿模型仍 ...
Cloudflare的CEO马修·普林斯(Matthew Prince),在今年8月的第二季度财报电话会上说了一句挺重的话。他说,从今年第二季度开始,穿过Cloudflare这张网的所有流量里,超过一半已经不是人类产生的了。他原话大概是,人类历史上第一次,在他们网络里流转的流量,人类已经不是多数。
论文估算,按照当时Haiku 4.5的API价格,解码1万条输入、输出窗口均为12000 Token的推理轨迹,名义成本约为720美元(约合人民币4858元)。 虽然模型厂商不会公开完整推理,但API计费需要知道模型到底生成了多少思考Token。因此我们可以拿到账单中的推理Token数,再与解码文本重新编码后的Token数进行比较。
OpenAI这边是GPT-5.6 Luna,Google这边则是Gemini Robotics 1.6。
大语言模型正在从 “回答问题” 走向 “完成任务”。在 Agentic RL 后训练中,模型不仅生成文本,还会调用搜索、代码执行等外部工具,根据环境返回继续推理。这样的交互让模型拥有更强的行动能力,也让训练系统面对一种比普通 RLHF 更不稳定的工作负载:同一批请求可能产生长度相差数十倍的轨迹,少量超长轨迹拖慢整个 rollout;与此同时,训练和 rollout 对 GPU ...
但真正没人愿意摆到台面上说的是,你的AI记忆现在被锁定在你最常用的那个平台里。从ChatGPT换到Claude,记忆是空的,一切从头开始。三个工具一起用,你就同时养着三个互不相通、发展轨迹完全不同的「你」。
义父Tibo,OpenAI Codex负责人,一高兴了就给人重置GPT额度。Codex周活4月份还只有300万,到7月下旬已经突破1000万,最快的时候一天涨100万。
科学研究中的验证则经常昂贵、延迟、多阶段且只能部分观察。一次实验失败可能来自方法、实现、数据、尺度或随机性;研究者需要用小规模实验区分多种解释,再决定是否投入完整训练。此时真正受限的不是可生成多少候选,而是多少计算能够转化为有效证据。
令人惊叹的是,GPT-5.6-Cyber的思索并未停止。它顺藤摸瓜,通过极其敏锐的上下文联想,自主寻找并利用了第二处漏洞:JSPI(JavaScript Promise Integration)中的栈逃逸(Stack Escape)缺陷。
据彭博社报道,这笔员工股份回购的买方是 OpenAI 自己而非外部投资者,回购对象包括现任和已离职的员工,交易估值 8520 亿美元,与今年 3 月那轮 1220 亿美元融资锚定的估值一致。
2020年底,Dario、妹妹Daniela Amodei和一批研究人员离开OpenAI。分歧之一,就是他们认为OpenAI的商业化速度太快,微软的影响越来越大,原有治理结构很难约束前沿AI风险。 它甚至没有把自己简单定义成一家商业公司,而是注册为Public Benefit Corporation,也就是公益公司。除了股东回报,董事会还可以依法考虑AI安全与长期公共利益。