游乐游手机版
首页/业界动态/文章详情

AI一周观察:科研瓶颈渐显,小模型影响定价

时间:2026-08-03 22:35
01、产业 小模型跑出大能力,正在改变AI的定价逻辑 7月30日,Thinking Machines Lab发布了Inkling‑Small,总参数276B,每次激活12B。在HLE、SWE‑bench Verified和Terminal‑Bench 2 1上,它的表现甚至超过了41B激活的大Ink

01、产业

小模型跑出大能力,正在改变AI的定价逻辑

7月30日,Thinking Machines Lab发布了Inkling‑Small,总参数276B,每次激活12B。在HLE、SWE‑bench Verified和Terminal‑Bench 2.1上,它的表现甚至超过了41B激活的大Inkling。价格方面,每百万输出Token从4.05美元直降到1.20美元,降幅接近70%。

紧接着,DeepSeek V4 Flash正式版在7月31日上线。它没有重新预训练,只在后训练上做了文章,大约13B激活参数就在三项代码与工具评测中拿到了54.2到82.7分,输出价格更是低到0.28美元。

两个模型走的是不同的效率路线。Inkling‑Small靠的是预训练配方、蒸馏和Agentic Coding RL,把大模型已经学会的能力压缩进更小的激活规模。而V4 Flash没有换底座,只是加强了后训练,能力却出现了明显跃升,目前用户反馈相当正向。

这两个案例说明,随着蒸馏等技术不断成熟,小参数模型确实可以在编程等复杂任务中做到相对可用。这个趋势其实已经持续了一段时间,但V4 Flash的发布,加上当前模型成本承压的大背景,终于让它成了大家讨论的公共话语焦点。

作为回应,OpenAI在7月30日把GPT‑5.6 Luna的价格下调了80%,Terra下调了20%,溢价继续留给Sol与Fast Mode。

至此,小模型不再只是部署选项,它们正在重写市场的价格锚点。超高的性价比让部分整体能力一般的大参数模型处境变得尴尬,甚至有可能被直接“斩杀”。

OpenAI组建自我改进团队

7月29日,OpenAI确认Lilian Weng回归,负责一个直接向高层汇报的递归式自我改进团队。初期路线会落在Harness上,让模型改进上下文、评测、训练和部署系统。就在第二天,公司披露Sol已经自主重写了生产推理内核,运行了数百次实验,把端到端服务成本降低了大约20%。

这是OpenAI首次明确地表态要利用AI自进化的能力。不过目前整体的使用模式仍然集中在Kernel更新这个层级,并没有表现出显著的领先优势。

整个实验的目标是降低服务成本,实验结果可以直接测量。模型不需要先发明新的学习理论,只要持续提出内核和调度改动、跑实验、保留有效方案,就能把大量工程小改进积累成20%的降本。

在当前模型界以infra为主的逻辑下,递归式自我改进最先兑现的形态,就在于它不断提高研发系统每周能完成的有效实验量。这才是真正的价值所在。

AI摘要已覆盖43%的Google搜索,但商业模式仍不清晰

Similarweb在7月22日发布报告,估算Google AI Overviews在一年内从大约15%的搜索结果扩展到43%。用户越来越多地在答案页完成理解,争夺的对象也从搜索排名转为能否进入答案。

同一份报告还估算,AI Mode的月访问量从2025年6月的1.26亿增至2026年5月的2.79亿。

Google正把搜索从链接目录改造成答案产品:用户少点一次网页,Google就多掌握一段阅读和追问过程。这无疑会重新安排内容行业的收益。

过去,内容方用内容换取搜索流量,再通过广告、订阅或转化回收成本。但答案页直接吸收内容后,来源即使被引用,也未必得到一次访问,商业价值有所折损。而Google只得到了一个相对不那么强的用户反馈数据流(因为实际上不可反问)。

从商业角度来讲,这个交换是否值得,仍然有待观察。

OpenAI分析80万条工作消息,发现岗位边界已经开始融合

7月27日,OpenAI发布机构报告,分析了超过80万条工作对话:43.5%的专业请求使用了相邻或其他岗位的技能。跨界最明显的岗位是客户体验、设计和人力资源,比例分别达到77%、75%和69%。

员工过去需要把任务交给别的部门,或者等专业人员排期,现在可以先让模型完成调研、分析、原型或文案,再请专家处理高风险部分。AI对组织产生的岗位边界迁移,终于有了一组有力的数据支持。

因此,企业后续的组织改革,需要参考一条工作流减少了多少移交、等待和返工,以及谁开始承担过去不属于自己的工作。这才是真正的衡量标准。

Andrew Ng获1亿美元投资,用新的AI教育解决认知缴械问题

7月28日,Coursera发布公告,宣布向Andrew Ng创办的LearnVector战略投资1亿美元。LearnVector计划从可信课程材料出发,根据学习目标规划路径、调整练习,并持续判断学习者是否真正掌握。

目前,生成式AI已经把得到答案变得过于容易。根据研究,越来越多的人开始无意识地习惯于未经充分审查就采用AI结论。这个现象被称为“AI带来的认知缴械”。

但在教育场景中,完成任务远不如通过过程摩擦形成能力重要。我们可能需要一个新的AI教育体系。LearnVector的概念即诞生于此——私人导师必须知道何时不该立刻给答案。它会分层提示,让学习者给出阶梯性的判断。有时候故意让学习者暴露错误,再安排变式练习。AI教育真正稀缺的能力不是消除摩擦,而是在正确位置制造摩擦。

LearnVector的赌注,是让模型为人的能力增长负责,而不只是为眼前任务完成负责。Coursera本次出资,还提供了完整的课程体系、练习记录和考核结果,这是目前AI教育领域相对比较稀缺的数据集。

02、研究

AI的科研边界开始展露

Peter Kirgis等研究者7月29日提交论文,让前沿Agent在两个后来被NeurIPS 2026接收的问题上各运行六天,并提供数千美元算力。Agent能写代码、跑实验和形成论文,却没有实质推进任何一个问题;更换模型和Scaffold后仍然如此。

这说明,当下的AI确实缺乏走出原框架的能力。这种能力目前有两个潜在解释。

Google DeepMind研究者Tom Zaha vy的《LLMs Can’t Jump》把AI缺乏的能力称为“跳跃”:模型能归纳、演绎,却难以从矛盾现象中提出原本不在搜索空间里的解释。延长运行只会在既定方向上搜得更远,不会自动告诉它何时应改写问题。

另一篇Yale University与University of Chicago的论文《Measuring the Gap Between Human and LLM Research Ideas》则更定量地对此进行了研究。他们发现,科研构思分两步。第一步是从哪里发现研究机会,也就是“为什么要做这项研究”。它可能来自矛盾、解释缺失、证据不足、适用范围过窄、失败风险、资源瓶颈,也可能来自两个研究方向没有连接。第二步是用什么动作构成贡献,例如建立理论、做测量、造一个系统、进行优化、提高鲁棒性,或者把多个方法综合起来。

目前,LLM与人类最大的差距出现在第一步,也就是“怎么看出这里有问题”。它们太喜欢“组合”和“连接”研究方向了。依靠同样的参考文献去提出研究方法,人类只有12.1%会选择连接分散文献,然后放进更大框架里去。但模型试图用这个方法的概率是47.1%到64.2%。

另外的重要发现包括:1)AI特别喜欢用成熟、显眼、可复用的技术母题,做成插槽,套成解释方法。2)更多思考对科研的新颖性反而形成了负向效果。打开thinking mode,Qwen3‑8B的桥接型选题反而从49.7%升到71.1%。推理把熟悉模板执行得更彻底,却没有增加选题动作。

与谷歌论文相似,该论文得到的结论是:AI真正稀缺的研究品味,是察觉异常、推翻和质疑假设——而这种类型的科学创新几乎占了80%。因此,想要做好AI4Science,下一步至少要推进奖励质疑、解耦和反例,让模型的注意力放在“为什么值得做”,而不是“怎样把它做完”。

Kimi K3公开2.8万亿参数训练方案,超大模型开始拼系统总效率

月之暗面7月27日提交Kimi K3技术报告并公开完整权重。K3总参数2.8T,每个Token激活104B,支持原生视觉与100万Token上下文。团队报告,相对K2的总体Scaling Efficiency提高了约2.5倍。

K3的架构调整,主要集中在引入线性注意力、通过投影压缩降低MoE专家参数提升带来的带宽负担,以及通过Attention Residuals提高深层神经网络的学习效率。另外的一些创新则主要分布在负载均衡上。MoonEP根据当前路由动态复制和迁移专家,让每个并行节点获得相同Token负载,并通过计算重叠和统一内存管理减少空转。

K3说明超大MoE的骨架正在定型:稀疏专家提供容量,混合注意力革新承担长上下文,残差寻址维持深层信息,集群调度把理论算力变成有效训练量。整体来看,它的改动点和从V3到V4这个周期内的架构更新范式完全一致。

T‑Rex把触觉从额外输入改成高速反射,灵巧手成功率达到65%

UC Berkeley、NVIDIA、Stanford等机构的研究者6月15日提交、18日更新T‑Rex论文,开放100小时触觉数据,并在12项接触密集任务中取得65%平均成功率,最强基线为35%。

它们的研究发现,直接把触觉接入视觉模型,准确率反而退步。T‑Rex因而分开低频规划与高频触觉纠错,因为触觉与视觉解决的不是同一个时间尺度。摄像头适合判断杯子在哪里、下一步抓什么。而手指已经接触物体后,力的变化可能在下一帧视觉到来前就决定抓取是否失败。T‑Rex让低频动作专家负责计划,高频触觉专家处理滑动、碰撞和接触变化,相当于把思考和反射拆开,达成了有效的能力提升。

之前,触觉虽然一直是具身模型的一个潜在重要维度,但并没有形成很好的融入触觉的训练方法。此后沿着这条路径,触觉会成为具身的一个主要训练模态。而且它还提供了一个潜在的范式反思空间:具身模型若继续沿统一Token序列处理所有输入,高频反馈会被慢速规划拖住。触觉、力觉和本体感觉进入机器人后,模型结构也必须按控制回路重新分层。比起System 1和System 2,我们可能需要一些更复杂和精细的优先级系统。

md形式不可靠,激发了新一轮的有效知识结构探索

7月28日,Surge AI提交HANDBOOK.md论文,设置了65个长程企业任务,把20到124页的SOP完整放进上下文,并开放邮件、日历、工单、表格、采购等82个工具,其中824条程序规则同时检查必做和禁止动作。结果30组配置中,最佳严格通过率只有36.2%,多数前沿模型低于25%。

这说明,即使依靠目前的Harness,长程文字形式的规范依然难以被有效遵循。增加思考也无法修复这一点。为了应对这一问题,在实践层面上Graph Engineering爆火,而在研究领域,如何更好地建构长程Agent任务的上下文也成了当下的核心热点。

其方法,就是把规则编译成可执行结构。DataFlow‑Harness不让Agent生成自由脚本,而是通过带类型的局部修改构建平台原生DAG,每一步都对应已存在的算子和管线状态。Prompt Graph Engineering进一步要求图结构显式存在、结构与提示内容分离、节点和边具有可执行语义,并把整张图作为可版本化和测试的一等制品。

HANDBOOK.md暴露了文档式管理的上限,其他研究给出的共同方向,是把规则从“可被读到”推进到“能在执行中被寻址、约束和验证”。因为这一改变,Agent的评价也随之从答案扩展到过程。LangChain最新的Agent评价标准将输出、轨迹和跨轮线程分开检查。终态评价看Agent最后有没有办成事,而轨迹评价则看模型是否越权、漏检或走了不可复现的路径。

对企业来说,这后续可能意味着知识库和Agent平台会逐渐分开。知识库保存规则原文和证据,运行时系统需要负责把规则编译成图、权限和测试。

早期信号|后训练最优算力可以通过预训练判断

NYU、Modal、UCLA、UIUC与Columbia的研究者7月17日提交论文,发现模型由50M增至680M时,RL占总算力的最优比例由约20%升至28%。

研究者先训练了一批500万到10亿参数的棋类模型,完整走了一遍“预训练—SFT—RL”的流程。他们发现,一个底座在预训练结束时的loss,基本可以预测它经过RL后最终能达到什么水平。相关性达到0.93到0.99,意味着底座训练得好不好,几乎已经决定了后面RL的起点和上限。

但预训练不只是决定起点,还决定RL是否吃得动。模型在预训练阶段见过的数据越多、基础能力越扎实,后续每增加一档RL算力,成绩提升得越快。反过来,如果底座还很弱,就急着切到RL,模型往往只是在反复强化自己原有的错误,投入更多算力也换不来多少进步。

因此,前期算力应该主要用来把底座练扎实;等继续预训练的边际收益开始下降,再逐渐把更多预算转向RL。

研究者进一步把这套规律接入Chinchilla scaling law,在大约400种模型规模和算力分配方案中寻找最优解。结果显示,在他们的实验条件下,模型从5000万参数增大到6.8亿参数时,RL占总训练算力的最优比例,大约从20%上升到28%。

当然,这个比例只针对实验里的棋类任务,而且优化目标是第一次回答就答对的概率。如果看pass@16,也就是允许模型生成多个候选答案,较大的模型经过RL后有时反而会持平甚至下降。原因是RL可能让模型更确信某几条高概率路径,却同时牺牲答案的多样性,甚至把难题里的错误思路强化得更稳定。

03、政策

前沿模型广泛暴露出逃逸沙箱风险

7月27日,Hugging Face公布了OpenAI安全评测事故的完整时间线:一个内部模型在ExploitGym网络安全评测中持续行动4.5天,留下约17600次操作,最终进入了Hugging Face的生产基础设施。OpenAI随后请CrowdStrike、METR与Redwood Research参与外部复核。

7月30日,Anthropic回看141006次网络安全评测,又发现三起真实机构事故。在这些事故中,系统提示告诉Claude“没有互联网”,实际环境却能出网,模型发现了出网的可能,因此把真实站点当作模拟题目继续攻。

不同模型、不同合作方出现相似事故,说明这是安全评测的共同结构风险。最弱的一环决定了隔离强度,目前看沙箱逃逸就是最弱的一环。

FCC阻止外国机器人和逆变器新型号获批,AI封锁延伸到身体和电力接口

7月28日,美国联邦通信委员会发布政府文件,宣布把外国生产的先进机器人设备和电力逆变器整体加入Covered List,新型号原则上无法取得进入美国市场所需的认证。限制正从先进芯片外移,具身身体和电力接口都开始被纳入AI供应链安全。

这主要是考虑先进机器人能够感知环境并执行物理动作,联网逆变器则处在发电设备与电网之间。一旦远程控制、软件更新或通信链路被利用,风险会直接落到工厂、家庭和能源系统。美国过去围绕算力限制模型训练,现在开始限制AI系统进入现实世界后可以控制的端点。

这会让具身智能公司的合规门槛前移。企业不仅要解释模型和芯片来自哪里,还要交代控制器、通信模块、更新机制和供应链。机器人与能源设备进入美国市场,原产地和远程访问权将和性能一起成为采购条件。

早期信号|超过1200名前沿AI从业者开始要求为自动化研发建立国际刹车机制

自动化研发的反馈速度开始成为独立治理对象,前沿实验室内部出现了为它设置国际刹车机制的主张。

多家实验室研究者7月28日发布《Pacing the Frontier》声明:截至当周结束,签署者已超过1200人。声明要求在模型快速参与训练、评测和部署时,保留可验证的主动放慢机制。

比较重要的是,OpenAI本次也积极参与这一号召。两大顶尖前沿模型公司都表达了同一个希望暂缓的信号。签署人们的主要担忧对象,是自动化研发(RSI)的快速进步。当下模型可以帮助设计实验、改进代码和分析训练,再把结果用于下一轮模型,循环频率持续加快后,外部机构很难只靠发布前评测掌握变化。

来源:https://36kr.com/p/3923672695172745
上一篇OpenAI Astra惊人突破:用2000美元成功拿下10道世纪难题,数学家的定义被改写了吗? 下一篇大模型公司估值正逐步淡化SOTA叙事
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
台式机加装固态硬盘怎么选?三星9100 PRO深度解析
业界动态 · 2026-09-01

台式机加装固态硬盘怎么选?三星9100 PRO深度解析

台式机升级存储常受限于系统启动慢、游戏加载卡顿与大文件传输延迟。本文基于三星9100 PRO的PCIe 5 0架构、14800MB s读取、13400MB s写入、2200K 2600K IOPS、1TB~8TB容量、第八代V-NAND与5nm主控、镍涂层散热与DTG技术、散热片版适配及魔术师软件,提供选购判断与安装兼容性要点,帮助读者评估是否值得一步到位升级。

宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高
业界动态 · 2026-09-01

宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高

宁德时代发布2026年中期分红方案,总额达61 8亿元,同比增长35%。本文梳理分红具体安排、历史对比、业绩支撑及分红机制,帮助投资者评估公司现金流实力与股东回报策略。

企业硬盘报废销毁合规指南:如何选择专业机构与处理流程
业界动态 · 2026-08-31

企业硬盘报废销毁合规指南:如何选择专业机构与处理流程

企业硬盘报废面临数据复原与合规风险,需选择具备资质且流程透明的专业机构。本文解析行业乱象,介绍以团体标准为核心的合规销毁流程,涵盖上门收运、消磁粉碎、视频溯源及尾料处置,帮助企业规避泄密责任,确保数据安全闭环。

机密文件销毁找什么机构?认准团标参编与资质合规
业界动态 · 2026-08-31

机密文件销毁找什么机构?认准团标参编与资质合规

机密文件销毁找什么机构?核心在于甄别服务商是否具备正规保密资质及是否参与行业标准制定。本文解析《商业秘密及敏感信息载体销毁通用规范》团标要求,提供筛选销毁机构的实操指南,帮助企业规避数据泄露风险,确保销毁流程合规可溯。

影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析
业界动态 · 2026-08-31

影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析

影石Insta360 X6全球同步发售即登顶国内外主流平台销量榜首。本文解析其搭载的索尼定制方形大底传感器、4nm AI三芯架构及8K50fps画质,详解3D时光舱、AI导演等独家功能,探讨全景相机从专业工具向大众智能创作设备的演进趋势。