深度研究

围绕热门AI概念、技术和市场变化的深度文章。

深度研究9.3

TEMPO:利用评论员校准突破大模型测试时训练性能瓶颈

TEMPO 提出了一种半监督强化学习框架,用于实现大型推理模型的可扩展测试时训练。通过交替运行的 EM 优化循环,该方法成功解决了传统自奖励机制中的奖励漂移与多样性崩溃难题。

AITest-Time TrainingReinforcement Learning
AI已发布
深度研究9.3

生产级 Agent 架构中的随机-确定性边界(SDB)研究

随机-确定性边界(SDB)是生产级 LLM Agent 架构中规范概率化输出向确定性系统动作转换的核心原语。研究表明,高达 71% 的生产环境 Agent 故障归因于 SDB 契约弱点,强化该边界成为提升长期系统可靠性的关键。

AI AgentSystem ArchitectureLLM Reliability
AI Agent已发布
深度研究9.2

Meta-Harness:通过智能体代码演进实现LLM外壳端到端自动化优化

由斯坦福大学IRIS实验室、MIT与KRAFTON联合提出的Meta-Harness,赋予智能体直接访问文件系统与执行日志的能力,实现了LLM外壳代码的端到端自动化演进。该框架突破了传统标量Prompt优化的局限,在分类、数学推理及编程基准测试中均取得了显著突破。

AILLMMeta-Harness
AI已发布
深度研究9.4

过程奖励模型(PRM):大模型复杂推理的步骤级监督演进

过程奖励模型(PRMs)通过对大语言模型推理轨迹中的中间步骤进行细粒度评估,有效破解了复杂推理中的信用分配难题。该技术不仅为强化学习后训练提供了密集反馈信号,还在推理搜索阶段实现了高效分支剪枝。

AIProcess Reward ModelsReinforcement Learning
AI已发布
深度研究9.0

激活工程:大语言模型控制的新前沿

激活工程是一种在推理时直接修改模型内部激活来控制其行为的技术,无需重新训练。它能高效引导模型的真实性与安全性等特性,但也存在"涌现性错位"的重大风险,即在不相关的任务上意外产生广泛的有害内容。

AI大语言模型AI安全
AI已发布
深度研究9.2

字节与北大提出 In-Place TTT:大语言模型推理阶段的动态权重自适应机制

由字节跳动 Seed 团队与北京大学联合提出的 In-Place TTT 技术,通过复用 Transformer 现有 MLP 下投影矩阵作为快速权重,实现了无需额外模块的大模型推理期动态微调。该方法被选为 ICLR 2026 口头报告,成功提升了 Qwen3-4B 与 LLaMA-3.1-8B 等开源模型在 128k 超长上下文任务中的性能表现。

AILLMTest-Time Training
AI已发布
深度研究9.5

Transformer架构的内在简洁性:ICLR 2026获奖论文深度解析

一篇在ICLR 2026会议上荣获杰出论文奖的理论研究,引入了"简洁性"概念来解释Transformer的强大能力。研究证明,Transformer在表示概念的效率上,比循环神经网络(RNN)等架构高出指数级别。

AITransformer深度学习
AI已发布
深度研究8.0

超维计算:一种受大脑启发的AI新范式

超维计算(HDC),又称向量符号架构(VSA),是一种受大脑启发的计算范式,为传统深度学习提供了新思路。它利用超高维向量进行高效、鲁棒且可解释的计算,尤其适用于边缘设备和快速知识检索。

AI超维计算向量符号架构
AI已发布
深度研究9.0

智能体混合 (MoA):一种协作式 AI 新架构

智能体混合 (MoA) 是一种新兴的 AI 架构,它利用多个独立的 AI 模型协作处理同一个任务,再由一个"聚合器"模型综合它们的输出来生成一个更高质量的最终答案。这种方法利用模型间的"协作性",仅使用开源模型就在多个基准测试中超越了像 GPT-4 Omni 这样的顶尖专有模型。

AI大语言模型智能体混合
AI已发布
深度研究9.0

Self-RAG:能自我反思的AI,提升事实准确性

Self-RAG是一种新颖的AI框架,它通过训练语言模型进行自我反思,使其能自主决定何时检索信息、评估信息质量并批判自己的生成内容。这个过程显著提高了模型的回答准确性和事实性,同时减少了内容"幻觉"。

人工智能大语言模型RAG
人工智能已发布
深度研究8.5

深度研究:液态时间常数网络 (LTC)

液态时间常数 (LTC) 网络是一种受生物启发的连续时间循环神经网络,它通过自适应调整时间常数来处理时序数据。这种独特的架构使其在处理不规则采样数据和资源受限环境中的预测任务时,表现出卓越的效率和性能。

AI神经网络RNN
AI已发布
深度研究9.0

深度混合注意力机制 (MoDA)

深度混合注意力机制 (MoDA) 是一种新颖的注意力架构,它允许模型的注意力头访问当前层和先前层的关键信息,从而在计算开销极小的情况下显著提升大型语言模型的性能。该方法旨在解决深度网络中的"信号衰减"问题,即有价值的早期特征在后续层中被稀释的现象。

人工智能大语言模型Transformer架构
人工智能已发布