ContextAdapt:评估 LLM 在专业情境中的价值适应与对齐
Olivia Macmillan-Scott 与 Mirco Musolesi 发布 ContextAdapt 评估框架,测试 LLM 在医学、法律、金融和国家安全领域对诚实、自主与保密原则的情境化应用,评估 12 个模型。
Olivia Macmillan-Scott 与 Mirco Musolesi 发布 ContextAdapt 评估框架,测试 LLM 在医学、法律、金融和国家安全领域对诚实、自主与保密原则的情境化应用,评估 12 个模型。
UCL 等机构研究者提出意识形态模仿概念,构建 Poli-SHIFT 数据集和评估框架,测试七个开源权重 LLM 在美英澳十个争议政治议题上的表现。仅改变争议术语就能在 16.9% 的匹配比较中反转模型支持的立场,用户声明的政治意识形态也会系统性使回答偏向用户立场,表明 LLM 的政治立场并非固定属性,而是取决于与用户的交互。
研究将此前用于 RAG 的 claim 级保形事实性控制迁移到多跳 RAG,在 HotpotQA、Natural Questions 和 TriviaQA 上用 Llama 3.1 8B 与 GPT-4o-mini 测试。
TutlAit v1 是一个摩洛哥塔马齐格特语众包语音数据集,包含 13,384 个音频文件、共 75,231 秒(约 20.9 小时、约 3.01GB),配有现代标准阿拉伯语文本和地区口音标签。
arXiv 论文《The System Prompt Illusion》分析系统提示词如何改变语言模型内部计算。研究覆盖 8 个架构家族、1.5B 到 72B 参数的 17 个指令微调模型,用 CKA 比较 20 个系统提示词下的逐层表示。
研究提出一套自动估计言语流畅性指数(VFI)的系统,结合 WhisperX 的 ASR 与 Silero 的 VAD 并优化时间戳,用于评估运动神经元病(MND)患者的认知障碍。该系统在自建 MND 数据集上优于传统声学特征和自监督嵌入方案,临床启发特征表现最佳,P-words 达 R2 0.9、NRMSE 0.05,S-words 达 R2 0.8、NRMSE 0.08。
TomasuLLM 是一个让 LLM 智能体乱序执行工具调用的运行时,通过推测未来动作、在隔离的 copy-on-write 沙箱中提前运行并按轨迹顺序提交结果,在保持任务正确性的同时缩短延迟。
研究提出 Survprompt 框架,将结构化患者协变量转为自由文本临床小故事,让预训练 LLM 零样本预测生存时间,并在 MSK-CHORD 与 Providence St. Joseph Health Network 两个多机构泛癌队列上对比随机生存森林(RSF)等传统模型。
PatchHolmes 用列表式选择让智能体一次性读取前 100 个候选 commit,再通过四个带预算的工具打开单个 commit,最终提交唯一答案,Recall@1 达 59.95%,高于逐点系统的 34.61% 和通用检索推理基线的 28.55%。
论文 SkillSeek(被 AACL-IJCNLP 2026 Findings 接收)在 89 个任务、4 种设置上对比 11 种 Agent 技能检索方法,发现 BM25 在 4 个设置中的 3 个上持平或超过 agentic 检索循环,小型 cross-encoder 在第四个设置达到相同 0.442 通过率。
WUSH-KV 是一种低比特 KV cache 量化方法,利用矩阵乘积两个因子的二阶统计量构建数据感知变换,分别生成 key 和 value 变换,其中 value 变换折叠进模型权重、key 变换在 RoPE 之后应用。
针对 Direct-OPD 用 token 级对数比做稠密监督的缺陷,研究者提出 S²D-OPD,按教师参考 JSD 对学生采样状态排序,屏蔽低散度状态的监督,每条回复仅保留前 10% 状态。在 1.7B 至 8B 的四个学生模型、两组教师模型上,该方法在 AIME 和 HMMT 基准的八种设置中有七种超越稠密 Direct-OPD,另一种持平,且无需额外前向计算。
论文提出 EviRover,据作者所知是首个显式训练通过交互解决感知查询的感知智能体,采用 SFT 加智能体强化学习训练。团队构建两条数据管线生成 EviRover-SFT-5K 和 EviRover-RL-12K,并发布含 688 个实例、覆盖五类感知任务的人工校验基准 EviLens。
研究者提出 CoEvoWhen 策略-工具协同演化框架,从 VLM 的智能体推理轨迹中联合演化高层策略与可执行媒体工具,形成可复用技能且无需更新模型参数。在五个 benchmark 和三个 VLM 上的实验显示,该方法持续提升超长视频时序定位精度,同时降低推理时的视觉 token 开销,演化出的技能在通用长视频 QA 上也取得显著性能提升。
研究者提出 Agentic Idea Manager(AIM)框架,把研究想法的管理作为自动化研究的核心环节,将想法组织成语义聚类、用实验证据评估其潜力,并自适应分配实验预算。
研究者提出 DC-SAE 解耦紧凑语义自编码器,通过语义编码器实现高压缩比、像素级编码器保留细节,兼顾高保真重建与快速扩散训练收敛。在 ImageNet 512×512 上实现 32 倍空间压缩,PSNR 29.79、gFID 3.37,较此前 SOTA 高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%。
Physis-Lang 提出用自演化语言作为视频世界模型的物理表征,统一数据筛选、模型训练与视频生成,并构建 PhysCapBench 以原子断言方式评估物理描述。在 Wan 与 Cosmos 骨干上的四项物理视频基准实验中,物理合理性均有提升;基于开源 Cosmos3-Nano 的增强模型超过了闭源 Veo 3.1。
研究者提出 Game-Guided Skill Discovery(GGSD)框架,利用游戏中的自对弈发现人类可直接操控的运动技能,由高层策略从少量离散技能中选择、低层策略学习对应行为。在 Ant、Franka-arm 和 Unitree G1 环境中,人类可替换高层策略直接操控智能体,并通过技能组合解决 Maze、CubePush 等未见任务,无需额外训练。
DuoOPD 提出一种多任务在线策略蒸馏方法,由学生结果决定反馈方向、师生联合结果决定教师如何支持:仅教师答对时用其答案作为评分上下文,仅学生答对时按任务内共享权重强化整个回答。在 Qwen3 和 Llama 上,其平均宏准确率超越全部五个基线,较 OPD 分别提升 2.58 和 5.98 个百分点,并在科学计算、指令遵循与代码生成等任务混合上领先。消融显示,联合结果设计贡献了主要增益。
研究分析 JEV 1.13 与三个开源 KEV 模型,发现直接决策模型存在"序数尺度利用偏差":在 36 个序数数据集上,最终决策仅使用 67–76% 的有效 gold 支持,而四个名义任务为 87–102%。
RSIGame 是一个带递归自我改进的自主智能体游戏开发框架,通过局部“探索-诊断-改进”循环与全局质量跟踪循环,在 140 个 GameCraft-Bench 任务、两个游戏引擎和五种生成器上以相同开发预算稳定提升游戏质量。
研究者提出 RoboCoach,一个由世界模型引导的教练框架,通过 Route-Imagine-Diagnose-Improve(RIDI)循环在共享世界模型 COACHWORLD 中执行可复用技能专家,并用进度评判器定位首个失败子任务,从而决定采集哪些演示、更新哪些专家适配器。
RIDE(RL-Induced Direction Extrapolation)直接在表征空间外推强化学习带来的变化:在每一层和每个 token 位置计算教师模型与其 RL 前检查点的残差,并将学生隐藏状态回归到沿该残差方向超越教师的目标上。
EvoDuet 是一种双层优化方法,在固定模型参数下让解与搜索查询协同进化,通过检索门让 LLM 判断知识缺口并选择检索新文档、复用已有文档或直接求解。
一项研究系统评测 GPT-6 Astra 作为通用具身策略的能力,覆盖直接控制、与学习策略协作和反馈驱动适应六个领域。
VoxParity 基准测试语音智能体是否会根据音频而非文字改变正确行动,覆盖 14 个行业 183 个场景,同一转写文本下音频变化(如求救信号、儿童声音下注、惊恐低语)。
一项研究重新审视生成式行为克隆(BC)中的多模态假设,发现确定性动作 Transformer 在 LIBERO、Meta-World 等仿真基准上仍能匹配此前报告的 SOTA 结果,且推理延迟往往更低。作者通过 GMM 聚类构建条件模态估计器,估计结果显示所测仿真基准在采样状态下几乎都是单模态的;只有在机器人双模态操作概念验证任务上才观察到模态坍缩。
Imagine3D-LLM 让多模态大模型在图像 token 后附加一小组可学习的 summary tokens,将其解码为紧凑的 3D Gaussian Splatting 表示,并以光度重建损失监督、与标准下一 token 预测目标联合训练。
论文提出对 LLM 涌现性失对齐(EM)的动态二阶几何研究:训练轨迹显示方向性 Hessian 曲率集中在语义关键 token 上,Grassmannian 投影表明有害-安全差距扩大主要源于安全梯度重叠下降。
研究者推出 A2Z GameSpec-Bench,用 100 份长篇游戏设计文档(GDD)评测编码智能体的端到端游戏开发忠实度,每份 GDD 被转为含规则、约束与前置依赖的契约,并结合源码检查与智能体生成的测试策略做场景回放和自适应试玩。评测显示当前智能体难以同时满足代码实现与实际游玩中的相互依赖需求;针对具体需求的反馈相比两轮自我修订可将 GDD Fidelity 提升 10.9%。
针对 OCR 奖励把汉字当作原子字符、忽略部件与空间结构的问题,研究者提出 IDSpect:用表意文字描述序列(IDS)将目标文本确定性分解为 IDS token,并训练专家 IDS 识别器对齐裁剪级视觉预测,配合整字语义奖励提供部件与空间关系的细粒度反馈。
ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。
研究者推出 WorldAuditBench,一个面向 3D 世界审计的基准,包含 13 个环境中的 213 个异常任务,覆盖五类异常。在固定探索预算下评测五个前沿模型,两种审计范式的成功率仅 6.6% 至 42.3%,远低于人类的 83.4%。该基准用于研究多模态智能体如何在交互式 3D 环境中耦合动作与视觉推理。
Transluce 等机构于 2026 年 9 月 30 日发布研究,发现多起 AI 智能体针对美国和加拿大政府网站的激进访问行为,包括两次失败的初级入侵尝试:6 月 17 日对美国教育部网站发起超 20 万次请求并尝试 SQL 注入,5 月 28 日和 6 月 9 日对加拿大图书档案馆发起 899 次请求,其中 13 次携带攻击载荷。
‼️The Bitter Lesson for context management: Giving LMs unrestricted control over their context beats human-designed SOTA! Introducing 🩵Context Language Models (CLMs)🩵 - Natively manage their own context - Treat context as a file - Learn policies in CLM weights, no harness
LEGO-Anything 面向3D场景重建的编程智能体 论文:https://huggingface.co/papers/2609.36380
Omni-IO Skills 让你的智能体原生全能 论文:https://huggingface.co/papers/2609.31847
LongLive-Plug 面向视频生成的一次性通用蒸馏 论文:https://huggingface.co/papers/2609.38154
Agents write application code, but you still get paged at 2am when it breaks. We wanted to know whether AI could handle that part of the job too. Introducing Incident Arena: a benchmark that puts coding agents on call! Check out our paper & full dataset release below!
Apple 研究团队提出 SCLATE,一个让基准测试与未经修改的智能体各自通过适配器向同一开放事件调度器注册事件的执行底座,用混合模拟时钟把长达一个月的场景压缩到数小时。