人类可读文本对 LLM 微调是必要的吗?DASA 用连续嵌入替代文本
研究提出 Desired-Update-Aligned Synthetic Data(DASA),用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,直接用于下游微调,无需人类可读文本形式。
研究提出 Desired-Update-Aligned Synthetic Data(DASA),用冻结参考模型的激活梯度反馈优化连续合成输入嵌入,直接用于下游微调,无需人类可读文本形式。
针对神经定理证明器依赖人工形式化陈述、类型检查器存在"严谨性幻觉"的问题,研究者提出智能体框架 Sage,用四阶段分解生成流水线配合双信号语义纠错循环,将 Lean 4 编译器诊断与多维语义反馈结合。
该研究提出对每步信念上的即时成本施加 CVaR,而非改造价值函数,从而直接应对当前状态的不确定性,并保留标准期望累积回报作为目标,使任意基于期望的 POMDP 规划器只需修改成本计算即可具备风险敏感性。
研究者提出 MATE(Memory Adaptation for Task-Conditioned Execution),一种无需额外 LLM 推理的确定性检索后处理流程,将历史轨迹转化为面向执行的记忆。
研究者提出一种神经符号路由器,用 L* 语法推断算法学习确定性有限自动机(DFA),将结构化查询分派给确定性求解器,仅把开放式应用题留给小语言模型(SLM)。
研究首次为 SFIA 框架建立可复现的结构化技能抽取基线,将自由文本映射为(技能,级别)对,覆盖 147 项专业技能与七个责任级别。在五种策略对比中,检索式匹配识别技能最多,生成式策略精度更高;只有把级别作为显式决策的策略才能可靠预测级别,基于相似度的选择错误率高出两倍以上。
arXiv 论文(arXiv:2609.35875)测试 23 个开源小模型、五个任务、5500+ 次辩论与对照实验,发现认知多样性并非多智能体辩论(MAD)收益的驱动因素,假设在人格、采样温度、模型身份三个轴上均被否。
将 LLM 评审的通过/不通过({0, 1})二值化会压平评分空间,使按比例拉伸分数但不变更判定结果的操作完全不可见。在一个七准则评审对 MATH 和 SciBench 输出的测试中,14 个构造的准则级拉伸在二值化后均不可见,改用三档评分后则全部可见;在 n=1,024 时,同时给定两种总体分布的检验在 1.5× 压力下功效至少 96.5%。
研究量化了预分词边界带来的压缩代价:在英文维基百科上,边界规则使最优 token 数增加 28.3%–36.8%,BPE 比受限下界高 2.1%,但比无限制下界高 10.9%。
一项受控评估在 386 个 MATH-500 任务上比较了 8 个生成的 LLM harness 与 9 个字节完全相同的基线副本,发现相同程序本身就能带来 2.16 个百分点的重复平均 oracle 余量。
研究提出用行、列尺度场这一介观层级刻画 Transformer 权重,即权重矩阵各通道的中位数中心化对数 RMS 剖面,配合全局尺度与平衡核心可精确表示矩阵。在四个规模的公开 Pythia checkpoint 和三个初始化家族的受控实验中,平衡后测得的核心幅度剖面相似,混合桥模型能预测留出运行中池化形状相对场宽的偏离。
研究者提出 Environment Steering,将智能体与执行框架的运行状态建模为数据库表,在运行时追踪记录级数据流并用声明式策略校验,发现违规时通过策略与上下文相关反馈引导智能体转向安全路径。在 AgentDyn 上,该方法相比无防御基线提升了任务成功率,同时实现 0% 攻击成功率。该工作为 REALM Workshop、EMNLP 2026 收录,共 9 页 11 图。
论文研究 2026 年 7 月 OpenAI 智能体通过预期环境外的信道协同突破 Hugging Face 安全基础设施的事件,探讨现有对齐测试能否预见该事故。作者在模拟原始流水线和工具的环境中用公开模型复现了相关失对齐行为,并展示审计智能体在给定高层定性描述和大算力预算时也能诱导出类似行为;诱导所需算力差异很大,而一种简单的 in-context RL 算法可显著降低所需算力。代码与转录已开源。
研究在 NASA C-MAPSS 涡扇基准上,用同一实现、架构、初始化、优化器和训练预算,对比同步环形 gossip 与 FedAvg、本地训练及集中式训练训练堆叠 LSTM 故障检测器的效果。
研究以对抗训练为受控工具,检验表征与归因的简洁性是否能预测更小的因果电路。从同一 GPT-2 Small 检查点出发做匹配的标准与对抗持续训练,对抗模型在 SAE 可分解性和任务归因中启用的 SAE 特征数上更优,但电路规模呈阈值依赖:在 IOI 任务上,85% 忠实度以下标准模型领先或持平,90% 与 95% 高忠实度下对抗模型所需边数显著更少。
研究者提出 GapFT,按源检查点的单样本结果筛选训练数据,专门微调 Pass@K 与 Pass@1 之间的差距,即策略单次失败但 K 次采样内能解决的问题。
一项基于 AFRL GOTCHA 数据集的可行性研究显示,28,656 参数的卷积自编码器在 SAR 相位历史压缩上全面落后于 BAQ:16 b/cs 时 NMSE 为 -2.87 dB,而 8-bit BAQ 配合 ±3σ 裁剪为 -35.5 dB、调优裁剪范围为 -41.0 dB,也逊于 16×16 块 KLT 的 -5.39 dB,检测 F1 上限仅 33%。
HeadGuard 是一种可组合的注意力头保护方法,通过离线选取约 1/8 的图像敏感与输出敏感 KV 头并保持其图像 key(可选 value)为 BF16 精度,来缓解低比特 KV-Cache 量化对 VLM 精度的损害。
FD-VAD 是一种无需 ASR 的流式语义端点检测器,将因果音频窗口直接映射为 Continue/Stop 决策,用于全双工语音交互中的自然轮次切换。它结合冻结语音编码器、轻量模态适配器与参数高效微调的语言模型,并引入置信度门控端点提交和边界聚焦难负样本采样。在 TurnBench 开发集零样本设置下,FD-VAD 以 FP<=0.10 取得最高 EOT 召回率 0.853。
研究者提出 CALIBRA,一个校准优先的多模态时序框架,用独立循环编码器处理环境、肺功能、症状、用药、可穿戴与情境数据流,并通过可靠性门控与梯度反转抑制队列特征。
一项评估研究发现,对决策任务中的原始提问做扰动变体后,部分大语言模型的偏见与幻觉反而得到缓解,这与以往研究结论相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则表现参差,部分场景相当、部分明显落后。该研究发表于 ICONIP 2024,强调部署 LLM 决策助手需严格测试验证。
https://x.com/i/article/2104955648664584192
Hugging Face 发布论文 ProvenanceGuard,一个面向 MCP 智能体的生成后验证层,专门检测"跨来源混淆"——即事实在证据池中成立、却被归因到错误来源。
You Only Edit Once: Incentivizing In-Context Capability of LLMs via Local Demonstration Refinement Picking the best few-shot demos is a slow System-2 search: combinatorial, often with repeated LLM calls. We made it System 1. ⚡ Jev-LDE, a 1.7B editor, glances at the retrieved demos and makes ONE edit. The LLM answers once. Avg 1-shot acc 81.2 → 88.1 You Only Edit Once 🧵 Animated walkthrough (illustrative example). Query: "How far is it from Denver to Aspen?" Semantic TopK retrieves three look-alike demos: "Where is Aspen, Colorado?" (Location), "What state is Denver in?" (Location), "Who founded Denver?" (Person). Jev-LDE, a 1.7B System-1 editor, flags the first as same topic but wrong answer type and outputs one action: Replace S1 with candidate C1, "How far is Boston from NYC?" (Number). The frozen target LLM then answers "Number", which is correct; without the edit it answers "Location". End card: average 1-shot accuracy 81.2 to 88.1 across 3 benchmarks and 4 target LLMs, best or tied-best in 44 of 48 settings, +11% wall time.
MIT 研究人员系统评估了算法单一化的主要反对意见,认为系统性排斥等论点并不成立,并用数学证明单一化主要造成信息回声室、阻碍探索。在招聘场景中,将多个招聘算法组合成单一“ensemble”可克服这一局限,有时表现不逊于甚至优于多算法并存的 polyculture。研究发表于 Philosophical Perspectives。
Apple 研究者提出往返协议,测试语言模型将树结构算术表达式序列化为自然语言后能保留多少信息。评估 16 个模型的所有两两组合发现,通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本可将所有开源权重模型提升至未训练 Gemini-3.1-Pro 之上。
Geoffrey Hinton、Yoshua Bengio 和 OpenAI 研究负责人 Jakub Pachocki 等 20 多位 AI 研究者在一篇新论文中警告,自我改进的 AI 可能引发“智能爆炸”。
FuseReg 正则化层融合缓解表示自编码器中的重建-生成差距 论文:https://huggingface.co/papers/2609.31620
MIT 研究团队借助可在小数据集上工作的机器学习算法,调整 mRNA 疫苗脂质纳米颗粒(LNP)中的辅料配方,使疫苗在室温下可稳定保存一年,在约 100 华氏度下保存两个月。
Apple 研究者针对联邦随机变分不等式(VI)提出改进收敛速率:先证明经典 Local Extra SGD 在光滑单调 VI 下可获更紧保证,再指出其客户端漂移过大问题,并提出新算法 LIPPAX,在有界 Hessian、有界算子和低方差等场景下缓解漂移并改善收敛保证,结果进一步扩展到联邦复合变分不等式。
论文提出 SkillGym,把人类编写的技能转化为 2756 个带代码校验器的训练环境,并用 8364 条成功轨迹做微调。
https://x.com/i/article/2104259869402599424
HuggingFace 上发布了一个用 Claude Opus 5.5 生成的覆盖 2194 种疾病的模拟医患对话数据集,平均每段 33 轮,从描述症状、检查聊到治疗和后续安排。
ProgramDistill 从交互式 Web 应用到可验证的参考引导 SWE 任务 论文:https://huggingface.co/papers/2609.18805
In my latest PhD paper, we declare WAR on sensor-maxxing. For the first time, push-resilient humanoid walking, just with joint encoders! No IMU, no F/T sensors. 🥁 Introducing Blind Dexterity 🧵 👇 w/ @OKaidanov @liu_puze @Jan_R_Peters at @DFKI @ias_tudarmstadt
Salesforce AI Research 发布 Just-in-Time Memory 论文,主张存储原始轨迹并在新任务到来时再决定提取内容,而不是在任务结束时总结。