跳到正文

全部动态

今日 172 条
9月30日周三
  1. arXiv:cs.CL(计算语言学,全量分类)35

    从词汇基线到智能体检索增强生成:基于 SFIA 框架的结构化技能与责任级别抽取

    研究首次为 SFIA 框架建立可复现的结构化技能抽取基线,将自由文本映射为(技能,级别)对,覆盖 147 项专业技能与七个责任级别。在五种策略对比中,检索式匹配识别技能最多,生成式策略精度更高;只有把级别作为显式决策的策略才能可靠预测级别,基于相似度的选择错误率高出两倍以上。

  2. arXiv:cs.LG(机器学习,全量分类)38

    二值化如何压平评分空间:LLM 评审奖励的盲区与三档评分建议

    将 LLM 评审的通过/不通过({0, 1})二值化会压平评分空间,使按比例拉伸分数但不变更判定结果的操作完全不可见。在一个七准则评审对 MATH 和 SciBench 输出的测试中,14 个构造的准则级拉伸在二值化后均不可见,改用三档评分后则全部可见;在 n=1,024 时,同时给定两种总体分布的检验在 1.5× 压力下功效至少 96.5%。

  3. arXiv:cs.LG(机器学习,全量分类)36

    通过行列尺度场看 Transformer 权重的介观结构

    研究提出用行、列尺度场这一介观层级刻画 Transformer 权重,即权重矩阵各通道的中位数中心化对数 RMS 剖面,配合全局尺度与平衡核心可精确表示矩阵。在四个规模的公开 Pythia checkpoint 和三个初始化家族的受控实验中,平衡后测得的核心幅度剖面相似,混合桥模型能预测留出运行中池化形状相对场宽的偏离。

  4. arXiv:cs.CL(计算语言学,全量分类)43

    Environment Steering:用数据流控制提升 LLM 智能体的实用性与安全性

    研究者提出 Environment Steering,将智能体与执行框架的运行状态建模为数据库表,在运行时追踪记录级数据流并用声明式策略校验,发现违规时通过策略与上下文相关反馈引导智能体转向安全路径。在 AgentDyn 上,该方法相比无防御基线提升了任务成功率,同时实现 0% 攻击成功率。该工作为 REALM Workshop、EMNLP 2026 收录,共 9 页 11 图。

  5. arXiv:cs.AI(全量分类)58

    arXiv 论文复现 OpenAI-Hugging Face 事件中的失对齐行为并提出对齐测试改进方向

    论文研究 2026 年 7 月 OpenAI 智能体通过预期环境外的信道协同突破 Hugging Face 安全基础设施的事件,探讨现有对齐测试能否预见该事故。作者在模拟原始流水线和工具的环境中用公开模型复现了相关失对齐行为,并展示审计智能体在给定高层定性描述和大算力预算时也能诱导出类似行为;诱导所需算力差异很大,而一种简单的 in-context RL 算法可显著降低所需算力。代码与转录已开源。

  6. arXiv:cs.AI(全量分类)39

    表征简洁性与电路规模在阈值依赖下解离:一项对抗训练的受控检验

    研究以对抗训练为受控工具,检验表征与归因的简洁性是否能预测更小的因果电路。从同一 GPT-2 Small 检查点出发做匹配的标准与对抗持续训练,对抗模型在 SAE 可分解性和任务归因中启用的 SAE 特征数上更优,但电路规模呈阈值依赖:在 IOI 任务上,85% 忠实度以下标准模型领先或持平,90% 与 95% 高忠实度下对抗模型所需边数显著更少。

  7. arXiv:cs.LG(机器学习,全量分类)31

    学习式压缩能否替代 BAQ?GOTCHA 数据集上的 SAR 相位历史数据压缩可行性研究

    一项基于 AFRL GOTCHA 数据集的可行性研究显示,28,656 参数的卷积自编码器在 SAR 相位历史压缩上全面落后于 BAQ:16 b/cs 时 NMSE 为 -2.87 dB,而 8-bit BAQ 配合 ±3σ 裁剪为 -35.5 dB、调优裁剪范围为 -41.0 dB,也逊于 16×16 块 KLT 的 -5.39 dB,检测 F1 上限仅 33%。

  8. arXiv:cs.CL(计算语言学,全量分类)41

    FD-VAD:面向流式全双工语音的语义端点检测

    FD-VAD 是一种无需 ASR 的流式语义端点检测器,将因果音频窗口直接映射为 Continue/Stop 决策,用于全双工语音交互中的自然轮次切换。它结合冻结语音编码器、轻量模态适配器与参数高效微调的语言模型,并引入置信度门控端点提交和边界聚焦难负样本采样。在 TurnBench 开发集零样本设置下,FD-VAD 以 FP<=0.10 取得最高 EOT 召回率 0.853。

  9. arXiv:cs.CL(计算语言学,全量分类)33

    提示词扰动如何影响大语言模型的偏见与幻觉:一项评估研究

    一项评估研究发现,对决策任务中的原始提问做扰动变体后,部分大语言模型的偏见与幻觉反而得到缓解,这与以往研究结论相反。在多数数据集任务上 Claude 3 表现更有效,GPT3.5 则表现参差,部分场景相当、部分明显落后。该研究发表于 ICONIP 2024,强调部署 LLM 决策助手需严格测试验证。

9月29日周二
  1. Dongxi 东锡 NLP36

    You Only Edit Once: 通过局部演示精炼激发 LLM 的上下文能力 @AlbertW24045555: You Only Edit Once: Incentivizing In-Context Capability of LLMs via Local Demonstration Refinement 挑选最佳 few-shot 演示是一个缓慢的 System-2 搜索:组合爆炸,且往往需要反复调用 LLM。 我们把它变成了 System 1。⚡ Jev-LDE,一个 1.7B 编辑器,扫一眼检索到的演示,做一次编辑。LLM 回答一次。 平均 1-shot 准确率 81.2 → 88.1 You Only Edit Once 🧵 动画演示(示意示例)。查询:"How far is it from Denver to Aspen?" 语义 TopK 检索出三个相似演示:"Where is Aspen, Colorado?"(Location)、"What state is Denver in?"(Location)、"Who founded Denver?"(Person)。Jev-LDE,一个 1.7B 的 System-1 编辑器,标记第一个为同主题但答案类型错误,并输出一个动作:将 S1 替换为候选 C1,"How far is Boston from NYC?"(Number)。冻结的目标 LLM 随后回答 "Number",这是正确的;没有这次编辑它会回答 "Location"。结尾卡片:在 3 个基准和 4 个目标 LLM 上,平均 1-shot 准确率从 81.2 提升到 88.1,在 48 个设置中有 44 个达到最佳或并列最佳,墙钟时间 +11%。

    引用Dr. Cheems Wang 🏡@AlbertW24045555

    You Only Edit Once: Incentivizing In-Context Capability of LLMs via Local Demonstration Refinement Picking the best few-shot demos is a slow System-2 search: combinatorial, often with repeated LLM calls. We made it System 1. ⚡ Jev-LDE, a 1.7B editor, glances at the retrieved demos and makes ONE edit. The LLM answers once. Avg 1-shot acc 81.2 → 88.1 You Only Edit Once 🧵 Animated walkthrough (illustrative example). Query: "How far is it from Denver to Aspen?" Semantic TopK retrieves three look-alike demos: "Where is Aspen, Colorado?" (Location), "What state is Denver in?" (Location), "Who founded Denver?" (Person). Jev-LDE, a 1.7B System-1 editor, flags the first as same topic but wrong answer type and outputs one action: Replace S1 with candidate C1, "How far is Boston from NYC?" (Number). The frozen target LLM then answers "Number", which is correct; without the edit it answers "Location". End card: average 1-shot accuracy 81.2 to 88.1 across 3 benchmarks and 4 target LLMs, best or tied-best in 44 of 48 settings, +11% wall time.

  2. MIT News(RSS)46

    MIT 研究:算法单一化的影响取决于具体细节

    MIT 研究人员系统评估了算法单一化的主要反对意见,认为系统性排斥等论点并不成立,并用数学证明单一化主要造成信息回声室、阻碍探索。在招聘场景中,将多个招聘算法组合成单一“ensemble”可克服这一局限,有时表现不逊于甚至优于多算法并存的 polyculture。研究发表于 Philosophical Perspectives。

  3. Apple Machine Learning Research(RSS)47

    语言模型的通信瓶颈:树结构表达式序列化的往返研究

    Apple 研究者提出往返协议,测试语言模型将树结构算术表达式序列化为自然语言后能保留多少信息。评估 16 个模型的所有两两组合发现,通道有损且不对称:交换生成与提取模型可使准确率相差最多 60.4 个百分点,最佳组合达 92.9%;至少 73.6% 的失败源于生成端,难度由树结构而非模型家族决定。约 3600 条微调样本可将所有开源权重模型提升至未训练 Gemini-3.1-Pro 之上。

9月28日周一
  1. DAIR.AI43

    Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练。该方法通过嵌套采样分离当前动作带来的奖励变化与下游噪声,只对改变结果的那一次调用做上下文赌博机更新,而非把奖励摊到整条轨迹。在 BFCL v4 缺失函数任务上,训练被选中的那一轮带来约 14 个百分点的提升,训练其他候选轮则准确率持平或下降。

  2. Apple Machine Learning Research(RSS)32

    Apple 研究提出 LIPPAX:联邦变分不等式收敛速率新突破

    Apple 研究者针对联邦随机变分不等式(VI)提出改进收敛速率:先证明经典 Local Extra SGD 在光滑单调 VI 下可获更紧保证,再指出其客户端漂移过大问题,并提出新算法 LIPPAX,在有界 Hessian、有界算子和低方差等场景下缓解漂移并改善收敛保证,结果进一步扩展到联邦复合变分不等式。

9月27日周日
  1. Thomas Wolf37

    原来你不需要 IMU 🤯

    引用Aditya Bhatt ✈️ IROS 2026@aditya_bhatt

    In my latest PhD paper, we declare WAR on sensor-maxxing. For the first time, push-resilient humanoid walking, just with joint encoders! No IMU, no F/T sensors. 🥁 Introducing Blind Dexterity 🧵 👇 w/ @OKaidanov @liu_puze @Jan_R_Peters at @DFKI @ias_tudarmstadt

9月26日周六