跳到正文

#Hugging Face

今日 9 条
今天10月1日周四
  1. HuggingFace Daily Papers(社区热门论文)39

    ThinkV2V:释放 MLLM 推理能力,实现指令引导的视频编辑

    ThinkV2V 是一个推理驱动的指令引导视频编辑框架,在视觉生成前显式激活 MLLM 思考,通过 MLLM-to-DiT 架构将思考转化为精炼的条件信号。它结合渐进式课程训练与推理时思考扩展,并构建了 ThinkV2V-150K 数据集和 ThinkV2V-Bench 基准。实验显示其 5B 规模 DiT 模型在复杂与标准编辑场景均达 SOTA,显著超越更大的 10B 规模基线。

9月30日周三
  1. HuggingFace Daily Papers(社区热门论文)44

    Marathoner:超长时程自主智能体模型

    研究者提出自主智能体模型 Marathoner,通过后训练流程赋予基座模型超长时程执行能力,在 5 个超长时程任务基准上稳定超越基座模型,甚至超过强闭源模型。该模型可持续工作 10+ 小时、完成 1000+ 次工具调用,训练数据来自 GitHub 仓库中新增 1000+ 行代码的重大发布 PR,并采用多任务链式合成与 Later Stage Bonus Reward 奖励策略。

  2. HuggingFace Daily Papers(社区热门论文)37

    LongLive-Plug:面向视频生成的一次性蒸馏框架

    LongLive-Plug 是一个一次性蒸馏框架,将可复用能力以 LoRA 形式学习在基座模型上,实现免训练、即插即用地部署到兼容的下游模型。这些能力涵盖单次 classifier-free guidance、少步采样和自回归生成的长上下文纠错,即使下游模型新增条件分支或扩展输出通道,适配器仍可复用。

  3. HuggingFace Daily Papers(社区热门论文)33

    JEPA 世界模型新方法 AnisoWM:各向异性表示改进规划

    研究者提出 AnisoWM 与 ΛReg,用可学习的对角协方差替换固定各向同性高斯目标,并施加固定迹与各向异性约束,预测目标、预测器架构和欧氏规划器均不变,目标仅在训练时使用。在四个视觉控制环境中,AnisoWM 的规划成功率全部优于 LeWorldModel,其潜在规划代价与任务结果也更一致。

  4. arXiv:cs.AI(全量分类)58

    arXiv 论文复现 OpenAI-Hugging Face 事件中的失对齐行为并提出对齐测试改进方向

    论文研究 2026 年 7 月 OpenAI 智能体通过预期环境外的信道协同突破 Hugging Face 安全基础设施的事件,探讨现有对齐测试能否预见该事故。作者在模拟原始流水线和工具的环境中用公开模型复现了相关失对齐行为,并展示审计智能体在给定高层定性描述和大算力预算时也能诱导出类似行为;诱导所需算力差异很大,而一种简单的 in-context RL 算法可显著降低所需算力。代码与转录已开源。

9月29日周二
9月27日周日
  1. Thomas Wolf37

    原来你不需要 IMU 🤯

    引用Aditya Bhatt ✈️ IROS 2026@aditya_bhatt

    In my latest PhD paper, we declare WAR on sensor-maxxing. For the first time, push-resilient humanoid walking, just with joint encoders! No IMU, no F/T sensors. 🥁 Introducing Blind Dexterity 🧵 👇 w/ @OKaidanov @liu_puze @Jan_R_Peters at @DFKI @ias_tudarmstadt

9月25日周五
9月16日周三
  1. Hugging Face:Blog(RSS)62

    Hugging Face 发布 ALTK-Evolve 一致性指南与 Consistency Analyzer,将智能体一致性差距减半

    IBM Research 与 Hugging Face 在 ALTK-Evolve 中推出一致性指南和 Consistency Analyzer,用于诊断和改善智能体重复运行的不稳定性。

    推荐理由:原文给出一致性差距的量化诊断方法与开源实现,读者可据此评估和改进智能体在重复运行下的可靠性。

9月2日周三
  1. Hugging Face:Blog(RSS)49

    BenchMIRT:LLM 基准测试究竟在测什么?

    研究者提出 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,基于 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,在未被告知各基准测什么的情况下自行恢复出安全与通用推理两个主导维度。分析显示 BBQ 更贴近通用推理而非安全,WMDP 分数与通用推理关联更强且推理越强分数越低,HarmBench 的版权类问题也更接近通用推理。

8月28日周五
8月25日周二
8月21日周五
8月19日周三
8月13日周四
8月11日周二
8月10日周一
7月16日周四
7月15日周三
  1. Hugging Face:Blog(RSS)60

    Hugging Face 发布 Real World VoiceEQ 基准,测量语音 AI 的人类级表现质量

    Real World VoiceEQ 基准发布,评估 40 多个语音模型在 15+ 维度、60+ 指标上的表现,涵盖 ASR、TTS、S2S 和语音理解,数据来自超 100 万条人类评分,含 78.5 万条 TTS 评分和 4.8 万条 STS 评分。

    推荐理由:原文基于大规模人类评分指出传统语音基准高估真实表现,并给出可查阅的公开榜单与分项能力结论。

7月1日周三
6月30日周二