
不下载数据集也能训机器人:NVIDIA Cosmos3-DROID 流式学习管线拆解
MarkTechPost 介绍了一套基于 NVIDIA Cosmos3-DROID 的端到端流式机器人学习管线,通过 byte-range Parquet 读取、行为克隆与时间集成,实现无需本地下载数据集的训练流程。
微调、对齐与训练技术

MarkTechPost 介绍了一套基于 NVIDIA Cosmos3-DROID 的端到端流式机器人学习管线,通过 byte-range Parquet 读取、行为克隆与时间集成,实现无需本地下载数据集的训练流程。

Cantina Security 与 Yeta Labs 发布专为漏洞研究训练的开放权重模型 apex-flash-1,基于 GLM-5.3-Flash 强化学习微调,MIT 许可,在 60 道留出漏洞任务中解出 40 道。

Hugging Face 上出现的 AutoSynthData 项目,尝试用自动化方式为企业智能体生成训练数据,缓解真实业务数据稀缺、标注成本高的问题。

成立七年的 Snorkel AI 完成 3.5 亿美元 E 轮融资,估值升至 35 亿美元。在企业争抢高质量训练与评测数据的当下,数据即服务正从边缘工具变成基础设施。

一项新研究把大模型的结构剪枝转化为伊辛优化问题,用物理学的组合优化视角决定该删掉哪些模块,为剪枝方法提供了新的理论框架。
Hacker News 上出现的 Mini-AGI 项目,尝试在 8GB 显存内训练一个持续学习模型,把「动态更新」而非「一次性训练」作为核心卖点。

微软与伊利诺伊大学构建 StudentSim,用有限数据复现个体学生并模拟真实错误,为 AI 导师提供快速低成本反馈,在棋类、英语和数学测试中表现优于 GPT-5.4。

Fyxer 借助 OpenAI 模型、微调、记忆机制与真实用户反馈,整理收件箱并以用户本人的语气起草邮件,试图解决 AI 助理最难的一环:信任。

Hugging Face 展示了一种把异步 GRPO 与 LoRA 放到 HF Jobs 上的做法,用对象存储桶和代理替代 NCCL 通信,降低了分布式强化学习微调的工程门槛。

Hugging Face团队通过TRL和OpenEnv,将编码模型训练成能画水彩画的智能体,展示了强化学习在非传统任务上的潜力,为AI对齐和工具使用提供了新思路。

Hugging Face 团队展示,仅用100步GRPO微调一个350M参数模型,即可显著提升其结构化输出能力,为小型模型高效对齐提供了新思路。

Hugging Face 发布 Sentence Transformers 对多向量嵌入模型(如 ColBERT)的训练与微调支持,为检索和重排序任务带来更高效的工具。