15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

发布时间:2026/8/1 15:38:17
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge 在具身智能领域让机器人具备感知、理解与行动能力是推动智能体进入真实世界的关键。MiniCPM 推出的 MiniCPM-Robot 系列模型围绕机器人操作与目标跟踪两大核心任务展开探索。其中MiniCPM-RobotManip 是一个仅 15 亿参数的视觉语言动作模型基于 MiniCPM-V 4.6 视觉语言骨干并结合扩散动作头实现从视觉观察和语言指令到机器人动作的端到端映射MiniCPM-RobotTrack 则聚焦实体目标跟踪以 0.9B 参数实现端侧实时视觉跟踪能力。通过轻量化架构、流式上下文记忆和高效视觉压缩技术MiniCPM-Robot 系列展现了小规模模型在真实机器人场景中的高效推理潜力。目前HyperAI超神经官网已上线了「MiniCPM-Robot面向真实世界的具身智能模型」快来试试吧~在线使用https://go.hyper.ai/0VsYI7 月 25 日- 7 月 30 日hyper.ai 官网更新速览* 优质公共数据集9 个* 优质教程精选8 个* 社区文章解读2 篇* 热门百科词条5 条* 8 月截稿顶会6 个访问官网hyper.ai公共数据集精选1.Math-Graph 数学定理依赖图数据集Math-Graph 是由华盛顿大学数学人工智能实验室于 2026 年发布的数学定理依赖图数据集构建了一个语句级粒度的数学定理依赖图相关论文成果为 TheoremGraph: Bridging Formal and Informal Mathematics。该数据集包含 47,952 条非形式化与形式化数学的语句匹配对将两类数学知识整合为一张连贯的依赖图覆盖非形式化informal与形式化formal数学涵盖论文元数据、数学语句形式/非形式、依赖关系边以及 LLM 生成的自然语言描述数据。在线运行HyperAI2.Nemotron-SFT-Math-v4 数学推理 SFT 数据集Nemotron-SFT-Math-v4 是由 NVIDIA 于 2026 年 5 月发布的数学推理数据集相关论文成果为 Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision旨在解决传统数学数据集质量参差不齐、推理轨迹不规范、准确率低、场景单一的问题有效提升模型结构化推理、多轨迹推理与答案校验能力广泛用于大模型数学推理微调、推理轨迹分析、答案校验算法研发、长上下文推理系统搭建与模型推理鲁棒性评测。该数据集包含 545,431 条训练样本涵盖 285,516 条 COT 思维推理样本与 259,915 条 TIR 工具推理样本覆盖代数、几何、数论、组合数学等竞赛与高校科研级数学场景数据采用人工与自动化混合标注方式包含唯一编号、题目文本、多轮对话、标准答案、来源、协议等标准化字段。在线运行https://go.hyper.ai/Kv9E43.MathNet 多模态数学基准推理数据集MathNet 是由 MIT 团队联合阿卜杜拉国王科技大学等机构于 2026 年发布的一个大规模多语言、多模态数学推理数据集相关论文成果为 MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval旨在评估与提升大模型在奥林匹克级数学推理与结构化检索任务中的能力广泛应用于用于数学推理评测、 RAG 研究及多模态 AI 训练等方向。该数据集为 v0 版本共收录 27,817 道专家级数学试题及配套标准解答涵盖 58 个国家和地区、 17 种语言的官方数学竞赛真题其中包含 5,148 道配图试题、共计 7,541 张几何及图形辅助配图。数据集覆盖代数、几何、数论、组合数学、微积分、概率统计等奥数知识体系支持数学问题求解、数学语义检索识别结构等价及相似试题、检索增强问题求解 3 个基准任务。在线运行https://go.hyper.ai/AWKaV数据集示例4.Nemotron-Math-v2 数学推理数据集Nemotron-Math-v2 是一个由 NVIDIA Corporation 于 2025 年发布的数学推理数据集相关文论成果为 Nemotron-Math: Efficient Long-Context Distillation of Mathematical Reasoning from Multi-Mode Supervision 。主要用于训练 LLM 以执行结构化数学推理研究工具增强的推理与纯语言推理的差异以及构建长语境或多轨迹推理系统等。该数据集包含约 34.7 万个高质量数学问题和 700 万个模型生成的推理轨迹。每个问题在六种配置下进行求解高 / 中 / 低推理深度与是否使用 Python TIR答案通过 LLM 作为裁判的管道进行验证。在线运行HyperAI5.CHIMERA 通用推理合成数据集CHIMERA 是一个专为推理训练设计的合成推理数据集相关论文成果为 CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning。该数据集涵盖广泛的 STEM 学科并提供长链思维CoT轨迹包含 9,225 个问题8 个学科数学、计算机科学、化学、物理、文学、历史、生物学、语音学所有示例均由大型语言模型LLM生成并通过自动验证无需人工标注。在线运行HyperAI6.Open-RL 推理问题数据集Open-RL 是由 Turing 于 2026 年发布的多领域推理问题数据集包含物理学、数学、生物学和化学的独立、可验证和明确的 STEM 推理问题。每个问题需要多步推理涉及符号操作和/或数值计算且具有可客观验证的最终答案。该数据集适合用于强化学习微调、奖励建模、结果监督训练以及可验证推理基准测试。每个问题需要多步推理并涉及符号操作和数值计算具有可验证的最终答案。在线运行HyperAI7.GPT-5.4 逐步推理数据集GPT-5.4-step-by-step-reasoning 逐步推理数据集是一个高密度合成推理数据集面向长链思维CoT建模与复杂问题求解任务。数据集基于「Master-Architect」流程构建由 gemini 3 flash 生成高难度提示结合 GPT-5.4 Reasoning Core 完成多步推理与结果生成。该数据集包含约 1,500 条精英级样本覆盖数学、编程与医学等高复杂度领域任务难度统一设定为「Grandmaster」及「Beyond-PhD」级别。数据样本包含完整多步推理过程及验证后的最终解答适用于长链逻辑推导与极限推理能力评估场景。在线运行HyperAI8.Sutra 10B Pretraining 教学训练数据集Sutra 10B Pretraining 是一个用于大语言模型预训练的高质量教学数据集由 Sutra 框架生成创建了结构化的教育内容优化了语言模型的预训练。这是 Sutra 系列中最大的一个数据集旨在展示密集、精心策划的数据集如何为小型语言模型提供最佳的预训练性能。该数据集共包含 10,193,029 条教学记录总规模超过 100 亿个 token涵盖跨学科、技术、科学、社会研究、数学、生活技能、艺术与创意、语言艺术以及哲学与伦理学等九大领域。数据内容遵循成熟的教学范式设计难度由基础到高级划分为 10 个等级具备良好的层次性与系统性。在线运行HyperAI9.VisCoR-55K 视觉推理数据集VisCoR-55K 是由华中科技大学联合阿里云与 2026 年发布的一个高质量视觉推理数据集该数据集包含约 55,000 个视觉推理样本每个样本都利用对比样本生成相应的推理过程涵盖通用、推理、数学、图表及 OCR 五大类别的高质量视觉推理数据集旨在促进视觉语言模型在可信且稳健的视觉推理方面的研究。在线运行https://go.hyper.ai/kIlWk公共教程精选1. MiniCPM-Robot面向真实世界的具身智能模型MiniCPM-Robot 是 OpenBMB 面向真实世界感知、决策与动作的具身智能模型族首发包含两款模型面向机器人操作的通用 VLA 模型 MiniCPM-RobotManip以及面向具身目标跟踪的端侧模型 MiniCPM-RobotTrack。在线运行MiniCPM-Robot: An Embodied Intelligence Model for Real-World Applications | Notebooks | HyperAIDemo 页面2. Diamond-1.0自回归语音修复模型Diamond 是由 nineninesix.ai 于 2026 年 7 月开发的语音修复模型采用自回归 seq2seq 架构将退化音频低码率编码、背景噪声、削波、窄带还原为 44.1 kHz 近录音室品质语音。在线运行Diamond-1.0: A Self-Autoregressive Speech Repair Model | Notebooks | HyperAIDemo 页面3. Nanbeige4.2-3B紧凑型智能体模型Nanbeige4.2-3B 是由南北阁于 2026 年 7 月开发的紧凑型智能体模型基于 Nanbeige4.2-3B-Base 构建。该模型采用 Looped Transformer循环 Transformer 架构通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数总计 4B即可在智能体基准测试中超越 Qwen3.5-9B、Gemma4-12B 等更大模型。在线运行Nanbeige4.2-3B: A Compact Agent Model | Notebooks | HyperAIDemo 页面4. Fara1.5-27B多模态计算机使用智能体Fara1.5-27B 是由 Microsoft Research AI Frontiers 于 2026 年 5 月发布的多模态计算机使用智能体。核心创新为仅视觉感知架构通过截图观察浏览器以结构化工具调用点击、输入、滚动、网页搜索等完成端到端任务无需访问 DOM。该模型基于 Qwen3.5-27B 进行监督微调训练数据由 FaraGen1.5 多智能体流程生成。在线运行Fara1.5-27B: Multimodal Computer Use Agent | Notebooks | HyperAIDemo 页面5. NVIDIA Cosmos3-Edge全模态推理模型Cosmos3-Edge 是由 NVIDIA 团队于 2026 年 7 月发布的 4B 参数全模态世界基础模型核心创新与特点为采用混合 TransformerMoT架构在一个统一框架内融合自回归 Transformer 和扩散 Transformer分别处理文本生成和图像/视频/动作等多模态生成。在线运行https://go.hyper.ai/yB4bzDemo 页面6. Mage-Flow高效原生分辨率图像生成与编辑基础模型Mage-Flow 是由 Microsoft 于 2026 年 7 月发布的紧凑型 4B 图像生成与编辑基础模型。它通过精心设计的 tokenizer-backbone-system 协同优化在 4B 参数规模下达到了与更大模型Qwen-Image 20B、FLUX.2 32B相媲美的质量同时保持更快的推理速度和更低的内存占用。在线运行Mage-Flow: A Foundation Model for Efficient Native Resolution Image Generation and Editing | Notebooks | HyperAIDemo 页面7. LingBot-World-V2无限世界与多样化交互的图像到视频生成LingBot-World-V2 是由 Robbyant 团队于 2026 年 7 月发布的图像到视频生成模型。该模型通过因果预训练实现无限时长交互并保持稳定输出质量同时支持 720p 60fps 实时视频生成具备攻击、射箭、施法等多样化交互能力。此外LingBot-World-V2 首次将智能体框架引入世界模型通过行为规划智能体和环境合成智能体实现更智能的场景理解与交互生成。在线运行https://go.hyper.ai/wecWCDemo 页面8.MOSS-Transcribe-Diarize端到端多说话人音频转录与说话人分离MOSS-Transcribe-Diarize 是由 MOSI.AI (OpenMOSS) 团队于 2026 年 7 月发布的端到端多说话人音频理解模型。只需一次推理模型即可同时完成语音转写和说话人分离输出带有时间戳和匿名说话人标签如 [S01]、[S02]的结构化文本。在线运行https://go.hyper.ai/TElI9Demo 页面社区文章解读1.美国阿贡实验室提出ChemGraph13项基准测试评估Agent在计算化学领域价值阿贡国家实验室推出由 LLM 驱动的智能体 ChemGraph专用于自动化计算化学分子模拟工作流。基准测试表明GPT-4o 等大模型在复杂任务中表现稳定而通过策略性地将任务拆解较小模型如GPT-4o-mini也能大幅提升性能达到甚至超越大模型水平。此研究为低成本推动 AI 科研自动化提供了新思路。查看完整报道https://go.hyper.ai/Cgo562.基于大模型推理与MCP工具调用斯坦福大学AI X射线科学家在同步辐射光源自主完成单晶衍射对准斯坦福大学与 SLAC 国家加速器实验室研究团队开发了一套「AI X 射线科学家」系统并将其部署到斯坦福同步辐射光源的真实光束线上。研究团队先在虚拟光束线中完成系统调试再迁移至真实设备以单晶取向矩阵求解为任务检验 AI 能否自主完成多步实验并处理真实环境中的突发偏差。查看完整报道https://go.hyper.ai/jF9qk热门百科词条精选1. 人机回圈 HITL2. 自动语音识别 ASR3. 光学字符识别 OCR4. 世界动作模型 WAM5. 思维引导的强化学习框架 GTR这里汇编了数百条 AI 相关词条让你在这里读懂「人工智能」Wiki | HyperAI8 月截稿顶会* 截稿时间为 AoE 时间一站式追踪人工智能学术顶会Events | HyperAI以上就是本周编辑精选的全部内容如果你有想要收录 hyper.ai 官方网站的资源也欢迎留言或投稿告诉我们哦下周再见