作为一个招蚊体质,这是我第一个真心支持的AI项目
编辑|Sia入夏之后,我们又迎来了一年一度的深夜终极副本:关灯,躺下。三秒后,耳边准时响起:嗡——嗡嗡——嗡嗡嗡。开灯,找不到。关灯,继续嗡。贴着耳朵 360° 环绕立体声输出,精准拿捏我的血压。人类
阅读全文编辑|Sia入夏之后,我们又迎来了一年一度的深夜终极副本:关灯,躺下。三秒后,耳边准时响起:嗡——嗡嗡——嗡嗡嗡。开灯,找不到。关灯,继续嗡。贴着耳朵 360° 环绕立体声输出,精准拿捏我的血压。人类
阅读全文多智能体协作对于解决复杂问题虽然具有巨大优势,但是其架构本质上易出现错误传播,因为由不正确的工作流生成或单智能体幻觉输出引起的错误会沿着协作链蔓延,影响最终结果。从 CAMEL、AutoGen、Met
阅读全文编辑|Sia在具身智能最难的泛化问题上,他们连续拿出顶会级成果,并把它们沉淀进其创新 VLOA 大模型,推动机器人迈向广阔现实。6 月 1 日至 5 日,机器人领域顶级会议 ICRA 2026 在奥地
阅读全文编辑|Panda过去一年,AI 推理模型的使用成本让不少开发者叫苦。「慢思考」模型在处理数学、代码、逻辑题时确实表现惊艳,但代价是每次调用都会生成几百乃至几千个「思考 token」。这些 token
阅读全文本文由 Nuoya Xiong、Yuhang Zhou、Hanqing Zeng、Zhaorun Chen、Furong Huang、Shuchao Bi、Lizhu Zhang、Zhuokai Zh
阅读全文编辑|泽南、杨文AI 视频生成,卡在长视频这道坎上太久了。过去一年,视频生成赛道动作频频。谷歌推出 Veo 系列,并在今年 I/O 大会发布新一代多模态视频生成与编辑模型 Gemini Omni Fl
阅读全文编辑 | Panda、泽南数学领域,最近着实被 AI 的产出冲击到了。2026 年 5 月 20 日,OpenAI 宣布,其内部推理模型成功推翻了由数学家保罗・埃尔德什(Paul Erdős)于 19
阅读全文PhysX-Omni:统一刚体、可形变与关节物体的物理 3D 生成该论文第一作者为曹子昂,研究方向主要聚焦于 3D AIGC、Physical AI 与具身智能。论文主要合作者包括来自南洋理工大学的李
阅读全文编辑|张倩现在市面上那么多机器人,有哪款是你真的愿意掏钱买回去的?2026 年,这个问题变得愈发重要,它直接决定了一家具身智能公司能否靠自己的造血能力活下去,而不是永远等待下一轮融资。与此同时,市场投
阅读全文机器之心编辑部很长一段时间,「长上下文」一直是各大模型厂商军备竞赛的焦点,从 128K 到 1M,再到更长的上下文窗口,业界已然形成一个固有认知,只要窗口足够大,模型就能记住更多内容,也就能处理更长、
阅读全文精细操作是具身智能迈向真实物理世界的关键能力,但现有评测往往只用 “成功 / 失败” 的二元指标衡量机器人表现,容易掩盖其在语义理解、精细感知和稳定执行中的真实短板。针对这一问题,东南大学魏秀参教授、
阅读全文编辑|Panda这是 Vibe Coding 的时代,这是 Vibe Working 的时代,这也是语音输入的时代……⌨️键盘,似乎正在变成一件古董。2025 年 2 月初,Andrej Karpat
阅读全文机器之心发布今日,分子之心正式对外发布全新的AI生物药从头设计平台——MMDesign。基于该平台,分子之心在极低的实验验证通量下,成功在细胞因子、免疫检查点、病毒蛋白及多次跨膜受体(如GPCR)等十
阅读全文机器之心编辑部在下载量突破 1.5 亿次之际,谷歌 Gemma 4 系列模型迎来了新的家族成员!今天,谷歌正式推出 Gemma 4 12B,目标是把具备智能体能力的多模态智能,直接带到笔记本电脑上。根
阅读全文编辑|杜伟这几天,全球科技圈的目光投向了 COMPUTEX。昨天是 COMPUTEX 正式开始的第一天,英伟达、高通的重磅主题演讲激起了行业的热烈讨论。英伟达创始人黄仁勋又一次强调 AI Agent
阅读全文赋予机器人物理理解和预测能力是通用操作的关键。蚂蚁灵波等机构提出的 LingBot-VA 试图将视频帧预测与动作推理统一起来,让机器人通过自回归扩散框架学会“一边思考一边行动”。在通用机器人领域,机器
阅读全文本文第一作者为张俊鹏,张拳石老师的博士生。一、SFT的争议长期以来,监督微调(Supervised Fine-Tuning,SFT)一直是深度神经网络中最常用的模型适配手段。在中小规模的传统神经网络中
阅读全文编辑|冷猫今年,我们正在打开 AI 自我进化的大门,按下了通往 AGI 的加速键。我们相信,AI 的自我进化是突破当前 Scaling 瓶颈的关键路径,这一点也是硅谷在去年年末就已经形成的共识。Ant
阅读全文机器之心编辑部从 LLM 的超长文本处理、视频生成模型的以假乱真、Agent 自主规划与执行的日趋成熟,到 VLA、世界模型等开始进入物理世界,AI 正在不断拓宽其能力边界。模型版本的迭代周期不断缩短
阅读全文当 AI 开始参与训练 AI过去,AI 研发基本是一条由人主导的流水线。人类收集数据、清洗数据、写训练代码、设计实验,再把整理好的数据交给模型学习。但现在,这条流程正在发生变化。AI 开始进入 AI
阅读全文编辑 | 陈陈过去一年,世界模型成了 AI 圈最热的词之一。越来越多机构开始宣称自家模型能够模拟世界,用户输入一句话,模型就能生成一段连续视频;给定一个动作或镜头,画面里的人物、场景和物体也能随之运动
阅读全文编辑|Sia过去,OpenAI 通过投资 Figure AI、1X Technologies 等机器人公司,更像是在用大模型 API 试水机器人时代的安卓模式。一年之后,局面变了。随着 Aditya
阅读全文机器之心编辑部Scaling 是过去十年 AI 进步最核心的驱动力。Ilya Sutskever 曾说,Scaling 这一个词改变了整个领域的思维方式。而现在,这个词正在经历它的第二次蜕变:从预训练
阅读全文编辑|杨文魔法打败魔法的「骚操作」,属实把我看乐了。今年年初,社交平台 Discord 为响应全球监管压力,搞了个「teen-by-default」,默认把大家都当未成年人,部分功能直接锁死。要想解锁
阅读全文机器之心编辑部从大模型的提示词到智能体的 Skills,看着进化了,但又没有完全进化。在智能体应用中,越来越多的程序员开始花大量时间写 CLAUDE.md、Codex 的 skill 文件、各种 Ag
阅读全文近年来,随着大模型从简单问答,走向深度研究、医疗咨询、多模态生成和长程 Agent 任务,一个基础问题变得越来越难回答:我们到底应该怎样判断模型输出的质量?在许多真实且复杂的场景中,我们可能没有标准答
阅读全文机器之心发布单机时代快结束了。过去两年,视频世界模型的进展有目共睹 ——Sora、Cosmos、Genie 把画质、时序、交互能力不断往前推。但所有这些进展,都建立在同一个前提上:世界里只有一个参与者
阅读全文编辑|Panda一张图能压多小?2025 年 2 月,国际图像专家组(JPEG)宣布了一件被行业低调庆祝的事:JPEG AI,这项历时多年、被寄予厚望的第一个端到端学习型图像编码国际标准,正式发布。消
阅读全文本文作者施柯煊和李瀚轩是香港中文大学计算机科学与工程系博士生,邱泽钜是德国马克斯普朗克研究所博士生,温研东是西湖大学助理教授,Simon Buchholz是德国马克斯普朗克研究所研究员,刘威杨是香港中
阅读全文机器之心发布上个月,一位时代少年团粉丝的偶然测试,把一个学术圈讨论的技术问题推到了全网面前。大家都知道大模型圈的「马嘉祺」事件,模型能准确说出马嘉祺的履历、综艺经历和团内角色,却始终没法正确输出马嘉祺
阅读全文