DeepSeek mHC之后,xHC重新设计「16路残差流」架构
上交、小红书等团队提出 xHC,用多尺度写回和稀疏更新继续改造 DeepSeek mHC。DeepSeek mHC 发布后,多路残差流迅速成为大模型架构研究中的热门方向。原始 HC 把单一残差状态扩展
阅读全文上交、小红书等团队提出 xHC,用多尺度写回和稀疏更新继续改造 DeepSeek mHC。DeepSeek mHC 发布后,多路残差流迅速成为大模型架构研究中的热门方向。原始 HC 把单一残差状态扩展
阅读全文统一多模态模型中,生成与理解是否共享一个知识空间?动机作为人类,我们可以阅读、倾听、观看,并把来自不同模态的信息整合进同一个大脑。之后,无论是写字、说话还是绘画,我们都能调用这些知识。那么,当一个统一
阅读全文模型权重保持不变,研究 agent 却在 100 轮筛选中重写了自己的搜索、上下文与评测机制。100 轮改写,约九成候选版本未能通过评测,真正刷新历史最佳的只有 7 轮。Weco AI 让一个研究 a
阅读全文随着大语言模型进入真实应用,推理成本正在成为限制落地的重要瓶颈。一次生成任务背后,往往包含长上下文预填充、逐 token 解码、KV cache 读写、矩阵乘法、注意力计算和大量框架调度开销。PyTo
阅读全文哪些问题值得回,哪些实验可以不做,这套 skill 先帮你排一遍。EMNLP 2026 rebuttal 刚刚收官,NeurIPS 2026 也将在 7 月 22 日出分。就在这个节点,港大 NLP
阅读全文无需从头重来,只要定位一个故障的中间工件,就能让跑偏的 AI 剪辑“悬崖勒马”?近年来,大型语言模型(LLMs)在长篇视觉叙事中展现出卓越潜力,生产方式正迅速从单一模型生成转向面向生产的智能体系统。但
阅读全文何恺明、Andrew Zisserman 等视觉大牛联手,把文生视频模型做成了多任务感知模型。靠着预测下一个 token,语言模型逐步把翻译、摘要、问答甚至推理收进同一套系统。计算机视觉却仍然高度分工
阅读全文角色、工作流、模型映射和奖励都可自定义,UnityMAS-O 让多智能体系统拥有统一的强化学习优化接口。©PaperWeekly 原创 · 作者 | 陈逸群单位 | 中国人民大学博士生研究方向 | 多
阅读全文AAAI 2027 的时间线、匿名要求、格式限制和合规风险,都集中整理在这份清单里。AAAI 2027 投稿已经启动。每到截稿季,作者反复确认的往往不只是论文有没有写完,还包括今年的规则有没有变化、提
阅读全文研究背景与摘要近年来,⼤语⾔模型正在从“会聊天”⾛向“会推理”。以 DeepSeek-R1 为代表的⼤语⾔推理模型,已经被⽤于数学求解、代码⽣成、科学分析、智能体决策等复杂任务场景。但推理能⼒的提升,
阅读全文有些论文赢在方法,有些论文连名字都很会:标题先让人停一秒。这两天刷到一张 ICML 2026 现场图,忍不住多看了两眼。〓 图源:@实对称齐次正定的炼丹变换一篇 ICML 论文,方法名缩写叫 Neur
阅读全文当大模型不再只是聊天,而是开始控制机械臂、车辆和服务机器人,AI 安全问题就不再只是“说错话”,而可能变成真实世界里的物理风险。过去我们谈大模型安全,更多关注的是幻觉、越狱、有害文本生成。 这些问题
阅读全文PaperWeekly × 星弧 STARC 科研觉醒AI前沿讲座 直播主题 判断大模型识别可信的边界:面向决策任务的不确定性量化 直播嘉宾 许凯第香港城市大学数据科学学院终身副教授 直播时间 20
阅读全文大模型到底记住了多少训练数据?这篇论文给出一个具体估计:GPT 类模型每个参数约 3.6 bit。大模型训练过的文本,究竟有多少真的留在了参数里?这个问题长期悬而未决。模型能补全一段训练文本,不一定说
阅读全文脉冲神经网络(SNN)因其高能效和时空处理能力,在 3D 感知中具有巨大潜力。然而,现有的 SNN 在预训练和推理阶段面临挑战,限制了其在 3D 开放世界理解(如零样本 3D 分类和开放世界问答)中的
阅读全文AI 要自我改进,短期内最先被改写的,可能不是模型权重,而是模型外层的 Harness。AI 如果走向自我改进,第一步会发生在哪里?很多人会想到模型权重:模型读自己的代码,改自己的参数,训练出更强版本
阅读全文类别增量学习要求模型不断学习新类别,同时保持旧类别的识别能力。近年来,基于 CLIP 等视觉语言模型的类别增量学习受到广泛关注,因为 CLIP 已经具备强大的视觉-文本对齐能力,可以通过冻结主干并训练
阅读全文这篇论文结果很强,关注度也不低,但 ICML 2026 最终给出的决定仍是 Reject。今年年初,何恺明团队用漂移模型把一步生成重新推到了台前。过去几年,扩散模型和流匹配模型不断刷新图像生成质量,但
阅读全文大语言模型越来越多地被用于生成跨领域问题的答案。然而,当这些模型单独使用时,常常会出现错误或不准确的答案。检索增强生成(RAG)可以部分解决这个问题。目前的方法将语言模型视为一个黑箱(black-bo
阅读全文AI 生成 PPT 往往“一改就乱全篇” 。清华、上交、北邮联合提出的 MemSlides 通过层次化记忆,让 Agent 实现了精准的局部修改 。清华大学、上海交通大学、北京邮电大学合作完成的 Me
阅读全文上线后的视觉模型,面对的从来不是一个静态测试集,而是一条持续变化的数据流。自动驾驶摄像头会从白天驶入黑夜,从晴天进入雨雾;视频分析系统会不断遇到新的光照、视角和场景;医学影像模型也可能因为采集协议、设
阅读全文自动读文献、做实验、写论文之后,AI for Science 的下一步,轮到科研协议本身。©PaperWeekly 原创 · 作者 | 刘嘉晨单位 | 密歇根大学研究方向 | AI for Scien
阅读全文多模态大语言模型(MLLM)通过指令微调获得了强大的视觉-语言理解能力,但真实部署场景中,模型往往需要持续学习新的任务、领域和回答格式,这使多模态持续指令微调(Multimodal Continual
阅读全文从目标定位到下一步行动,VLX-Go 补上 VLX 系列的行动决策层。让机器人跟上前面的人,并绕开突然出现的障碍物。这个任务听起来简单,但对 VLM 来说,文字回答远远不够。真实设备要的是下一小段可以
阅读全文近日,科睿唯安发布2026年度期刊引证报告(Journal Citation Reports, JCR)。Wiley 旗下The Advanced Portfolio 整体表现亮眼,多本期刊的影响因子
阅读全文当智能体走进 GPU 集群运维现场,真正难的不是回答问题,而是定位问题。随着全球智能体加速落地,算力需求呈指数级爆发,以 GPU 为核心的 AI 基础设施正变得愈发关键。据摩根士丹利报告预测,2028
阅读全文点亮👆“☆”星标,不错过推送内容~🎯 活动预告:美团&顶会论文分享会继续!ACL'26 两场及搜推 ASX 团队专场已结束,视频沉淀见【美团技术团队小红书】,还有 2 场【 ICML'26 美团论文分
阅读全文继 VLX-Flow 之后,Om AI 把 VLX 系列推进到第二层能力:让模型在实时视觉场景中看准目标。3B 参数的 VLM,能在细粒度感知上超过 Gemini 3.1 Pro 吗?在 Om AI
阅读全文当科研 Agent 越来越会生成 idea,真正稀缺的能力,开始变成判断什么值得做。当大模型深度介入科研流程后,研究想法的生成门槛被显著降低,科研产出随之呈现出爆发式增长。与此同时,全球科研论文数量持
阅读全文VLX-Flow、VLX-Seek、VLX-Go 三款模型连发,联汇科技把流式多模态推向真实设备和物理世界。过去一年,多模态模型越来越会看图、看视频、听语音,也开始把摄像头和屏幕变成新的交互入口。但真
阅读全文