24G显卡可跑!南大PRISM工具包来了,多模态持续微调开箱即用
南京大学 LAMDA 团队推出 PRISM,用插件式架构和全栈精度调度,把多模态持续指令微调实验压到 24G 显卡上。多模态大语言模型(MLLM)通过指令微调统一了视觉理解与视觉-语言任务,但真实部署
阅读全文南京大学 LAMDA 团队推出 PRISM,用插件式架构和全栈精度调度,把多模态持续指令微调实验压到 24G 显卡上。多模态大语言模型(MLLM)通过指令微调统一了视觉理解与视觉-语言任务,但真实部署
阅读全文在没有人工标注和外部反馈的情况下,Ctx2Skill 让大模型仅凭上下文完成 Skills 的自动生成与筛选。近年来,大语言模型在复杂推理、代码生成以及智能体等方向不断突破,但一个更接近真实世界的问题
阅读全文随着多模态大模型的飞速发展,AI模型开始具备“看懂世界”的能力。然而在现实场景中,视频往往动辄数十分钟甚至上小时:信息密度高、关键证据稀疏且分布不均。如何让 AI 模型像人类一样高效、准确地理解视频内
阅读全文PaperWeekly × 星弧 STARC 科研觉醒AI前沿讲座 直播主题 智能体驱动的医学编码(Agentic Medical Coding) 直播嘉宾 马凤龙宾夕法尼亚州立大学副教授 直播时间
阅读全文Arbor 用一棵假设树,把 Agent 的每次实验都变成可积累、可复盘的研究进展。这两年,我们见证了 LLM Agent 的能力边界被一次次扩展。从最早的 Chatbot,到会调用工具的 Tool-
阅读全文教师不是灌输知识,而是帮助学习者从自身孕育认识。——苏格拉底苏格拉底式教学强调,不直接把答案交给学习者,而是通过追问、提示和对话,引导其发现自身思路中的矛盾,并完成自我修正。SocraticPO 将这
阅读全文不久前,我们陆续发布并开源了百灵 2.6 系列模型,包括 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T。今天,我们正式发布 Ling & Ring 2.6 Tech
阅读全文从传感材料、器件设计,到信号处理、系统集成与数据分析,下一代传感技术正在深刻改变医疗健康、环境监测、智能制造、基础设施等关键应用场景。面向这一快速演进的前沿领域,施普林格·自然于 2026 年推出全新
阅读全文预训练语料的价值,可能不只取决于文本质量,还取决于它在 Web 网络里的位置。大模型预训练一直在筛数据。过去筛的是文本本身:干不干净,重复不重复,质量高不高,属于哪个领域。普林斯顿陈丹琦组这篇新作,把
阅读全文生成式奖励模型(Generative Reward Model,GRM)通过思维链(Chain-of-Thought,CoT)提示增强大语言模型(LLM)的推理能力,但其现有实现面临效率低下与奖励信号
阅读全文几篇 AutoResearch 论文刷屏之后,真正值得打开的 SKILL.md 终于放出来了。过去几周,很多人都在关注陈德里的 AutoResearch SKILL。最早让它出圈的,是一篇由他和两个
阅读全文即使 SFT(Supervised Fine-Tuning,监督微调)训练已收敛、loss 已平稳、所有超参都调无可调,你的模型在训练集上重新测试——仍然有平均 15.3% 的样本答不对。这不是过拟合
阅读全文一个基于 Qwen2.5-Coder-3B 的小模型,靠后训练在 AIME26、LiveCodeBench v6 等可验证任务上冲到前沿模型附近。3B 参数,本来应该是小模型的舒适区。能本地跑,成本低
阅读全文无需里程计、无需轨迹规划,仅凭一台单目相机和一个端到端神经网络,把「所见」直接变成「所动」——让无人机像猛禽穿林一样,看一眼便侧身钻过比自己还窄、且朝向未知的缝隙。苍鹰俯冲穿过树干间的缝隙时,从不会在
阅读全文采用 Gemini-2.5/3.1-Pro API,通过“结构化剧本+证据链”生成 10 万条训练数据,VITA-1.5-7B、Qwen2.5-Omni-7B、Qwen3-Omni-30B 模型在 O
阅读全文今天的大语言模型,可能一直活在"只顾眼前"的诅咒里。Next-Token Prediction(NTP)无疑是一个英雄。它与 Transformer 一起,开启了大模型时代。每一步只预测一个 toke
阅读全文956 篇 CVPR Highlight 显示,好摘要和好引言并不是凭感觉写出来的。为什么要单独研究 abstract 和 intro?因为这两段很大程度上决定了审稿人会先如何理解你的故事和亮点。这两
阅读全文想象一个桌面 Agent 正在替你整理表格、配置浏览器、修改 VS Code workspace。它既能像人一样点击界面,也能直接调用工具完成结构化操作。这听起来像是一个更强的 Agent:看到按钮就
阅读全文模型权重之外,Agent 的上下文、工具、记忆、失败修复和源码更新,正在成为新的能力来源。现在看一个 Agent 强不强,已经不能只看它背后的模型。它能看到哪些上下文,能调用哪些工具,动作如何被约束,
阅读全文引言当 Agent 开始自主调用工具、执行多步任务,安全风险的防御就不再只是一句简单的 Prompt 拦截。工程团队面临的核心挑战是:如何高效、可控地将安全规范对齐到 Agent 的复杂执行轨迹中?传
阅读全文不改注意力形式、不做推理后压缩,只让 K 和 V 共享投影,KV Cache 就能少掉一半。Transformer 的 Q、K、V 三套投影,早已是注意力机制的默认配置。Q 负责发起查询,K 负责匹配
阅读全文本文在大模型 Agent 上观察到了社会心理学中反复验证过的行动者-观察者不对称现象,并构建了 AFB 基准来量化这一偏见。我们提出 ReTAS 模型,借助费希特辩证法的「正题、反题、合题」三步推理,
阅读全文Transformer 擅长并行训练,RNN 擅长固定记忆。MIT 这项工作试图把两者接到一起。RNN 真的输给 Transformer 了吗?过去几年,序列建模的主角几乎一直是 Transforme
阅读全文RepoZero 是首个能够全自动、可验证、可扩展评估大语言模型从零开始生成完整代码仓库能力的基准测试系统。这项由北京大学与百度合作的研究成果,重新定义了 AI 代码生成的评估标准。论文标题:Repo
阅读全文PaperWeekly × 星弧 STARC 科研觉醒AI前沿讲座 直播主题 从攻击机理到防御之道:一场关于"可信机器学习"的深度对话 直播嘉宾 张景锋复旦大学可信具身智能研究院副教授 直播时间 2
阅读全文一组 10T tokens 控制实验显示,纯代码能稳稳提升编程能力,却不一定带来更强复杂数学推理。过去几年,大模型训练里有个很常见的判断:多喂代码,模型会更会推理。这个判断听起来很顺。代码有语法、有结
阅读全文从几十个 3D 关节点出发,AI 正在绕开人脸与外观,重新定义行人重识别的技术边界。在安防监控、医疗健康和具身智能等场景中,目标身份的精准识别始终是机器视觉领域的核心技术。传统方法高度依赖外观或面部特
阅读全文