从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布
Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:Flash:面向实时交互,首包延迟在 300ms 左右。Plus:面向高质量生成,在自然度和音色还原度上表现更佳。本次
阅读全文Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:Flash:面向实时交互,首包延迟在 300ms 左右。Plus:面向高质量生成,在自然度和音色还原度上表现更佳。本次
阅读全文和 AI 打视频电话,卡顿、延迟、声画不同步,是常态。这本质上就是“语音识别 ➡️ 大模型 ➡️ 语音合成 ➡️ 动画驱动”的流水线拼装。环节越多,延迟越高,割裂感越强。但真正的自然交流,应该像和朋友
阅读全文语音交互的下一个形态是什么?是毫秒级的快速响应?是深度思考的逻辑推理?还是能够感知情绪、像真人般对谈的情感共鸣?如何让语音交互跨越“机械感”走向了“自然和智能”?我们也在持续探索。今天,我们想和大家分
阅读全文Agent 开发离不开真实环境,但真实环境:成本贵、响应慢、控制难。搭沙箱环境成本高、真实的边缘 Case 难收集。而在真实环境里做强化学习,一旦 Agent 执行了不可逆的“危险操作”,整个环境就崩
阅读全文在 AI for Science 领域,我们一直在思考:蛋白质、小分子、材料和化学反应等科学对象,能不能像人类语言一样,被一个模型统一建模和生成?现状是,AI4S 的主流路径是为每个问题训练一个专家模
阅读全文在具身智能的探索中,我们常面临一个共同的困境:为什么大语言模型能写诗、能 coding,却很难让一台机器人稳稳地拿起一个杯子,或者在陌生的走廊里找到一家咖啡店?因为物理世界是连续、复杂且充满不确定性的
阅读全文当我们谈论“把大模型跑在手机上”时,速度始终是绕不开的核心问题。模型越大、参数越多,推理时的矩阵乘法运算量就越大。随着 Arm 第二代可伸缩矩阵扩展 (SME2) 技术的普及,以及 MNN 推理引擎的
阅读全文让 Agent 改一个按钮、修一个 Bug,今天已不算新闻。但只给它一份调研文档,让它从 0 写出高度还原的完整应用呢?这是一条横跨规划、架构、十几个模块编码、验证、修复的超长程任务:几个小时、成百上
阅读全文在上一期《让手机拥有视觉感知能力》中,我们探讨了如何通过 MCP 架构和端侧语义提取,让大模型安全地“看懂”物理世界。但在实际动手时我们会发现:做端侧 AI App 会伴随一长串的工程问题:Andro
阅读全文通用智能体已经深入真实工作流,能自主完成写代码、处理文件等复杂任务。然而,一旦任务失败,很难界定是模型“没想明白”,还是工具或环境“没配好”。为此,我们推出全新评测基准 PawBench 。它面向个人
阅读全文一款能看、能想、能动手的多模态智能体模型 Qwen3.7-Plus 发布,它不止“看图说话”,更能看懂界面、操作应用、生成代码、交付结果。在 Qwen3.7 强大文本与 Agent 能力的基础上,我们
阅读全文大家在玩 Agent 时,有没有遇到这个痛点,Agent 对物理世界完全是“盲”的,大模型看不到开发板的状态、听不到设备的运行异响,也无法直接获取手机摄像头捕捉的画面。本篇是「手机上的创意AI」挑战
阅读全文当 AI 从“会生图”进化到能替代专业摄影、甚至深度参与艺术创作时,我们该如何评测一个模型的“真实创作能力”?目前业界的文生图(T2I)评测,大多仍局限于基础语义遵循、图像质量或审美打分。但在真实的影
阅读全文开发一个能“跑通 Demo 演示”的智能体并不难。难的是,让它在真实场景里稳定地完成任务。长链路任务中途断裂、工具调用缺乏安全边界、上下文越跑越臃肿、本地脚本难以接入生产环境……这些才是智能体走向落地
阅读全文很多开发者对 AI Agent 的真实体验是:“Demo很惊艳,一上生产就崩溃。”任务稍长就丢上下文,换个框架就性能暴跌,跑几轮就开始“自我循环”……我们需要的是一个能理解意图、规划路径、持续迭代并可
阅读全文训练大模型时,注意力层的计算开销往往是个"隐形瓶颈"。尤其当模型规模越来越大、上下文越来越长时,这部分开销会悄悄吃掉大量算力和时间。自 Qwen3-Next 发布以来,Gated Delta Netw
阅读全文如今,AI 搜索把全网资料塞进几百万 Token 的上下文,大模型要做的就是从中找出正确答案。但让人崩溃的常常是:正确资料喂到嘴边,它要么答错,要么答案碰巧对了,引用的证据却全是错的。问题出在哪?出在
阅读全文精心写好的 Agent,一上线就翻车?不懂行业黑话、乱调 API、业务规则一变策略就失效……手动改 Prompt、换模型、重新部署,维护成本越来越高。静态的工程部署,根本扛不住真实业务的复杂多变。Ag
阅读全文你的家乡话,语音识别能听懂吗?过去,答案是“很难”。方言一出口,转写结果常常是乱码或空白。但这一切正在改变......通义实验室正式推出 Fun-ASR1.5,实现了「方言工业级可用」的语音识别大模型
阅读全文体量轻巧、推理高效,Qwen3.6-35B-A3B 开源!这是一款采用稀疏混合专家(MoE)架构的高效模型:总参数 350 亿,每次推理仅激活 30 亿参数。参数量虽小,性能依旧强劲。在智能体编程上,
阅读全文给大模型接上企业知识库(RAG)已是行业标配。它让 AI 告别“凭空捏造”,回答有据可查。但当知识库从纯文档升级为图文、视频交织的立体资产时,传统方案就开始力不从心了。想象一家制造企业的真实知识库:1
阅读全文蝴蝶效应告诉我们,一次微小的振翅,足以在千里之外引发风暴。但主流强化学习(RLVR)却对推理链上的每个Token一视同仁——它不知道哪一只“蝴蝶”才是关键。如何找到它?通义实验室智能计算团队连发四篇技
阅读全文AI 视频创作,我们常遇到两大难题:内容生成不专业:想要一段紧张的追逐戏,AI 却不懂剧本;想要细腻的微表情,它只会呆板假笑。视频修改困难:多了一个路人,删不掉;动作差了点意思,改不了。换个机位?只能
阅读全文Qwen3.6其他开源尺寸模型和更强大的Qwen3.6Max模型近期发布,敬请期待继今年 2 月发布 Qwen3.5 系列后,今天我们正式推出 Qwen3.6-Plus,现已通过阿里云百炼 API 开
阅读全文