全部安全开发新闻数码摄影汽车北京AIIT其他
  • 文章封面

    从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 发布

    作者:通义实验室发布日期:2026-07-20 16:53:08

    Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:Flash:面向实时交互,首包延迟在 300ms 左右。Plus:面向高质量生成,在自然度和音色还原度上表现更佳。本次

    阅读全文
  • 文章封面

    Wan-Streamer v0.2:响应延迟仅550ms,让 AI 真正与你"面对面"

    作者:通义实验室发布日期:2026-07-17 15:13:58

    和 AI 打视频电话,卡顿、延迟、声画不同步,是常态。这本质上就是“语音识别 ➡️ 大模型 ➡️ 语音合成 ➡️ 动画驱动”的流水线拼装。环节越多,延迟越高,割裂感越强。但真正的自然交流,应该像和朋友

    阅读全文
  • 文章封面

    Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?

    作者:通义实验室发布日期:2026-07-15 10:30:23

    语音交互的下一个形态是什么?是毫秒级的快速响应?是深度思考的逻辑推理?还是能够感知情绪、像真人般对谈的情感共鸣?如何让语音交互跨越“机械感”走向了“自然和智能”?我们也在持续探索。今天,我们想和大家分

    阅读全文
  • 文章封面

    小有可为AI向善创新挑战赛,启程!

    作者:通义实验室发布日期:2026-07-08 12:15:33

    阅读全文
  • 文章封面

    🔥Fun-ASR-Realtime发布:语音识别再升级!

    作者:通义实验室发布日期:2026-07-06 14:09:34

    阅读全文
  • 文章封面

    Qwen-AgentWorld 开源:让 Agent 学会“先预测,再行动”

    作者:通义实验室发布日期:2026-06-24 11:32:02

    Agent 开发离不开真实环境,但真实环境:成本贵、响应慢、控制难。搭沙箱环境成本高、真实的边缘 Case 难收集。而在真实环境里做强化学习,一旦 Agent 执行了不可逆的“危险操作”,整个环境就崩

    阅读全文
  • 文章封面

    首个统一科学大模型 LOGOS 正式开源

    作者:通义实验室发布日期:2026-06-18 10:31:26

    在 AI for Science 领域,我们一直在思考:蛋白质、小分子、材料和化学反应等科学对象,能不能像人类语言一样,被一个模型统一建模和生成?现状是,AI4S 的主流路径是为每个问题训练一个专家模

    阅读全文
  • 文章封面

    Qwen-Robot 发布:打通大模型到物理世界的最后一公里

    作者:通义实验室发布日期:2026-06-16 14:14:14

    在具身智能的探索中,我们常面临一个共同的困境:为什么大语言模型能写诗、能 coding,却很难让一台机器人稳稳地拿起一个杯子,或者在陌生的走廊里找到一家咖啡店?因为物理世界是连续、复杂且充满不确定性的

    阅读全文
  • 文章封面

    端侧 AI 提速 80%?如何让 Qwen3-VL 在手机起飞

    作者:通义实验室发布日期:2026-06-11 19:43:46

    当我们谈论“把大模型跑在手机上”时,速度始终是绕不开的核心问题。模型越大、参数越多,推理时的矩阵乘法运算量就越大。随着 Arm 第二代可伸缩矩阵扩展 (SME2) 技术的普及,以及 MNN 推理引擎的

    阅读全文
  • 文章封面

    只给一份文档,Qwen3.7-Max 从 0 交付双端应用

    作者:通义实验室发布日期:2026-06-09 17:27:44

    让 Agent 改一个按钮、修一个 Bug,今天已不算新闻。但只给它一份调研文档,让它从 0 写出高度还原的完整应用呢?这是一条横跨规划、架构、十几个模块编码、验证、修复的超长程任务:几个小时、成百上

    阅读全文
  • 文章封面

    Agent 辅助开发,一站式打通 Qwen3-VL Android 端侧推理

    作者:通义实验室发布日期:2026-06-08 17:53:36

    在上一期《让手机拥有视觉感知能力》中,我们探讨了如何通过 MCP 架构和端侧语义提取,让大模型安全地“看懂”物理世界。但在实际动手时我们会发现:做端侧 AI App 会伴随一长串的工程问题:Andro

    阅读全文
  • 文章封面

    PawBench:给通用智能体一把可度量的尺

    作者:通义实验室发布日期:2026-06-05 17:54:27

    通用智能体已经深入真实工作流,能自主完成写代码、处理文件等复杂任务。然而,一旦任务失败,很难界定是模型“没想明白”,还是工具或环境“没配好”。为此,我们推出全新评测基准 PawBench 。它面向个人

    阅读全文
  • 文章封面

    Qwen3.7-Plus:把多模态AI变成“实干家”

    作者:通义实验室发布日期:2026-06-02 01:59:25

    一款能看、能想、能动手的多模态智能体模型 Qwen3.7-Plus 发布,它不止“看图说话”,更能看懂界面、操作应用、生成代码、交付结果。在 Qwen3.7 强大文本与 Agent 能力的基础上,我们

    阅读全文
  • 文章封面

    教程首发|让手机拥有视觉感知能力

    作者:通义实验室发布日期:2026-05-29 17:44:29

    大家在玩 Agent 时,有没有遇到这个痛点,Agent 对物理世界完全是“盲”的,大模型看不到开发板的状态、听不到设备的运行异响,也无法直接获取手机摄像头捕捉的画面。本篇是「手机上的创意AI」挑战

    阅读全文
  • 文章封面

    Qwen-Image-Bench:56 个创作级考点,定义生图评测新标准!

    作者:通义实验室发布日期:2026-05-28 17:47:55

    当 AI 从“会生图”进化到能替代专业摄影、甚至深度参与艺术创作时,我们该如何评测一个模型的“真实创作能力”?目前业界的文生图(T2I)评测,大多仍局限于基础语义遵循、图像质量或审美打分。但在真实的影

    阅读全文
  • 文章封面

    从透明开发到系统工程:AgentScope 2.0 发布

    作者:通义实验室发布日期:2026-05-26 11:56:58

    开发一个能“跑通 Demo 演示”的智能体并不难。难的是,让它在真实场景里稳定地完成任务。长链路任务中途断裂、工具调用缺乏安全边界、上下文越跑越臃肿、本地脚本难以接入生产环境……这些才是智能体走向落地

    阅读全文
  • 文章封面

    Qwen3.7-Max 重新定义 AI Agent 基座

    作者:通义实验室发布日期:2026-05-20 11:04:33

    很多开发者对 AI Agent 的真实体验是:“Demo很惊艳,一上生产就崩溃。”任务稍长就丢上下文,换个框架就性能暴跌,跑几轮就开始“自我循环”……我们需要的是一个能理解意图、规划路径、持续迭代并可

    阅读全文
  • 文章封面

    30W奖池已就位!手机上的创意AI挑战赛,等你瓜分

    作者:通义实验室发布日期:2026-05-19 16:30:00

    阅读全文
  • 文章封面

    FlashQLA:让 Qwen 的注意力层跑得更快

    作者:通义实验室发布日期:2026-04-29 19:07:56

    训练大模型时,注意力层的计算开销往往是个"隐形瓶颈"。尤其当模型规模越来越大、上下文越来越长时,这部分开销会悄悄吃掉大量算力和时间。自 Qwen3-Next 发布以来,Gated Delta Netw

    阅读全文
  • 文章封面

    搜对≠答对:EAPO用“证据奖励”让大模型不再靠猜

    作者:通义实验室发布日期:2026-04-27 17:55:40

    如今,AI 搜索把全网资料塞进几百万 Token 的上下文,大模型要做的就是从中找出正确答案。但让人崩溃的常常是:正确资料喂到嘴边,它要么答错,要么答案碰巧对了,引用的证据却全是错的。问题出在哪?出在

    阅读全文
  • 文章封面

    Qwen3.6-27B:无需MoE路由,旗舰级编程能力

    作者:通义实验室发布日期:2026-04-22 21:00:00

    阅读全文
  • 文章封面

    我的 Agent 又乱调工具了!

    作者:通义实验室发布日期:2026-04-21 17:22:03

    精心写好的 Agent,一上线就翻车?不懂行业黑话、乱调 API、业务规则一变策略就失效……手动改 Prompt、换模型、重新部署,维护成本越来越高。静态的工程部署,根本扛不住真实业务的复杂多变。Ag

    阅读全文
  • 文章封面

    敢不敢用家乡话测试这个 AI?

    作者:通义实验室发布日期:2026-04-20 14:01:57

    你的家乡话,语音识别能听懂吗?过去,答案是“很难”。方言一出口,转写结果常常是乱码或空白。但这一切正在改变......通义实验室正式推出 Fun-ASR1.5,实现了「方言工业级可用」的语音识别大模型

    阅读全文
  • 文章封面

    Qwen3.6-35B-A3B 开源!

    作者:通义实验室发布日期:2026-04-16 21:22:14

    体量轻巧、推理高效,Qwen3.6-35B-A3B 开源!这是一款采用稀疏混合专家(MoE)架构的高效模型:总参数 350 亿,每次推理仅激活 30 亿参数。参数量虽小,性能依旧强劲。在智能体编程上,

    阅读全文
  • 文章封面

    5句AI时代的心里话,哪句戳中了你?

    作者:通义实验室发布日期:2026-04-10 15:50:56

    阅读全文
  • 文章封面

    图文视频All in One!一个开源框架搞定全模态知识库

    作者:通义实验室发布日期:2026-04-09 17:30:00

    给大模型接上企业知识库(RAG)已是行业标配。它让 AI 告别“凭空捏造”,回答有据可查。但当知识库从纯文档升级为图文、视频交织的立体资产时,传统方案就开始力不从心了。想象一家制造企业的真实知识库:1

    阅读全文
  • 文章封面

    FIPO:精准追踪2%的Token,突破大模型推理瓶颈!

    作者:通义实验室发布日期:2026-04-07 17:32:43

    蝴蝶效应告诉我们,一次微小的振翅,足以在千里之外引发风暴。但主流强化学习(RLVR)却对推理链上的每个Token一视同仁——它不知道哪一只“蝴蝶”才是关键。如何找到它?通义实验室智能计算团队连发四篇技

    阅读全文
  • 文章封面

    热浪中的每个“我”:一场关于AI与人的年度对话

    作者:通义实验室发布日期:2026-04-07 17:32:43

    阅读全文
  • 文章封面

    Wan2.7-Video 为创作自由而来

    作者:通义实验室发布日期:2026-04-03 14:14:07

    AI 视频创作,我们常遇到两大难题:内容生成不专业:想要一段紧张的追逐戏,AI 却不懂剧本;想要细腻的微表情,它只会呆板假笑。视频修改困难:多了一个路人,删不掉;动作差了点意思,改不了。换个机位?只能

    阅读全文
  • 文章封面

    Qwen3.6-Plus:编码智能体能力全面跃升!

    作者:通义实验室发布日期:2026-04-02 12:32:37

    Qwen3.6其他开源尺寸模型和更强大的Qwen3.6Max模型近期发布,敬请期待继今年 2 月发布 Qwen3.5 系列后,今天我们正式推出 Qwen3.6-Plus,现已通过阿里云百炼 API 开

    阅读全文
下一页