CosyVoice 2:基于大型语言模型的可扩展流式语音合成技术
Abstract在我们之前的工作中,我们推出了 CosyVoice 这一多语言语音合成模型,其基于有监督的离散语音标记。通过采用带有两种流行生成模型(语言模型(LMs)和流匹配)的渐进式语义解码技术
阅读全文Abstract在我们之前的工作中,我们推出了 CosyVoice 这一多语言语音合成模型,其基于有监督的离散语音标记。通过采用带有两种流行生成模型(语言模型(LMs)和流匹配)的渐进式语义解码技术
阅读全文编辑部 发自 凹非寺量子位 | 公众号 QbitAI“DeepSeek,评价一下第三届中国AIGC产业峰会”:今年的峰会现场,20余位大咖以「万物皆可AI」为主题,激辩“技术前沿与产业痛点”:2025
阅读全文编辑部 整理自 AIGC峰会量子位 | 公众号 QbitAI多模态生成技术持续突破内容创作的边界。生数作为多模态领域的明星玩家,所提供的技术正推动AI视频创作进入系统性可用新阶段。在本次第三届AIGC
阅读全文克雷西 发自 凹非寺量子位 | 公众号 QbitAI让推理模型不要思考,得到的结果反而更准确?UC伯克利新研究发现,强制要求模型跳过思考过程,推理能力却比正常思考还好。例如在定理证明任务当中,“不思考
阅读全文DeepSeek 发自 凹非寺量子位 | 公众号 QbitAI未来同事,你好~这是一则招聘帖。量子位是一个关注AI及前沿科技的新媒体平台,我们着迷于全新技术和趋势带来的改变,并正致力于帮助更多人第一时
阅读全文今天,我们发布并开源 UI-TARS-1.5,这是一款基于视觉-语言模型构建的开源多模态智能体,能够在虚拟世界中高效执行各类任务。目前,UI-TARS-1.5 已在 7 个典型的 GUI 图形用户界面
阅读全文机器之心报道作者:蛋酱这几天的大模型圈子,特别热闹。凌晨是 OpenAI 的 o3 和 o4-mini,一觉醒来,国内这边的豆包大模型又上新了一波。巧合的是,都是能看懂图像、能调用工具的新一代推理模型
阅读全文机器之心发布机器之心编辑部当春风吹过狮城,ICLR 2025 如约而至,全球技术精英汇聚一堂。从前沿展示到深度对话,再到思想碰撞的夜晚,蚂蚁集团邀你开启一场科技与灵感的奇妙之旅,共同见证技术的力量!蚂
阅读全文本文由南洋理工大学和商汤科技联合完成。第一作者杨沛青为南洋理工大学 MMLab@NTU 在读博士生,在 CVPR、NeurIPS、IJCV 等国际顶级会议与期刊上发表多篇研究成果。项目负责作者为该校研
阅读全文在人工智能快速融入社会各领域的今天,如何培养学生的AI素养已成为教育领域的重要议题。今天读了一篇韩国人写的AI素养框架研究,该研究提出了八大AI素养核心能力框架(包含18个子能力),先不说这些素养、能
阅读全文近期,Stanford大学李飞飞与吴佳俊团队提出全新世界模型基准WorldScore,不仅统一了3D、4D和视频生成模型的评估标准,还揭示了当前“世界生成”技术的核心挑战,包括相机控制能力不足和长序列
阅读全文📆 时间:4月18日周五晚7点📍 地点:上海(具体地点报名后通知)👥 人数:6-7人🎯 人群:大厂、创业公司产品/技术、创业者💡 主题:AI 内容娱乐📆 时间:4月21日周一晚7点📍 地点:深圳(具体
阅读全文图片来源:Windsurf根据彭博社消息,广受欢迎的 AI 编程助手 Windsurf 的开发商正与 OpenAI 洽谈收购事宜,交易金额约为 30 亿美元。若交易达成,OpenAI 将与包括 Any
阅读全文图片来源:UnsplashOpenAI 于4月16日,宣布推出 o3 和 o4-mini 两款新型 AI 推理模型,该公司称 o3 是其迄今为止最先进的推理模型,在数学、编程、推理、科学及视觉理解能力
阅读全文OpenAI 做 Agent,得天独厚。作者丨郑佳美编辑丨马晓宁今天凌晨,奥特曼突然发文宣布推出自家最新的 o 系列模型:满血版 o3 和 o4-mini,同时表示这两款模型都可以自由调用 ChatG
阅读全文最近,豆包大模型发布了系列更新。其中,豆包1.5·深度思考模型在推理任务和通用任务的综合表现达到业界前沿水平,并拥有视觉推理能力;豆包文生图模型3.0登上权威竞技场Artificial Analysi
阅读全文⬇️ 点击查看中选成果 ⬇️🔗蚂蚁集团17篇论文被机器学习顶会ICLR 2025收录,其中一篇入选Spotlight点击下方公众号名片关注蚂蚁集团招聘获取更多AI前沿资讯与顶尖职业机会⬇️ 点击阅读全
阅读全文目前,大模型推理领域的强化学习(如R1-Zero)主要面向数学和代码等任务,将其应用于开放式自然语言生成任务(如,机器翻译),面临着奖励设计困难、推理能力诱导不确定、泛化能力待验证等诸多未知的挑战。针
阅读全文多模态大语言模型(MLLM)作为具身智能(Embodied AI)和自动驾驶(Autonomous Driving)的端到端解决方案已成为主流趋势,并在视觉语义理解任务中取得了显著进展。然而,它们在现
阅读全文合适的工作难找?最新的招聘信息也不知道?AI 求职为大家精选人工智能领域最新鲜的招聘信息,助你先人一步投递,快人一步入职!清华大学 × 生数科技随着生成式人工智能的快速发展,多模态生成模型正引领 AI
阅读全文嘿,大家好!这里是一个专注于前沿AI和智能体的频道~昨天晚上, OpenAI 发布了性能更强的 o3 和 o4-mini 模型。编码能力大幅提升,如下图,SWE-Bench已经接近了claude so
阅读全文今日凌晨 1:33 分, 在我们做梦的时候,OpenAI又更新了!前天是更新 gpt4.1 的 API,昨天是更新了 chatgpt 的图库。而今天的更是 o3 和 o4-mini。更新公告中提到:“
阅读全文整理 | 褚杏娟 今天凌晨,OpenAI 发布了 OpenAI o3 和 o4-mini,是为回答之前思考更长时间而训练。这些推理模型首次实现了自主调用并整合 ChatGPT 内的全量工具:包括网页搜
阅读全文演讲嘉宾|张泽华编辑 |李忠良策划 |AICon 全球人工智能开发与应用大会在京东广告的大模型应用架构中,召回环节至关重要。传统召回方式在规则灵活性和用户需求捕捉上存在局限,而大模型带来了新的契机,但
阅读全文近年来,大语言模型 LLMs 在多种任务上的卓越表现已得到广泛认可。然而,要实现其高效部署,精细的超参数优化至关重要。为了探究最佳超参数的规律,我们开展了大规模的实证研究,通过在不同配置上进行网格搜索
阅读全文在今天凌晨的线上发布会上,OpenAI 一次推出两款全新模型 o3 与 o4‑mini ,并宣布它们立即向 ChatGPT Plus、Pro 与 Team 订阅者开放,引入了可直接“用图片思考”的多模
阅读全文作者|王飞邮箱|wf@pingwest.com在当下的城市生活里,我们每天都在追赶节奏:清晨闹钟响起,日程排满,屏幕闪烁,步履匆匆。我们努力拼搏,渴望更好的生活,但也常常忽略了——真正的“更好”,其实
阅读全文作者|周一笑邮箱|zhouyixiao@pingwest.com距离OpenAI发布GPT-4.1仅仅过去两天,OpenAI在本周再次投下“重磅炸弹”——正式发布了其o系列的两个新模型:o3和 o4-
阅读全文作者|玄宁邮箱|wangzhaoyang@pingwest.com从人们被大模型“震撼”完开始思考如何把这项技术用起来的第一天,教育就是被很多人天然想到的场景。一个能压缩全世界知识的AI,天然就是一个
阅读全文AI 正在深刻变革企业级软件、人才管理与技术文档的运作模式。EntreConnect 隆重邀请多位顶尖产品领袖与创始人,共同探讨 AI 如何重塑企业工作流、提升业务效率,并为下一代智能工具带来全新机遇
阅读全文