可能是目前效果最好的开源生图模型,混元生图3.0来了
允中 发自 凹非寺量子位 | 公众号 QbitAI腾讯混元最新发布并开源原生多模态生图模型——混元图像3.0(HunyuanImage 3.0)!模型参数规模高达80B,是目前参数量最大的开源生图模型
阅读全文允中 发自 凹非寺量子位 | 公众号 QbitAI腾讯混元最新发布并开源原生多模态生图模型——混元图像3.0(HunyuanImage 3.0)!模型参数规模高达80B,是目前参数量最大的开源生图模型
阅读全文闻乐 发自 凹非寺量子位 | 公众号 QbitAI距第二篇研究仅过去三天,Thingking Machines发布了第三篇研究博客。核心作者是OpenAI联创之一John Schulman。Thing
阅读全文闻乐 发自 凹非寺量子位 | 公众号 QbitAIAI生成第三视角视频已经驾轻就熟,但第一视角生成却仍然“不熟”。为此,新加坡国立大学、南洋理工大学、香港科技大学与上海人工智能实验室联合发布EgoTw
阅读全文新智元报道 编辑:KingHZ 艾伦【新智元导读】AI Agent赋能出行领域,将带来怎样的全新体验?滴滴给出了自己的答案,于近日面向公众内测上线了小滴这款打车Agent,颠覆了滴滴自己亲手开创
阅读全文新智元报道 编辑:元宇【新智元导读】LoRA能否与全参微调性能相当?在Thinking Machines的最新论文中,他们研究了LoRA与FullFT达到相近表现的条件。Thinking Mac
阅读全文新智元报道 编辑:倾倾【新智元导读】别再吐槽GPT-5变笨了!OpenAI最新发布的提示工程指南,揭秘了一套调教prompt。用对了之后,它就能从偶尔靠谱,变成稳定、高效、甚至补漏收尾的全能搭档
阅读全文🔥今年年初春节期间我们举办了「HF论文茶话会」在社区受到广泛关注,这个国庆假期我们将举办国庆假期Hugging Face八日游活动,将和大家一起盘点2025 年第 3 季度 Hugging Face
阅读全文近日,豆包P图引发广泛关注网友踊跃分享各类玩法如阳光氛围、俯拍合照、水下写真等等通过豆包 Seedream 4.0修图方式更加多样,效果提升明显一张平平无奇的照片发给豆包再输入一段提示词,秒变写真大片
阅读全文在人工智能的研究中,我们关心的是在序贯决策里如何实现长期目标的最优化;然而,一旦缺乏全局校正,哪怕每一步看似合理,仍可能在错误前提上越走越偏。在多步骤任务中,Agent 可能由于对指令的误解、知识的缺
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......9月25日晚,雷军发布了小米的最新顶级旗舰,小米17 Pro Max。作为“对标”iPhone
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......9 月 29 日消息,好多网友在微博、小红书这些社交平台上晒图,说字节跳动家的豆包输入法,iOS
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......大家晚上好呀!最近小编整理手机文件时头都大了,尤其是从蓝奏云上下资源,总得上电脑登录,有时候出门
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......这一次,特斯拉“翻车”了!根据官方信息,特斯拉 Cybertruck 后轮驱动版(入门版)被移除
阅读全文👆👆👆重要提醒!微信推荐机制大幅调整,大家务必将我们公众号设为★星标,否则很可能看不到推送了......黄金周已进入最后的倒计时。最近我在准备假期自驾游出行,一直有在看高德扫街榜推荐的餐厅和路线,觉得
阅读全文英特尔正通过其 XPU 混合架构、AI 算力以及开放的软件生态来引领这一趋势。作者丨马晓宁编辑丨陈彩娴AI PC 市场的竞争正在升温,格局也在重塑。无论是对于终端 AI 的讨论,还是智能硬件的热潮,其
阅读全文机器之心报道机器之心编辑部新一代大模型的发布,都赶在了国庆假期前。昨天,深度求索刚刚开源 DeepSeek-V3.2-Exp。今天,另一国产大模型之光智谱 AI 也正式发布了旗下新一代旗舰模型 GLM
阅读全文机器之心发布机器之心编辑部2025年9月17日,中国科学院香港创新研究院人工智能与机器人创新中心(CAIR)在香港正式开源发布其最新科研成果——EchoCare“聆音”超声基座大模型(简称“聆音”)。
阅读全文面向自动驾驶的多模态大模型在 “推理链” 上多以文字或符号为中介,易造成空间 - 时间关系模糊与细粒度信息丢失。FSDrive(FutureSightDrive)提出 “时空视觉 CoT”(Spati
阅读全文我花了很多时间写代码。有些日子 coding 很开心,有些日子我只是盯着文档,复制粘贴一些 boilerplate 代码。写代码无聊的部分不是解决问题,而是搭建环境、把各种组件连起来,或者把研究成果转
阅读全文Qwen3-LiveTranslate-Flash 是一款基于大语言模型的高精度、高响应、高鲁棒性的多语言实时音视频同传模型。依托Qwen3-Omni强大的基座能力、海量多模态数据、百万小时音视频数据
阅读全文三则消息(你懂的)本文发出时,GLM-4.6 已上线,大提升,马上开源寒武纪(寒王),已实现 GLM-4.6 的 FP8+Int4 混合量化部署摩尔线程,已实现原生 FP8 精度稳定跑 GLM-4.6
阅读全文打平全参,还是效率掉队?这是围绕 LoRA 最大的争议。Thinking Machines 团队通过系统化实验与工程级配方,首次证明:在后训练的典型规模下,LoRA 并不是玄学调参,而是能被科学刻画、
阅读全文“玛娜生态,末日废土,跑得最快的噬极兽。”在《灵笼》的世界里,谁更适应环境,谁就活下来——“跑得最快”的物种在废土中率先突围。现在,科学家把这条自然法则搬进现实的设计室:把俄罗斯方块当作可拼接的“器官
阅读全文现有多模态大模型(LMMs)在复杂多样的 OCR 任务中表现如何?华中科技大学、华南理工大学、阿德莱德大学和字节跳动联合推出新一代 OCR 评测基准 OCRBench v2,并发布最新私有数据榜单(2
阅读全文作者|亚当·图兹编辑|李婧滢本文首发于巴伦APP科技巨头与特朗普政府的同频,堪称后者第二任期最令人意外的现象之一。对于那些在华盛顿,或在特朗普出访英国、海湾时簇拥而来的科技巨头,我们当然可以从意识形态
阅读全文图片来源:YoutubeZ Highlights当时感觉这个领域几乎没有人真正认真对待这个方向——他们的产品虽然很棒,可能只是稍作改进,但并没有真正朝着一个世界努力:在那个世界里,今天我们所知道的编码
阅读全文⚡ RL 的转折点:从“小众”到“突破口”在过去,RL 常被视为“小众方向”,更多停留在论文与模拟环境。但今天,随着 LLM 发展接近瓶颈,RL 已经成为推动 reasoning、决策智能与复杂场景交
阅读全文专注AIGC领域的专业社区,关注微软&OpenAI、百度文心一言、讯飞星火等大语言模型(LLM)的发展和应用落地,聚焦LLM的市场研究和AIGC开发者生态,欢迎关注!苹果公司的研究人员用一个叫Simp
阅读全文