别再写提示词小作文了:GPT-5.6 Chat、Work、Codex 应该这样用
> 作者:北辰最近大家是不是每天都在等着 Tibo 刷新 Codex 额度?file 20260720163925647额度到账,打开 GPT-5.6,手放到键盘上,另一个问题又来了:现在到底该怎么写
阅读全文> 作者:北辰最近大家是不是每天都在等着 Tibo 刷新 Codex 额度?file 20260720163925647额度到账,打开 GPT-5.6,手放到键盘上,另一个问题又来了:现在到底该怎么写
阅读全文当我们需要为一个复杂的智能体系统添加新功能或修改现有行为时,面临的第一个挑战往往不是“如何改”,而是“在哪里改”。一个看似简单的需求,其实现代码可能分散在数十个文件、跨越多个执行阶段,并通过共享状态相
阅读全文> 本文来自社区投稿摘要当一个医疗大模型在美国医师执照考试中取得 90% 以上的准确率,这是否意味着它已经具备进入真实医疗场景的能力?近期,Science 发表研究[1]称大模型在多项临床推理任务中匹
阅读全文> 本文来自社区投稿AI Agent 的瓶颈不是能力,是认知——它不知道你会怎么决策今天的 AI Agent 已经能自主执行越来越长的任务链——读代码、定位 bug、生成修复、跑测试、提交 PR,一口
阅读全文在实验室里,一台双机械臂机器人正面对一项新任务:将散落的耳机和充电仓整理收纳。它从未在当前的桌布纹理和特定光照条件下练习过,但任务开始后,机械臂流畅地定位、抓取、放置,最终合上仓盖,一气呵成。这背后,
阅读全文随着人工智能从纯文本迈向多模态时代,我们正见证着智能体能力的巨大飞跃。如今,一个先进的多模态大语言模型不仅能理解文字,还能处理图像、音频甚至视频,并生成融合多种模态的回应。然而,在这令人兴奋的能力背后
阅读全文今天的大模型很擅长说“不”。你问它不该问的事,它会解释边界、提醒风险、建议你换个方向。但有一个问题一直很少被认真讨论:如果请求本身不变,只是换一种更会说话的方式,模型还会坚持拒绝吗?PNAS 最近发表
阅读全文导读:多模态深度搜索要求 Agent 在看图、检索、验证与推理之间持续切换,开源系统却长期受制于数据、环境和奖励彼此割裂。SearchEyes 用 typed knowledge graph 构建统一
阅读全文> 本文编译自外网今年一月我加入 Lovable。在那之前,我每个月大概花 600 美元买 token。进了 Lovable 之后,更大的项目、更大的 scope、以及必要的 token 就该花、不用
阅读全文当我们谈论“世界模拟”时,脑海中浮现的或许是精心设计的游戏关卡,或是影视作品中宏大的虚拟场景。然而,如果有一个系统,能够根据你的指令,实时、无限地生成一个视觉连贯、可交互的生动世界,并且这个世界能够持
阅读全文导读:刚说过的偏好,AI 下次就忘;反复强调的禁忌,它还是照犯。NapMem 的转折在于:它不再把记忆当成几条检索结果,而是让模型主动在用户画像、主题轨迹、记忆记录和原始对话之间查证。更有意思的是,拉
阅读全文AI深入生产核心,用户端的发展方向已十分清晰,智能体将全面渗透产业。长远来看,智能体将演变为类似“AI操作系统”的复杂系统。用户只需下达任务,系统便能自动将任务拆解并协同多个智能体共同完成。可见技术底
阅读全文一台机器人在厨房里准备早餐,它需要从碗中取出面包片放入烤面包机,再将两个小碗叠放到盘子上。这看似简单的任务,却要求机器人具备精准的抓取、稳定的放置、以及多步骤的逻辑规划能力。在实验室的模拟环境中,它或
阅读全文记忆张量MemTensor WAIC 2026 专题论坛嘉宾阵容正式公布。7 月 17 日,记忆张量MemTensor 将在 WAIC 2026 现场,上海世博展览馆 9 号会议室举办《从一次性 Ag
阅读全文在智能助手、实时翻译或客服对话等场景中,用户期望与多模态大模型进行如同真人般的流畅交流:用户一边说话,模型一边理解并生成语音回复,用户甚至可以在模型回复过程中随时打断。这种实时、多轮、支持打断的交互模
阅读全文> 本文转载自「HAMi 社区」 HAMi 晋升 CNCF Incubating 项目2026 年 7 月 2 日,HAMi 正式晋升为CNCF Incubating(孵化) 项目,CNCF 技术监督
阅读全文> 作者:北辰昨天我收到一封 Google Scholar Alerts 邮件,标题是:The Effect of Forecasting and Budgeting Practices on Lon
阅读全文> 本文来自社区投稿导读领域任务不只是缺一个更大的模型。在金融风控、医疗、企业知识库、城市智能和个人设备等场景中,系统既需要大模型的通用知识与推理能力,也需要小模型贴近本地数据、业务流程和部署资源。但
阅读全文> 作者:李剑锋导读:如果你也经常需要讲课、汇报、答辩、面试,或者写一些希望别人认真读完的文章,那么 MIT 经典课程 How to Speak 就非常值得一看。它讲的并不只是“如何演讲”,而是如何把
阅读全文> 本文来自社区投稿摘要设想一条商品 AI 口播视频:主播得是指定的那张脸,手里的商品不能变形,嘴型要跟着声音走,表情和身体节奏也要自然,动作还得严格服从给定的 pose,最后整段画面还要和文本描述对
阅读全文图片由 AI 生成摘要在智能客服、多轮对话等场景中,大语言模型需要处理不断累积的对话历史。为了提升效率,系统通常会缓存历史对话对应的键值对(KV Cache),避免重复计算。然而,随着对话轮次增加,历
阅读全文最近 AI 编程圈里,一个词又开始刷屏了 — Loop Engineering。 Claude Code 的创始人 Boris Cherney 和 OpenClaw 之父 Peter Steinber
阅读全文在学术会议、商业路演或内部汇报中,一份优秀的PPT是成功沟通的关键。然而,从零开始制作一份既专业又符合个人风格的PPT,往往需要耗费大量时间和精力。尽管现有的AI工具已经能够根据文本生成幻灯片,但它们
阅读全文> 本文编译自外网把 SQL parser 重写一遍这种重活儿,听起来不该让 Agent 去干。因为Parser 是典型的"一个字符都不能错"的东西。PostHog 里尤其如此:用户直接写 SQL 查
阅读全文> 本文来自社区投稿视频生成模型(Video Generative Models)是近年最炙手可热的方向。从 Sora、Veo 到 Kling、Seedance,它们能生成以假乱真的画面,对时间动态与
阅读全文> 作者:李剑锋上一篇我们已经完成了视觉大模型的基础概念、环境配置和 Qwen3-VL 调用实战。接下来这一篇会继续沿着工程落地链路往后走,重点放在数据集准备、LoRA 微调、adapter 推理、模
阅读全文SMARTFLOW AI · 前沿洞察OpenAI 把刀,捅向了英伟达的定价权2026 年 6 月 24 日 · OpenAI×Broadcom Jalapeño · 共 7 节一家做模型的公司,开始
阅读全文在电影制作、广告创意或在线教育中,我们或许都曾有过这样的体验:输入一段文字描述,满怀期待地等待AI生成一段视频。传统的视频生成模型,如Sora、Veo等,通常以"离线、一次性"的方式工作:用户提交提示
阅读全文