一行代码让小模型干翻GPT-5.5!把AI逼成程序员自己修Bug,这篇神仙论文火了
大道至简:让AI智能体通过“读文件”实现极速自我进化想象一下,你雇佣了一个绝顶聪明的实习生(AI大模型)。为了让他做好工作,你给了他一本《工作手册》(技能提示词)和一套办公软件(运行框架/工具)。然而
阅读全文大道至简:让AI智能体通过“读文件”实现极速自我进化想象一下,你雇佣了一个绝顶聪明的实习生(AI大模型)。为了让他做好工作,你给了他一本《工作手册》(技能提示词)和一套办公软件(运行框架/工具)。然而
阅读全文过去一年,很多人对大模型的期待已经变了。以前我们关心的是:它会不会写文案、能不能回答问题、代码补全准不准。现在真正有价值的问题变成了:它能不能接住一个复杂任务?能不能读完整个项目?能不能自己查资料、写
阅读全文一、 论文速览论文名片论文标题: From AGI to ASI(从通用人工智能到超级人工智能)论文网址:https://arxiv.org/pdf/2606.12683作者团队: Tim Genew
阅读全文一、 论文速览论文名片论文标题: SkillOpt: Executive Strategy for Self-Evolving Agent Skills(SkillOpt:面向自我进化智能体技能的执行
阅读全文一、 论文速览论文名片论文标题:Self-Compacting Language Model Agents (具备自我压缩能力的语言模型代理)论文网址:https://arxiv.org/pdf/26
阅读全文原文链接:https://claude.com/blog/getting-started-with-loops很多人用 AI 编程工具时,都会遇到一个相似的尴尬:你让它改一个功能,它确实改了;你让它跑
阅读全文原文链接:https://claude.com/blog/steering-claude-code-skills-hooks-rules-subagents-and-more很多团队刚开始用 AI 编
阅读全文过去一年,很多人使用 AI 编程工具的方式都很相似:打开工具,输入需求,然后期待模型一次性给出代码。刚开始这确实很惊艳,但用久之后,问题也会越来越明显:同一个项目里,你每次都要反复告诉它项目怎么启动、
阅读全文一、论文速览在正式开启硬核科普之前,我们先来认识一下今天的主角——一篇试图改变人工智能阅读长文档方式的重磅技术报告。论文基本信息论文标题:UnlimitedOCRWorks: Welcome the
阅读全文一、论文速览1. 论文基本信息论文标题: DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Gene
阅读全文一、论文速览论文标题: PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions(Phone
阅读全文一、 论文速览论文名片论文标题: HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry(HarnessX:一个可组
阅读全文一、论文速览论文名片论文标题: Co-Evolving Skill Generation and Policy Optimization(技能生成与策略优化的协同进化,简称 SAPO )论文网址:ht
阅读全文一、 论文速览在我们还在惊叹于AI能熟练使用各种工具(比如调用天气API、使用计算器)的时候,全球顶尖的AI研究团队已经把目光投向了下一个更具革命性的命题: 如果世界上还没有现成的工具,AI能不能自己
阅读全文过去两年,我们对 AI Agent 的理解,大多还停留在一个很熟悉的画面里:你打开一个聊天窗口,输入一个目标,Agent 开始思考、调用工具、生成代码、修改文件。你看着 token 一行行流出来,如果
阅读全文这两年,很多人都在学习怎么更好地使用 AI 写代码。一开始,大家最关注的是一件事:Prompt 到底怎么写?怎么描述需求?怎么补充上下文?怎么一步一步追问?怎么让 AI 输出更稳定、更像你想要的样子?
阅读全文一、 论文速览论文名片论文标题 :《Code as Agent Harness: Toward Executable, Verifiable, and Stateful Agent Systems》(
阅读全文一、 论文速览论文名片论文标题: Task-Focused Memorization for Multimodal Agents(多模态智能体的任务导向型记忆)论文网址:https://arxiv.o
阅读全文一、 论文速览论文名片论文标题: CL-BENCH LIFE: CAN LANGUAGE MODELS LEARN FROM REAL-LIFE CONTEXT? (CL-bench Life:语言模
阅读全文距离 Opus 4.7 仅 41 天,Anthropic 于 2026 年 5 月 28 日推出旗舰迭代 Claude Opus 4.8。定价不变,却在代码诚实性、代理工作流和速度调控等维度带来了可感
阅读全文一、 论文速览论文名片论文标题 :Adapting the Interface, Not the Model: Runtime Harness Adaptation for Deterministic
阅读全文一、论文速览论文名片论文标题: Perception or Prejudice: Can MLLMs Go Beyond First Impressions of Personality?(是感知还是
阅读全文一、 论文速览论文名片论文标题: SkillOS: Learning Skill Curation for Self-Evolving Agents(SkillOS:为自我进化智能体学习技能管理)论文
阅读全文一、论文速览1. 基本信息论文标题: HARNESSAPI: A SKILL-FIRST FRAMEWORK FOR UNIFIED STREAMING APIS AND MCP TOOLS(Harn
阅读全文一、 论文速览论文标题:SkillEvolver: Skill Learning as a Meta-Skill (SkillEvolver:将“学习技能”本身作为一种元技能)论文网址:https:/
阅读全文论文速览论文标题: SKILLGEN: Verified Inference-Time Agent Skill Synthesis(SKILLGEN:经过验证的推理时智能体技能合成)论文网址:http
阅读全文论文名片论文标题: MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory(MemEye:一个以视觉为中心的
阅读全文一、核心摘要论文基本信息论文标题: AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents(A
阅读全文相关推荐:AI 视觉领域的“O1 时刻”来了?让模型从“看图”进化到“推理”,智谱做对了什么?太猛了!仅0.9B参数干翻千亿大模型,智谱GLM-OCR凭什么成为“地表最强”小钢炮?被老外误认成Clau
阅读全文一、 核心摘要论文标题:Large Vision–Language Models Get Lost in Attention (大型视觉-语言模型在注意力中迷路了)论文网址:https://arxiv
阅读全文