Agent RFT 深度解析:如何让 AI 智能体自我进化
OpenAI 在 Build Hour 分享的 Agent RFT 强化微调走了一条与人工调 Prompt 完全不同的路,让 Agent 在真实任务中试错、对了奖励错了惩罚,从而自我进化找到最优路径,本文是视频学习笔记与要点梳理。
ARCHIVE / INDEX
按时间与主题浏览长期积累的技术文章。
OpenAI 在 Build Hour 分享的 Agent RFT 强化微调走了一条与人工调 Prompt 完全不同的路,让 Agent 在真实任务中试错、对了奖励错了惩罚,从而自我进化找到最优路径,本文是视频学习笔记与要点梳理。
谷歌正式发布 Gemini 3.0 Pro 预览版,登顶 LMArena 并在 MathArena、ScreenSpot、ARC-AGI-2、人类终极考试等基准上大幅超越 GPT-5.1 和 Claude Sonnet 4.5,本文实测其编程与界面克隆能力表现。
解读 CNCF 在 KubeCon NA 发布的最新技术雷达报告,聚焦 AI 推理工具与引擎、机器学习编排以及 Agentic AI 平台三大领域,基于 300 多位开发者的真实体验给出 Adopt、Trial、Assess、Hold 分级与技术选型参考。
KubeCon NA 2025 上 Google 发布开源项目 Agent Sandbox,专为 AI Agent 代码执行设计,解决传统容器隔离不足、提示词注入风险以及数千沙箱快速创建销毁等难题,本文剖析其由来与 Kubernetes 的智能体演进。
AI Agent 处理复杂任务时为什么总是断片健忘?本文结合 Chroma 上下文腐烂实验和 Manus、Anthropic、Cursor 等团队的实战经验,用管理计算机内存的思路讲清上下文工程的缓存、压缩与筛选方法。
Anthropic 工程团队发现让 Agent 写代码调用工具,可把上千工具带来的上下文爆炸从 15 万 token 降到 2 千,效率提升 98.7%,本文解析这一被称为 Code Mode 的新范式如何顺带解决 PII 脱敏、状态持久化与技能复用。
解读上海交大 28 页论文《Context Engineering 2.0》,从熵减这一全新视角阐释上下文工程的本质是弥合人机认知差距,回溯二十年发展历程,说明写 Prompt、调 RAG、设计 Agent 其实都在帮机器理解人的意图。
Google Gemini 借助 Canvas 模式支持一句话自动生成 PPT,上传网络文章或学术论文即可提取要点生成幻灯片并导出到 Google Slides,本文实测其效果、风格与图表不能自动嵌入等使用细节。
解析 Anthropic 推出的 Claude Skills,讲清 SKILL.md、参考文档与可执行代码的组成,以及渐进式披露如何省 Token,并演示在 Claude 应用、API 和 Claude Code 中的用法。
Karpathy 开源 nanochat,用约 8000 行代码复刻完整的 ChatGPT 全栈流程,涵盖分词器、预训练、微调、推理到 WebUI,租 8 卡 H100 训练 4 小时、成本约 100 美元就能得到一个可读可 hack 的对话模型。