Agent RFT 深度解析:如何让 AI 智能体自我进化
OpenAI 在 Build Hour 分享的 Agent RFT 强化微调走了一条与人工调 Prompt 完全不同的路,让 Agent 在真实任务中试错、对了奖励错了惩罚,从而自我进化找到最优路径,本文是视频学习笔记与要点梳理。
ARCHIVE / INDEX
按时间与主题浏览长期积累的技术文章。
OpenAI 在 Build Hour 分享的 Agent RFT 强化微调走了一条与人工调 Prompt 完全不同的路,让 Agent 在真实任务中试错、对了奖励错了惩罚,从而自我进化找到最优路径,本文是视频学习笔记与要点梳理。
谷歌正式发布 Gemini 3.0 Pro 预览版,登顶 LMArena 并在 MathArena、ScreenSpot、ARC-AGI-2、人类终极考试等基准上大幅超越 GPT-5.1 和 Claude Sonnet 4.5,本文实测其编程与界面克隆能力表现。
解读 CNCF 在 KubeCon NA 发布的最新技术雷达报告,聚焦 AI 推理工具与引擎、机器学习编排以及 Agentic AI 平台三大领域,基于 300 多位开发者的真实体验给出 Adopt、Trial、Assess、Hold 分级与技术选型参考。
KubeCon NA 2025 上 Google 发布开源项目 Agent Sandbox,专为 AI Agent 代码执行设计,解决传统容器隔离不足、提示词注入风险以及数千沙箱快速创建销毁等难题,本文剖析其由来与 Kubernetes 的智能体演进。
AI Agent 处理复杂任务时为什么总是断片健忘?本文结合 Chroma 上下文腐烂实验和 Manus、Anthropic、Cursor 等团队的实战经验,用管理计算机内存的思路讲清上下文工程的缓存、压缩与筛选方法。
Anthropic 工程团队发现让 Agent 写代码调用工具,可把上千工具带来的上下文爆炸从 15 万 token 降到 2 千,效率提升 98.7%,本文解析这一被称为 Code Mode 的新范式如何顺带解决 PII 脱敏、状态持久化与技能复用。
解读上海交大 28 页论文《Context Engineering 2.0》,从熵减这一全新视角阐释上下文工程的本质是弥合人机认知差距,回溯二十年发展历程,说明写 Prompt、调 RAG、设计 Agent 其实都在帮机器理解人的意图。
开源项目 MCP AI Hub 通过 LiteLLM 把 Claude Code、Codex 等 Agent 工具一键接入 100+ AI 模型,只需在配置文件里填好 API Key,就能在同一工具里自由切换 OpenAI、Anthropic、Google 各家模型,本文分享项目由来与使用方法。
AKS 团队在 KubeCon India 发布了首个 Kubernetes AI Agent,也就是 AKS CLI Agent,它基于开源 HolmesGPT 和 AKS MCP 服务构建,把安全智能的 Agentic 运维诊断工作流直接带到终端。
整理自 AKS 官方博客,介绍开源的 AKS MCP 服务如何通过标准化 MCP 协议深度集成 AKS API,让 AI Agent 直接诊断集群健康、分析网络配置并智能扩缩容,赋予云原生运维原生 AI 能力。