写 Claude Skill 最大的盲区,Anthropic 终于帮你补上了
Anthropic 更新 skill-creator,把软件工程的测试、基准评估和迭代改进搬进 Skill 开发。本文讲解如何用 eval 取代凭感觉判断,验证 Skill 是否真正起作用、判断触发时机并做多 Agent 并行 A/B 对比。
ARCHIVE / INDEX
按时间与主题浏览长期积累的技术文章。
Anthropic 更新 skill-creator,把软件工程的测试、基准评估和迭代改进搬进 Skill 开发。本文讲解如何用 eval 取代凭感觉判断,验证 Skill 是否真正起作用、判断触发时机并做多 Agent 并行 A/B 对比。
装完 OpenClaw 不知道怎么用?本文分享 AI 日报自动生成、调度 Codex 与 Claude Code、打造第二大脑、内容创作工厂、K8s 安全部署等进阶玩法,帮你把 OpenClaw 从聊天机器人变成真正干活的 Agent。
本文编译自 OpenAI 工程博客,深入讲解 Codex CLI 的 Agent Loop 实现细节,包括 Prompt 构建、模型推理、工具调用、上下文管理和性能优化。
本文编译自 Anthropic 工程博客,系统介绍 AI Agent 评估体系的构建方法,包括评估类型、评分器设计、不同类型 Agent 的评估策略以及从 0 到 1 的实操路线图。
Notion CEO Ivan Zhao 长文《蒸汽、钢铁与无限心智》全文翻译,通过类比钢铁与蒸汽机的历史,探讨 AI 作为这个时代的奇迹材料如何重塑知识工作,从提升个人效率到改变组织形态乃至重构经济结构。
解读 Anthropic《2026 State of AI Agents Report》,报告调研 500 多家企业,发现 57% 已部署多阶段工作流 Agent、80% 看到投资回报、90% 使用 AI 辅助编程,揭示 AI Agents 从试点走向规模化落地的真相。
OpenAI 工程师用 Codex 在 28 天、50 亿 tokens 内做出生产级 Sora 安卓应用,本文提炼其四步方法:把 AI 当新员工培训、用计划文档引导长任务、让多个 AI 并行工作、重新定位人的角色。
OpenAI、Anthropic 联合 Block 成立 Agentic AI 基金会并把核心开源项目捐给 Linux Foundation,本文类比当年 CNCF 统一容器编排的历史,解读这场合作背后争夺 AI Agent 标准话语权的野心。
Codex CLI v0.65.0 开始支持 Skills,本文说明它为什么能缓解 MCP 带来的上下文膨胀,介绍 Codex 中 Skills 的用法、我迁移的技能包以及目前还存在的小问题。
Google Cloud 实验环境跑通 13 万节点 GKE、AWS 支持 10 万节点 EKS,本文从 xAI、Meta、Anthropic 的算力竞赛切入,剖析云厂商如何为大模型训练重塑超大规模 Kubernetes 集群的底层基础设施。