Jev 初体验:一个不生成文本的模型,8 道分类题全对2026/09/23
为了找一段旧对话,我在自己的 Codex 日志里搜「jev」——432 个文件命中,99% 是 base64 噪声,但顺着剩下的真实记录挖出了一个已经配好却没用过的模型:Jev(TypeSafe AI 的 System One 决策模型,
jev-1.13.0)。它不生成文本,只返回带概率的类型化判断(Choice/Noul/Score 三种原语)。本文记录两次实测:连通性检查(noul 判断紧急度 0.95,1.1s)和一次 8 道新闻标题分类实验——8/8 全对、单次调用 0.58s、2052 tokens,包括「OpenAI 发布面向法律的前沿模型产品」这种标题里带「模型」字样的易错题。结论:判断型和生成型不是竞争关系,把「选择题」从大模型的活儿里拆出来给 Jev,又快又便宜又可校准。
22 小时三个模块:我用 Claude Code 把博客从文章站改成 AI 信息站2026/09/23
2026-09-21 14:00 到 09-22 12:26,我用 Claude Code 在 22 小时里给这个 VitePress 博客加了三个内容模块:AI 动态(/news,主源外链+一句话点评)、模型竞技场(/arena,固定 8 题库 × 多模型逐字对答)、产品体验(/products,时间流体验日志+站内文章),6 个功能提交、测试从 31 涨到 45 全绿、本地构建逐次验证后推送 release 上线。本文拆解让这件事变快的真正原因——一个重复四次的「四件套」架构(数据 TS 文件 + 纯函数 utils + md 页面 + 录入 skill),以及比代码更难的部分:诚实规则(答案逐字照录、绝不代写、模型名如实标注)和关卡式工作流。结论:我的角色从写代码的人变成了把关的人,而这才是 AI 时代个人站该有的迭代速度。
DeepSeek Harness 深度评测:两天 9 万 star 的「一切皆插件」,是未来还是过度设计?2026/08/15
DeepSeek 于 2026-08-13 开源的 agent 运行时框架 deepseek-harness(dsh)两天内狂揽 9 万+ star。本文基于对仓库源码的完整探索、与 Pi / Codex CLI / Claude Code / OpenCode 的横向对比,以及对 X、Hacker News 与中文社区数十条真实评价的交叉验证,拆解它「一切皆插件」的 Cordis 内核、Turn/Step 事件化主循环、append-only 会话日志与自我修改工具集等核心原理,并逐条核实社区的好评与质疑:它对日常写代码的人确实「重得没必要」,但为自进化 agent 与多智能体运行时铺设了目前独一份的底层骨架。文末给出明确的选型建议。
从"你提示 Agent"到"系统提示 Agent":Loop Engineering 完整拆解2026/07/08
本文沿着 Prompt → Context → Harness → Loop 的协作演进,完整拆解 Loop Engineering 的来源、六段控制流、验证器、停止条件与三类护栏。文章结合 Ralph Loop、Claude Code /goal 与 /loop、Codex Automations、Karpathy autoresearch 等实践,说明循环真正的新意并非 while 语句,而是把验证、预算、状态与反馈组织成可持续运行的工程系统。最后给出任务决策矩阵和上线路径,强调循环的价值上限取决于一个无法被 Agent 欺骗的验证器。
Agent 的记忆:从无状态模型到持久心智2026/06/04
本文从大语言模型无状态这一根本约束出发,系统拆解 Agent 记忆的 抽取、存储、检索、更新与遗忘 四阶段生命周期,并比较向量、图数据库与文件式记忆等主流架构。文章结合 Mem0、Letta、Graphiti、Codex、Claude Code 等实践,分析被动抽取与主动编辑、数据库派与文件派、长期画像与原始工作记忆之间的关键取舍。最终指出,真正决定记忆系统能否长期运行的,不只是召回能力,而是可审计的维护机制、合并优先策略与基于真实使用的遗忘。
丢掉沉重的记忆:Codex、Claude Code 与 OpenCode 的上下文压缩术2026/04/09
本文以一个 15,400 tokens 的登录 Bug 修复场景为切入点,深入拆解了三款主流 CLI Agent(Codex CLI、Claude Code、OpenCode)的上下文压缩策略。Codex CLI 采用"工作交接单"式的单层摘要替换;Claude Code 设计了三层递进机制——工具结果修剪、Prompt Cache 友好策略和 9 部分结构化 LLM 总结;OpenCode 则以非物理删除的时间戳标记隐藏配合 5 标题 LLM 摘要实现"阶梯治理"。文章揭示了一个核心洞察:最好的上下文管理不是无限扩大记忆容量,而是学会精密地遗忘。
我把 Harness Engineering 也提炼成了 SKILL2026/04/03
笔者分享了将 Harness Engineering 知识提炼为可复用 Agent Skill 的经验。在系统阅读了 Anthropic、OpenAI、Martin Fowler、LangChain 等来源的文章后,提炼出 Harness 设计的七个核心层:项目搭建、上下文工程、约束与防护、多 Agent 架构、评估与反馈、长时间任务、诊断。最终产出的 harness-engineering 技能覆盖三大场景——新项目搭建、Agent 行为诊断、持续改进,采用渐进式披露架构。定量评估显示有技能时断言通过率 100%,无技能时 83%。核心洞察:Agent 表现不好,80% 的原因不在模型,在 Harness。
HUNT0 上线了——尽早发布,尽早发现2026/01/01
HUNT0 是一个面向 maker 和 indie hacker 的社区驱动发布目录,想把“发布”变成一件有仪式感、可被发现、可获得反馈的事:你可以预约发布日期,通过声望加权投票与评论拿到早期反馈,再通过榜单与 Explore(按筛选意图组织)快速发现值得关注的新产品。
v1.0.0 先把核心闭环跑通:launch → discover → vote → discuss → recap/reward。我们做了实时同步投票状态、结构化的提交流程(免费排队 + Premium Launch)、以及提醒/奖项等自动化机制,目标是减少噪音,让早期发现更“有章可循”。
GPT4o生图风格小全2025/04/11
笔者整理了一份详尽的GPT-4o图像生成风格指南,涵盖了多种独特的艺术风格和应用场景。主要包括:
经典艺术风格:吉卜力动画风格、赛博朋克风格、水彩画风格、油画风格、浮世绘风格等
现代创意风格:3D Q版角色、手绘简笔画、像素艺术、Low Poly低多边形、手绘高亮信息卡片等
这些风格可应用于品牌设计、头像生成、儿童绘本、产品原型等多个实际场景。文中还分享了发现新玩法的四个秘籍:利用搜索引擎、社交媒体、专业平台以及反向分析法。通过这些方法,用户可以不断探索和创新,提升提示词使用技巧,创造出更多独特的视觉效果。
本文为读者提供了一个系统化的GPT-4o图像生成参考指南,既可作为入门教程,也适合进阶学习使用。
谷歌 Agent2Agent(A2A)协议深度调研报告2025/04/10
2025年4月,Google在 Cloud Next 2025 大会上正式发布了全新的 Agent2Agent (A2A) 协议。A2A是一个开放的互操作性协议,旨在打破不同AI代理框架和供应商之间的壁垒,实现跨平台的安全高效协作。该协议专为企业环境设计,通过标准化代理之间的通信,解决各类数据孤岛问题,使复杂工作流程的自动化成为可能并提升生产力。
A2A发布时即获得超过50家行业领先企业的支持(如Atlassian、Box、Salesforce、SAP、ServiceNow、MongoDB等),为AI智能体提供了一个通用框架,让不同供应商或架构的代理能够安全交换信息、协调操作,并无缝集成到企业业务中。
这一合作阵容体现出业界对AI代理互操作性的共同愿景:未来无论底层技术如何,AI智能体都能像网络服务一样自由“对话”和协同工作。
- 1
- 2