模型笔记与智能体系统

可以验证的 AI 工程系统

面向需要做工程决策的构建者,聚焦编程智能体、评测、安全边界与供应商变化,区分可核实事实、作者分析和未知项。

浏览全部文章
从这里开始

从 AI 主张走到可评估的工程系统

先理解数据边界,再拆解运行时,最后建立评估方法和供应商退出预案。

01

先界定数据边界

分清保留承诺、安全处理,以及应用仍需自行负责的控制。

阅读指南
02

评估完成的工作

建立同时衡量正确性、安全性、成本与波动的任务集和评分表。

阅读指南
03

为供应商变化做准备

把平台变化转化为可移植性、回退和迁移检查。

阅读指南
全部文章

继续浏览这个主题

01

OpenAI 计划停止向 Cursor 提供模型:开发者应在 11 月 12 日前准备什么

SpaceX 收购 Cursor 后,OpenAI 表示准备终止为其提供模型的合同。本文区分已确认事实与未知项,并给出降低模型供应商锁定风险的迁移清单。

02

腾讯 Hy4 preview 解析:770B 参数和 1M 上下文到底改变了什么

腾讯发布并开源 Hy4 preview。本文根据官方发布信息,梳理 770B/49B 混合专家架构、百万级上下文、接入方式、价格和开发者仍需自行验证的证据边界。

03

OpenAI Private Safety Processing:零数据保留对开发者意味着什么

OpenAI 正在预览面向 Zero Data Retention 部署的安全处理层。本文梳理公告已确认的内容、尚未承诺的部分,以及团队在依赖它之前应核对的事项。

04

如何构建可重复的 LLM Agent 评估

用真实任务、固定 Harness 和可审计指标,判断编程代理是否真的改善了工作,而不是只会生成漂亮回答。

05

Claude 文本水印:检测能力、边界与写作者需要知道的事

Anthropic 表示未来的 Claude 模型会使用不可见的统计水印。真正重要的问题不是检测器能否标记每段文字,而是这个信号究竟能证明什么。

可以验证的 AI 工程系统 — aifincode