VC从感觉到工程

工具介绍 · Lesson 01

模型地图:先看最新模型,再选工具

以 2026 年 7 月快照认识 Claude、OpenAI、Gemini、DeepSeek、GLM 和 Kimi,再把模型接入 Agent 与企业工作流。

约 16 分钟模型地图 / 闭源模型 / 开放权重 / 选型

完成后你能:

  • 区分国外闭源服务与中国开放权重模型
  • 按能力、部署、数据和成本比较模型,而不是迷信总榜
  • 为企业 OpenAI 兼容 API 选择可验证的模型候选

这门课从模型开始,但不把“最新”理解成一张永远正确的排行榜。本页是 2026 年 7 月的模型地图快照:模型名称、价格、上下文上限、Preview 状态和 API 别名都会变化,真正接入企业项目之前要重新核对官方文档。

先分清两种交付方式

类别 本课选取 常见交付方式 先问企业什么
国外闭源服务 Claude、OpenAI、Gemini 厂商 API、托管控制台、配套 Agent 产品 数据是否出境、保留多久、区域与合规范围是什么?
中国开放权重模型 DeepSeek、GLM、Kimi 官方 API、开放权重、企业自建推理服务 具体模型的许可证、显存、推理引擎和运维谁负责?

“开源模型”在口语中经常混用。更准确的说法是:开放权重不等于所有训练数据、代码和服务条款都开放。部署前以对应模型卡和许可证为准,不要只因为模型文件可以下载,就默认它适合商业使用。

国外闭源三家

以下是入门时需要认识的家族,不是强弱排序。每一家的版本会交替更新,选择时应使用稳定的、明确写入项目配置的模型 ID。

家族 2026 年 7 月可先认识的型号 更适合拿来观察什么 企业接入时核对
Claude Claude Fable 5 面向最复杂的长周期 Coding;Claude Sonnet 5 面向规模化 Agent/Coding 长任务、代码库理解、工具调用和持续的 Agent 工作 API 区域、数据处理条款、上下文与用量上限、Claude Code 的权限边界
OpenAI GPT-5.6 Sol / Terra / Luna:复杂专业任务、能力/成本平衡、高吞吐三种取向 Responses API、结构化工具调用、后台任务与多 Agent 编排 使用稳定模型 ID 还是别名、数据控制、速率限制、是否需要特定区域
Gemini Gemini 3.6 Flash 稳定高性价比;Gemini 3.5 Flash 面向持续 Agent/Coding;Gemini 3.1 Pro 仍是 Preview 多模态输入、长上下文、Agentic Coding,以及 Stable/Preview 的生命周期差异 Preview 是否允许生产使用、模型弃用通知、配额、输入数据的保留策略

闭源模型的优势是开箱即用、服务商负责推理基础设施;代价是模型权重不可审计,网络、账号、数据处理和供应商变更都会成为工程约束。

中国开放权重三家

这里保留你在课程中指定的三个家族。它们通常同时提供 API 与可下载的权重,但每个版本的许可证和部署要求可能不同。

家族 当前应先认识的型号 典型能力与形态 部署提醒
DeepSeek DeepSeek-V4-Pro / V4-Flash(可从官方 V4 模型集合核对版本) 推理与 Coding 家族;同时提供 API 和开放权重版本 许可证以具体模型卡为准,显存、量化、vLLM/SGLang 支持要单独验证;旧的 deepseek-chatdeepseek-reasoner 别名正在退场
GLM GLM-5.2 模型卡GLM-4.7 文档仍是 Coding Agent 的重要参考 长上下文、推理和终端 Agent;既可走 Z.ai API,也可按模型卡自部署 不要把 API 的可用型号当成可本地部署型号;核对 MIT 或其他许可证、硬件与推理引擎版本
Kimi Kimi K2.7-Code 模型卡Kimi K2.5 官方仓库 面向 Coding Agent 的开放权重路线,支持视觉/视频与 OpenAI、Anthropic 兼容 API K2 家族更新很快;固定版本前先看模型卡、上下文长度、preserve_thinking 行为和 vLLM/SGLang/KTransformers 要求

开放权重的真正价值不只是“免费”:它让企业可以评估权重、选择推理服务商、在内网部署或做蒸馏与量化。与此同时,GPU 预算、升级责任、许可证解释和安全补丁也从供应商转移到了团队。

用场景选候选,不做总榜

场景 可以先放进评估集的候选 需要实测的指标
代码库理解、长任务 Agent Claude Opus、GPT-5.6 Sol、Gemini 3.5 Flash、DeepSeek V4-Pro、GLM-5.2、Kimi K2.7-Code 任务完成率、工具调用是否稳定、失败后能否恢复
高频、成本敏感的自动化 GPT-5.6 Luna、Gemini 3.6 Flash,以及对应的开放权重 Flash/量化版本 首 token 延迟、吞吐、单任务总 token、并发时的错误率
内网或专有数据 DeepSeek、GLM、Kimi 的开放权重版本 最小 GPU 配置、许可证、日志是否留在内网、升级与回滚方案
多模态需求 Gemini 系列、Kimi K2 家族,以及企业批准的闭源视觉模型 图片/视频输入限制、工具调用、敏感数据脱敏效果

这张表只是候选集。不要用供应商自己的“最强模型”描述代替评测。用同一批真实任务、同一套工具定义和同一套验收标准跑小型基准,才知道某个模型是否适合你的项目。

模型、Agent、Skill 是三层

回答的问题 例子
模型 谁负责理解与生成? Claude、GPT、Gemini、DeepSeek、GLM、Kimi
Agent / Harness 谁组织上下文、调用工具、循环执行? OpenCode、Claude Code、Codex CLI、Kimi Code CLI
Skill 如何把上下文、步骤和验收标准封装成可复用能力? SKILL.md、团队工作流、项目规范

同一个模型放进不同 Agent,使用体验和安全边界可能完全不同;同一个 Agent 连接不同模型,能力、速度和成本也会变化;Skill 则决定团队经验能否稳定复用。后面的课程会把模型选择落实为 VIBE_BASE_URLVIBE_API_KEY<MODEL_ID>,而不是把密钥写进仓库。

MCP 与 Subagent 不是第四、第五种模型层。MCP 位于 Agent 的工具连接边界,让它访问外部工具和数据;Subagent 位于 Agent 的任务编排内部,让主 Agent 把一部分工作交给独立上下文处理。工具介绍为它们分别安排了 Agent 与 SubagentMCP独立章节。

两种常见工具形态

编辑器型:看得见、改得近

Visual Studio Code + GitHub Copilot、Cursor 与 TRAE 把聊天、补全和多文件修改放在编辑器中。优点是文件、Diff 和诊断信息都在熟悉的界面里;缺点是产品通常与特定编辑器生态、账号体系或云服务绑定。

适合:已经习惯图形化 IDE、需要频繁手工调整代码的人。

终端型:组合自由、离工程最近

OpenCode、Claude Code、Codex CLI 与 Kimi Code CLI 直接在项目终端工作。它们天然能够使用 Git、测试命令和脚本;其中 OpenCode 还能连接企业提供的 OpenAI-compatible 模型 API。

适合:Linux 环境、模型需要替换、希望把工作流写成脚本或规则的团队。

为什么本教程选择 OpenCode

本教程的客户环境已经提供 OpenAI 兼容 API。OpenCode 的价值不在于“永远排名第一”,而在于它是开源终端 Agent,模型提供商可配置,适合 Linux 和企业模型网关。

我们的主线因此是:

企业模型 API → OpenCode → 本地项目 → Git 与测试 → GitHub Pages

其他工具会被介绍,但不会在实践中来回切换。统一主线能让零基础读者把注意力留给任务方法,而不是反复适应界面。

完成检查