AI 模型最佳实践
持续更新 AI 模型、编程工具、UI、购买渠道、语音输入和 Vibe Coding 避坑建议。
这是我买过并长期使用多种 AI 模型、开发十几个产品以后,给朋友和 01MVP 用户整理的常见问题。
这不是永久不变的排行榜。模型、套餐和渠道变化很快,本页只保留当前还能执行的建议,并持续更新。具体型号和价格以厂商官网为准;没有特别说明时,排序与体验都是我的个人判断。
复杂后端、大型仓库、跨文件重构和长期任务,先求理解与稳定。
速度快、执行力强,适合明确任务、批量修改和快速试错。
有原型用 GPT-5.6;从零开始先用 GPT Image 2 或 Gemini 图像模型做视觉目标。
把长需求直接说出来,再让 AI 复述确认,通常比手打更快。
不想研究,直接这样选
| 你的情况 | 我的当前建议 | 为什么 |
|---|---|---|
| 第一次使用 AI 编程 | Cursor Pro 或 ChatGPT Plus 二选一 | 都是每月 20 美元档;Cursor 偏编辑器,Codex 偏完整 Agent |
| 复杂后端、大型项目、长期任务 | Codex + GPT-5.6 Sol | 需求理解、计划、跨文件修改和验收更稳 |
| 追求速度、大量改代码 | Grok 4.5 | 快,适合范围明确的批量执行 |
| 已经有原型图、设计稿或清楚的 UI 要求 | GPT-5.6 | 给它明确视觉目标后,实现和持续修改比较稳 |
| 从零设计 UI | GPT Image 2 / Gemini 图像模型 → GPT-5.6 | 先生成视觉目标,再分析并实现,不要直接让代码模型盲猜审美 |
| 预算有限,任务简单明确 | DeepSeek V4 Flash | 速度快、成本低,疑难 Bug 不要反复硬修 |
| 想低成本使用多种模型 | OpenCode Go | 首月 5 美元、之后 10 美元;模型与额度以官网实时页面为准 |
大多数人只买一个就够了
喜欢 VS Code 图形界面,先选 Cursor;更看重复杂任务、长时间执行和最终验收,先选 Codex。真正用完额度或出现明确短板后,再买第二个。
官方价格页:
我的综合体验快照
截至 2026 年 7 月 24 日,仅按我自己的实际使用体验:
Fable 5 > GPT-5.6 Sol > Kimi K3 > Grok 4.5 > GLM 5.2 ≈ Opus 4.8 > Qwen 3.8 > DeepSeek V4 ≈ Gemini 3.6
综合排名的参考价值没有想象中大。
Fable 5 综合能力很强,但复杂后端我还是会选 GPT-5.6 Sol;Grok 不一定综合第一,但速度、成本和执行量很突出,还能在 Grok 产品中配合 Imagine 生成图片和视频。
这份排序发布后很快就遇到了新型号更新,例如 Claude Opus 5,因此它只作为当时的体验记录。没有经过真实任务对比的新型号,我不会为了“榜单最新”强行插入。
真正选模型时,先看任务,不要只看总榜。
复杂编程、后端和长期任务
优先选择 Codex / GPT-5.6 Sol。
它适合复杂架构、大型代码库重构、跨文件修改,以及需要 AI 长时间自主执行的任务。我的实际体验是:
GPT-5.6 Sol > Fable 5 > Grok 4.5
它不一定最快,但理解需求、制定计划、检查结果和处理复杂问题的稳定性更强。
不要只让模型“写代码”。给它真实仓库、报错、成功标准和允许修改的范围,并要求它运行验证。复杂任务最后的价值经常来自检查与收口,不是第一轮输出速度。
追求速度和大量写代码
优先选择 Grok 4.5。
它更适合:
- 范围清楚的批量修改。
- 同时推进多个项目。
- 快速生成第一版,再由另一个模型验收。
- 代码、图片和视频需求混在同一项目里的快速试验。
xAI 官方把 Grok 4.5 定位为编程、Agent 和知识工作模型,并给出了约 80 TPS 的服务速度。我的实际体感也是目前第一梯队里很快的一个。
如果任务仍然含糊,不要因为模型快就直接开干。速度只会让错误更快地扩散。
官方入口:Grok 4.5 · Grok Imagine
国产模型怎么选
DeepSeek V4 Flash
我的体验是:快是真的快。
明确的小任务,别的模型可能要跑很久,它可以几分钟完成。缺点是疑难 Bug、复杂上下文和错误修复容易卡住;连续改错时,不要继续堆补丁。
适合:
- 明确的代码修改。
- 文案、整理、格式转换。
- 能快速验收的批量任务。
不适合把一个已经排查不清的复杂 Bug 无限交给它重试。
DeepSeek V4 Pro
推理速度比 Flash 慢。至少在我的任务里,没有稳定体现出与等待时间同等幅度的提升,部分疑难 Bug 仍会乱修。
官方同时提供 V4 Flash 和 V4 Pro,两者都支持 1M 上下文、思考/非思考模式和工具调用。真实项目里仍应使用同一组任务做对照,不要只看型号里的 Pro。
官方入口:DeepSeek V4 · 模型与价格
GLM 5.2 和 OpenCode Go
GLM 5.2 的综合完成度比较均衡。我的主要不满是速度和成本,以及部分接入方式不能读图或生成图片;具体能力取决于你使用的产品和 Endpoint。
OpenCode Go 当前首月 5 美元、之后每月 10 美元,包含 GLM、Kimi、Qwen、DeepSeek 和 Grok 等多个模型,适合预算有限但确实需要多模型的人。
如果你准备购买,也可以使用我的邀请链接。这是推广链接;是否有双方奖励、适用地区和活动期限,以 OpenCode 页面下单时的实时说明为准。
AI 设计的 UI 很难看,怎么优化
模型只是执行者。UI 最容易失败的原因,是你既没有给视觉目标,也没有把“好看”拆成可观察的要求。
已经有原型图或明确 UI 要求
直接把这些材料交给 GPT-5.6:
- 原型图、截图或竞品参考。
- 哪些信息最重要。
- 必须保留的交互和页面状态。
- 字体、颜色、间距和组件约束。
- 桌面端与手机端的验收截图尺寸。
让它先复述页面结构和视觉规则,再开始实现。不要只说“做得高级一点”。
如果只是局部调整按钮、间距、颜色和组件状态,ChatGPT Pro 用户也可以优先试 GPT-5.3 Codex Spark;它更快,但不适合替代 GPT-5.6 处理复杂、开放式设计任务。没有 Spark 权限时,GPT-5.6 配合低到中等推理强度就够了。
从零开始,没有原型图
推荐流程:
- 先拆用户旅程和页面目标。
- 用 GPT Image 2 或 Gemini 图像模型生成 2~3 个视觉方向。
- 选定一个方向,整理成设计规范。
- 再让 GPT-5.6 或其他编程 Agent 实现。
- 实际打开页面,对照效果图修改。
ChatGPT / Codex 的内置图像生成使用 gpt-image-2。Google 的 gemini-3.5-flash 擅长生成交互式 Web UI 和图形,但它本身不直接输出图片;需要图片原型时,应使用 Gemini 3.1 Flash Image、Gemini 3 Pro Image,或 Gemini 产品里的图像生成入口。
我不把 Claude 作为需要长期稳定账号的第一推荐,主要因为我自己的账号稳定性体验不好。这是个人经历,不代表每个用户都会遇到同样问题;无论使用哪个平台,都应通过官方渠道购买并遵守地区和账户规则。
语音输入:我只推荐豆包输入法
我实际对比用过闪电说、微信语音输入、讯飞、搜狗和 Typeless。目前 豆包输入法 对我的普通话、长句和口语化表达识别最准,改字最少。
这是个人使用结论,不是实验室测评。口音、设备、网络和版本都会影响结果。
输入法可能接触你输入的内容。安装前请阅读对应平台的权限和隐私说明;在 iOS 上开启“允许完全访问”前尤其要确认自己能接受相关数据边界。密码、密钥和敏感客户资料不要通过任何联网输入法口述。
我最常用的方式是:把长需求直接说给 AI,然后补一句:
简明扼要地复述你理解的我的需求,再说明你的执行方案。发现歧义先指出,不要直接猜。确认复述正确后再执行,通常能减少大量返工。
更完整的用法看:语音输入:只推荐豆包输入法。
我日常最常用的三个 Prompt
1. 一次性把问题讨论清楚
根据我发的需求【替换成你的需求】,一次性列出所有需要讨论和决定的问题。
每个问题都要给出:
1. 你推荐的解决方案;
2. 为什么这样选;
3. 其他方案的主要代价;
4. 哪些信息能从现有代码或资料中直接确认。
先完成讨论和对齐,不要直接修改。如果你经常遇到“AI 没理解清楚就开始干”,可以安装 grill-me:
npx skills add https://github.com/mattpocock/skills --skill grill-mePlan Mode 适合快速确认执行步骤;grill-me 更适合需求仍然含糊、产品决策很多、返工成本高的任务。不要每个小改动都进行长时间审问。
2. 系统性扫描仓库
系统性扫描仓库中的以下问题:
- 残留代码和历史文档
- 不符合当前最佳实践的实现
- 明显 Bug、重复和性能问题
- 前后不一致、架构不合理
- 文档冲突和历史遗留
先区分“有证据的问题”和“需要进一步确认的线索”。
只修改有把握、范围清楚、能够验证的项目;保留无关改动和用户数据。
完成后运行对应检查,汇报改动、证据和仍未验证的部分。大仓库不要让一个 Agent 无边界乱改。可以让多个 Agent 分模块扫描,但最终要由一个主 Agent 去重、判断优先级并统一验收。
3. 先复述,再执行
简明扼要地复述你认为的我的需求、成功标准和限制条件,再说明你的执行方案。
如果你的理解依赖假设,把假设明确写出来。人经常表达不准确。先让 AI 复述,是成本最低的需求验收。
项目越来越复杂,怎么避免失控
项目复杂以后,有两件事情必须做。
1. 懂基本架构和术语
不需要先成为工程师,但要知道项目大概由什么组成。
例如做 iOS App,至少要知道 Swift、SwiftUI、Xcode、Bundle ID、签名、App Store Connect 分别在解决什么问题。可以直接问 AI:
我要做一个【描述你的 App】。我是新手,请先告诉我:
1. 从开发到上线有哪些主要步骤;
2. 每一步有哪些必须理解的术语;
3. 哪些技术细节现在可以先不学;
4. 项目出问题时应该先检查哪一层。2. 重要需求要反复对齐
人表达不清楚时,AI 会用自己的假设补空白。让 AI 先提问、给推荐方案、读取代码能确认的部分,再开始实现。
当 AI 连续两三次修不好同一个问题时,停止继续说“再修一下”。先看 Git diff,回到最近能工作的状态,缩小复现范围,再换思路或换模型。
20 条已经落伍的 Vibe Coding 方式
下面不是“绝对规则”,而是我从真实项目和社区讨论中整理出的高频坑。X 链接是讨论线索,不是统计研究;正确做法仍要结合你的团队、风险和项目规模。
怎么快速建立 AI 基本认知
最省事的方法,不是强迫自己每天读论文,而是改变信息流:
- 在抖音、小红书、B 站主动搜索 AI、Agent、AI 编程和具体模型。
- 少点与你目标无关的内容,让推荐算法逐渐理解你的兴趣。
- 关注少量持续做真实项目、愿意展示失败过程的创作者。
- 看到型号、价格和“重大突破”,回到厂商官网核对。
AI HOT 可以用来快速浏览热点,但它是聚合入口,不是最终信源。重要决策仍要打开原始报道、官方文档或代码仓库。
新手想学 Vibe Coding,不要一开始收集几百个工具。先完成一个能运行、能打开、能提交 Git 的小项目,再看 AI 编程工具选型 和 第一个 AI 项目。
怎么充值和使用 Codex
优先顺序:
- 官方 ChatGPT / Codex 订阅。
- 官方 API,按量付费并设置预算限制。
- 只有确实需要人民币支付或统一 Endpoint 时,才评估中转服务。
ChatGPT Plus 当前是每月 20 美元,包含 GPT-5.6 系列和扩展的 Codex 用量。Pro 从每月 100 美元起,提供 Plus 的 5 倍或 20 倍用量。绝大多数个人用户先买 Plus,用完以后再决定是否升级。
我不建议把闲鱼代充、共享号、成品号和明显低于正常价格的 7 天 / 30 天账号写成长期购买方案。它们可能被追回、停用或暴露会话与代码;频繁换号省下的钱,通常抵不过中断工作的成本。
本站也不提供绕过地区限制的教程。付款和使用前,请在官方页面确认你的地区、支付方式、账户归属、自动续费和退款规则。
继续看:购买 AI 订阅前先看风险。
API 中转站怎么选
中转站解决的是支付、网络或统一 Endpoint,不会自动带来更好的隐私、模型质量和稳定性。
图片和视频 API 可以自行评估 fal、Kie.ai 等平台;其他聚合服务也必须先检查上游模型、倍率、日志保留、余额期限和退款规则。不要只看“充值 1 元等于多少美元额度”。
涉及商业代码、客户资料、用户数据和密钥时,优先官方 API。任何候选平台都先小额测试一周,并准备可以切换的第二个上游。
完整检查表:API 中转服务:价格与风险。
Codex 遇到 WebSocket 重连错误怎么办
如果出现 websocket closed by server before response.completed:
- 先升级 Codex,并重试一个更小的任务。
- 检查代理、公司网络或跨境线路是否会中断 WebSocket。
- 查看 Codex 日志,确认是传输中断,不是额度、认证或服务端错误。
- Codex 支持从 WebSocket 回退到 HTTP;Provider 配置也支持
supports_websockets = false。
supports_websockets = false 是 Provider 级配置,不是所有网络错误的万能修复。确认问题来自 WebSocket 后,可以在用户级 ~/.codex/config.toml 加入:
model_provider = "openai_http"
[model_providers.openai_http]
name = "OpenAI"
wire_api = "responses"
supports_websockets = false
requires_openai_auth = true这段配置让 OpenAI 模型请求使用 HTTP streaming。不要把它放进项目级 .codex/config.toml,也不要照抄陌生人的 base_url、Token 或认证配置。官方配置字段见 Codex Configuration Reference。
维护说明
本页每 30 天复核一次。更新时重点检查:
- 型号、套餐和官方链接是否还存在。
- 个人结论是否仍来自最近的真实任务。
- 价格是否有明确查询日期。
- 推荐渠道是否仍由用户自己控制账户和付款。
- FAQ 是否来自近期群聊里反复出现的问题。
无法确认的结论直接删掉或标成个人体验,不为了“内容丰富”保留过期资料。
如果你想从零做出并发布自己的产品,从 01MVP 实战手册 开始。
这篇文档有问题?