# AI 大模型决策报告 > 按具体任务比较 AI 模型、产品、编程工作流、推理强度、API 成本、会员套餐与专项工具,而不是只给一个总榜。 - Canonical site: https://llmcp.edlab.top/ - Version: v1.36.1 - Snapshot date: 2026-09-05 - Primary language: zh-CN; English overview is listed below. - Machine-readable section index: https://llmcp.edlab.top/ai-index.json ## Reading rules - 先读页面或小节结论,再核对其证据、日期和限制。 - 官方事实、厂商自报、独立测试、社区体验和编辑判断不能互相替代。 - 分数差不能直接解释成智力百分比;应回到同一任务集的成功率、成本、等待和返工。 - 型号、价格和评测都是带日期的快照,不代表永久实时。 - 语音误识别和错拼只用于搜索容错,不是正式型号。 ## Core pages - [AI 大模型选择器](https://llmcp.edlab.top/): 按任务、效果、成本和使用入口快速选择模型,并查看四条分轨结论。 - [模型、推理档与多代理工作流](https://llmcp.edlab.top/workflows/): 对照 Astra、Fable 5.1 与 Sol 的推理档、成本、前端游戏表现,以及便宜模型执行、子代理和 worktree 的实际用法。 - [主流 AI 会员套餐与搭配](https://llmcp.edlab.top/plans/): 按功能门槛、真实用量和已有订阅选择 Kimi、ChatGPT、Claude、Google AI、SuperGrok 等套餐。 - [多模型直接对比](https://llmcp.edlab.top/compare/): 一次选择 2—4 个模型,在同一口径下比较能力、价格、适用任务和限制。 - [专项 AI 工具地图](https://llmcp.edlab.top/specialists/): 按 X 调研、图像、视频生成、视频换语言、配音和字幕等具体任务选择首选与达标低价方案。 - [模型状态与能力变化](https://llmcp.edlab.top/model-health/): 把官方服务故障、滚动能力观测和社区体感分开,避免把一次波动直接叫作降智。 - [全站目录](https://llmcp.edlab.top/directory/): 浏览全部主要页面、重点段落和模型资料入口。 - [零 Token 数据观察室](https://llmcp.edlab.top/auto-update-lab/): 查看带日期的数据快照、来源状态和历史样例;观察数据不会自动改写正式结论。 - [English AI model decision guide](https://llmcp.edlab.top/en/): A concise English guide to the site's model, workflow, cost, and evidence tracks. ## Model profiles - [Claude Fable 5.1](https://llmcp.edlab.top/models/claude-fable-5-1/): 高难任务旗舰;高难规划、含糊多文件实现、长程专业工作与异家复核。核验 2026-09-05。 - [GPT-6 Astra](https://llmcp.edlab.top/models/gpt-6-astra/): 高难任务旗舰;复杂推理、代码与终端闭环、资料分析、少返工的端到端任务。核验 2026-09-05。 - [Gemini 3.8 Flash](https://llmcp.edlab.top/models/gemini-3-8-flash/): 高性价比多模态执行;多模态资料、Google 工具、有验收的多文件开发和长程代码执行。核验 2026-09-05。 - [Meta Muse Spark 1.3](https://llmcp.edlab.top/models/meta-muse-spark-1-3/): 新品观察;专业工作与长代理新品观察;先核对可用版本和账户入口。核验 2026-09-05。 - [Claude Fable 5](https://llmcp.edlab.top/models/claude-fable-5/): 上一代 Fable 基线;完整应用、模糊需求、多文件长任务、独立复核。核验 2026-08-13。 - [Claude Opus 5](https://llmcp.edlab.top/models/claude-opus-5/): 高端实用与复核;复杂代理编程、开放式架构、长链路企业任务与高质量成品。核验 2026-07-31。 - [Claude Mythos 5](https://llmcp.edlab.top/models/claude-mythos-5/): 受限研究参考;仅适用于获批组织的高权限安全、生命科学与网络研究。核验 2026-07-23。 - [GPT-5.6 Sol](https://llmcp.edlab.top/models/gpt-5-6-sol/): 成熟高端与成本路线;仓库修复、终端执行、复杂架构与主力编程。核验 2026-08-29。 - [GPT-5.6 Terra](https://llmcp.edlab.top/models/gpt-5-6-terra/): 均衡型号;有测试兜底的日常多文件开发、能力与成本平衡。核验 2026-07-31。 - [GPT-5.6 Luna](https://llmcp.edlab.top/models/gpt-5-6-luna/): 轻量高吞吐;计划已明确的批量实现、快速小改、后台助手与低成本长上下文。核验 2026-07-31。 - [GPT-5.5](https://llmcp.edlab.top/models/gpt-5-5/): 上一代基线;旧项目兼容、稳定 Codex 工作流。核验 2026-07-31。 - [GPT-5.5 Pro](https://llmcp.edlab.top/models/gpt-5-5-pro/): 高成本研究参考;极难研究、证明、长分析和高价值一次性任务。核验 2026-07-31。 - [Claude Opus 4.8](https://llmcp.edlab.top/models/claude-opus-4-8/): 成熟高端基线;开放式架构、可靠长任务、范围控制、代码复核与企业工作。核验 2026-07-23。 - [Claude Sonnet 5](https://llmcp.edlab.top/models/claude-sonnet-5/): 均衡执行型号;边界明确的日常执行、完整应用、速度与能力平衡。核验 2026-07-23。 - [Grok 4.6](https://llmcp.edlab.top/models/grok-4-6/): 低价前沿旗舰;低价前沿编程、工具代理、知识工作,以及需要 X 搜索的实时信息调研。核验 2026-08-15。 - [Grok 4.5](https://llmcp.edlab.top/models/grok-4-5/): 上一代 Grok 基线;复现基于 Grok 4.5 的旧工作流与升级前后对照。核验 2026-08-13。 - [Meta Muse Spark 1.2](https://llmcp.edlab.top/models/meta-muse-spark-1-2/): 法律金融与长代理专项;法律、金融、医疗与税务等专业工作流,以及可恢复的长时间后台代理。核验 2026-08-15。 - [Meta Muse Spark 1.1](https://llmcp.edlab.top/models/meta-muse-spark-1-1/): 上一代代理基线;尚未迁移的 Muse 旧流程与 1.2 升级前后对照。核验 2026-07-17。 - [Gemini 3.7 Flash](https://llmcp.edlab.top/models/gemini-3-7-flash/): 效率价值与成熟流程;高速多模态理解、Google 搜索与地图工具、长流程代理、高频编程循环和金融研究。核验 2026-08-15。 - [Gemini 3.6 Flash](https://llmcp.edlab.top/models/gemini-3-6-flash/): 上一代 Gemini 基线;复现基于 Gemini 3.6 Flash 的旧测试、价格快照与工作流。核验 2026-08-15。 - [Gemini 3.5 Flash](https://llmcp.edlab.top/models/gemini-3-5-flash/): 上一代多模态基线;复现基于 Gemini 3.5 Flash 的旧测试、价格快照与工作流。核验 2026-07-23。 - [GLM-5.3](https://llmcp.edlab.top/models/glm-5-3/): 开放权重前沿旗舰;复杂代码、长程 Agent、中文专业任务,以及有大型推理基础设施的开放权重部署。核验 2026-08-29。 - [GLM-5.3-Flash](https://llmcp.edlab.top/models/glm-5-3-flash/): 低价合格执行者;强模型已写清计划后的批量实现、可回滚代码支线、结构化抽取与有引用的低风险知识工作。核验 2026-08-29。 - [GLM-5.2](https://llmcp.edlab.top/models/glm-5-2/): 上一代开放权重基线;中文任务、MIT 开放权重部署、工具代理与成本可控的企业工作流。核验 2026-08-29。 - [Qwen 3.8 Max](https://llmcp.edlab.top/models/qwen-3-8-max/): 国产强第二梯队旗舰;中文复杂任务、视觉与长上下文、阿里云生态,以及需要统一国内 API 入口的团队。核验 2026-08-29。 - [Qwen 3.8 Max Preview](https://llmcp.edlab.top/models/qwen-3-8-max-preview/): 已结束的预览基线;复现预览期的 Token Plan 工作流与正式版迁移前后对照。核验 2026-08-13。 - [Qwen 3.7 Max](https://llmcp.edlab.top/models/qwen-3-7-max/): 上一代千问基线;尚未迁移的 Qwen 3.7 应用与 3.8 升级前后复测。核验 2026-08-13。 - [Qwen 3.7 Plus](https://llmcp.edlab.top/models/qwen-3-7-plus/): 中文成本型号;中文日常、低价 coding tools、规模化调用。核验 2026-07-17。 - [DeepSeek V4 Pro 0813](https://llmcp.edlab.top/models/deepseek-v4-pro/): 低价长程代码专项;Max 档下有测试兜底的长程代码、批量仓库任务和极度成本敏感的企业试点。核验 2026-08-29。 - [DeepSeek V4 Flash 0731](https://llmcp.edlab.top/models/deepseek-v4-flash/): 低成本可验收候选;Max 档下可验收的批量抽取、分类、草稿与低风险客服试点。核验 2026-08-29。 - [Kimi K3](https://llmcp.edlab.top/models/kimi-k3/): 通用旗舰 · 新发布;网页与 React 原型、长资料、并行调研、图片 / 视频理解、长程 Agent,以及具备大型推理基础设施的开放权重部署。核验 2026-08-15。 - [Kimi K2.6](https://llmcp.edlab.top/models/kimi-k2-6/): 上一代通用开放权重型号;Kimi 通用聊天、复杂推理与多模态理解。核验 2026-07-17。 - [MiniMax M3](https://llmcp.edlab.top/models/minimax-m3/): 国产代码与代理专项;代码代理、多模态工具任务、低成本长上下文。核验 2026-07-13。 - [Kimi K2.7 Code](https://llmcp.edlab.top/models/kimi-k2-7-code/): Kimi 编程专项;开放权重代码代理、MCP 工具调用、中文编程生态。核验 2026-07-17。 ## Retrieval note 需要精确回答具体问题时,优先读取 ai-index.json 中匹配的 section URL,再打开对应网页小节。不要只根据本导航文件推断排名或价格。