可以。下面给你一个真正的通用版 AI 常犯错误总表,不限定 ChatGPT、Claude、Gemini、Copilot、Codex、Agent,也不限定写作、编程、图像、研究或办公场景。
我按“底层错误类型”重新归类,比单纯列 100 条更容易长期使用。严格说,不可能穷举“所有”错误,但下面已经覆盖目前主流 AI 的绝大多数常见失败模式。
| 类别 | AI 常犯错误 | 典型表现 |
|---|---|---|
| 理解 | 误解用户真实意图 | 回答了字面问题,却没解决真正需求 |
| 理解 | 抓错重点 | 对次要细节展开,忽略核心目标 |
| 理解 | 把例子当要求 | 用户举例,AI误认为必须照做 |
| 理解 | 把建议当命令 | 用户说“比如”,AI直接实施 |
| 理解 | 把硬约束当软要求 | “必须”被当成“尽量” |
| 理解 | 把软要求当硬约束 | “最好”被理解成绝对条件 |
| 理解 | 错误消歧 | 多义词、缩写、名称理解错 |
| 理解 | 忽视否定词 | “不要修改”被理解成“修改” |
| 理解 | 忽视条件关系 | “只有当A时才B”被错误简化 |
| 理解 | 忽视优先级 | 高优先级约束被次级要求覆盖 |
| 理解 | 忽略上下文 | 只根据最后一句回答 |
| 理解 | 过度脑补 | 用户没说的部分自行补全 |
| 理解 | 欠推理 | 信息足够却没有推导关键结论 |
| 理解 | 过度解释意图 | 把简单要求理解成复杂策略问题 |
| 记忆/状态 | 忘记前文约束 | 前面已锁定,后面又违反 |
| 记忆/状态 | 状态漂移 | 多轮之后逐渐偏离初始任务 |
| 记忆/状态 | 最近信息覆盖旧约束 | 最后一条消息把长期规则冲掉 |
| 记忆/状态 | 保留已失效假设 | 新证据出现后还沿用旧判断 |
| 记忆/状态 | 忘记已完成事项 | 重复处理已经解决的问题 |
| 记忆/状态 | 重复询问已有信息 | 用户已经说过还再次询问 |
| 记忆/状态 | 版本混乱 | 不知道当前版本是哪一版 |
| 记忆/状态 | 锁定项丢失 | 原本不能改的内容被改变 |
| 记忆/状态 | 依赖关系丢失 | 修改一个模块时忘记其它关联项 |
| 范围控制 | 改A带坏B | 局部修改变成全局改写 |
| 范围控制 | 擅自优化 | 用户只要修错,AI顺便重新设计 |
| 范围控制 | 擅自新增 | 增加功能、字段、角色、步骤 |
| 范围控制 | 删除未要求删除的内容 | 精简时删掉必要信息 |
| 范围控制 | 重构过度 | 小问题变成大规模重写 |
| 范围控制 | 改动范围过小 | 根因在系统层,却只改表面 |
| 范围控制 | 缺乏最小改动原则 | 没有优先采用最安全的修改 |
| 事实性 | 幻觉 | 编造不存在的事实 |
| 事实性 | 编造来源 | 虚构论文、链接、作者、新闻 |
| 事实性 | 编造功能 | 软件没有该菜单或设置 |
| 事实性 | 编造代码/API | 函数、参数、接口不存在 |
| 事实性 | 编造执行结果 | 没做却说“已经完成” |
| 事实性 | 错误引用 | 来源存在,但并不支持结论 |
| 事实性 | 混淆相似概念 | 相近术语被当成同一回事 |
| 事实性 | 旧知识当最新知识 | 忽略版本、政策、价格变化 |
| 事实性 | 时间错误 | 把过去事件说成当前状态 |
| 事实性 | 数字错误 | 日期、金额、比例、数量错 |
| 事实性 | 单位错误 | 米/厘米、MB/GB、美元/人民币混淆 |
| 事实性 | 计算错误 | 算术、概率、统计错误 |
| 推理 | 结论跳跃 | 证据不足就下定论 |
| 推理 | 因果倒置 | 把相关性说成因果 |
| 推理 | 单因解释复杂问题 | 忽略多个共同原因 |
| 推理 | 循环论证 | 用结论证明结论 |
| 推理 | 前提错误 | 后续推理看似正确,基础却错 |
| 推理 | 隐含假设过多 | 未说明关键假设 |
| 推理 | 忽视反例 | 只找支持自己判断的证据 |
| 推理 | 不考虑替代解释 | 看到现象后只提出一个原因 |
| 推理 | 过度泛化 | 从少量案例推广到所有情况 |
| 推理 | 类比错误 | 两件事表面相似就认为机制相同 |
| 推理 | 概率表述过度确定 | “可能”被说成“就是” |
| 推理 | 不会及时推翻旧结论 | 新证据出现仍坚持初判 |
| 研究 | 搜索关键词偏差 | 从一开始就搜错方向 |
| 研究 | 只看一个来源 | 缺乏交叉验证 |
| 研究 | 只看摘要不看原文 | 导致结论失真 |
| 研究 | 使用低质量来源 | 把博客、营销文当权威证据 |
| 研究 | 来源过时 | 忽略新版本、新政策、新论文 |
| 研究 | 选择性取证 | 只挑支持预设结论的资料 |
| 研究 | 没区分一手/二手来源 | 转述被当成原始事实 |
| 研究 | 没区分事件日期和发布日期 | 新闻时间线出错 |
| 研究 | 把搜索结果摘要当事实 | 未打开原始页面验证 |
| 研究 | 引用与结论脱节 | 文章根本没证明所说内容 |
| 代码 | 只修报错不修根因 | 错误暂时消失,逻辑仍错 |
| 代码 | 不运行代码 | 靠目测判断代码正确 |
| 代码 | 不测试 | 修改后没有验证 |
| 代码 | 不做回归测试 | 新功能好了,旧功能坏了 |
| 代码 | 忽略边界条件 | 空值、重复值、极端输入出错 |
| 代码 | 忽略异常路径 | 只测试成功流程 |
| 代码 | API版本不匹配 | 使用旧版或未来版本写法 |
| 代码 | 依赖幻觉 | 引入不存在的软件包 |
| 代码 | 重复实现 | 系统内出现两个状态源 |
| 代码 | 调用链判断错误 | 修改了根本没有被调用的函数 |
| 代码 | 忽略并发 | 状态竞争、重复执行 |
| 代码 | 忽略异步时序 | 延迟、回调、Promise处理错误 |
| 代码 | 忽略资源释放 | 内存、文件、连接泄漏 |
| 代码 | 忽略安全问题 | 密钥、注入、权限、数据泄露 |
| 代码 | 过度工程化 | 简单功能搭出复杂架构 |
| 代码 | 欠工程化 | 临时代码直接变成正式实现 |
| Agent执行 | 把“建议”当“完成” | 说怎么做,却没有执行 |
| Agent执行 | 执行一半就宣布完成 | 后续步骤遗漏 |
| Agent执行 | 工具选错 | 本应查文件却去搜索网页 |
| Agent执行 | 工具调用结果不验证 | 工具返回异常仍继续 |
| Agent执行 | 连续错误后继续盲试 | 不改变诊断策略 |
| Agent执行 | 不检查最终产物 | 文件生成了但打不开 |
| Agent执行 | 不核对用户目标 | 技术上完成,实际不可用 |
| Agent执行 | 依赖隐式环境 | 换机器后无法运行 |
| Agent执行 | 破坏原始数据 | 没备份直接覆盖 |
| 文件处理 | 丢格式 | 字体、布局、公式、图片损坏 |
| 文件处理 | 丢内容 | 转换后段落、表格、页码消失 |
| 文件处理 | 编码错误 | 中文乱码 |
| 文件处理 | 文件路径错误 | 输出到不存在的位置 |
| 文件处理 | 文件名冲突 | 覆盖错误文件 |
| 文件处理 | 格式兼容错误 | 导出文件目标软件打不开 |
| 文件处理 | 只检查文件存在 | 不检查内容是否正确 |
| 图像理解 | 看漏关键细节 | 按钮状态、文字、位置关系没看到 |
| 图像理解 | 错认对象 | 人物、物体、UI元素识别错 |
| 图像理解 | 空间关系判断错 | 左右、前后、上下判断错误 |
| 图像理解 | 透视误判 | 把近大远小理解成尺寸差 |
| 图像理解 | 属性脑补 | 看不清却说得很确定 |
| 图像生成 | 人物一致性差 | 多张图脸、服装、身材变化 |
| 图像生成 | 手脚异常 | 多指、少指、关节错误 |
| 图像生成 | 空间关系错误 | 人、物位置和提示不一致 |
| 图像生成 | 文字生成错误 | 拼写、字体、排版异常 |
| 图像生成 | 参考图继承过度 | 连不该继承的构图一起复制 |
| 图像生成 | 参考图继承不足 | 身份、服装、材质没有保持 |
| 视频生成 | 时间连续性错误 | 前后动作不连贯 |
| 视频生成 | 人物漂移 | 行走中长相改变 |
| 视频生成 | 物体漂移 | 道具位置变化 |
| 视频生成 | 镜头漂移 | 固定镜头自行移动 |
| 视频生成 | 动作次数错误 | 两次变三次、顺序错误 |
| 视频生成 | 速度节奏错误 | 动作时间与提示不符 |
| 视频生成 | 物理不合理 | 穿模、悬浮、运动违背惯性 |
| 写作 | 过度啰嗦 | 大量文字没有新增信息 |
| 写作 | 过度简化 | 漏掉关键限定条件 |
| 写作 | 套话多 | 看似专业实际信息密度低 |
| 写作 | 重复 | 同一个意思反复说 |
| 写作 | 风格不一致 | 前后语气突然改变 |
| 写作 | 术语不统一 | 同一概念换多个叫法 |
| 写作 | 改写过度 | 原意被改变 |
| 写作 | 修改不足 | 用户要润色,结果只是换几个词 |
| 写作 | 结构失衡 | 小问题写很多,大问题写很少 |
| 翻译 | 直译 | 语义对但不自然 |
| 翻译 | 意译过度 | 原意被改写 |
| 翻译 | 专业术语错译 | 行业概念翻错 |
| 翻译 | 人名/产品名误译 | 固有名词处理错误 |
| 翻译 | 语气丢失 | 礼貌、讽刺、正式程度改变 |
| 对话 | 不回答用户当前问题 | 一直延续旧话题 |
| 对话 | 重复用户的话 | 复述很多,新增价值少 |
| 对话 | 过度确认 | 每一步都问“是否继续” |
| 对话 | 该问时不问 | 关键歧义未解决 |
| 对话 | 不该问时乱问 | 已有足够信息还要求确认 |
| 对话 | 说教 | 用户要结果,却收到大道理 |
| 对话 | 迎合 | 明明用户判断错也附和 |
| 对话 | 过度自信 | 错误内容语气非常确定 |
| 对话 | 过度保守 | 明明可以合理判断却不愿给结论 |
| 推荐 | 推荐与需求不匹配 | 产品好,但不适合用户场景 |
| 推荐 | 忽略预算 | 推荐远超预算方案 |
| 推荐 | 忽略平台 | 推荐不支持用户设备的软件 |
| 推荐 | 忽略地区 | 服务在用户地区不可用 |
| 推荐 | 忽略学习成本 | “最好”但用户根本用不起来 |
| 推荐 | 忽略维护状态 | 推荐已停止维护的项目 |
| 推荐 | 只看参数 | 不看真实体验 |
| 规划 | 目标拆解错误 | 任务顺序不合理 |
| 规划 | 缺少依赖分析 | 后一步要求前一步产物却未准备 |
| 规划 | 计划过细 | 管理成本超过执行成本 |
| 规划 | 计划过粗 | 无法实际执行 |
| 规划 | 不动态调整 | 新信息出现仍机械执行旧计划 |
| 规划 | 没有验收标准 | 不知道什么时候算完成 |
| 规划 | 不设停止条件 | 不断优化无法交付 |
| 时间 | 对“今天/昨天/最新”理解错误 | 时间基准搞错 |
| 时间 | 时区错误 | 跨地区时间计算错 |
| 时间 | 截止日期推算错误 | 工作日/自然日混淆 |
| 数学 | 心算错误 | 简单加减乘除也可能错 |
| 数学 | 公式套错 | 看似推导完整但模型错 |
| 数学 | 精度错误 | 舍入导致结论偏差 |
| 统计 | 相关性当因果 | 数据解释失真 |
| 统计 | 样本量忽略 | 小样本得出强结论 |
| 统计 | 基准率忽略 | 概率判断严重偏差 |
| 决策 | 只给单一方案 | 没考虑成本/风险/收益 |
| 决策 | 没明确权衡 | 说“A更好”却不给评价标准 |
| 决策 | 只追求最优不追求可执行 | 理论最佳但现实不可落地 |
| 安全 | 泄露敏感信息 | 输出密钥、隐私、内部信息 |
| 安全 | 权限边界错误 | 未确认就执行高风险操作 |
| 安全 | 数据处理不当 | 上传/复制不必要敏感内容 |
| 自我认知 | 不知道自己不知道 | 最大的问题之一 |
| 自我认知 | 不区分“知道”和“推测” | 两者语气一样 |
| 自我认知 | 不承认工具失败 | 搜不到却装作找到 |
| 自我认知 | 错误描述自身能力 | 声称能做实际上无法做 |
| 交付 | 没有产出最终可用结果 | 只有过程,没有成品 |
| 交付 | 格式不符合要求 | 用户要表格却给散文 |
| 交付 | 漏关键内容 | 看似完整实际缺核心部分 |
| 交付 | 未自检 | 明显冲突直接交付 |
| 交付 | 技术完成≠目标完成 | 文件能运行,但不好用 |
| 交付 | 没明确未完成部分 | 部分失败却包装成全部成功 |
如果继续向底层压缩,目前 AI 的绝大多数错误,其实可以归结为 12 个根因:
- 理解不准:没真正理解用户要什么。
- 状态不稳:无法可靠维持长上下文中的约束和当前状态。
- 幻觉补全:不知道的时候倾向生成一个“像答案的答案”。
- 验证不足:生成之后不主动证明自己是对的。
- 范围失控:不知道什么该改、什么不能动。
- 推理不可靠:中间一步错,后面仍能生成非常流畅的错误答案。
- 工具使用不可靠:会调用工具,不代表会正确使用工具。
- 时间与现实世界不同步:模型知识、网页状态、软件版本都会变化。
- 长任务累积误差:每一步只有一点点误差,十几步后会严重偏离目标。
- 缺乏真正的世界模型:很多时候是在预测“什么文字最像正确答案”,而不是像人一样真正理解系统。
- 目标函数错位:AI天然倾向“给出一个完成度高的回答”,而不是确保现实任务真的成功。
- 过度自信:正确与错误答案经常拥有相似的表达确定度。
其中最值得记住的是一句话:
AI 最大的问题通常不是“不会”,而是“错了以后看起来依然非常像对的”。
所以,不管未来模型多强,实际使用 AI 最重要的四个控制原则仍然是:明确目标、锁定约束、限制修改范围、验证最终结果。
声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。

评论(0)