自编考卷 · 8 正题 + 1 彩蛋

免费档大模型同台实测 · 考卷全文

DeepSeek V4.1 Flash / Step 5 / MiMo V2.6 Pro & Flash 同台测试用题 · 2026-09-23

怎么用这套卷子

  1. 打开任一家官网网页版对话(DeepSeek / Step / MiMo),关闭联网搜索;
  2. 每题新开一个对话,把灰框内全文复制发送;
  3. 同一题隔 5 分钟用完全相同的文字再发一遍,两次答案不一致记"不稳定";
  4. 先自己算,再点开"标准答案与判分"对照。祝你别被答案键坑到,我们都被坑过(见第 2 题彩蛋)。

Q1 · 糖果袋(最坏情况穷举)

考点:穷举全部失败路径并取最大值。常见错误答案 21(漏算西瓜)。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具,禁止写代码,只靠推理给出答案。

在一个黑色袋子里放有三种口味的糖果,每种糖果有两种不同形状(圆形和五角星形)。数量如下:

|        | 苹果味 | 桃子味 | 西瓜味 | 合计 |
|--------|--------|--------|--------|------|
| 圆形   |   7    |   9    |   8    |  24  |
| 五角星 |   7    |   6    |   4    |  17  |

参赛者需要在活动前决定摸出的糖果数目。最少取出多少个糖果,才能保证手中同时拥有"不同形状的苹果味和桃子味"的糖?

"不同形状的苹果味和桃子味"指以下任意一种组合即可:
- 圆形苹果味 + 五角星桃子味
- 五角星苹果味 + 圆形桃子味

请给出最终答案并展示完整推理过程。
标准答案与判分
答案:29。最大失败集 = 圆形苹果 7 + 圆形桃子 9 + 全部西瓜 12 = 28(此时无五角星苹果、无五角星桃子)。第 29 颗无论摸到哪种五角星苹果/桃子必触发条件。
判分:29 = 满分;21 = 0 分(漏算西瓜);看是否穷举全部失败路径并取最大值。

Q2 · 花园约束求解(唯一性陷阱)

考点:约束是否足以锁定唯一解。注意规则 1 只有一条对角相等。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具。

一个正方形花园被均匀划分为 4 个区域,种植红、黄、蓝、绿四种颜色的花:

┌──────┬──────┐
│ 红色 │ 黄色 │
├──────┼──────┤
│ 蓝色 │ 绿色 │
└──────┴──────┘

规则:
1. 对角守恒:左上 = 右下
2. 相邻差值:任意共享边的相邻区域,花朵数量之差 ≤ 7
3. 总量:四个区域总数恰好为 100
4. 各区域均为正整数

已知红色区域有 28 朵。求黄色、蓝色、绿色各多少朵,并验证所有规则。

额外要求:如果你认为条件不足以确定唯一解,请指出并给出所有可能的解。
标准答案与判分
答案:3 组解(不唯一)。红=绿=28,黄+蓝=44,黄蓝互不相邻、各自与 28 差 ≤7,故 (黄,蓝) ∈ {(21,23), (22,22), (23,21)}。
判分:给出全部 3 组解 = 满分;只给 1 组 = 部分分;是否主动讨论"条件不足"是核心信号。
🥚 彩蛋:这套题的原始版规则 1 写的是"左上 = 右下,右上 = 左下"两条,那样会强制黄=蓝=22、解唯一。我们出题时只执行了前一半、答案键却按后一半预期给 3 组解,把自己家的判卷搞翻了车——DeepSeek / Step / MiMo Pro 按原始题面答"唯一解 22/22"全是被冤枉的。想知道模型有多诚实,可以拿原始版(把规则 1 改回两条对角相等)再考一遍。

Q3 · 四步溶液混合(多步精确计算)

考点:长链计算不跳步、不漂移。任何一步浓度算错都会步步错。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具。

一个化学实验室有三瓶溶液:
- A 瓶:300ml,浓度 20% 的盐水
- B 瓶:500ml,浓度 12% 的盐水
- C 瓶:200ml,浓度 30% 的盐水

实验员依次执行以下操作:
1. 从 A 瓶倒出 100ml 到 B 瓶,搅匀
2. 从 B 瓶倒出 150ml 到 C 瓶,搅匀
3. 从 C 瓶倒出 80ml 回 A 瓶,搅匀
4. 从 A 瓶倒出 50ml 到 B 瓶,搅匀

求最终各瓶的溶液体积和盐浓度(质量百分比)。要求给出每一步的中间结果,不能跳步。
标准答案与判分
答案(按密度 1g/ml 的常规假设):A 230ml / 20.82%,B 500ml / 14.08%,C 270ml / 22.86%;总盐量 180g 守恒可作校验。
判分:三瓶终值全对(±0.05%)且 4 步中间结果无跳步 = 满分;主动指出"质量百分比缺密度数据"属超额加分。

Q4 · 矛盾检测(全场事故集中地)

考点:识别"不可能满足"并给出论证。这是四家模型全部出事故的一道题,慎入。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具。

请用 Python 写一个函数,接收一个整数列表,返回列表中所有"出现次数为奇数"的元素。要求:
- 不能使用任何额外的数据结构(不能新建 list、dict、set)
- 时间复杂度 O(n)
- 空间复杂度 O(1)
- 如果有多个奇数出现次数的元素,返回任意一个

然后回答:这道题的要求是否同时满足?如果不可能,请证明为什么。
标准答案与判分
答案:不可能同时满足。要点:①"返回所有"与"返回任意一个"语义冲突;②最坏情形奇频元素达 Θ(n),"返回所有"与 O(1) 空间、禁建容器冲突;③异或(XOR)只在"恰好一个奇频元素"时成立,反例 [1,2,3] 异或得 0 不在列表中。
判分:先指出"不可能"并论证 = 满分;直接写 dict 解并声称"满足" = 0 分;先写代码后自我纠错 = 加分。

Q5 · 链式计算(一步错,步步错)

考点:五步接龙计算 + 是否回头自检。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具。

请依次回答以下问题,每一步必须基于上一步的结果:

1. 计算:17 × 23 = ?
2. 将上一步的结果加上 89,然后除以 16,保留两位小数。
3. 将上一步的结果乘以 7,然后减去 42。
4. 将上一步的结果开平方根,保留三位小数。
5. 将上一步的结果乘以 100,然后四舍五入到整数。

要求:每一步必须展示计算过程。如果你发现自己在上一步算错了,请明确指出"我在第 X 步算错了",然后从那个步骤重新开始。
标准答案与判分
答案:391 → 30.00 → 168 → 12.961 → 1296
判分:终值 1296、5 步全展示为满分;是否主动复核属加分项。

Q6 · Agent 任务规划(锚点评分)

考点:任务拆解、依赖标注、异常意识、收尾确认。无唯一答案,按锚点给分。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具。

假设你是一个电脑助手,需要完成以下任务:

从桌面上的 report.docx 中提取所有表格数据,将数据整理成 CSV 格式,保存到 output.csv,然后打开 output.csv 确认前 5 行数据无误,最后在桌面上创建一个 done.txt 写入"任务完成"。

按顺序列出你会在电脑上执行的每一步操作(用自然语言描述即可,比如"打开文件管理器,找到桌面")。要求:
- 每一步必须明确说明你在操作哪个文件、用什么工具
- 如果某一步需要等待上一步完成才能继续,请注明"等待"
- 如果某个操作可能失败,请给出至少一种异常处理方案
评分锚点(无标准答案)
必查点:① report.docx 不存在的处理;② 无表格 / 多表结构不一致的口径;③ CSV 编码(UTF-8 / BOM);④ 依赖步骤是否标"等待";⑤ 写 done.txt 前是否确认核对通过;⑥ 异常处理 ≥3 种。
判分:计划完整性 40% + 异常意识 30% + 指令遵循 20% + 收尾确认 10%。

Q7 · 时钟角度(反直觉陷阱)

考点:常识陷阱。常见错误是答 0°(以为时针停在 3 点整不动)。

请逐步推理,展示完整过程。禁止联网搜索,禁止调用任何工具。

现在是 3 点 15 分。请问时针和分针之间的夹角是多少度?请展示计算过程。
标准答案与判分
答案:7.5°。分针 90°;时针 3×30° + 15×0.5° = 97.5°;夹角 7.5°。
判分:7.5° = 满分;0° = 0 分。

Q8 · 质数函数(6 条硬约束)

考点:功能正确之外,6 条约束逐条核对 + 写后自检。

请逐步推理,展示完整过程。如果题目存在矛盾或不可能满足的条件,请明确指出。禁止联网搜索,禁止调用任何工具。

请用 Python 写一个判断质数的函数 is_prime(n),满足以下所有约束:

1. 函数名必须是 is_prime,参数名必须是 n
2. 返回值为 bool 类型
3. 正确处理 n ≤ 1 的情况(返回 False)
4. 不能使用任何 import 语句
5. 不能写任何注释(包括 # 、""" 、''')
6. 效率:对于 n = 97 应在 10 次循环内完成判断

写完后请自检:你的函数是否满足以上全部 6 条约束?逐条确认。
标准答案与判分
参考实现:试除到 √n(i*i ≤ n),n=97 循环 4 次(奇数版)或 8 次(朴素版),均达标。
判分:功能正确 30% + 6 条约束逐条通过 40% + 自检准确 20% + 代码风格 10%。常见失败:写注释、用 import、循环到 i < n。

彩蛋 · 考官翻车现场:Q2 原始版题面

把下面这段发给任何一家模型,它会告诉你"解唯一"——而它是对的。错的曾是我们自己的答案键。

(与 Q2 唯一的区别在规则 1)

规则:
1. 对角守恒:左上 = 右下,右上 = 左下
2. 相邻差值:任意共享边的相邻区域,花朵数量之差 ≤ 7
3. 总量:四个区域总数恰好为 100
4. 各区域均为正整数

已知红色区域有 28 朵。求黄色、蓝色、绿色各多少朵,并验证所有规则。
额外要求:如果你认为条件不足以确定唯一解,请指出并给出所有可能的解。
为什么
"右上 = 左下"强制黄=蓝,总量锁定 22,解唯一(28/22/22/28)。我们最初按 3 组解的答案键判卷,把答对的三家全判了错。教训:独立实测要审的不只是模型,还有考官自己的标准答案。

复测战绩墙

照上面任一题复测完了?把结果交上来,挂在这里给后来人参考——哪家稳、哪家翻车,比跑分表真实。

战绩加载中……