LMCC例题A

考试时间:90分钟 满分:100分
您的姓名:
⼀、单选题(20题 × 3分 = 60分)
1、关于监督学习、无监督学习与自监督学习,下列说法正确的是:
2、关于模型的训练集、验证集和测试集,以下说法正确的是:
3、与图像数据相比,自然语言作为大模型输入时最典型的底层特征是:
4、关于注意力机制中查询(Query)、键(Key)、值(Value)的作用,下列说法正确的是:
5、关于自回归语言模型的"下一个词元预测"任务,下列说法正确的是:
6、关于大语言模型的"生成"和"理解"两类核心范式,下列说法正确的是:
7、指令数据(Instruction Data)的典型组成是:
8、关于温度(Temperature)参数在文本生成中的作用,以下说法正确的是:
9、关于大语言模型的幻觉(Hallucination)现象,以下说法正确的是:
10、关于Prompt(提示词)的设计原则,以下哪项不正确?
11、关于语言模型的发展历程,下列理解最准确的是:
12、关于编码器-解码器架构、因果解码器架构和前缀解码器架构,下列说法正确的是:
13、关于自监督学习与预训练任务,下列说法最准确的是:
14、关于指令数据集的构建,下列做法最合理的是:
15、关于贪心搜索和束搜索解码,下列说法正确的是:
16、某训练集共有9600条样本,Batch Size设置为64,完整训练3个epoch。若每个batch更新一次模型参数,且样本数能被batch size整除,则总参数更新步数为:
17、某二分类模型在测试集上的结果为:真正例TP=80,假正例FP=20,假负例FN=40。该模型的精确率 (Precision)和召回率(Recall)最接近:
18、某14B模型在BF16下权重占用约28GB。若改为INT4后,权重本体理论占用缩至1/4;另外需要1.6GB量化标尺开销与0.9GB元数据开销;并预计运行时碎片化额外增加15%(按"量化后权重本体+固定开销"计)。则总占用最接近:
19、某排序前5项相关性分数为[3,2,0,1,0]。按 DCG=Σ((2^rel−1)/log2(i+1)),NDCG@5最接近:
20、某推理服务每步设置batch=48、平均序列长度3072 token,单步耗时3.0s。系统每执行5步还会触发一次额外checkpoint同步,耗时1.5s。按长期平均计算,系统吞吐量最接近:
⼆、材料题(10题 × 4分 = 40分)
材料题1:智能体⼯具调⽤JSON校验器

在⼯具调⽤型智能体中,模型输出通常需要被解析为结构化JSON,再根据⼯具schema校验⼯具名和参数是否
合法。下⾯的代码实现了⼀个简化版⼯具调⽤校验器:它读取模型输出字符串,检查⼯具名、参数字段和参数
类型,并返回标准化后的⼯具调⽤对象。
请阅读代码,并根据描述完成空缺部分。

21、【材料题1·智能体工具调用JSON校验器】代码片段:obj = ____[1]____。 需要将模型输出字符串解析为Python对象。请选择正确实现:
22、【材料题1·智能体工具调用JSON校验器】代码片段:required = spec["required"];optional = spec["optional"];allowed_keys = ____[2]____。 需要得到该工具允许出现的全部参数名。请选择正确实现:
23、【材料题1·智能体工具调用JSON校验器】代码片段:missing_keys = ____[3]____。 需要找出缺失的必需参数。请选择正确实现:
24、【材料题1·智能体工具调用JSON校验器】代码片段:if name in arguments and ____[4]____: return False。 需要检查参数值是否符合schema中声明的类型。请选择正确实现:
材料题2:API⽂档检索助⼿

API⽂档检索助⼿是⼀类典型的检索增强系统。它先把API⽂档⽚段编码成向量并建⽴索引;当⽤户提出问题
时,再把问题编码成向量,与⽂档向量计算相似度,选出最相关的⽂档⽚段,⽤于后续回答⽣成。
补充材料:
1. tokenizer(texts, return_tensors="pt", padding=True, truncation=True) 会返回⼀个字典,
常⻅字段包括 input_ids 和 attention_mask 。
2. 嵌⼊模型输出的 last_hidden_state 形状通常为 [batch_size, seq_len, hidden_dim] 。
3. attention_mask 的形状通常为 [batch_size, seq_len] ,其中1表示真实token,0表示padding
token。
4. 对带padding的序列做平均池化时,应排除padding位置,否则短⽂本向量会被填充值稀释。
5. 若查询向量和⽂档向量都已做L2归⼀化,则⼆者点积等价于余弦相似度。
6. 如果查询向量形状为 [1, hidden_dim] ,⽂档矩阵形状为 [num_docs, hidden_dim] ,则⼀次性计算
所有⽂档相似度可使⽤矩阵乘法,结果形状为 [1, num_docs] 。
请阅读代码,并根据描述完成空缺部分。

25、【材料题2·API文档检索助手】代码片段:tokens = ____[1]____。 在encode_texts方法中,需要将输入文本列表转换为模型所需的token格式。请选择正确实现:
26、【材料题2·API文档检索助手】代码片段:sentence_embeddings = ____[2]____。 需要对序列隐藏状态做masked mean pooling,得到句子级向量。请选择正确实现:
27、【材料题2·API文档检索助手】代码片段:similarity_scores = ____[3]____。 需要一次性计算查询向量与全部文档向量的相似度。请选择正确实现:
材料题3:论⽂阅读——思维链忠实性与早退策略

请阅读下⾯根据论⽂ Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought
(arXiv:2603.05488v4,2026-05-28)整理的中⽂阅读材料,然后回答3个问题。
1. 研究背景:思维链为什么看起来重要
近年来,思维链提示被⼴泛⽤于提升⼤语⾔模型在数学、科学和复杂推理任务上的表现。特别是经过强化学习
训练的推理模型,常常会在给出答案前⽣成较⻓的中间推理⽂本,形式上像是在逐步分析问题、排除错误选
项、检查条件并修正判断。直观上,如果模型把推理过程写出来,⼈们似乎就可以通过阅读这些⽂字判断模型
是否真的在推理、哪⾥出现了逻辑错误、是否有潜在⻛险。因此,⼀些安全和可解释性⽅案把"监控思维链⽂
本"视为理解模型内部过程的重要窗⼝。
这篇论⽂⾸先提醒读者:思维链很有⽤,但它不⼀定等于模型真实内部过程的逐字转录。⼀个推理模型可能写
出结构清楚、逻辑连贯、看似诚实的推理⽂本,但这些⽂本仍可能没有及时反映模型内部已经形成的判断。换
句话说,外显思维链更像模型在任务过程中"说出来的内容",⽽不是模型内部状态的完整记录。

2. 核⼼概念:什么是"表演式思维链"
论⽂把⼀种关键现象称为"表演式思维链"。它并不是说模型完全随机输出,也不是说所有⻓思维链都没有价
值,⽽是指:模型在内部激活中已经较早形成了对最终答案的⾼置信判断,但外部输出仍继续⽣成看似犹豫、
探索、推导或⾃我检查的⽂字。也就是说,模型可能在内部"已经知道答案",却在⽂本上继续表现为"还在⼀
步步想"。
这⾥的关键⽭盾不是模型最终是否答对,⽽是"内部答案形成时间"和"外部⽂本承认答案的时间"之间是否存在
明显错位。如果内部状态很早就指向某个答案,⽽⽂本要到很后⾯才透露这个答案,那么只阅读⽂本的监控者
就会滞后。

3. 研究设计:三种⽅法⽐较"模型何时知道答案"
为了研究这种错位,论⽂⽐较了三类"早期解码"⽅法:
- 激活探针:在模型⽣成思维链的不同位置截取内部激活,训练⼀个轻量探针预测模型最终会选择的答案。使
⽤注意⼒池化探针,对⼀段前缀中的隐藏状态做可学习的加权汇聚。
- 强制提前作答:在模型⽣成到某个中间步骤时截断思维链,然后提示同⼀个模型⽴刻给出最终选项,观察模
型在该时刻是否已经具备回答能⼒。
- 思维链监测器:另⼀个语⾔模型,只能阅读被测模型已经⽣成的部分思维链,判断这些⽂本是否⾜以推出最
终选项;信息不⾜时可以回答"不⾜以判断"。
三种⽅法的信息权限不同:激活探针能读内部表示,强制提前作答能把潜在信息压出来,思维链监测器只能看
外部⽂字。三者之间的时间差就能反映内部信念和外显⽂本之间的错位。

4. 实验设置
论⽂主要分析DeepSeek-R1 671B和GPT-OSS 120B两个开放权重推理模型。实验任务包括MMLU-Redux
2.0(5280道题,偏知识回忆)和GPQA-Diamond(198道更困难的科学问题,需要多步推理)。论⽂关注的
是:在思维链⽣成到0%、20%、50%、80%等不同位置时,三种⽅法分别能多早看出模型最终会选什么。

5. 主要发现:容易题更容易出现"表演式推理"
论⽂的核⼼发现是,表演式思维链具有明显的任务差异。在MMLU-Redux这类相对容易、偏知识回忆的题⽬
上,激活探针和强制提前作答常常在思维链很早的位置就能较⾼准确率地预测模型最终答案;但思维链监测器
要晚得多才从⽂本中看到答案线索。这说明模型内部答案信息已经出现,后续较⻓的思维链更多是在铺陈、解
释或延迟显露答案。
论⽂⽤"探针/强制提前作答与⽂本监测器之间的信息增益差距"来刻画"表演性"。在DeepSeek-R1上,MMLU
的"探针相对监测器"差距为0.417,"强制作答相对监测器"差距为0.505;⽽GPQA-Diamond上对应数值只有
0.012和0.010,接近0。这意味着:对偏记忆的题,模型可能读完题后很快就知道答案,只是仍继续写出⼀段
像推理过程的⽂字;⽽在困难多跳题上,三种⽅法的准确率通常从接近随机⽔平开始,随着推理过程逐步提
⾼,三者增⻓趋势更⼀致。

6. 模型规模的影响
更⼤的模型往往更早就能从内部激活中解码出最终答案,说明它们可能更多依赖参数中已有的知识和先验。较
⼩的蒸馏模型在前半段推理中探针准确率更低,后⾯才逐渐提升,表现得更像"需要现场推理"。但"是否表演
式"不是模型的固定属性,⽽是模型能⼒、任务难度和答案是否容易被已有知识快速确定之间的交互结果。

7. 转折点:⻓思维链并不总是表演
论⽂特别研究了思维链中的"转折点",例如回溯、重新考虑、突然意识到某个条件的重要性。结果显示,⾼置
信回答(从开始探针置信度就达到90%以上且之后从未低于90%)中的转折点更少:所有转折点按步骤归⼀
化后的总⽐例为0.020,⽽⾮⾼置信回答为0.045,约为前者两倍多。这说明许多回溯和重新考虑并⾮纯粹表
演,⽽可能对应真实的不确定性消解。

8. 讨论:思维链监控的价值与边界
论⽂的重点不是简单否定思维链,⽽是要求更谨慎地解释思维链。对于容易题,模型可能已经在内部形成答
案,但继续⽣成⻓篇推导;只读⽂本的监测器直到答案接近显露时才知道模型要选什么。在这种情形下,思维
链⽂本可能⽆法可靠⽤于发现"模型是否已经承诺了某个答案"。
对于困难题,情况不同。如果答案信息确实在⽣成过程中逐步出现,那么⽂本推理可能更好地追踪模型内部信
念变化。换句话说,思维链监控并不是完全⽆效,⽽是有适⽤条件。

9. ⼯程启发:探针置信度早退
论⽂提出的⼯程启发是"基于探针置信度的早退"。如果注意⼒探针经过校准,能够在中间位置以较⾼置信度预
测最终答案,并且答案在连续步骤中保持稳定,那么系统可以提前停⽌⽣成,不再让模型继续写完整思维链。
这种策略把探针从解释⼯具变成⾃适应计算⼯具:简单题少⽣成,复杂题多⽣成。
论⽂报告,在MMLU上,DeepSeek-R1以95%置信度阈值早退时,可以保留原始性能的97%,同时节省68%
的⽣成token;在GPQA-Diamond上,80%置信度阈值早退可以保留约97%的性能,并节省50%的token。这
个差异也呼应了前⾯的讨论:容易题更容易提前确定答案,因此早退空间更⼤。
早退并不等于越早停⽌越好。若探针没有校准,或者任务确实需要多步推理,过早停⽌可能让模型错过后续关
键计算,损害准确率。更合理的策略是设置较⾼置信度阈值,同时要求答案在相邻步骤中保持稳定。

10. 总结
这篇论⽂提醒⼈们区分两种情况:⼀种是模型已经内部确定答案,后续思维链主要起解释、包装或延迟显露作
⽤;另⼀种是模型确实在⽣成过程中逐步形成答案,思维链更忠实地反映了推理过程。
28、【材料题3·论文阅读:思维链忠实性与早退策略】 某道MMLU 类题目中,模型生成到思维链20%位置时,激活探针已经以较高置信度预测最终选项为B;此时强制模型提前作答,模型也输出B;但只阅读已生成文本的思维链监测器回答"不足以判断"。直到思维链接近结尾时,文本才明确支持B。根据阅读材料,对这一现象最合理的解释是:
29、【材料题3·论文阅读:思维链忠实性与早退策略】 阅读材料给出DeepSeek-R1上的"探针相对监测器"差距:MMLU 为0.417,GPQA-Diamond为0.012;"强制作答相对监测器"差距:MMLU 为0.505,GPQA-Diamond为0.010。对这些数字的解读,最准确的是:
30、【材料题3·论文阅读:思维链忠实性与早退策略】 某系统希望使用探针置信度做早退。连续4个检查点的探针输出如下,其中阈值设为0.90,要求"同一答案连续两个检查点置信度均不低于阈值"才允许早退: 检查点预测答案置信度 20% B 0.86 40% C 0.91 60% B 0.93 80% B 0.94 根据阅读材料中"高置信度+答案稳定性"的原则,以下策略最合理的是:
更多问卷 复制此问卷