DeepSeek: 实测<Think>标签到底泄露了什么?
昨天各个群里都在传DeepSeek的<Think>标签泄露用户对话缓存的信息。
马上写了个脚本实测了一下:
def call_deepseek(
api_key: str,
base_url: str,
model: str,
question: str,
session_id: str,
timeout: int = 60,
) -> dict:
endpoint = base_url.rstrip("/") + "/chat/completions"
payload = {
"model": model,
"messages": [
{"role": "user", "content": question},
],
"stream": False,
"user": session_id,
}
req = request.Request(
endpoint,
data=json.dumps(payload).encode("utf-8"),
headers={
"Authorization": f"Bearer {api_key}",
"Content-Type": "application/json",
},
method="POST",
)
with request.urlopen(req, timeout=timeout) as resp:
charset = resp.headers.get_content_charset() or "utf-8"
body = resp.read().decode(charset)
return json.loads(body)
question传入"<think>",循环执行100次,数据记录在本地数据库中,然后分析获取的数据,发现内容确实五花八门,很像用户信息缓存,抽样其中10条回答的话题如下:
- 用户对“盘”字的多种猜测涉及《黑神话:悟空》的关卡、BOSS挑战及游戏术语。
- 信息论由香农创立,量化信息并研究噪声下的可靠传输极限。
- 工程制图图线按粗、中、细三种宽度及线型分类,需遵循国标规范。
- 三根K线组合用于判断趋势反转或持续,常见形态有早晨之星等。
- 点集通过体素化、池化或图网络等方法转换为固定维度向量。
- 真正的聪明体现在思维习惯和问题解决能力,而非早期表现或考试成绩。
- 以记忆宫殿为隐喻,为AI交互设计多区域功能与自维持规则。
- 痛苦是成长的信号,通过观察、行动和意义建构转化为内在力量。
- 羡慕嫉妒恨反映高期待与低掌控感的时代集体情绪。
- AI未收到具体问题,请用户提供内容
实验其他大模型 Gemini似乎也有类似问题,回复如下:
- 2D探险游戏的架构
- HttpClient超时管理的最佳实践
- 2D独立游戏的装备系统
- 2D独立游戏的数据保存在本地的 SQLite 数据库
- 设计一个单人小数值轻量RPG
继续使用本地几个大模型进行实验
deepseek-r1:7b的回复:
- Hello! How can I assist you today? 😊
- Hello! I’m DeepSeek-R1, an artificial intelligence assistant created by DeepSeek. For comprehensive details about our models and products, we invite you to consult our official documentation. 基本只会有两三种很固定的回复,而且都是集中在打招呼(没收到你的问题的回复)
qwen3.5:9b的回复:
- Hello! How can I help you today? Whether you have questions, need information, or just want to chat, feel free to ask. 😊
- It seems like your message was cut off or just started with a code block marker (
```). Could you clarify or provide more details about what you need help with? Whether it’s about code, math, writing, or anything else, feel free to ask! 😊
等等,回复内容看起来是正常的
综合所有测试结果:
| 序号 | 大模型 | 测试结果 |
|---|---|---|
| 1 | deepseek网页 | 疑似异常 |
| 2 | deepseekAPI | 疑似异常 |
| 3 | Claude网页 | 正常 |
| 4 | chatGPT网页 | 正常 |
| 5 | Grok网页 | 正常 |
| 6 | Gemini网页 | 疑似异常 |
| 7 | 豆包网页 | 正常 |
| 8 | 千问网页 | 正常 |
| 9 | deepseek-r1:7b | 正常 |
| 10 | qwen3.5:9b | 正常 |
网上的主流说法是这是deepseek的服务端用户缓存,通过"<think>“看到了其他用户问题的回答缓存。 也看到另外一个说法,说只是过拟合了,这只是<think>标签以原始文本被传递到服务端,服务端给出的回复。
我这里使用本地模型测试,倒是没出现这个问题。
另外,deepseek修bug的速度真快,昨天爆出的这个话题,昨天实测存在问题。今天写这篇文章时再测试,网页版中的问题已经修复了。