模型可在不暴露影响下被引导

X:马东锡 NLP (@dongxi_nlp)2026-08-07 13:16

模型可以在不暴露其影响的情况下被引导。 悄无声息的轻推可以逃过推理监控器的检测。 论文: 《在隐式影响场景下,思维链监控可能不可靠》

ai