你有没有发现跟大模型对话,同样的提示词每次结果都不一样。 这符合我们对于“大模型的本质就是个猜词器”的一贯认知。然而,可重复性是科学进步的基石。因此让大模型输出完全确定的结果是一个非常值得研究的问题,特别是强化学习需要确定性的 Rollout,来保证实验的可复现性和训练过程的稳定性。