一、核心概念:温度(Temperature)是什么?
当我们谈论大模型的“创造力”或“发散性”时,temperature 参数是背后的总导演。从技术角度讲,它控制着模型预测下一个 token(词或字符)时,其概率分布的“尖锐”或“平坦”程度。简单来说,温度值越低,模型的选择越确定、越保守,它会倾向于选择模型认为最有可能的下一个词,输出结果更稳定、更符合训练数据的常见模式。温度值越高,模型的选择越随机、越发散,那些概率较低的“冷门”词也有机会被选中,从而产生更意想不到、更有“创意”的内容,但也更容易出现事实错误或逻辑不通。
可以把它想象成调音台上的一个旋钮:低温是“清晰模式”,高温是“混响模式”。理解这一点是调优的第一步,因为它直接决定了你希望模型在确定性和创造力之间如何权衡。
二、超越温度:其他关键的采样参数
温度虽然是最知名的参数,但它并非独自工作。top_p 和 top_k 是它的左膀右臂,共同决定最终的词选择。