来自人类反馈的强化学习(RLHF)
Mina Parham
AI Engineer


from peft import prepare_model_for_int8_trainingpretrained_model = AutoModelForCausalLM.from_pretrained( model_name, load_in_8bit=True )pretrained_model_8bit = prepare_model_for_int8_training(pretrained_model)
from peft import LoraConfig, get_peft_modelconfig = LoraConfig(r=32, # 低秩矩阵的秩lora_alpha=32, # LoRA 更新的缩放因子lora_dropout=0.1, # LoRA 层的 dropout 比率bias="lora_only"# 仅更新 LoRA 层的偏置,其他保持冻结)lora_model = get_peft_model(pretrained_model_8bit, config) model = AutoModelForCausalLMWithValueHead.from_pretrained(lora_model)
ppo_trainer = PPOTrainer(
config, # 刚定义的配置
model, # 我们的 PPO 模型
ref_model=None,
tokenizer=tokenizer,
dataset=dataset,
data_collator=collator,
optimizer=optimizer
)
来自人类反馈的强化学习(RLHF)