payelb
/

PKUSafeRLHF_TinyLlama-1.1B_aligned_with_MARS_RM

Model card Files Files and versions

PKUSafeRLHF_TinyLlama-1.1B_aligned_with_MARS_RM / README.md

payelb's picture

Upload PPO-aligned TinyLlama-1.1B model using MARS reward model on PKUSafeRLHF

8f21213 verified 18 days ago

|

history blame contribute delete

372 Bytes

payelb/PKUSafeRLHF_TinyLlama-1.1B_aligned_with_MARS_RM

Base model: TinyLlama/TinyLlama-1.1B-Chat-v1.0

Alignment dataset: PKU-Alignment/PKU-SafeRLHF

Reward model: payelb/PKUSafeRLHF_roberta-base_1k_fixed_MARS

Method: PPO alignment with LoRA adapters.

Notes:

Reward normalization and clipping enabled
KL control enabled
pad_token_id/eos_token_id explicitly set