Upload folder using huggingface_hub

Browse files

Files changed (13) hide show

ft_7b_NLSY79_numeric_ckpt_3/config.json +31 -0
ft_7b_NLSY79_numeric_ckpt_3/generation_config.json +10 -0
ft_7b_NLSY79_numeric_ckpt_3/model-00001-of-00006.safetensors +3 -0
ft_7b_NLSY79_numeric_ckpt_3/model-00002-of-00006.safetensors +3 -0
ft_7b_NLSY79_numeric_ckpt_3/model-00003-of-00006.safetensors +3 -0
ft_7b_NLSY79_numeric_ckpt_3/model-00004-of-00006.safetensors +3 -0
ft_7b_NLSY79_numeric_ckpt_3/model-00005-of-00006.safetensors +3 -0
ft_7b_NLSY79_numeric_ckpt_3/model-00006-of-00006.safetensors +3 -0
ft_7b_NLSY79_numeric_ckpt_3/model.safetensors.index.json +298 -0
ft_7b_NLSY79_numeric_ckpt_3/special_tokens_map.json +30 -0
ft_7b_NLSY79_numeric_ckpt_3/tokenizer.json +0 -0
ft_7b_NLSY79_numeric_ckpt_3/tokenizer_config.json +52 -0
ft_7b_NLSY79_numeric_ckpt_3/trainer_state.json +645 -0

ft_7b_NLSY79_numeric_ckpt_3/config.json ADDED Viewed

	@@ -0,0 +1,31 @@

+{
+  "_name_or_path": "togethercomputer/llama-2-7b",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "head_dim": 128,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 11008,
+  "max_position_embeddings": 4096,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 32,
+  "pad_token_id": 0,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 10000.0,
+  "tie_word_embeddings": false,
+  "torch_dtype": "float32",
+  "transformers_version": "4.45.1",
+  "use_cache": false,
+  "vocab_size": 32000
+}

ft_7b_NLSY79_numeric_ckpt_3/generation_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "bos_token_id": 1,
+  "do_sample": true,
+  "eos_token_id": 2,
+  "max_length": 4096,
+  "pad_token_id": 32000,
+  "temperature": 0.6,
+  "top_p": 0.9,
+  "transformers_version": "4.45.1"
+}

ft_7b_NLSY79_numeric_ckpt_3/model-00001-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:38575ada3644733d01c9c8244575730f4be748f7837b2c315a3ab21d16277529
+size 4840396416

ft_7b_NLSY79_numeric_ckpt_3/model-00002-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cc14a4dec910feca24b532902a794f691472d8f51eb03ca9e0189364221698f5
+size 4857206856

ft_7b_NLSY79_numeric_ckpt_3/model-00003-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1355600dab31b5e227495a36ae03db9a660d7594aa9a415366e9e46ec23629d9
+size 4857206904

ft_7b_NLSY79_numeric_ckpt_3/model-00004-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2b4460799d2d2cdf081c32a54d1b6facda939cd47a503e924d4c4070557c6325
+size 4857206904

ft_7b_NLSY79_numeric_ckpt_3/model-00005-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:225e2d929be06c02d98f73dda7b9746d0c0d03cd199ecf09d906f240d0d9058e
+size 4857206904

ft_7b_NLSY79_numeric_ckpt_3/model-00006-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c79ae6daedcf8840c45fa8d7eb8c4d84d00db80a3077583473065667828df39c
+size 2684472112

ft_7b_NLSY79_numeric_ckpt_3/model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,298 @@

+{
+  "metadata": {
+    "total_size": 26953662464
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00006-of-00006.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.norm.weight": "model-00006-of-00006.safetensors"
+  }
+}

ft_7b_NLSY79_numeric_ckpt_3/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,30 @@

+{
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  }
+}

ft_7b_NLSY79_numeric_ckpt_3/tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

ft_7b_NLSY79_numeric_ckpt_3/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,52 @@

+{
+  "add_bos_token": true,
+  "add_eos_token": false,
+  "add_prefix_space": null,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32000": {
+      "content": "<pad>",
+      "lstrip": true,
+      "normalized": true,
+      "rstrip": true,
+      "single_word": false,
+      "special": false
+    }
+  },
+  "additional_special_tokens": [],
+  "bos_token": "<s>",
+  "chat_template": "{% if messages[0]['role'] == 'system' %}{% set loop_messages = messages[1:] %}{% set system_message = messages[0]['content'] %}{% else %}{% set loop_messages = messages %}{% set system_message = false %}{% endif %}{% for message in loop_messages %}{% if loop.index0 == 0 and system_message != false %}{% set content = '<<SYS>>\\n' + system_message + '\\n<</SYS>>\\n\\n' + message['content'] %}{% else %}{% set content = message['content'] %}{% endif %}{% if message['role'] == 'user' or message['role'] == 'tool' %}{{ bos_token + '[INST] ' + content + ' [/INST]' }}{% elif message['role'] == 'system' %}{{ '<<SYS>>\\n' + content + '\\n<</SYS>>\\n\\n' }}{% elif message['role'] == 'assistant' %}{{ ' '  + content + ' ' + eos_token }}{% endif %}{% endfor %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "</s>",
+  "legacy": false,
+  "model_max_length": 4096,
+  "pad_token": "<unk>",
+  "padding_side": "right",
+  "sp_model_kwargs": {},
+  "tokenizer_class": "LlamaTokenizer",
+  "unk_token": "<unk>",
+  "use_default_system_prompt": true
+}

ft_7b_NLSY79_numeric_ckpt_3/trainer_state.json ADDED Viewed

	@@ -0,0 +1,645 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 3.0,
+  "eval_steps": 28,
+  "global_step": 84,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.03571428571428571,
+      "grad_norm": 11.919661521911621,
+      "learning_rate": 9.880952380952381e-06,
+      "loss": 1.0483,
+      "step": 1
+    },
+    {
+      "epoch": 0.07142857142857142,
+      "grad_norm": 5.637782096862793,
+      "learning_rate": 9.761904761904762e-06,
+      "loss": 0.7917,
+      "step": 2
+    },
+    {
+      "epoch": 0.10714285714285714,
+      "grad_norm": 4.753999710083008,
+      "learning_rate": 9.642857142857144e-06,
+      "loss": 0.4759,
+      "step": 3
+    },
+    {
+      "epoch": 0.14285714285714285,
+      "grad_norm": 5.962626934051514,
+      "learning_rate": 9.523809523809525e-06,
+      "loss": 0.3606,
+      "step": 4
+    },
+    {
+      "epoch": 0.17857142857142858,
+      "grad_norm": 2.603311777114868,
+      "learning_rate": 9.404761904761905e-06,
+      "loss": 0.244,
+      "step": 5
+    },
+    {
+      "epoch": 0.21428571428571427,
+      "grad_norm": 1.5189177989959717,
+      "learning_rate": 9.285714285714288e-06,
+      "loss": 0.2214,
+      "step": 6
+    },
+    {
+      "epoch": 0.25,
+      "grad_norm": 7.829935550689697,
+      "learning_rate": 9.166666666666666e-06,
+      "loss": 0.2326,
+      "step": 7
+    },
+    {
+      "epoch": 0.2857142857142857,
+      "grad_norm": 2.978585720062256,
+      "learning_rate": 9.047619047619049e-06,
+      "loss": 0.1932,
+      "step": 8
+    },
+    {
+      "epoch": 0.32142857142857145,
+      "grad_norm": 1.122315526008606,
+      "learning_rate": 8.92857142857143e-06,
+      "loss": 0.1934,
+      "step": 9
+    },
+    {
+      "epoch": 0.35714285714285715,
+      "grad_norm": 3.6377272605895996,
+      "learning_rate": 8.80952380952381e-06,
+      "loss": 0.2177,
+      "step": 10
+    },
+    {
+      "epoch": 0.39285714285714285,
+      "grad_norm": 0.8451521396636963,
+      "learning_rate": 8.690476190476192e-06,
+      "loss": 0.1968,
+      "step": 11
+    },
+    {
+      "epoch": 0.42857142857142855,
+      "grad_norm": 0.7287263870239258,
+      "learning_rate": 8.571428571428571e-06,
+      "loss": 0.1798,
+      "step": 12
+    },
+    {
+      "epoch": 0.4642857142857143,
+      "grad_norm": 0.6711848974227905,
+      "learning_rate": 8.452380952380953e-06,
+      "loss": 0.1754,
+      "step": 13
+    },
+    {
+      "epoch": 0.5,
+      "grad_norm": 0.6150436401367188,
+      "learning_rate": 8.333333333333334e-06,
+      "loss": 0.1739,
+      "step": 14
+    },
+    {
+      "epoch": 0.5357142857142857,
+      "grad_norm": 0.36332571506500244,
+      "learning_rate": 8.214285714285714e-06,
+      "loss": 0.1656,
+      "step": 15
+    },
+    {
+      "epoch": 0.5714285714285714,
+      "grad_norm": 0.4374944865703583,
+      "learning_rate": 8.095238095238097e-06,
+      "loss": 0.1786,
+      "step": 16
+    },
+    {
+      "epoch": 0.6071428571428571,
+      "grad_norm": 0.39076942205429077,
+      "learning_rate": 7.976190476190477e-06,
+      "loss": 0.178,
+      "step": 17
+    },
+    {
+      "epoch": 0.6428571428571429,
+      "grad_norm": 0.3334675133228302,
+      "learning_rate": 7.857142857142858e-06,
+      "loss": 0.1636,
+      "step": 18
+    },
+    {
+      "epoch": 0.6785714285714286,
+      "grad_norm": 0.20510493218898773,
+      "learning_rate": 7.738095238095238e-06,
+      "loss": 0.1623,
+      "step": 19
+    },
+    {
+      "epoch": 0.7142857142857143,
+      "grad_norm": 0.2360071837902069,
+      "learning_rate": 7.61904761904762e-06,
+      "loss": 0.1652,
+      "step": 20
+    },
+    {
+      "epoch": 0.75,
+      "grad_norm": 0.264940470457077,
+      "learning_rate": 7.500000000000001e-06,
+      "loss": 0.1619,
+      "step": 21
+    },
+    {
+      "epoch": 0.7857142857142857,
+      "grad_norm": 0.300240159034729,
+      "learning_rate": 7.380952380952382e-06,
+      "loss": 0.1535,
+      "step": 22
+    },
+    {
+      "epoch": 0.8214285714285714,
+      "grad_norm": 0.33321136236190796,
+      "learning_rate": 7.261904761904762e-06,
+      "loss": 0.1632,
+      "step": 23
+    },
+    {
+      "epoch": 0.8571428571428571,
+      "grad_norm": 0.22443978488445282,
+      "learning_rate": 7.1428571428571436e-06,
+      "loss": 0.1637,
+      "step": 24
+    },
+    {
+      "epoch": 0.8928571428571429,
+      "grad_norm": 0.2477205991744995,
+      "learning_rate": 7.023809523809524e-06,
+      "loss": 0.1661,
+      "step": 25
+    },
+    {
+      "epoch": 0.9285714285714286,
+      "grad_norm": 0.2265806943178177,
+      "learning_rate": 6.9047619047619055e-06,
+      "loss": 0.1588,
+      "step": 26
+    },
+    {
+      "epoch": 0.9642857142857143,
+      "grad_norm": 0.2170599400997162,
+      "learning_rate": 6.785714285714287e-06,
+      "loss": 0.1661,
+      "step": 27
+    },
+    {
+      "epoch": 1.0,
+      "grad_norm": 0.23174011707305908,
+      "learning_rate": 6.666666666666667e-06,
+      "loss": 0.1575,
+      "step": 28
+    },
+    {
+      "epoch": 1.0,
+      "eval_loss": 0.15946057438850403,
+      "eval_runtime": 2.1474,
+      "eval_samples_per_second": 58.674,
+      "eval_steps_per_second": 1.863,
+      "step": 28
+    },
+    {
+      "epoch": 1.0357142857142858,
+      "grad_norm": 0.25703656673431396,
+      "learning_rate": 6.547619047619048e-06,
+      "loss": 0.151,
+      "step": 29
+    },
+    {
+      "epoch": 1.0714285714285714,
+      "grad_norm": 0.21578814089298248,
+      "learning_rate": 6.4285714285714295e-06,
+      "loss": 0.1618,
+      "step": 30
+    },
+    {
+      "epoch": 1.1071428571428572,
+      "grad_norm": 0.23016810417175293,
+      "learning_rate": 6.30952380952381e-06,
+      "loss": 0.1652,
+      "step": 31
+    },
+    {
+      "epoch": 1.1428571428571428,
+      "grad_norm": 0.25853970646858215,
+      "learning_rate": 6.1904761904761914e-06,
+      "loss": 0.1651,
+      "step": 32
+    },
+    {
+      "epoch": 1.1785714285714286,
+      "grad_norm": 0.24886569380760193,
+      "learning_rate": 6.071428571428571e-06,
+      "loss": 0.1618,
+      "step": 33
+    },
+    {
+      "epoch": 1.2142857142857142,
+      "grad_norm": 0.2360197901725769,
+      "learning_rate": 5.9523809523809525e-06,
+      "loss": 0.1597,
+      "step": 34
+    },
+    {
+      "epoch": 1.25,
+      "grad_norm": 0.26883211731910706,
+      "learning_rate": 5.833333333333334e-06,
+      "loss": 0.1619,
+      "step": 35
+    },
+    {
+      "epoch": 1.2857142857142856,
+      "grad_norm": 0.28918421268463135,
+      "learning_rate": 5.7142857142857145e-06,
+      "loss": 0.159,
+      "step": 36
+    },
+    {
+      "epoch": 1.3214285714285714,
+      "grad_norm": 0.32539820671081543,
+      "learning_rate": 5.595238095238096e-06,
+      "loss": 0.1488,
+      "step": 37
+    },
+    {
+      "epoch": 1.3571428571428572,
+      "grad_norm": 0.25007861852645874,
+      "learning_rate": 5.476190476190477e-06,
+      "loss": 0.1596,
+      "step": 38
+    },
+    {
+      "epoch": 1.3928571428571428,
+      "grad_norm": 0.21030496060848236,
+      "learning_rate": 5.357142857142857e-06,
+      "loss": 0.1523,
+      "step": 39
+    },
+    {
+      "epoch": 1.4285714285714286,
+      "grad_norm": 0.2676588296890259,
+      "learning_rate": 5.2380952380952384e-06,
+      "loss": 0.1563,
+      "step": 40
+    },
+    {
+      "epoch": 1.4642857142857144,
+      "grad_norm": 0.25507068634033203,
+      "learning_rate": 5.119047619047619e-06,
+      "loss": 0.1519,
+      "step": 41
+    },
+    {
+      "epoch": 1.5,
+      "grad_norm": 0.17729367315769196,
+      "learning_rate": 5e-06,
+      "loss": 0.1551,
+      "step": 42
+    },
+    {
+      "epoch": 1.5357142857142856,
+      "grad_norm": 0.18454481661319733,
+      "learning_rate": 4.880952380952381e-06,
+      "loss": 0.1532,
+      "step": 43
+    },
+    {
+      "epoch": 1.5714285714285714,
+      "grad_norm": 0.29042497277259827,
+      "learning_rate": 4.761904761904762e-06,
+      "loss": 0.1473,
+      "step": 44
+    },
+    {
+      "epoch": 1.6071428571428572,
+      "grad_norm": 0.19090823829174042,
+      "learning_rate": 4.642857142857144e-06,
+      "loss": 0.1507,
+      "step": 45
+    },
+    {
+      "epoch": 1.6428571428571428,
+      "grad_norm": 0.18267019093036652,
+      "learning_rate": 4.523809523809524e-06,
+      "loss": 0.1551,
+      "step": 46
+    },
+    {
+      "epoch": 1.6785714285714286,
+      "grad_norm": 0.18257488310337067,
+      "learning_rate": 4.404761904761905e-06,
+      "loss": 0.1529,
+      "step": 47
+    },
+    {
+      "epoch": 1.7142857142857144,
+      "grad_norm": 0.21793578565120697,
+      "learning_rate": 4.2857142857142855e-06,
+      "loss": 0.1485,
+      "step": 48
+    },
+    {
+      "epoch": 1.75,
+      "grad_norm": 0.19642029702663422,
+      "learning_rate": 4.166666666666667e-06,
+      "loss": 0.153,
+      "step": 49
+    },
+    {
+      "epoch": 1.7857142857142856,
+      "grad_norm": 0.20266643166542053,
+      "learning_rate": 4.047619047619048e-06,
+      "loss": 0.1492,
+      "step": 50
+    },
+    {
+      "epoch": 1.8214285714285714,
+      "grad_norm": 0.22516804933547974,
+      "learning_rate": 3.928571428571429e-06,
+      "loss": 0.1504,
+      "step": 51
+    },
+    {
+      "epoch": 1.8571428571428572,
+      "grad_norm": 0.1919289529323578,
+      "learning_rate": 3.80952380952381e-06,
+      "loss": 0.1495,
+      "step": 52
+    },
+    {
+      "epoch": 1.8928571428571428,
+      "grad_norm": 0.22315968573093414,
+      "learning_rate": 3.690476190476191e-06,
+      "loss": 0.1503,
+      "step": 53
+    },
+    {
+      "epoch": 1.9285714285714286,
+      "grad_norm": 0.1482672542333603,
+      "learning_rate": 3.5714285714285718e-06,
+      "loss": 0.1537,
+      "step": 54
+    },
+    {
+      "epoch": 1.9642857142857144,
+      "grad_norm": 0.2447565644979477,
+      "learning_rate": 3.4523809523809528e-06,
+      "loss": 0.1539,
+      "step": 55
+    },
+    {
+      "epoch": 2.0,
+      "grad_norm": 0.18086212873458862,
+      "learning_rate": 3.3333333333333333e-06,
+      "loss": 0.1504,
+      "step": 56
+    },
+    {
+      "epoch": 2.0,
+      "eval_loss": 0.15052884817123413,
+      "eval_runtime": 2.1528,
+      "eval_samples_per_second": 58.529,
+      "eval_steps_per_second": 1.858,
+      "step": 56
+    },
+    {
+      "epoch": 2.0357142857142856,
+      "grad_norm": 0.1740996390581131,
+      "learning_rate": 3.2142857142857147e-06,
+      "loss": 0.1497,
+      "step": 57
+    },
+    {
+      "epoch": 2.0714285714285716,
+      "grad_norm": 0.14250056445598602,
+      "learning_rate": 3.0952380952380957e-06,
+      "loss": 0.1461,
+      "step": 58
+    },
+    {
+      "epoch": 2.107142857142857,
+      "grad_norm": 0.16776707768440247,
+      "learning_rate": 2.9761904761904763e-06,
+      "loss": 0.1457,
+      "step": 59
+    },
+    {
+      "epoch": 2.142857142857143,
+      "grad_norm": 0.15274859964847565,
+      "learning_rate": 2.8571428571428573e-06,
+      "loss": 0.149,
+      "step": 60
+    },
+    {
+      "epoch": 2.1785714285714284,
+      "grad_norm": 0.23901039361953735,
+      "learning_rate": 2.7380952380952387e-06,
+      "loss": 0.1446,
+      "step": 61
+    },
+    {
+      "epoch": 2.2142857142857144,
+      "grad_norm": 0.15212753415107727,
+      "learning_rate": 2.6190476190476192e-06,
+      "loss": 0.1451,
+      "step": 62
+    },
+    {
+      "epoch": 2.25,
+      "grad_norm": 0.17873702943325043,
+      "learning_rate": 2.5e-06,
+      "loss": 0.1474,
+      "step": 63
+    },
+    {
+      "epoch": 2.2857142857142856,
+      "grad_norm": 0.1357268989086151,
+      "learning_rate": 2.380952380952381e-06,
+      "loss": 0.1488,
+      "step": 64
+    },
+    {
+      "epoch": 2.3214285714285716,
+      "grad_norm": 0.17847894132137299,
+      "learning_rate": 2.261904761904762e-06,
+      "loss": 0.1544,
+      "step": 65
+    },
+    {
+      "epoch": 2.357142857142857,
+      "grad_norm": 0.20869728922843933,
+      "learning_rate": 2.1428571428571427e-06,
+      "loss": 0.1469,
+      "step": 66
+    },
+    {
+      "epoch": 2.392857142857143,
+      "grad_norm": 0.15223827958106995,
+      "learning_rate": 2.023809523809524e-06,
+      "loss": 0.1474,
+      "step": 67
+    },
+    {
+      "epoch": 2.4285714285714284,
+      "grad_norm": 0.1523120105266571,
+      "learning_rate": 1.904761904761905e-06,
+      "loss": 0.1426,
+      "step": 68
+    },
+    {
+      "epoch": 2.4642857142857144,
+      "grad_norm": 0.1669520139694214,
+      "learning_rate": 1.7857142857142859e-06,
+      "loss": 0.1514,
+      "step": 69
+    },
+    {
+      "epoch": 2.5,
+      "grad_norm": 0.1686873584985733,
+      "learning_rate": 1.6666666666666667e-06,
+      "loss": 0.1541,
+      "step": 70
+    },
+    {
+      "epoch": 2.5357142857142856,
+      "grad_norm": 0.1791808158159256,
+      "learning_rate": 1.5476190476190479e-06,
+      "loss": 0.1464,
+      "step": 71
+    },
+    {
+      "epoch": 2.571428571428571,
+      "grad_norm": 0.15623259544372559,
+      "learning_rate": 1.4285714285714286e-06,
+      "loss": 0.1489,
+      "step": 72
+    },
+    {
+      "epoch": 2.607142857142857,
+      "grad_norm": 0.14973101019859314,
+      "learning_rate": 1.3095238095238096e-06,
+      "loss": 0.1514,
+      "step": 73
+    },
+    {
+      "epoch": 2.642857142857143,
+      "grad_norm": 0.2189069539308548,
+      "learning_rate": 1.1904761904761906e-06,
+      "loss": 0.1517,
+      "step": 74
+    },
+    {
+      "epoch": 2.678571428571429,
+      "grad_norm": 0.15775644779205322,
+      "learning_rate": 1.0714285714285714e-06,
+      "loss": 0.1421,
+      "step": 75
+    },
+    {
+      "epoch": 2.7142857142857144,
+      "grad_norm": 0.15489579737186432,
+      "learning_rate": 9.523809523809525e-07,
+      "loss": 0.1505,
+      "step": 76
+    },
+    {
+      "epoch": 2.75,
+      "grad_norm": 0.16758202016353607,
+      "learning_rate": 8.333333333333333e-07,
+      "loss": 0.1519,
+      "step": 77
+    },
+    {
+      "epoch": 2.7857142857142856,
+      "grad_norm": 0.13228367269039154,
+      "learning_rate": 7.142857142857143e-07,
+      "loss": 0.148,
+      "step": 78
+    },
+    {
+      "epoch": 2.821428571428571,
+      "grad_norm": 0.14372079074382782,
+      "learning_rate": 5.952380952380953e-07,
+      "loss": 0.1521,
+      "step": 79
+    },
+    {
+      "epoch": 2.857142857142857,
+      "grad_norm": 0.16200599074363708,
+      "learning_rate": 4.7619047619047623e-07,
+      "loss": 0.1503,
+      "step": 80
+    },
+    {
+      "epoch": 2.892857142857143,
+      "grad_norm": 0.12723486125469208,
+      "learning_rate": 3.5714285714285716e-07,
+      "loss": 0.1539,
+      "step": 81
+    },
+    {
+      "epoch": 2.928571428571429,
+      "grad_norm": 0.1323743462562561,
+      "learning_rate": 2.3809523809523811e-07,
+      "loss": 0.1473,
+      "step": 82
+    },
+    {
+      "epoch": 2.9642857142857144,
+      "grad_norm": 0.15712212026119232,
+      "learning_rate": 1.1904761904761906e-07,
+      "loss": 0.1439,
+      "step": 83
+    },
+    {
+      "epoch": 3.0,
+      "grad_norm": 0.11317042261362076,
+      "learning_rate": 0.0,
+      "loss": 0.1508,
+      "step": 84
+    },
+    {
+      "epoch": 3.0,
+      "eval_loss": 0.14835017919540405,
+      "eval_runtime": 2.1972,
+      "eval_samples_per_second": 57.346,
+      "eval_steps_per_second": 1.82,
+      "step": 84
+    }
+  ],
+  "logging_steps": 1.0,
+  "max_steps": 84,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 3,
+  "save_steps": 28,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": true
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 5.435330827334451e+16,
+  "train_batch_size": 4,
+  "trial_name": null,
+  "trial_params": null
+}