Upload folder using huggingface_hub

Browse files

Files changed (13) hide show

ft_7b_NLSY97_with_birth_year_ckpt_3/config.json +31 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/generation_config.json +10 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model-00001-of-00006.safetensors +3 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model-00002-of-00006.safetensors +3 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model-00003-of-00006.safetensors +3 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model-00004-of-00006.safetensors +3 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model-00005-of-00006.safetensors +3 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model-00006-of-00006.safetensors +3 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/model.safetensors.index.json +298 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/special_tokens_map.json +30 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/tokenizer.json +0 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/tokenizer_config.json +52 -0
ft_7b_NLSY97_with_birth_year_ckpt_3/trainer_state.json +414 -0

ft_7b_NLSY97_with_birth_year_ckpt_3/config.json ADDED Viewed

	@@ -0,0 +1,31 @@

+{
+  "_name_or_path": "togethercomputer/llama-2-7b",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 1,
+  "eos_token_id": 2,
+  "head_dim": 128,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 11008,
+  "max_position_embeddings": 4096,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 32,
+  "pad_token_id": 0,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 10000.0,
+  "tie_word_embeddings": false,
+  "torch_dtype": "float32",
+  "transformers_version": "4.45.1",
+  "use_cache": false,
+  "vocab_size": 32000
+}

ft_7b_NLSY97_with_birth_year_ckpt_3/generation_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "bos_token_id": 1,
+  "do_sample": true,
+  "eos_token_id": 2,
+  "max_length": 4096,
+  "pad_token_id": 32000,
+  "temperature": 0.6,
+  "top_p": 0.9,
+  "transformers_version": "4.45.1"
+}

ft_7b_NLSY97_with_birth_year_ckpt_3/model-00001-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:df3efa1d5c0166de96d0fcea26872ab9b89f84b8087cc79ae1fdf543c39019c3
+size 4840396416

ft_7b_NLSY97_with_birth_year_ckpt_3/model-00002-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:11b35d0187dbeccdb91a55facd03223eaba6711c90538a0d6c75dac076339a79
+size 4857206856

ft_7b_NLSY97_with_birth_year_ckpt_3/model-00003-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c5fb357ba8c857587b6c6c83113fa9d2c05bd7e37362abe827dc1170d00e42d4
+size 4857206904

ft_7b_NLSY97_with_birth_year_ckpt_3/model-00004-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:6c1a84eb49f6f4a4c84283b017e4c36b777c8ddef1571dd26bb47fd251aef378
+size 4857206904

ft_7b_NLSY97_with_birth_year_ckpt_3/model-00005-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:260ff06cc0b1de9f022dacdbc3a600489d7b2349cb5eff52855f6b997ec5e4d4
+size 4857206904

ft_7b_NLSY97_with_birth_year_ckpt_3/model-00006-of-00006.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e57324ce35e9a2a363cbda65c439c7d07e18539b9b79ed1a58ec9e8aaabc2480
+size 2684472112

ft_7b_NLSY97_with_birth_year_ckpt_3/model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,298 @@

+{
+  "metadata": {
+    "total_size": 26953662464
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00006-of-00006.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00003-of-00006.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00004-of-00006.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00005-of-00006.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00006-of-00006.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00006.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00006.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00006.safetensors",
+    "model.norm.weight": "model-00006-of-00006.safetensors"
+  }
+}

ft_7b_NLSY97_with_birth_year_ckpt_3/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,30 @@

+{
+  "bos_token": {
+    "content": "<s>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "</s>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "unk_token": {
+    "content": "<unk>",
+    "lstrip": false,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  }
+}

ft_7b_NLSY97_with_birth_year_ckpt_3/tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

ft_7b_NLSY97_with_birth_year_ckpt_3/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,52 @@

+{
+  "add_bos_token": true,
+  "add_eos_token": false,
+  "add_prefix_space": null,
+  "added_tokens_decoder": {
+    "0": {
+      "content": "<unk>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "1": {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "2": {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "32000": {
+      "content": "<pad>",
+      "lstrip": true,
+      "normalized": true,
+      "rstrip": true,
+      "single_word": false,
+      "special": false
+    }
+  },
+  "additional_special_tokens": [],
+  "bos_token": "<s>",
+  "chat_template": "{% if messages[0]['role'] == 'system' %}{% set loop_messages = messages[1:] %}{% set system_message = messages[0]['content'] %}{% else %}{% set loop_messages = messages %}{% set system_message = false %}{% endif %}{% for message in loop_messages %}{% if loop.index0 == 0 and system_message != false %}{% set content = '<<SYS>>\\n' + system_message + '\\n<</SYS>>\\n\\n' + message['content'] %}{% else %}{% set content = message['content'] %}{% endif %}{% if message['role'] == 'user' or message['role'] == 'tool' %}{{ bos_token + '[INST] ' + content + ' [/INST]' }}{% elif message['role'] == 'system' %}{{ '<<SYS>>\\n' + content + '\\n<</SYS>>\\n\\n' }}{% elif message['role'] == 'assistant' %}{{ ' '  + content + ' ' + eos_token }}{% endif %}{% endfor %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "</s>",
+  "legacy": false,
+  "model_max_length": 4096,
+  "pad_token": "<unk>",
+  "padding_side": "right",
+  "sp_model_kwargs": {},
+  "tokenizer_class": "LlamaTokenizer",
+  "unk_token": "<unk>",
+  "use_default_system_prompt": true
+}

ft_7b_NLSY97_with_birth_year_ckpt_3/trainer_state.json ADDED Viewed

	@@ -0,0 +1,414 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 3.0,
+  "eval_steps": 17,
+  "global_step": 51,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.058823529411764705,
+      "grad_norm": 14.359891891479492,
+      "learning_rate": 9.803921568627451e-06,
+      "loss": 1.1598,
+      "step": 1
+    },
+    {
+      "epoch": 0.11764705882352941,
+      "grad_norm": 7.887507915496826,
+      "learning_rate": 9.607843137254903e-06,
+      "loss": 0.9201,
+      "step": 2
+    },
+    {
+      "epoch": 0.17647058823529413,
+      "grad_norm": 7.017418384552002,
+      "learning_rate": 9.411764705882354e-06,
+      "loss": 0.5463,
+      "step": 3
+    },
+    {
+      "epoch": 0.23529411764705882,
+      "grad_norm": 7.650944709777832,
+      "learning_rate": 9.215686274509804e-06,
+      "loss": 0.3759,
+      "step": 4
+    },
+    {
+      "epoch": 0.29411764705882354,
+      "grad_norm": 5.457299709320068,
+      "learning_rate": 9.019607843137256e-06,
+      "loss": 0.2288,
+      "step": 5
+    },
+    {
+      "epoch": 0.35294117647058826,
+      "grad_norm": 2.910707950592041,
+      "learning_rate": 8.823529411764707e-06,
+      "loss": 0.2185,
+      "step": 6
+    },
+    {
+      "epoch": 0.4117647058823529,
+      "grad_norm": 7.998508930206299,
+      "learning_rate": 8.627450980392157e-06,
+      "loss": 0.2086,
+      "step": 7
+    },
+    {
+      "epoch": 0.47058823529411764,
+      "grad_norm": 1.0877732038497925,
+      "learning_rate": 8.43137254901961e-06,
+      "loss": 0.1671,
+      "step": 8
+    },
+    {
+      "epoch": 0.5294117647058824,
+      "grad_norm": 1.145589828491211,
+      "learning_rate": 8.23529411764706e-06,
+      "loss": 0.1621,
+      "step": 9
+    },
+    {
+      "epoch": 0.5882352941176471,
+      "grad_norm": 0.7896699905395508,
+      "learning_rate": 8.03921568627451e-06,
+      "loss": 0.1495,
+      "step": 10
+    },
+    {
+      "epoch": 0.6470588235294118,
+      "grad_norm": 0.516334056854248,
+      "learning_rate": 7.84313725490196e-06,
+      "loss": 0.1416,
+      "step": 11
+    },
+    {
+      "epoch": 0.7058823529411765,
+      "grad_norm": 0.5364362001419067,
+      "learning_rate": 7.647058823529411e-06,
+      "loss": 0.1364,
+      "step": 12
+    },
+    {
+      "epoch": 0.7647058823529411,
+      "grad_norm": 0.4288877546787262,
+      "learning_rate": 7.450980392156863e-06,
+      "loss": 0.1363,
+      "step": 13
+    },
+    {
+      "epoch": 0.8235294117647058,
+      "grad_norm": 0.35166794061660767,
+      "learning_rate": 7.2549019607843145e-06,
+      "loss": 0.13,
+      "step": 14
+    },
+    {
+      "epoch": 0.8823529411764706,
+      "grad_norm": 0.46281731128692627,
+      "learning_rate": 7.058823529411766e-06,
+      "loss": 0.1368,
+      "step": 15
+    },
+    {
+      "epoch": 0.9411764705882353,
+      "grad_norm": 0.24695518612861633,
+      "learning_rate": 6.862745098039216e-06,
+      "loss": 0.127,
+      "step": 16
+    },
+    {
+      "epoch": 1.0,
+      "grad_norm": 0.3453289866447449,
+      "learning_rate": 6.666666666666667e-06,
+      "loss": 0.1377,
+      "step": 17
+    },
+    {
+      "epoch": 1.0,
+      "eval_loss": 0.13291074335575104,
+      "eval_runtime": 1.6183,
+      "eval_samples_per_second": 48.199,
+      "eval_steps_per_second": 1.854,
+      "step": 17
+    },
+    {
+      "epoch": 1.0588235294117647,
+      "grad_norm": 0.3154250979423523,
+      "learning_rate": 6.470588235294119e-06,
+      "loss": 0.1332,
+      "step": 18
+    },
+    {
+      "epoch": 1.1176470588235294,
+      "grad_norm": 0.289508193731308,
+      "learning_rate": 6.274509803921569e-06,
+      "loss": 0.127,
+      "step": 19
+    },
+    {
+      "epoch": 1.1764705882352942,
+      "grad_norm": 0.2529110908508301,
+      "learning_rate": 6.07843137254902e-06,
+      "loss": 0.132,
+      "step": 20
+    },
+    {
+      "epoch": 1.2352941176470589,
+      "grad_norm": 0.2912794351577759,
+      "learning_rate": 5.882352941176471e-06,
+      "loss": 0.1303,
+      "step": 21
+    },
+    {
+      "epoch": 1.2941176470588236,
+      "grad_norm": 0.2398548424243927,
+      "learning_rate": 5.686274509803922e-06,
+      "loss": 0.127,
+      "step": 22
+    },
+    {
+      "epoch": 1.3529411764705883,
+      "grad_norm": 0.24929042160511017,
+      "learning_rate": 5.4901960784313735e-06,
+      "loss": 0.1309,
+      "step": 23
+    },
+    {
+      "epoch": 1.4117647058823528,
+      "grad_norm": 0.2534692883491516,
+      "learning_rate": 5.294117647058824e-06,
+      "loss": 0.1287,
+      "step": 24
+    },
+    {
+      "epoch": 1.4705882352941178,
+      "grad_norm": 0.24865902960300446,
+      "learning_rate": 5.098039215686274e-06,
+      "loss": 0.1236,
+      "step": 25
+    },
+    {
+      "epoch": 1.5294117647058822,
+      "grad_norm": 0.22743427753448486,
+      "learning_rate": 4.901960784313726e-06,
+      "loss": 0.1256,
+      "step": 26
+    },
+    {
+      "epoch": 1.5882352941176472,
+      "grad_norm": 0.33256009221076965,
+      "learning_rate": 4.705882352941177e-06,
+      "loss": 0.127,
+      "step": 27
+    },
+    {
+      "epoch": 1.6470588235294117,
+      "grad_norm": 0.2789921164512634,
+      "learning_rate": 4.509803921568628e-06,
+      "loss": 0.1267,
+      "step": 28
+    },
+    {
+      "epoch": 1.7058823529411766,
+      "grad_norm": 0.27135005593299866,
+      "learning_rate": 4.313725490196079e-06,
+      "loss": 0.1282,
+      "step": 29
+    },
+    {
+      "epoch": 1.7647058823529411,
+      "grad_norm": 0.2998020648956299,
+      "learning_rate": 4.11764705882353e-06,
+      "loss": 0.1233,
+      "step": 30
+    },
+    {
+      "epoch": 1.8235294117647058,
+      "grad_norm": 0.19383421540260315,
+      "learning_rate": 3.92156862745098e-06,
+      "loss": 0.1282,
+      "step": 31
+    },
+    {
+      "epoch": 1.8823529411764706,
+      "grad_norm": 0.2980964183807373,
+      "learning_rate": 3.7254901960784316e-06,
+      "loss": 0.1276,
+      "step": 32
+    },
+    {
+      "epoch": 1.9411764705882353,
+      "grad_norm": 0.2439938336610794,
+      "learning_rate": 3.529411764705883e-06,
+      "loss": 0.1221,
+      "step": 33
+    },
+    {
+      "epoch": 2.0,
+      "grad_norm": 0.2092602252960205,
+      "learning_rate": 3.3333333333333333e-06,
+      "loss": 0.1221,
+      "step": 34
+    },
+    {
+      "epoch": 2.0,
+      "eval_loss": 0.1262439638376236,
+      "eval_runtime": 1.6061,
+      "eval_samples_per_second": 48.565,
+      "eval_steps_per_second": 1.868,
+      "step": 34
+    },
+    {
+      "epoch": 2.0588235294117645,
+      "grad_norm": 0.2056116759777069,
+      "learning_rate": 3.1372549019607846e-06,
+      "loss": 0.1213,
+      "step": 35
+    },
+    {
+      "epoch": 2.1176470588235294,
+      "grad_norm": 0.1927880346775055,
+      "learning_rate": 2.9411764705882355e-06,
+      "loss": 0.1175,
+      "step": 36
+    },
+    {
+      "epoch": 2.176470588235294,
+      "grad_norm": 0.16962529718875885,
+      "learning_rate": 2.7450980392156867e-06,
+      "loss": 0.1206,
+      "step": 37
+    },
+    {
+      "epoch": 2.235294117647059,
+      "grad_norm": 0.18827354907989502,
+      "learning_rate": 2.549019607843137e-06,
+      "loss": 0.128,
+      "step": 38
+    },
+    {
+      "epoch": 2.2941176470588234,
+      "grad_norm": 0.15534727275371552,
+      "learning_rate": 2.3529411764705885e-06,
+      "loss": 0.1274,
+      "step": 39
+    },
+    {
+      "epoch": 2.3529411764705883,
+      "grad_norm": 0.152162566781044,
+      "learning_rate": 2.1568627450980393e-06,
+      "loss": 0.1259,
+      "step": 40
+    },
+    {
+      "epoch": 2.411764705882353,
+      "grad_norm": 0.18159569799900055,
+      "learning_rate": 1.96078431372549e-06,
+      "loss": 0.1265,
+      "step": 41
+    },
+    {
+      "epoch": 2.4705882352941178,
+      "grad_norm": 0.20787517726421356,
+      "learning_rate": 1.7647058823529414e-06,
+      "loss": 0.1234,
+      "step": 42
+    },
+    {
+      "epoch": 2.5294117647058822,
+      "grad_norm": 0.1723829060792923,
+      "learning_rate": 1.5686274509803923e-06,
+      "loss": 0.124,
+      "step": 43
+    },
+    {
+      "epoch": 2.588235294117647,
+      "grad_norm": 0.1591772735118866,
+      "learning_rate": 1.3725490196078434e-06,
+      "loss": 0.1254,
+      "step": 44
+    },
+    {
+      "epoch": 2.6470588235294117,
+      "grad_norm": 0.14490148425102234,
+      "learning_rate": 1.1764705882352942e-06,
+      "loss": 0.1226,
+      "step": 45
+    },
+    {
+      "epoch": 2.7058823529411766,
+      "grad_norm": 0.15648190677165985,
+      "learning_rate": 9.80392156862745e-07,
+      "loss": 0.1199,
+      "step": 46
+    },
+    {
+      "epoch": 2.764705882352941,
+      "grad_norm": 0.16589215397834778,
+      "learning_rate": 7.843137254901962e-07,
+      "loss": 0.1245,
+      "step": 47
+    },
+    {
+      "epoch": 2.8235294117647056,
+      "grad_norm": 0.1226159930229187,
+      "learning_rate": 5.882352941176471e-07,
+      "loss": 0.123,
+      "step": 48
+    },
+    {
+      "epoch": 2.8823529411764706,
+      "grad_norm": 0.1442696899175644,
+      "learning_rate": 3.921568627450981e-07,
+      "loss": 0.1207,
+      "step": 49
+    },
+    {
+      "epoch": 2.9411764705882355,
+      "grad_norm": 0.1095050647854805,
+      "learning_rate": 1.9607843137254904e-07,
+      "loss": 0.1212,
+      "step": 50
+    },
+    {
+      "epoch": 3.0,
+      "grad_norm": 0.13223156332969666,
+      "learning_rate": 0.0,
+      "loss": 0.1224,
+      "step": 51
+    },
+    {
+      "epoch": 3.0,
+      "eval_loss": 0.12467500567436218,
+      "eval_runtime": 1.6198,
+      "eval_samples_per_second": 48.154,
+      "eval_steps_per_second": 1.852,
+      "step": 51
+    }
+  ],
+  "logging_steps": 1.0,
+  "max_steps": 51,
+  "num_input_tokens_seen": 0,
+  "num_train_epochs": 3,
+  "save_steps": 17,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": true
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 3.2992576055279616e+16,
+  "train_batch_size": 4,
+  "trial_name": null,
+  "trial_params": null
+}