Training in progress, step 75, checkpoint

Browse files

Files changed (5) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +202 -3

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:b57fd0cff793537098323bd889b5020738b1e5e3873ae4c3af72cdc2de9247e4
 size 35237104

 version https://git-lfs.github.com/spec/v1
+oid sha256:24a563f5a4ddd822e5bcf1fe4d9864c503a827a33f3eca3615cf428388d2b6b3
 size 35237104

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:edf79ebb668d9aa689be333cfefdfbb14459870e45c29d0406fdaa3599bbecf1
 size 70667778

 version https://git-lfs.github.com/spec/v1
+oid sha256:4358faaad86c1bb59c4f36737764daa2f32c856743a4b1b243e2e92cb9cba37d
 size 70667778

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:12268954978dab25b5aaff68eb836df3d54e4f583ead17bf0e2167e105e8bf94
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:a1ac9e9984393f21feee4c2b4ab3c9ba671bf2d1c3b0d832bd5e9f9194775eae
 size 14244

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:a89ffc445067fef9d6d02bb3ff9e61d5e3209e6fa67c7259b3b364b90dbaa2cd
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:f23e2214bcafb439ebc7528dcc283ef6218d509a276c0baff0743503ecbe3d92
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
   "best_metric": null,
   "best_model_checkpoint": null,
-  "epoch": 0.041736227045075125,
   "eval_steps": 9,
-  "global_step": 50,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -405,6 +405,205 @@
       "learning_rate": 5.868240888334653e-05,
       "loss": 2.5819,
       "step": 50
     }
   ],
   "logging_steps": 1,
@@ -424,7 +623,7 @@
       "attributes": {}
     }
   },
-  "total_flos": 1964600469749760.0,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null

 {
   "best_metric": null,
   "best_model_checkpoint": null,
+  "epoch": 0.06260434056761269,
   "eval_steps": 9,
+  "global_step": 75,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "learning_rate": 5.868240888334653e-05,
       "loss": 2.5819,
       "step": 50
+    },
+    {
+      "epoch": 0.04257095158597663,
+      "grad_norm": 1.1659084558486938,
+      "learning_rate": 5.695865504800327e-05,
+      "loss": 3.0356,
+      "step": 51
+    },
+    {
+      "epoch": 0.04340567612687813,
+      "grad_norm": 1.0479695796966553,
+      "learning_rate": 5.522642316338268e-05,
+      "loss": 2.9132,
+      "step": 52
+    },
+    {
+      "epoch": 0.04424040066777963,
+      "grad_norm": 1.0335667133331299,
+      "learning_rate": 5.348782368720626e-05,
+      "loss": 2.8807,
+      "step": 53
+    },
+    {
+      "epoch": 0.045075125208681135,
+      "grad_norm": 0.9959902763366699,
+      "learning_rate": 5.174497483512506e-05,
+      "loss": 2.5507,
+      "step": 54
+    },
+    {
+      "epoch": 0.045075125208681135,
+      "eval_loss": 2.8698601722717285,
+      "eval_runtime": 32.0898,
+      "eval_samples_per_second": 31.443,
+      "eval_steps_per_second": 3.958,
+      "step": 54
+    },
+    {
+      "epoch": 0.045909849749582635,
+      "grad_norm": 1.5530030727386475,
+      "learning_rate": 5e-05,
+      "loss": 2.9575,
+      "step": 55
+    },
+    {
+      "epoch": 0.04674457429048414,
+      "grad_norm": 1.4625574350357056,
+      "learning_rate": 4.825502516487497e-05,
+      "loss": 2.9145,
+      "step": 56
+    },
+    {
+      "epoch": 0.04757929883138564,
+      "grad_norm": 1.3883436918258667,
+      "learning_rate": 4.6512176312793736e-05,
+      "loss": 3.0878,
+      "step": 57
+    },
+    {
+      "epoch": 0.048414023372287146,
+      "grad_norm": 1.4030698537826538,
+      "learning_rate": 4.477357683661734e-05,
+      "loss": 2.7505,
+      "step": 58
+    },
+    {
+      "epoch": 0.049248747913188645,
+      "grad_norm": 1.3059231042861938,
+      "learning_rate": 4.3041344951996746e-05,
+      "loss": 2.8434,
+      "step": 59
+    },
+    {
+      "epoch": 0.05008347245409015,
+      "grad_norm": 0.8829728960990906,
+      "learning_rate": 4.131759111665349e-05,
+      "loss": 2.1365,
+      "step": 60
+    },
+    {
+      "epoch": 0.05091819699499165,
+      "grad_norm": 1.467118501663208,
+      "learning_rate": 3.960441545911204e-05,
+      "loss": 3.1508,
+      "step": 61
+    },
+    {
+      "epoch": 0.05175292153589316,
+      "grad_norm": 1.2122942209243774,
+      "learning_rate": 3.790390522001662e-05,
+      "loss": 2.8352,
+      "step": 62
+    },
+    {
+      "epoch": 0.052587646076794656,
+      "grad_norm": 0.994874119758606,
+      "learning_rate": 3.6218132209150045e-05,
+      "loss": 2.911,
+      "step": 63
+    },
+    {
+      "epoch": 0.052587646076794656,
+      "eval_loss": 2.8601207733154297,
+      "eval_runtime": 32.4405,
+      "eval_samples_per_second": 31.103,
+      "eval_steps_per_second": 3.915,
+      "step": 63
+    },
+    {
+      "epoch": 0.05342237061769616,
+      "grad_norm": 1.038936734199524,
+      "learning_rate": 3.4549150281252636e-05,
+      "loss": 2.8027,
+      "step": 64
+    },
+    {
+      "epoch": 0.05425709515859766,
+      "grad_norm": 0.9290437698364258,
+      "learning_rate": 3.289899283371657e-05,
+      "loss": 2.8319,
+      "step": 65
+    },
+    {
+      "epoch": 0.05509181969949917,
+      "grad_norm": 1.4522688388824463,
+      "learning_rate": 3.12696703292044e-05,
+      "loss": 2.9978,
+      "step": 66
+    },
+    {
+      "epoch": 0.055926544240400666,
+      "grad_norm": 1.5390747785568237,
+      "learning_rate": 2.9663167846209998e-05,
+      "loss": 2.7995,
+      "step": 67
+    },
+    {
+      "epoch": 0.05676126878130217,
+      "grad_norm": 1.095628261566162,
+      "learning_rate": 2.8081442660546125e-05,
+      "loss": 2.832,
+      "step": 68
+    },
+    {
+      "epoch": 0.05759599332220367,
+      "grad_norm": 1.1453615427017212,
+      "learning_rate": 2.6526421860705473e-05,
+      "loss": 2.7923,
+      "step": 69
+    },
+    {
+      "epoch": 0.05843071786310518,
+      "grad_norm": 1.3366105556488037,
+      "learning_rate": 2.500000000000001e-05,
+      "loss": 2.8731,
+      "step": 70
+    },
+    {
+      "epoch": 0.05926544240400668,
+      "grad_norm": 1.453717827796936,
+      "learning_rate": 2.350403678833976e-05,
+      "loss": 2.8363,
+      "step": 71
+    },
+    {
+      "epoch": 0.06010016694490818,
+      "grad_norm": 1.1732043027877808,
+      "learning_rate": 2.2040354826462668e-05,
+      "loss": 2.8937,
+      "step": 72
+    },
+    {
+      "epoch": 0.06010016694490818,
+      "eval_loss": 2.853658437728882,
+      "eval_runtime": 32.1886,
+      "eval_samples_per_second": 31.347,
+      "eval_steps_per_second": 3.945,
+      "step": 72
+    },
+    {
+      "epoch": 0.06093489148580968,
+      "grad_norm": 0.9332495331764221,
+      "learning_rate": 2.061073738537635e-05,
+      "loss": 2.8937,
+      "step": 73
+    },
+    {
+      "epoch": 0.06176961602671119,
+      "grad_norm": 1.1398509740829468,
+      "learning_rate": 1.9216926233717085e-05,
+      "loss": 2.8762,
+      "step": 74
+    },
+    {
+      "epoch": 0.06260434056761269,
+      "grad_norm": 0.7939409613609314,
+      "learning_rate": 1.7860619515673033e-05,
+      "loss": 2.9231,
+      "step": 75
     }
   ],
   "logging_steps": 1,
       "attributes": {}
     }
   },
+  "total_flos": 2991960348426240.0,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null