Training in progress, step 50, checkpoint

Browse files

Files changed (5) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +202 -3

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:904fffda54b3b1dd4914eee88bd8cc863a1ab8ce306db98fff099bd24d917fd0
 size 167832240

 version https://git-lfs.github.com/spec/v1
+oid sha256:4f31796c4370254d6e20af3a4bd9050f4efb870b3205f7224d96093838d7db0c
 size 167832240

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:2e7baf021dd003235efcff7f08c17e0680a9b1b1a84656f161a5801dd35e15a7
 size 335922386

 version https://git-lfs.github.com/spec/v1
+oid sha256:adb77e550360b1cd3a584ae6e364bd2cdeb90bb658893b4adbad1abdeab7749f
 size 335922386

last-checkpoint/rng_state.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:4eb56092cc8ea9ba091dac6b07cb73418ed9d343f5a72342fc3307e5ddd8ec0c
 size 14244

 version https://git-lfs.github.com/spec/v1
+oid sha256:98d841eda044e2a0b4625c1a49f398ba41b30f358c4216b4153690415e794a13
 size 14244

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:8c931ece4da598a541d357f6c98f67481603252e193960022d37ddd49c584b1f
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:a89ffc445067fef9d6d02bb3ff9e61d5e3209e6fa67c7259b3b364b90dbaa2cd
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
   "best_metric": null,
   "best_model_checkpoint": null,
-  "epoch": 0.023820867079561697,
   "eval_steps": 9,
-  "global_step": 25,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -206,6 +206,205 @@
       "learning_rate": 9.330127018922194e-05,
       "loss": 2.2298,
       "step": 25
     }
   ],
   "logging_steps": 1,
@@ -225,7 +424,7 @@
       "attributes": {}
     }
   },
-  "total_flos": 3.70943641780224e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null

 {
   "best_metric": null,
   "best_model_checkpoint": null,
+  "epoch": 0.04764173415912339,
   "eval_steps": 9,
+  "global_step": 50,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "learning_rate": 9.330127018922194e-05,
       "loss": 2.2298,
       "step": 25
+    },
+    {
+      "epoch": 0.024773701762744165,
+      "grad_norm": 1.220881462097168,
+      "learning_rate": 9.24024048078213e-05,
+      "loss": 2.4306,
+      "step": 26
+    },
+    {
+      "epoch": 0.02572653644592663,
+      "grad_norm": 1.5156694650650024,
+      "learning_rate": 9.145187862775209e-05,
+      "loss": 2.7689,
+      "step": 27
+    },
+    {
+      "epoch": 0.02572653644592663,
+      "eval_loss": 2.390195369720459,
+      "eval_runtime": 195.5478,
+      "eval_samples_per_second": 4.521,
+      "eval_steps_per_second": 0.568,
+      "step": 27
+    },
+    {
+      "epoch": 0.0266793711291091,
+      "grad_norm": 1.081608772277832,
+      "learning_rate": 9.045084971874738e-05,
+      "loss": 2.0068,
+      "step": 28
+    },
+    {
+      "epoch": 0.027632205812291567,
+      "grad_norm": 1.2319940328598022,
+      "learning_rate": 8.940053768033609e-05,
+      "loss": 2.3822,
+      "step": 29
+    },
+    {
+      "epoch": 0.028585040495474036,
+      "grad_norm": 1.1373631954193115,
+      "learning_rate": 8.83022221559489e-05,
+      "loss": 2.1743,
+      "step": 30
+    },
+    {
+      "epoch": 0.029537875178656504,
+      "grad_norm": 1.7887684106826782,
+      "learning_rate": 8.715724127386972e-05,
+      "loss": 2.7599,
+      "step": 31
+    },
+    {
+      "epoch": 0.03049070986183897,
+      "grad_norm": 2.468310594558716,
+      "learning_rate": 8.596699001693255e-05,
+      "loss": 2.4588,
+      "step": 32
+    },
+    {
+      "epoch": 0.03144354454502144,
+      "grad_norm": 1.4182935953140259,
+      "learning_rate": 8.473291852294987e-05,
+      "loss": 2.5963,
+      "step": 33
+    },
+    {
+      "epoch": 0.03239637922820391,
+      "grad_norm": 1.6286972761154175,
+      "learning_rate": 8.345653031794292e-05,
+      "loss": 2.385,
+      "step": 34
+    },
+    {
+      "epoch": 0.03334921391138637,
+      "grad_norm": 1.6932363510131836,
+      "learning_rate": 8.213938048432697e-05,
+      "loss": 2.3984,
+      "step": 35
+    },
+    {
+      "epoch": 0.03430204859456884,
+      "grad_norm": 1.6212579011917114,
+      "learning_rate": 8.07830737662829e-05,
+      "loss": 2.559,
+      "step": 36
+    },
+    {
+      "epoch": 0.03430204859456884,
+      "eval_loss": 2.326164484024048,
+      "eval_runtime": 195.2942,
+      "eval_samples_per_second": 4.527,
+      "eval_steps_per_second": 0.568,
+      "step": 36
+    },
+    {
+      "epoch": 0.03525488327775131,
+      "grad_norm": 3.3297510147094727,
+      "learning_rate": 7.938926261462366e-05,
+      "loss": 2.2348,
+      "step": 37
+    },
+    {
+      "epoch": 0.03620771796093378,
+      "grad_norm": 1.1248424053192139,
+      "learning_rate": 7.795964517353735e-05,
+      "loss": 2.3229,
+      "step": 38
+    },
+    {
+      "epoch": 0.037160552644116246,
+      "grad_norm": 1.1936289072036743,
+      "learning_rate": 7.649596321166024e-05,
+      "loss": 2.1951,
+      "step": 39
+    },
+    {
+      "epoch": 0.038113387327298714,
+      "grad_norm": 1.2495434284210205,
+      "learning_rate": 7.500000000000001e-05,
+      "loss": 2.2668,
+      "step": 40
+    },
+    {
+      "epoch": 0.03906622201048118,
+      "grad_norm": 1.079162359237671,
+      "learning_rate": 7.347357813929454e-05,
+      "loss": 2.2035,
+      "step": 41
+    },
+    {
+      "epoch": 0.04001905669366365,
+      "grad_norm": 1.159868836402893,
+      "learning_rate": 7.191855733945387e-05,
+      "loss": 1.9719,
+      "step": 42
+    },
+    {
+      "epoch": 0.04097189137684612,
+      "grad_norm": 1.2213239669799805,
+      "learning_rate": 7.033683215379002e-05,
+      "loss": 2.2513,
+      "step": 43
+    },
+    {
+      "epoch": 0.04192472606002858,
+      "grad_norm": 1.4291725158691406,
+      "learning_rate": 6.873032967079561e-05,
+      "loss": 2.2991,
+      "step": 44
+    },
+    {
+      "epoch": 0.04287756074321105,
+      "grad_norm": 1.114621877670288,
+      "learning_rate": 6.710100716628344e-05,
+      "loss": 2.1182,
+      "step": 45
+    },
+    {
+      "epoch": 0.04287756074321105,
+      "eval_loss": 2.283418655395508,
+      "eval_runtime": 195.3577,
+      "eval_samples_per_second": 4.525,
+      "eval_steps_per_second": 0.568,
+      "step": 45
+    },
+    {
+      "epoch": 0.04383039542639352,
+      "grad_norm": 1.91363525390625,
+      "learning_rate": 6.545084971874738e-05,
+      "loss": 2.2587,
+      "step": 46
+    },
+    {
+      "epoch": 0.04478323010957599,
+      "grad_norm": 1.2641960382461548,
+      "learning_rate": 6.378186779084995e-05,
+      "loss": 2.187,
+      "step": 47
+    },
+    {
+      "epoch": 0.045736064792758456,
+      "grad_norm": 1.4268271923065186,
+      "learning_rate": 6.209609477998338e-05,
+      "loss": 2.3428,
+      "step": 48
+    },
+    {
+      "epoch": 0.046688899475940925,
+      "grad_norm": 1.0803133249282837,
+      "learning_rate": 6.0395584540887963e-05,
+      "loss": 2.1408,
+      "step": 49
+    },
+    {
+      "epoch": 0.04764173415912339,
+      "grad_norm": 0.9304092526435852,
+      "learning_rate": 5.868240888334653e-05,
+      "loss": 2.003,
+      "step": 50
     }
   ],
   "logging_steps": 1,
       "attributes": {}
     }
   },
+  "total_flos": 7.41887283560448e+16,
   "train_batch_size": 8,
   "trial_name": null,
   "trial_params": null