Training in progress, step 50, checkpoint

Browse files

Files changed (8) hide show

last-checkpoint/adapter_model.safetensors +1 -1
last-checkpoint/optimizer.pt +1 -1
last-checkpoint/rng_state_0.pth +1 -1
last-checkpoint/rng_state_1.pth +1 -1
last-checkpoint/rng_state_2.pth +1 -1
last-checkpoint/rng_state_3.pth +1 -1
last-checkpoint/scheduler.pt +1 -1
last-checkpoint/trainer_state.json +188 -5

last-checkpoint/adapter_model.safetensors CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:0d5d9cf50dbc129ee988d0a31df528d4e966fc8765d6e26695de8fab9210f7b5
 size 335604696

 version https://git-lfs.github.com/spec/v1
+oid sha256:534a56f1bf6242ac01256fc251a65ba40fadd6dbde0ad139e92e273947832828
 size 335604696

last-checkpoint/optimizer.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:bfa7f1c330467320224a16a003fab7ad13ed97052ceebf875a47961d9008b0a7
 size 671466706

 version https://git-lfs.github.com/spec/v1
+oid sha256:76876b339ecf59507472e1a10a856c25237d43ea6e48ae776212f06d9005ab59
 size 671466706

last-checkpoint/rng_state_0.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:f4d939fa8a73339b0eacb4f942155a1f5c173559681c320f81ebb7026b684963
 size 15024

 version https://git-lfs.github.com/spec/v1
+oid sha256:3f6b28ddceffcfbb0eba88c1253d9911a71087a0094e0bfdf46af8eb09c71e1e
 size 15024

last-checkpoint/rng_state_1.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:cdebbaef04f27a5f7646687f30112a2fffa2f707ab07d50b31476eb5c8ff2721
 size 15024

 version https://git-lfs.github.com/spec/v1
+oid sha256:2d309aaef3b1e5898ac57d64657b760ac77a2c95a5d95f8529614ca1aed1aaaa
 size 15024

last-checkpoint/rng_state_2.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:96e3be404530e347355eb700f11b1e80c9b7f3eaaeb3af279418c0d19f662e55
 size 15024

 version https://git-lfs.github.com/spec/v1
+oid sha256:97c53f4da5420488101ec3275bdfc923e394ed7e19e556423cd25a0dedcbfc47
 size 15024

last-checkpoint/rng_state_3.pth CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:260783626fa52d0ac8d89469df9c10b55a57bc69e952cc53fe47a8672f810dbc
 size 15024

 version https://git-lfs.github.com/spec/v1
+oid sha256:17433ce56533032b14ee12a4eaa80b1ba94e3f84b10da2de1e7b768ebdb2efb1
 size 15024

last-checkpoint/scheduler.pt CHANGED Viewed

@@ -1,3 +1,3 @@
 version https://git-lfs.github.com/spec/v1
-oid sha256:5eda964d5b06109c7ff637060199d72e397eeb7027b50e10972a323edbe81312
 size 1064

 version https://git-lfs.github.com/spec/v1
+oid sha256:fb0ce41087f0939d63a9a6eb297660d82f62bda022868309a8c97328e5da41a5
 size 1064

last-checkpoint/trainer_state.json CHANGED Viewed

@@ -1,9 +1,9 @@
 {
-  "best_metric": 0.30335336923599243,
-  "best_model_checkpoint": "miner_id_24/checkpoint-25",
-  "epoch": 0.01778845084828675,
   "eval_steps": 25,
-  "global_step": 25,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
@@ -198,6 +198,189 @@
       "eval_samples_per_second": 14.302,
       "eval_steps_per_second": 3.719,
       "step": 25
     }
   ],
   "logging_steps": 1,
@@ -226,7 +409,7 @@
       "attributes": {}
     }
   },
-  "total_flos": 2.984041808658432e+17,
   "train_batch_size": 1,
   "trial_name": null,
   "trial_params": null

 {
+  "best_metric": 0.12278789281845093,
+  "best_model_checkpoint": "miner_id_24/checkpoint-50",
+  "epoch": 0.0355769016965735,
   "eval_steps": 25,
+  "global_step": 50,
   "is_hyper_param_search": false,
   "is_local_process_zero": true,
   "is_world_process_zero": true,
       "eval_samples_per_second": 14.302,
       "eval_steps_per_second": 3.719,
       "step": 25
+    },
+    {
+      "epoch": 0.01849998888221822,
+      "grad_norm": 2.975804090499878,
+      "learning_rate": 7.917848237560709e-05,
+      "loss": 0.5658,
+      "step": 26
+    },
+    {
+      "epoch": 0.01921152691614969,
+      "grad_norm": 2.311894416809082,
+      "learning_rate": 7.75e-05,
+      "loss": 0.429,
+      "step": 27
+    },
+    {
+      "epoch": 0.01992306495008116,
+      "grad_norm": 1.3672640323638916,
+      "learning_rate": 7.577868759557654e-05,
+      "loss": 0.2389,
+      "step": 28
+    },
+    {
+      "epoch": 0.02063460298401263,
+      "grad_norm": 0.7648161053657532,
+      "learning_rate": 7.401782177833148e-05,
+      "loss": 0.2071,
+      "step": 29
+    },
+    {
+      "epoch": 0.0213461410179441,
+      "grad_norm": 1.1158180236816406,
+      "learning_rate": 7.222075445642904e-05,
+      "loss": 0.1953,
+      "step": 30
+    },
+    {
+      "epoch": 0.02205767905187557,
+      "grad_norm": 1.5425399541854858,
+      "learning_rate": 7.03909064496551e-05,
+      "loss": 0.1899,
+      "step": 31
+    },
+    {
+      "epoch": 0.02276921708580704,
+      "grad_norm": 1.3230940103530884,
+      "learning_rate": 6.853176097769229e-05,
+      "loss": 0.131,
+      "step": 32
+    },
+    {
+      "epoch": 0.02348075511973851,
+      "grad_norm": 0.7612606287002563,
+      "learning_rate": 6.664685702961344e-05,
+      "loss": 0.112,
+      "step": 33
+    },
+    {
+      "epoch": 0.02419229315366998,
+      "grad_norm": 0.4409436285495758,
+      "learning_rate": 6.473978262721463e-05,
+      "loss": 0.107,
+      "step": 34
+    },
+    {
+      "epoch": 0.02490383118760145,
+      "grad_norm": 0.4337151050567627,
+      "learning_rate": 6.281416799501188e-05,
+      "loss": 0.088,
+      "step": 35
+    },
+    {
+      "epoch": 0.02561536922153292,
+      "grad_norm": 0.5711820125579834,
+      "learning_rate": 6.087367864990233e-05,
+      "loss": 0.1323,
+      "step": 36
+    },
+    {
+      "epoch": 0.02632690725546439,
+      "grad_norm": 0.6534641981124878,
+      "learning_rate": 5.8922008423644624e-05,
+      "loss": 0.1032,
+      "step": 37
+    },
+    {
+      "epoch": 0.02703844528939586,
+      "grad_norm": 1.1616266965866089,
+      "learning_rate": 5.696287243144013e-05,
+      "loss": 0.3308,
+      "step": 38
+    },
+    {
+      "epoch": 0.02774998332332733,
+      "grad_norm": 1.08228600025177,
+      "learning_rate": 5.500000000000001e-05,
+      "loss": 0.2675,
+      "step": 39
+    },
+    {
+      "epoch": 0.0284615213572588,
+      "grad_norm": 0.8149510025978088,
+      "learning_rate": 5.303712756855988e-05,
+      "loss": 0.177,
+      "step": 40
+    },
+    {
+      "epoch": 0.02917305939119027,
+      "grad_norm": 0.7890299558639526,
+      "learning_rate": 5.107799157635538e-05,
+      "loss": 0.1581,
+      "step": 41
+    },
+    {
+      "epoch": 0.02988459742512174,
+      "grad_norm": 0.46428173780441284,
+      "learning_rate": 4.912632135009769e-05,
+      "loss": 0.1306,
+      "step": 42
+    },
+    {
+      "epoch": 0.03059613545905321,
+      "grad_norm": 0.4688973128795624,
+      "learning_rate": 4.718583200498814e-05,
+      "loss": 0.0909,
+      "step": 43
+    },
+    {
+      "epoch": 0.03130767349298468,
+      "grad_norm": 0.5706167817115784,
+      "learning_rate": 4.526021737278538e-05,
+      "loss": 0.0766,
+      "step": 44
+    },
+    {
+      "epoch": 0.03201921152691615,
+      "grad_norm": 0.7713613510131836,
+      "learning_rate": 4.3353142970386564e-05,
+      "loss": 0.093,
+      "step": 45
+    },
+    {
+      "epoch": 0.03273074956084762,
+      "grad_norm": 0.7292242646217346,
+      "learning_rate": 4.146823902230772e-05,
+      "loss": 0.0818,
+      "step": 46
+    },
+    {
+      "epoch": 0.03344228759477909,
+      "grad_norm": 0.745477557182312,
+      "learning_rate": 3.960909355034491e-05,
+      "loss": 0.0861,
+      "step": 47
+    },
+    {
+      "epoch": 0.03415382562871056,
+      "grad_norm": 0.8162257671356201,
+      "learning_rate": 3.777924554357096e-05,
+      "loss": 0.1041,
+      "step": 48
+    },
+    {
+      "epoch": 0.03486536366264203,
+      "grad_norm": 0.8203452229499817,
+      "learning_rate": 3.598217822166854e-05,
+      "loss": 0.0862,
+      "step": 49
+    },
+    {
+      "epoch": 0.0355769016965735,
+      "grad_norm": 0.8991295695304871,
+      "learning_rate": 3.422131240442349e-05,
+      "loss": 0.0849,
+      "step": 50
+    },
+    {
+      "epoch": 0.0355769016965735,
+      "eval_loss": 0.12278789281845093,
+      "eval_runtime": 3.5088,
+      "eval_samples_per_second": 14.25,
+      "eval_steps_per_second": 3.705,
+      "step": 50
     }
   ],
   "logging_steps": 1,
       "attributes": {}
     }
   },
+  "total_flos": 5.968083617316864e+17,
   "train_batch_size": 1,
   "trial_name": null,
   "trial_params": null