{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 5000, "global_step": 84375, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.035555555555555556, "grad_norm": 31.097620010375977, "learning_rate": 5.91964920597298e-06, "loss": 1.6025, "step": 1000 }, { "epoch": 0.07111111111111111, "grad_norm": 15.004558563232422, "learning_rate": 1.1845223986726713e-05, "loss": 0.5208, "step": 2000 }, { "epoch": 0.10666666666666667, "grad_norm": 18.05305290222168, "learning_rate": 1.7770798767480447e-05, "loss": 0.4374, "step": 3000 }, { "epoch": 0.14222222222222222, "grad_norm": 15.441234588623047, "learning_rate": 2.369637354823418e-05, "loss": 0.4142, "step": 4000 }, { "epoch": 0.17777777777777778, "grad_norm": 11.936789512634277, "learning_rate": 2.9621948328987915e-05, "loss": 0.3916, "step": 5000 }, { "epoch": 0.17777777777777778, "eval_loss": 0.3775472640991211, "eval_runtime": 11.6508, "eval_samples_per_second": 85.831, "eval_steps_per_second": 2.747, "eval_sts-dev_pearson_cosine": 0.8150497373285317, "eval_sts-dev_spearman_cosine": 0.8196131231126629, "step": 5000 }, { "epoch": 0.21333333333333335, "grad_norm": 12.518898963928223, "learning_rate": 3.554752310974165e-05, "loss": 0.382, "step": 6000 }, { "epoch": 0.24888888888888888, "grad_norm": 9.117196083068848, "learning_rate": 4.147309789049538e-05, "loss": 0.3824, "step": 7000 }, { "epoch": 0.28444444444444444, "grad_norm": 9.207646369934082, "learning_rate": 4.739867267124911e-05, "loss": 0.3744, "step": 8000 }, { "epoch": 0.32, "grad_norm": 8.699370384216309, "learning_rate": 4.9630614851785036e-05, "loss": 0.3781, "step": 9000 }, { "epoch": 0.35555555555555557, "grad_norm": 5.3027729988098145, "learning_rate": 4.897217430238224e-05, "loss": 0.367, "step": 10000 }, { "epoch": 0.35555555555555557, "eval_loss": 0.37576642632484436, "eval_runtime": 35.1214, "eval_samples_per_second": 28.473, "eval_steps_per_second": 0.911, "eval_sts-dev_pearson_cosine": 0.8076134919907783, "eval_sts-dev_spearman_cosine": 0.8136231582786481, "step": 10000 }, { "epoch": 0.39111111111111113, "grad_norm": 13.608588218688965, "learning_rate": 4.831373375297945e-05, "loss": 0.3527, "step": 11000 }, { "epoch": 0.4266666666666667, "grad_norm": 2.712616443634033, "learning_rate": 4.765529320357665e-05, "loss": 0.3354, "step": 12000 }, { "epoch": 0.4622222222222222, "grad_norm": 7.297984600067139, "learning_rate": 4.699685265417386e-05, "loss": 0.3147, "step": 13000 }, { "epoch": 0.49777777777777776, "grad_norm": 3.9520838260650635, "learning_rate": 4.633841210477106e-05, "loss": 0.3084, "step": 14000 }, { "epoch": 0.5333333333333333, "grad_norm": 3.8519201278686523, "learning_rate": 4.567997155536827e-05, "loss": 0.2975, "step": 15000 }, { "epoch": 0.5333333333333333, "eval_loss": 0.35147717595100403, "eval_runtime": 30.6971, "eval_samples_per_second": 32.576, "eval_steps_per_second": 1.042, "eval_sts-dev_pearson_cosine": 0.8128354003998368, "eval_sts-dev_spearman_cosine": 0.8205304242394997, "step": 15000 }, { "epoch": 0.5688888888888889, "grad_norm": 7.860720634460449, "learning_rate": 4.502153100596547e-05, "loss": 0.2978, "step": 16000 }, { "epoch": 0.6044444444444445, "grad_norm": 7.748737335205078, "learning_rate": 4.436309045656268e-05, "loss": 0.2916, "step": 17000 }, { "epoch": 0.64, "grad_norm": 8.615702629089355, "learning_rate": 4.370464990715988e-05, "loss": 0.2792, "step": 18000 }, { "epoch": 0.6755555555555556, "grad_norm": 5.2580156326293945, "learning_rate": 4.304620935775709e-05, "loss": 0.2661, "step": 19000 }, { "epoch": 0.7111111111111111, "grad_norm": 9.318315505981445, "learning_rate": 4.238776880835429e-05, "loss": 0.2583, "step": 20000 }, { "epoch": 0.7111111111111111, "eval_loss": 0.3185396194458008, "eval_runtime": 30.8313, "eval_samples_per_second": 32.435, "eval_steps_per_second": 1.038, "eval_sts-dev_pearson_cosine": 0.8058349279884176, "eval_sts-dev_spearman_cosine": 0.8159206996876398, "step": 20000 }, { "epoch": 0.7466666666666667, "grad_norm": 4.720574855804443, "learning_rate": 4.17293282589515e-05, "loss": 0.2529, "step": 21000 }, { "epoch": 0.7822222222222223, "grad_norm": 6.6863484382629395, "learning_rate": 4.10708877095487e-05, "loss": 0.2505, "step": 22000 }, { "epoch": 0.8177777777777778, "grad_norm": 3.1214375495910645, "learning_rate": 4.041244716014591e-05, "loss": 0.2454, "step": 23000 }, { "epoch": 0.8533333333333334, "grad_norm": 0.6488115787506104, "learning_rate": 3.9754006610743114e-05, "loss": 0.242, "step": 24000 }, { "epoch": 0.8888888888888888, "grad_norm": 5.3746113777160645, "learning_rate": 3.909556606134032e-05, "loss": 0.2307, "step": 25000 }, { "epoch": 0.8888888888888888, "eval_loss": 0.28817781805992126, "eval_runtime": 31.3269, "eval_samples_per_second": 31.921, "eval_steps_per_second": 1.021, "eval_sts-dev_pearson_cosine": 0.8068056591060926, "eval_sts-dev_spearman_cosine": 0.8175004911072571, "step": 25000 }, { "epoch": 0.9244444444444444, "grad_norm": 7.79231595993042, "learning_rate": 3.8437125511937525e-05, "loss": 0.2349, "step": 26000 }, { "epoch": 0.96, "grad_norm": 9.042169570922852, "learning_rate": 3.7778684962534734e-05, "loss": 0.2238, "step": 27000 }, { "epoch": 0.9955555555555555, "grad_norm": 10.183342933654785, "learning_rate": 3.7120244413131936e-05, "loss": 0.2132, "step": 28000 }, { "epoch": 1.031111111111111, "grad_norm": 1.6765131950378418, "learning_rate": 3.6461803863729144e-05, "loss": 0.1601, "step": 29000 }, { "epoch": 1.0666666666666667, "grad_norm": 2.5507757663726807, "learning_rate": 3.5803363314326346e-05, "loss": 0.1581, "step": 30000 }, { "epoch": 1.0666666666666667, "eval_loss": 0.2580932080745697, "eval_runtime": 31.0615, "eval_samples_per_second": 32.194, "eval_steps_per_second": 1.03, "eval_sts-dev_pearson_cosine": 0.8157474163754647, "eval_sts-dev_spearman_cosine": 0.8222299144499523, "step": 30000 }, { "epoch": 1.1022222222222222, "grad_norm": 2.3133509159088135, "learning_rate": 3.5144922764923555e-05, "loss": 0.1532, "step": 31000 }, { "epoch": 1.1377777777777778, "grad_norm": 2.026036262512207, "learning_rate": 3.448648221552076e-05, "loss": 0.1494, "step": 32000 }, { "epoch": 1.1733333333333333, "grad_norm": 5.352447986602783, "learning_rate": 3.3828041666117966e-05, "loss": 0.1484, "step": 33000 }, { "epoch": 1.208888888888889, "grad_norm": 2.9670166969299316, "learning_rate": 3.316960111671517e-05, "loss": 0.1529, "step": 34000 }, { "epoch": 1.2444444444444445, "grad_norm": 6.357540607452393, "learning_rate": 3.251116056731238e-05, "loss": 0.1467, "step": 35000 }, { "epoch": 1.2444444444444445, "eval_loss": 0.24440895020961761, "eval_runtime": 31.2456, "eval_samples_per_second": 32.005, "eval_steps_per_second": 1.024, "eval_sts-dev_pearson_cosine": 0.814902241190906, "eval_sts-dev_spearman_cosine": 0.8211414049575237, "step": 35000 }, { "epoch": 1.28, "grad_norm": 6.782201766967773, "learning_rate": 3.185272001790958e-05, "loss": 0.1522, "step": 36000 }, { "epoch": 1.3155555555555556, "grad_norm": 0.9291681051254272, "learning_rate": 3.119427946850679e-05, "loss": 0.1412, "step": 37000 }, { "epoch": 1.3511111111111112, "grad_norm": 6.588221073150635, "learning_rate": 3.053583891910399e-05, "loss": 0.1416, "step": 38000 }, { "epoch": 1.3866666666666667, "grad_norm": 7.346938133239746, "learning_rate": 2.9877398369701205e-05, "loss": 0.1393, "step": 39000 }, { "epoch": 1.4222222222222223, "grad_norm": 7.207787990570068, "learning_rate": 2.921895782029841e-05, "loss": 0.1389, "step": 40000 }, { "epoch": 1.4222222222222223, "eval_loss": 0.2562263309955597, "eval_runtime": 31.2811, "eval_samples_per_second": 31.968, "eval_steps_per_second": 1.023, "eval_sts-dev_pearson_cosine": 0.8227387520545976, "eval_sts-dev_spearman_cosine": 0.826905561534745, "step": 40000 }, { "epoch": 1.4577777777777778, "grad_norm": 2.1179184913635254, "learning_rate": 2.8560517270895616e-05, "loss": 0.1353, "step": 41000 }, { "epoch": 1.4933333333333334, "grad_norm": 2.6916444301605225, "learning_rate": 2.790207672149282e-05, "loss": 0.1284, "step": 42000 }, { "epoch": 1.528888888888889, "grad_norm": 9.770589828491211, "learning_rate": 2.7243636172090027e-05, "loss": 0.1317, "step": 43000 }, { "epoch": 1.5644444444444443, "grad_norm": 2.033369779586792, "learning_rate": 2.6585195622687232e-05, "loss": 0.1242, "step": 44000 }, { "epoch": 1.6, "grad_norm": 9.705333709716797, "learning_rate": 2.5926755073284438e-05, "loss": 0.1228, "step": 45000 }, { "epoch": 1.6, "eval_loss": 0.22733546793460846, "eval_runtime": 30.7521, "eval_samples_per_second": 32.518, "eval_steps_per_second": 1.041, "eval_sts-dev_pearson_cosine": 0.8129372102759819, "eval_sts-dev_spearman_cosine": 0.8243194932998689, "step": 45000 }, { "epoch": 1.6355555555555554, "grad_norm": 6.558931827545166, "learning_rate": 2.5268314523881643e-05, "loss": 0.1308, "step": 46000 }, { "epoch": 1.6711111111111112, "grad_norm": 2.8348495960235596, "learning_rate": 2.4609873974478845e-05, "loss": 0.1231, "step": 47000 }, { "epoch": 1.7066666666666666, "grad_norm": 10.423678398132324, "learning_rate": 2.395143342507605e-05, "loss": 0.1196, "step": 48000 }, { "epoch": 1.7422222222222223, "grad_norm": 4.737322807312012, "learning_rate": 2.3292992875673256e-05, "loss": 0.1202, "step": 49000 }, { "epoch": 1.7777777777777777, "grad_norm": 8.491903305053711, "learning_rate": 2.263455232627046e-05, "loss": 0.12, "step": 50000 }, { "epoch": 1.7777777777777777, "eval_loss": 0.21721433103084564, "eval_runtime": 48.5394, "eval_samples_per_second": 20.602, "eval_steps_per_second": 0.659, "eval_sts-dev_pearson_cosine": 0.8221879391828698, "eval_sts-dev_spearman_cosine": 0.8276168454271825, "step": 50000 }, { "epoch": 1.8133333333333335, "grad_norm": 7.367649078369141, "learning_rate": 2.1976111776867667e-05, "loss": 0.1213, "step": 51000 }, { "epoch": 1.8488888888888888, "grad_norm": 3.9367151260375977, "learning_rate": 2.1317671227464872e-05, "loss": 0.1134, "step": 52000 }, { "epoch": 1.8844444444444446, "grad_norm": 0.3449944853782654, "learning_rate": 2.0659230678062077e-05, "loss": 0.109, "step": 53000 }, { "epoch": 1.92, "grad_norm": 1.9318583011627197, "learning_rate": 2.0000790128659283e-05, "loss": 0.1158, "step": 54000 }, { "epoch": 1.9555555555555557, "grad_norm": 2.4510562419891357, "learning_rate": 1.9342349579256488e-05, "loss": 0.1073, "step": 55000 }, { "epoch": 1.9555555555555557, "eval_loss": 0.22918041050434113, "eval_runtime": 48.7814, "eval_samples_per_second": 20.5, "eval_steps_per_second": 0.656, "eval_sts-dev_pearson_cosine": 0.8226444171661187, "eval_sts-dev_spearman_cosine": 0.832783411507352, "step": 55000 }, { "epoch": 1.991111111111111, "grad_norm": 8.485190391540527, "learning_rate": 1.8683909029853697e-05, "loss": 0.1053, "step": 56000 }, { "epoch": 2.026666666666667, "grad_norm": 0.6446801424026489, "learning_rate": 1.8025468480450902e-05, "loss": 0.0643, "step": 57000 }, { "epoch": 2.062222222222222, "grad_norm": 9.16294002532959, "learning_rate": 1.7367027931048108e-05, "loss": 0.0546, "step": 58000 }, { "epoch": 2.097777777777778, "grad_norm": 4.509792327880859, "learning_rate": 1.6708587381645313e-05, "loss": 0.054, "step": 59000 }, { "epoch": 2.1333333333333333, "grad_norm": 0.07099995762109756, "learning_rate": 1.605014683224252e-05, "loss": 0.0535, "step": 60000 }, { "epoch": 2.1333333333333333, "eval_loss": 0.279130220413208, "eval_runtime": 55.8907, "eval_samples_per_second": 17.892, "eval_steps_per_second": 0.573, "eval_sts-dev_pearson_cosine": 0.8213308892826775, "eval_sts-dev_spearman_cosine": 0.8271747105077873, "step": 60000 }, { "epoch": 2.168888888888889, "grad_norm": 1.7394822835922241, "learning_rate": 1.5391706282839724e-05, "loss": 0.0512, "step": 61000 }, { "epoch": 2.2044444444444444, "grad_norm": 7.789730548858643, "learning_rate": 1.473326573343693e-05, "loss": 0.0546, "step": 62000 }, { "epoch": 2.24, "grad_norm": 10.078393936157227, "learning_rate": 1.4074825184034135e-05, "loss": 0.0539, "step": 63000 }, { "epoch": 2.2755555555555556, "grad_norm": 2.606584310531616, "learning_rate": 1.341638463463134e-05, "loss": 0.0561, "step": 64000 }, { "epoch": 2.311111111111111, "grad_norm": 4.760853290557861, "learning_rate": 1.2757944085228546e-05, "loss": 0.0478, "step": 65000 }, { "epoch": 2.311111111111111, "eval_loss": 0.256197065114975, "eval_runtime": 55.5249, "eval_samples_per_second": 18.01, "eval_steps_per_second": 0.576, "eval_sts-dev_pearson_cosine": 0.8246413401396585, "eval_sts-dev_spearman_cosine": 0.8288094370870545, "step": 65000 }, { "epoch": 2.3466666666666667, "grad_norm": 1.3447166681289673, "learning_rate": 1.2099503535825751e-05, "loss": 0.0555, "step": 66000 }, { "epoch": 2.3822222222222225, "grad_norm": 2.37924861907959, "learning_rate": 1.1441062986422956e-05, "loss": 0.0503, "step": 67000 }, { "epoch": 2.417777777777778, "grad_norm": 1.2358015775680542, "learning_rate": 1.0782622437020162e-05, "loss": 0.0449, "step": 68000 }, { "epoch": 2.453333333333333, "grad_norm": 0.22912859916687012, "learning_rate": 1.0124181887617367e-05, "loss": 0.0482, "step": 69000 }, { "epoch": 2.488888888888889, "grad_norm": 9.296670913696289, "learning_rate": 9.465741338214573e-06, "loss": 0.0493, "step": 70000 }, { "epoch": 2.488888888888889, "eval_loss": 0.26088747382164, "eval_runtime": 55.5071, "eval_samples_per_second": 18.016, "eval_steps_per_second": 0.577, "eval_sts-dev_pearson_cosine": 0.8255009970943029, "eval_sts-dev_spearman_cosine": 0.831174307235804, "step": 70000 }, { "epoch": 2.5244444444444447, "grad_norm": 1.4696452617645264, "learning_rate": 8.807300788811778e-06, "loss": 0.0486, "step": 71000 }, { "epoch": 2.56, "grad_norm": 0.014002230018377304, "learning_rate": 8.148860239408983e-06, "loss": 0.0483, "step": 72000 }, { "epoch": 2.5955555555555554, "grad_norm": 10.814248085021973, "learning_rate": 7.49041969000619e-06, "loss": 0.0444, "step": 73000 }, { "epoch": 2.631111111111111, "grad_norm": 0.9171813726425171, "learning_rate": 6.831979140603395e-06, "loss": 0.0421, "step": 74000 }, { "epoch": 2.6666666666666665, "grad_norm": 0.6967930197715759, "learning_rate": 6.1735385912006005e-06, "loss": 0.042, "step": 75000 }, { "epoch": 2.6666666666666665, "eval_loss": 0.25533053278923035, "eval_runtime": 55.7954, "eval_samples_per_second": 17.923, "eval_steps_per_second": 0.574, "eval_sts-dev_pearson_cosine": 0.8229336010617173, "eval_sts-dev_spearman_cosine": 0.8301305406762217, "step": 75000 }, { "epoch": 2.7022222222222223, "grad_norm": 5.206503391265869, "learning_rate": 5.515098041797807e-06, "loss": 0.0409, "step": 76000 }, { "epoch": 2.7377777777777776, "grad_norm": 8.96776008605957, "learning_rate": 4.856657492395012e-06, "loss": 0.0456, "step": 77000 }, { "epoch": 2.7733333333333334, "grad_norm": 1.4853557348251343, "learning_rate": 4.1982169429922175e-06, "loss": 0.0411, "step": 78000 }, { "epoch": 2.8088888888888888, "grad_norm": 0.08554021269083023, "learning_rate": 3.539776393589423e-06, "loss": 0.0416, "step": 79000 }, { "epoch": 2.8444444444444446, "grad_norm": 0.010798577219247818, "learning_rate": 2.8813358441866287e-06, "loss": 0.0392, "step": 80000 }, { "epoch": 2.8444444444444446, "eval_loss": 0.24324475228786469, "eval_runtime": 55.6948, "eval_samples_per_second": 17.955, "eval_steps_per_second": 0.575, "eval_sts-dev_pearson_cosine": 0.8258729995042317, "eval_sts-dev_spearman_cosine": 0.8310916968189412, "step": 80000 }, { "epoch": 2.88, "grad_norm": 1.3684927225112915, "learning_rate": 2.222895294783834e-06, "loss": 0.0365, "step": 81000 }, { "epoch": 2.9155555555555557, "grad_norm": 21.493656158447266, "learning_rate": 1.5644547453810395e-06, "loss": 0.042, "step": 82000 }, { "epoch": 2.951111111111111, "grad_norm": 7.1114654541015625, "learning_rate": 9.06014195978245e-07, "loss": 0.0422, "step": 83000 }, { "epoch": 2.986666666666667, "grad_norm": 0.7839590907096863, "learning_rate": 2.475736465754507e-07, "loss": 0.0343, "step": 84000 } ], "logging_steps": 1000, "max_steps": 84375, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 5000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }