mmbert-base-arabic-nli / trainer_state.json
Omartificial-Intelligence-Space's picture
Upload 17 files
3ccf048 verified
Raw History Blame Contribute Delete
21.4 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 5000,
"global_step": 84375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.035555555555555556,
"grad_norm": 31.097620010375977,
"learning_rate": 5.91964920597298e-06,
"loss": 1.6025,
"step": 1000
},
{
"epoch": 0.07111111111111111,
"grad_norm": 15.004558563232422,
"learning_rate": 1.1845223986726713e-05,
"loss": 0.5208,
"step": 2000
},
{
"epoch": 0.10666666666666667,
"grad_norm": 18.05305290222168,
"learning_rate": 1.7770798767480447e-05,
"loss": 0.4374,
"step": 3000
},
{
"epoch": 0.14222222222222222,
"grad_norm": 15.441234588623047,
"learning_rate": 2.369637354823418e-05,
"loss": 0.4142,
"step": 4000
},
{
"epoch": 0.17777777777777778,
"grad_norm": 11.936789512634277,
"learning_rate": 2.9621948328987915e-05,
"loss": 0.3916,
"step": 5000
},
{
"epoch": 0.17777777777777778,
"eval_loss": 0.3775472640991211,
"eval_runtime": 11.6508,
"eval_samples_per_second": 85.831,
"eval_steps_per_second": 2.747,
"eval_sts-dev_pearson_cosine": 0.8150497373285317,
"eval_sts-dev_spearman_cosine": 0.8196131231126629,
"step": 5000
},
{
"epoch": 0.21333333333333335,
"grad_norm": 12.518898963928223,
"learning_rate": 3.554752310974165e-05,
"loss": 0.382,
"step": 6000
},
{
"epoch": 0.24888888888888888,
"grad_norm": 9.117196083068848,
"learning_rate": 4.147309789049538e-05,
"loss": 0.3824,
"step": 7000
},
{
"epoch": 0.28444444444444444,
"grad_norm": 9.207646369934082,
"learning_rate": 4.739867267124911e-05,
"loss": 0.3744,
"step": 8000
},
{
"epoch": 0.32,
"grad_norm": 8.699370384216309,
"learning_rate": 4.9630614851785036e-05,
"loss": 0.3781,
"step": 9000
},
{
"epoch": 0.35555555555555557,
"grad_norm": 5.3027729988098145,
"learning_rate": 4.897217430238224e-05,
"loss": 0.367,
"step": 10000
},
{
"epoch": 0.35555555555555557,
"eval_loss": 0.37576642632484436,
"eval_runtime": 35.1214,
"eval_samples_per_second": 28.473,
"eval_steps_per_second": 0.911,
"eval_sts-dev_pearson_cosine": 0.8076134919907783,
"eval_sts-dev_spearman_cosine": 0.8136231582786481,
"step": 10000
},
{
"epoch": 0.39111111111111113,
"grad_norm": 13.608588218688965,
"learning_rate": 4.831373375297945e-05,
"loss": 0.3527,
"step": 11000
},
{
"epoch": 0.4266666666666667,
"grad_norm": 2.712616443634033,
"learning_rate": 4.765529320357665e-05,
"loss": 0.3354,
"step": 12000
},
{
"epoch": 0.4622222222222222,
"grad_norm": 7.297984600067139,
"learning_rate": 4.699685265417386e-05,
"loss": 0.3147,
"step": 13000
},
{
"epoch": 0.49777777777777776,
"grad_norm": 3.9520838260650635,
"learning_rate": 4.633841210477106e-05,
"loss": 0.3084,
"step": 14000
},
{
"epoch": 0.5333333333333333,
"grad_norm": 3.8519201278686523,
"learning_rate": 4.567997155536827e-05,
"loss": 0.2975,
"step": 15000
},
{
"epoch": 0.5333333333333333,
"eval_loss": 0.35147717595100403,
"eval_runtime": 30.6971,
"eval_samples_per_second": 32.576,
"eval_steps_per_second": 1.042,
"eval_sts-dev_pearson_cosine": 0.8128354003998368,
"eval_sts-dev_spearman_cosine": 0.8205304242394997,
"step": 15000
},
{
"epoch": 0.5688888888888889,
"grad_norm": 7.860720634460449,
"learning_rate": 4.502153100596547e-05,
"loss": 0.2978,
"step": 16000
},
{
"epoch": 0.6044444444444445,
"grad_norm": 7.748737335205078,
"learning_rate": 4.436309045656268e-05,
"loss": 0.2916,
"step": 17000
},
{
"epoch": 0.64,
"grad_norm": 8.615702629089355,
"learning_rate": 4.370464990715988e-05,
"loss": 0.2792,
"step": 18000
},
{
"epoch": 0.6755555555555556,
"grad_norm": 5.2580156326293945,
"learning_rate": 4.304620935775709e-05,
"loss": 0.2661,
"step": 19000
},
{
"epoch": 0.7111111111111111,
"grad_norm": 9.318315505981445,
"learning_rate": 4.238776880835429e-05,
"loss": 0.2583,
"step": 20000
},
{
"epoch": 0.7111111111111111,
"eval_loss": 0.3185396194458008,
"eval_runtime": 30.8313,
"eval_samples_per_second": 32.435,
"eval_steps_per_second": 1.038,
"eval_sts-dev_pearson_cosine": 0.8058349279884176,
"eval_sts-dev_spearman_cosine": 0.8159206996876398,
"step": 20000
},
{
"epoch": 0.7466666666666667,
"grad_norm": 4.720574855804443,
"learning_rate": 4.17293282589515e-05,
"loss": 0.2529,
"step": 21000
},
{
"epoch": 0.7822222222222223,
"grad_norm": 6.6863484382629395,
"learning_rate": 4.10708877095487e-05,
"loss": 0.2505,
"step": 22000
},
{
"epoch": 0.8177777777777778,
"grad_norm": 3.1214375495910645,
"learning_rate": 4.041244716014591e-05,
"loss": 0.2454,
"step": 23000
},
{
"epoch": 0.8533333333333334,
"grad_norm": 0.6488115787506104,
"learning_rate": 3.9754006610743114e-05,
"loss": 0.242,
"step": 24000
},
{
"epoch": 0.8888888888888888,
"grad_norm": 5.3746113777160645,
"learning_rate": 3.909556606134032e-05,
"loss": 0.2307,
"step": 25000
},
{
"epoch": 0.8888888888888888,
"eval_loss": 0.28817781805992126,
"eval_runtime": 31.3269,
"eval_samples_per_second": 31.921,
"eval_steps_per_second": 1.021,
"eval_sts-dev_pearson_cosine": 0.8068056591060926,
"eval_sts-dev_spearman_cosine": 0.8175004911072571,
"step": 25000
},
{
"epoch": 0.9244444444444444,
"grad_norm": 7.79231595993042,
"learning_rate": 3.8437125511937525e-05,
"loss": 0.2349,
"step": 26000
},
{
"epoch": 0.96,
"grad_norm": 9.042169570922852,
"learning_rate": 3.7778684962534734e-05,
"loss": 0.2238,
"step": 27000
},
{
"epoch": 0.9955555555555555,
"grad_norm": 10.183342933654785,
"learning_rate": 3.7120244413131936e-05,
"loss": 0.2132,
"step": 28000
},
{
"epoch": 1.031111111111111,
"grad_norm": 1.6765131950378418,
"learning_rate": 3.6461803863729144e-05,
"loss": 0.1601,
"step": 29000
},
{
"epoch": 1.0666666666666667,
"grad_norm": 2.5507757663726807,
"learning_rate": 3.5803363314326346e-05,
"loss": 0.1581,
"step": 30000
},
{
"epoch": 1.0666666666666667,
"eval_loss": 0.2580932080745697,
"eval_runtime": 31.0615,
"eval_samples_per_second": 32.194,
"eval_steps_per_second": 1.03,
"eval_sts-dev_pearson_cosine": 0.8157474163754647,
"eval_sts-dev_spearman_cosine": 0.8222299144499523,
"step": 30000
},
{
"epoch": 1.1022222222222222,
"grad_norm": 2.3133509159088135,
"learning_rate": 3.5144922764923555e-05,
"loss": 0.1532,
"step": 31000
},
{
"epoch": 1.1377777777777778,
"grad_norm": 2.026036262512207,
"learning_rate": 3.448648221552076e-05,
"loss": 0.1494,
"step": 32000
},
{
"epoch": 1.1733333333333333,
"grad_norm": 5.352447986602783,
"learning_rate": 3.3828041666117966e-05,
"loss": 0.1484,
"step": 33000
},
{
"epoch": 1.208888888888889,
"grad_norm": 2.9670166969299316,
"learning_rate": 3.316960111671517e-05,
"loss": 0.1529,
"step": 34000
},
{
"epoch": 1.2444444444444445,
"grad_norm": 6.357540607452393,
"learning_rate": 3.251116056731238e-05,
"loss": 0.1467,
"step": 35000
},
{
"epoch": 1.2444444444444445,
"eval_loss": 0.24440895020961761,
"eval_runtime": 31.2456,
"eval_samples_per_second": 32.005,
"eval_steps_per_second": 1.024,
"eval_sts-dev_pearson_cosine": 0.814902241190906,
"eval_sts-dev_spearman_cosine": 0.8211414049575237,
"step": 35000
},
{
"epoch": 1.28,
"grad_norm": 6.782201766967773,
"learning_rate": 3.185272001790958e-05,
"loss": 0.1522,
"step": 36000
},
{
"epoch": 1.3155555555555556,
"grad_norm": 0.9291681051254272,
"learning_rate": 3.119427946850679e-05,
"loss": 0.1412,
"step": 37000
},
{
"epoch": 1.3511111111111112,
"grad_norm": 6.588221073150635,
"learning_rate": 3.053583891910399e-05,
"loss": 0.1416,
"step": 38000
},
{
"epoch": 1.3866666666666667,
"grad_norm": 7.346938133239746,
"learning_rate": 2.9877398369701205e-05,
"loss": 0.1393,
"step": 39000
},
{
"epoch": 1.4222222222222223,
"grad_norm": 7.207787990570068,
"learning_rate": 2.921895782029841e-05,
"loss": 0.1389,
"step": 40000
},
{
"epoch": 1.4222222222222223,
"eval_loss": 0.2562263309955597,
"eval_runtime": 31.2811,
"eval_samples_per_second": 31.968,
"eval_steps_per_second": 1.023,
"eval_sts-dev_pearson_cosine": 0.8227387520545976,
"eval_sts-dev_spearman_cosine": 0.826905561534745,
"step": 40000
},
{
"epoch": 1.4577777777777778,
"grad_norm": 2.1179184913635254,
"learning_rate": 2.8560517270895616e-05,
"loss": 0.1353,
"step": 41000
},
{
"epoch": 1.4933333333333334,
"grad_norm": 2.6916444301605225,
"learning_rate": 2.790207672149282e-05,
"loss": 0.1284,
"step": 42000
},
{
"epoch": 1.528888888888889,
"grad_norm": 9.770589828491211,
"learning_rate": 2.7243636172090027e-05,
"loss": 0.1317,
"step": 43000
},
{
"epoch": 1.5644444444444443,
"grad_norm": 2.033369779586792,
"learning_rate": 2.6585195622687232e-05,
"loss": 0.1242,
"step": 44000
},
{
"epoch": 1.6,
"grad_norm": 9.705333709716797,
"learning_rate": 2.5926755073284438e-05,
"loss": 0.1228,
"step": 45000
},
{
"epoch": 1.6,
"eval_loss": 0.22733546793460846,
"eval_runtime": 30.7521,
"eval_samples_per_second": 32.518,
"eval_steps_per_second": 1.041,
"eval_sts-dev_pearson_cosine": 0.8129372102759819,
"eval_sts-dev_spearman_cosine": 0.8243194932998689,
"step": 45000
},
{
"epoch": 1.6355555555555554,
"grad_norm": 6.558931827545166,
"learning_rate": 2.5268314523881643e-05,
"loss": 0.1308,
"step": 46000
},
{
"epoch": 1.6711111111111112,
"grad_norm": 2.8348495960235596,
"learning_rate": 2.4609873974478845e-05,
"loss": 0.1231,
"step": 47000
},
{
"epoch": 1.7066666666666666,
"grad_norm": 10.423678398132324,
"learning_rate": 2.395143342507605e-05,
"loss": 0.1196,
"step": 48000
},
{
"epoch": 1.7422222222222223,
"grad_norm": 4.737322807312012,
"learning_rate": 2.3292992875673256e-05,
"loss": 0.1202,
"step": 49000
},
{
"epoch": 1.7777777777777777,
"grad_norm": 8.491903305053711,
"learning_rate": 2.263455232627046e-05,
"loss": 0.12,
"step": 50000
},
{
"epoch": 1.7777777777777777,
"eval_loss": 0.21721433103084564,
"eval_runtime": 48.5394,
"eval_samples_per_second": 20.602,
"eval_steps_per_second": 0.659,
"eval_sts-dev_pearson_cosine": 0.8221879391828698,
"eval_sts-dev_spearman_cosine": 0.8276168454271825,
"step": 50000
},
{
"epoch": 1.8133333333333335,
"grad_norm": 7.367649078369141,
"learning_rate": 2.1976111776867667e-05,
"loss": 0.1213,
"step": 51000
},
{
"epoch": 1.8488888888888888,
"grad_norm": 3.9367151260375977,
"learning_rate": 2.1317671227464872e-05,
"loss": 0.1134,
"step": 52000
},
{
"epoch": 1.8844444444444446,
"grad_norm": 0.3449944853782654,
"learning_rate": 2.0659230678062077e-05,
"loss": 0.109,
"step": 53000
},
{
"epoch": 1.92,
"grad_norm": 1.9318583011627197,
"learning_rate": 2.0000790128659283e-05,
"loss": 0.1158,
"step": 54000
},
{
"epoch": 1.9555555555555557,
"grad_norm": 2.4510562419891357,
"learning_rate": 1.9342349579256488e-05,
"loss": 0.1073,
"step": 55000
},
{
"epoch": 1.9555555555555557,
"eval_loss": 0.22918041050434113,
"eval_runtime": 48.7814,
"eval_samples_per_second": 20.5,
"eval_steps_per_second": 0.656,
"eval_sts-dev_pearson_cosine": 0.8226444171661187,
"eval_sts-dev_spearman_cosine": 0.832783411507352,
"step": 55000
},
{
"epoch": 1.991111111111111,
"grad_norm": 8.485190391540527,
"learning_rate": 1.8683909029853697e-05,
"loss": 0.1053,
"step": 56000
},
{
"epoch": 2.026666666666667,
"grad_norm": 0.6446801424026489,
"learning_rate": 1.8025468480450902e-05,
"loss": 0.0643,
"step": 57000
},
{
"epoch": 2.062222222222222,
"grad_norm": 9.16294002532959,
"learning_rate": 1.7367027931048108e-05,
"loss": 0.0546,
"step": 58000
},
{
"epoch": 2.097777777777778,
"grad_norm": 4.509792327880859,
"learning_rate": 1.6708587381645313e-05,
"loss": 0.054,
"step": 59000
},
{
"epoch": 2.1333333333333333,
"grad_norm": 0.07099995762109756,
"learning_rate": 1.605014683224252e-05,
"loss": 0.0535,
"step": 60000
},
{
"epoch": 2.1333333333333333,
"eval_loss": 0.279130220413208,
"eval_runtime": 55.8907,
"eval_samples_per_second": 17.892,
"eval_steps_per_second": 0.573,
"eval_sts-dev_pearson_cosine": 0.8213308892826775,
"eval_sts-dev_spearman_cosine": 0.8271747105077873,
"step": 60000
},
{
"epoch": 2.168888888888889,
"grad_norm": 1.7394822835922241,
"learning_rate": 1.5391706282839724e-05,
"loss": 0.0512,
"step": 61000
},
{
"epoch": 2.2044444444444444,
"grad_norm": 7.789730548858643,
"learning_rate": 1.473326573343693e-05,
"loss": 0.0546,
"step": 62000
},
{
"epoch": 2.24,
"grad_norm": 10.078393936157227,
"learning_rate": 1.4074825184034135e-05,
"loss": 0.0539,
"step": 63000
},
{
"epoch": 2.2755555555555556,
"grad_norm": 2.606584310531616,
"learning_rate": 1.341638463463134e-05,
"loss": 0.0561,
"step": 64000
},
{
"epoch": 2.311111111111111,
"grad_norm": 4.760853290557861,
"learning_rate": 1.2757944085228546e-05,
"loss": 0.0478,
"step": 65000
},
{
"epoch": 2.311111111111111,
"eval_loss": 0.256197065114975,
"eval_runtime": 55.5249,
"eval_samples_per_second": 18.01,
"eval_steps_per_second": 0.576,
"eval_sts-dev_pearson_cosine": 0.8246413401396585,
"eval_sts-dev_spearman_cosine": 0.8288094370870545,
"step": 65000
},
{
"epoch": 2.3466666666666667,
"grad_norm": 1.3447166681289673,
"learning_rate": 1.2099503535825751e-05,
"loss": 0.0555,
"step": 66000
},
{
"epoch": 2.3822222222222225,
"grad_norm": 2.37924861907959,
"learning_rate": 1.1441062986422956e-05,
"loss": 0.0503,
"step": 67000
},
{
"epoch": 2.417777777777778,
"grad_norm": 1.2358015775680542,
"learning_rate": 1.0782622437020162e-05,
"loss": 0.0449,
"step": 68000
},
{
"epoch": 2.453333333333333,
"grad_norm": 0.22912859916687012,
"learning_rate": 1.0124181887617367e-05,
"loss": 0.0482,
"step": 69000
},
{
"epoch": 2.488888888888889,
"grad_norm": 9.296670913696289,
"learning_rate": 9.465741338214573e-06,
"loss": 0.0493,
"step": 70000
},
{
"epoch": 2.488888888888889,
"eval_loss": 0.26088747382164,
"eval_runtime": 55.5071,
"eval_samples_per_second": 18.016,
"eval_steps_per_second": 0.577,
"eval_sts-dev_pearson_cosine": 0.8255009970943029,
"eval_sts-dev_spearman_cosine": 0.831174307235804,
"step": 70000
},
{
"epoch": 2.5244444444444447,
"grad_norm": 1.4696452617645264,
"learning_rate": 8.807300788811778e-06,
"loss": 0.0486,
"step": 71000
},
{
"epoch": 2.56,
"grad_norm": 0.014002230018377304,
"learning_rate": 8.148860239408983e-06,
"loss": 0.0483,
"step": 72000
},
{
"epoch": 2.5955555555555554,
"grad_norm": 10.814248085021973,
"learning_rate": 7.49041969000619e-06,
"loss": 0.0444,
"step": 73000
},
{
"epoch": 2.631111111111111,
"grad_norm": 0.9171813726425171,
"learning_rate": 6.831979140603395e-06,
"loss": 0.0421,
"step": 74000
},
{
"epoch": 2.6666666666666665,
"grad_norm": 0.6967930197715759,
"learning_rate": 6.1735385912006005e-06,
"loss": 0.042,
"step": 75000
},
{
"epoch": 2.6666666666666665,
"eval_loss": 0.25533053278923035,
"eval_runtime": 55.7954,
"eval_samples_per_second": 17.923,
"eval_steps_per_second": 0.574,
"eval_sts-dev_pearson_cosine": 0.8229336010617173,
"eval_sts-dev_spearman_cosine": 0.8301305406762217,
"step": 75000
},
{
"epoch": 2.7022222222222223,
"grad_norm": 5.206503391265869,
"learning_rate": 5.515098041797807e-06,
"loss": 0.0409,
"step": 76000
},
{
"epoch": 2.7377777777777776,
"grad_norm": 8.96776008605957,
"learning_rate": 4.856657492395012e-06,
"loss": 0.0456,
"step": 77000
},
{
"epoch": 2.7733333333333334,
"grad_norm": 1.4853557348251343,
"learning_rate": 4.1982169429922175e-06,
"loss": 0.0411,
"step": 78000
},
{
"epoch": 2.8088888888888888,
"grad_norm": 0.08554021269083023,
"learning_rate": 3.539776393589423e-06,
"loss": 0.0416,
"step": 79000
},
{
"epoch": 2.8444444444444446,
"grad_norm": 0.010798577219247818,
"learning_rate": 2.8813358441866287e-06,
"loss": 0.0392,
"step": 80000
},
{
"epoch": 2.8444444444444446,
"eval_loss": 0.24324475228786469,
"eval_runtime": 55.6948,
"eval_samples_per_second": 17.955,
"eval_steps_per_second": 0.575,
"eval_sts-dev_pearson_cosine": 0.8258729995042317,
"eval_sts-dev_spearman_cosine": 0.8310916968189412,
"step": 80000
},
{
"epoch": 2.88,
"grad_norm": 1.3684927225112915,
"learning_rate": 2.222895294783834e-06,
"loss": 0.0365,
"step": 81000
},
{
"epoch": 2.9155555555555557,
"grad_norm": 21.493656158447266,
"learning_rate": 1.5644547453810395e-06,
"loss": 0.042,
"step": 82000
},
{
"epoch": 2.951111111111111,
"grad_norm": 7.1114654541015625,
"learning_rate": 9.06014195978245e-07,
"loss": 0.0422,
"step": 83000
},
{
"epoch": 2.986666666666667,
"grad_norm": 0.7839590907096863,
"learning_rate": 2.475736465754507e-07,
"loss": 0.0343,
"step": 84000
}
],
"logging_steps": 1000,
"max_steps": 84375,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 5000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}