Sentence Similarity
sentence-transformers
Safetensors
Arabic
modernbert
feature-extraction
dense
Generated from Trainer
dataset_size:900000
loss:GISTEmbedLoss
Eval Results (legacy)
text-embeddings-inference
Instructions to use Omartificial-Intelligence-Space/mmbert-base-arabic-nli with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- sentence-transformers
How to use Omartificial-Intelligence-Space/mmbert-base-arabic-nli with sentence-transformers:
from sentence_transformers import SentenceTransformer model = SentenceTransformer("Omartificial-Intelligence-Space/mmbert-base-arabic-nli") sentences = [ "ممكن تخبرني ارتفاع برج الخليفة", "الزيادات في سكان الجبل الأسود. أنهى الجبل الأسود عام 2014 عدد سكانه 621800 نسمة ، وهو ما يمثل زيادة قدرها 279 شخصًا مقارنة بعام 2013.", "يبلغ ارتفاعه الإجمالي 829.8 مترًا (2،722 قدمًا) وارتفاع السقف (باستثناء الهوائي) 828 مترًا (2،717 قدمًا) ، وكان برج خليفة أطول مبنى في العالم منذ ظهوره في أواخر عام 2008. برج خليفة", "في 4 يناير 2010 ، تحولت أنظار العالم إلى برج خليفة حيث افتتح صاحب السمو الشيخ محمد بن راشد آل مكتوم ، نائب رئيس الدولة رئيس مجلس الوزراء حاكم دبي ، أطول برج في العالم. تلا ذلك عرض ضوئي وصوتي مذهل وتم بثه في جميع أنحاء العالم. يشارك." ] embeddings = model.encode(sentences) similarities = model.similarity(embeddings, embeddings) print(similarities.shape) # [4, 4] - Notebooks
- Google Colab
- Kaggle
Download trainer_state.json from Omartificial-Intelligence-Space/mmbert-base-arabic-nli: direct link, hf CLI and curl.
- Browser
- Download file 21.4 kB
-
https://huggingface.co/Omartificial-Intelligence-Space/mmbert-base-arabic-nli/resolve/main/trainer_state.json
- Command line
-
hf download hf://Omartificial-Intelligence-Space/mmbert-base-arabic-nli/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/Omartificial-Intelligence-Space/mmbert-base-arabic-nli/resolve/main/trainer_state.json
21.4 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 5000, | |
| "global_step": 84375, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.035555555555555556, | |
| "grad_norm": 31.097620010375977, | |
| "learning_rate": 5.91964920597298e-06, | |
| "loss": 1.6025, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.07111111111111111, | |
| "grad_norm": 15.004558563232422, | |
| "learning_rate": 1.1845223986726713e-05, | |
| "loss": 0.5208, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.10666666666666667, | |
| "grad_norm": 18.05305290222168, | |
| "learning_rate": 1.7770798767480447e-05, | |
| "loss": 0.4374, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.14222222222222222, | |
| "grad_norm": 15.441234588623047, | |
| "learning_rate": 2.369637354823418e-05, | |
| "loss": 0.4142, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "grad_norm": 11.936789512634277, | |
| "learning_rate": 2.9621948328987915e-05, | |
| "loss": 0.3916, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.17777777777777778, | |
| "eval_loss": 0.3775472640991211, | |
| "eval_runtime": 11.6508, | |
| "eval_samples_per_second": 85.831, | |
| "eval_steps_per_second": 2.747, | |
| "eval_sts-dev_pearson_cosine": 0.8150497373285317, | |
| "eval_sts-dev_spearman_cosine": 0.8196131231126629, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.21333333333333335, | |
| "grad_norm": 12.518898963928223, | |
| "learning_rate": 3.554752310974165e-05, | |
| "loss": 0.382, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.24888888888888888, | |
| "grad_norm": 9.117196083068848, | |
| "learning_rate": 4.147309789049538e-05, | |
| "loss": 0.3824, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.28444444444444444, | |
| "grad_norm": 9.207646369934082, | |
| "learning_rate": 4.739867267124911e-05, | |
| "loss": 0.3744, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 8.699370384216309, | |
| "learning_rate": 4.9630614851785036e-05, | |
| "loss": 0.3781, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "grad_norm": 5.3027729988098145, | |
| "learning_rate": 4.897217430238224e-05, | |
| "loss": 0.367, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.35555555555555557, | |
| "eval_loss": 0.37576642632484436, | |
| "eval_runtime": 35.1214, | |
| "eval_samples_per_second": 28.473, | |
| "eval_steps_per_second": 0.911, | |
| "eval_sts-dev_pearson_cosine": 0.8076134919907783, | |
| "eval_sts-dev_spearman_cosine": 0.8136231582786481, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.39111111111111113, | |
| "grad_norm": 13.608588218688965, | |
| "learning_rate": 4.831373375297945e-05, | |
| "loss": 0.3527, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.4266666666666667, | |
| "grad_norm": 2.712616443634033, | |
| "learning_rate": 4.765529320357665e-05, | |
| "loss": 0.3354, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 0.4622222222222222, | |
| "grad_norm": 7.297984600067139, | |
| "learning_rate": 4.699685265417386e-05, | |
| "loss": 0.3147, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 0.49777777777777776, | |
| "grad_norm": 3.9520838260650635, | |
| "learning_rate": 4.633841210477106e-05, | |
| "loss": 0.3084, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "grad_norm": 3.8519201278686523, | |
| "learning_rate": 4.567997155536827e-05, | |
| "loss": 0.2975, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5333333333333333, | |
| "eval_loss": 0.35147717595100403, | |
| "eval_runtime": 30.6971, | |
| "eval_samples_per_second": 32.576, | |
| "eval_steps_per_second": 1.042, | |
| "eval_sts-dev_pearson_cosine": 0.8128354003998368, | |
| "eval_sts-dev_spearman_cosine": 0.8205304242394997, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 0.5688888888888889, | |
| "grad_norm": 7.860720634460449, | |
| "learning_rate": 4.502153100596547e-05, | |
| "loss": 0.2978, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 0.6044444444444445, | |
| "grad_norm": 7.748737335205078, | |
| "learning_rate": 4.436309045656268e-05, | |
| "loss": 0.2916, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 8.615702629089355, | |
| "learning_rate": 4.370464990715988e-05, | |
| "loss": 0.2792, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 0.6755555555555556, | |
| "grad_norm": 5.2580156326293945, | |
| "learning_rate": 4.304620935775709e-05, | |
| "loss": 0.2661, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "grad_norm": 9.318315505981445, | |
| "learning_rate": 4.238776880835429e-05, | |
| "loss": 0.2583, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 0.7111111111111111, | |
| "eval_loss": 0.3185396194458008, | |
| "eval_runtime": 30.8313, | |
| "eval_samples_per_second": 32.435, | |
| "eval_steps_per_second": 1.038, | |
| "eval_sts-dev_pearson_cosine": 0.8058349279884176, | |
| "eval_sts-dev_spearman_cosine": 0.8159206996876398, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 0.7466666666666667, | |
| "grad_norm": 4.720574855804443, | |
| "learning_rate": 4.17293282589515e-05, | |
| "loss": 0.2529, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 0.7822222222222223, | |
| "grad_norm": 6.6863484382629395, | |
| "learning_rate": 4.10708877095487e-05, | |
| "loss": 0.2505, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 0.8177777777777778, | |
| "grad_norm": 3.1214375495910645, | |
| "learning_rate": 4.041244716014591e-05, | |
| "loss": 0.2454, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 0.8533333333333334, | |
| "grad_norm": 0.6488115787506104, | |
| "learning_rate": 3.9754006610743114e-05, | |
| "loss": 0.242, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "grad_norm": 5.3746113777160645, | |
| "learning_rate": 3.909556606134032e-05, | |
| "loss": 0.2307, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 0.8888888888888888, | |
| "eval_loss": 0.28817781805992126, | |
| "eval_runtime": 31.3269, | |
| "eval_samples_per_second": 31.921, | |
| "eval_steps_per_second": 1.021, | |
| "eval_sts-dev_pearson_cosine": 0.8068056591060926, | |
| "eval_sts-dev_spearman_cosine": 0.8175004911072571, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 0.9244444444444444, | |
| "grad_norm": 7.79231595993042, | |
| "learning_rate": 3.8437125511937525e-05, | |
| "loss": 0.2349, | |
| "step": 26000 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 9.042169570922852, | |
| "learning_rate": 3.7778684962534734e-05, | |
| "loss": 0.2238, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 0.9955555555555555, | |
| "grad_norm": 10.183342933654785, | |
| "learning_rate": 3.7120244413131936e-05, | |
| "loss": 0.2132, | |
| "step": 28000 | |
| }, | |
| { | |
| "epoch": 1.031111111111111, | |
| "grad_norm": 1.6765131950378418, | |
| "learning_rate": 3.6461803863729144e-05, | |
| "loss": 0.1601, | |
| "step": 29000 | |
| }, | |
| { | |
| "epoch": 1.0666666666666667, | |
| "grad_norm": 2.5507757663726807, | |
| "learning_rate": 3.5803363314326346e-05, | |
| "loss": 0.1581, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.0666666666666667, | |
| "eval_loss": 0.2580932080745697, | |
| "eval_runtime": 31.0615, | |
| "eval_samples_per_second": 32.194, | |
| "eval_steps_per_second": 1.03, | |
| "eval_sts-dev_pearson_cosine": 0.8157474163754647, | |
| "eval_sts-dev_spearman_cosine": 0.8222299144499523, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 1.1022222222222222, | |
| "grad_norm": 2.3133509159088135, | |
| "learning_rate": 3.5144922764923555e-05, | |
| "loss": 0.1532, | |
| "step": 31000 | |
| }, | |
| { | |
| "epoch": 1.1377777777777778, | |
| "grad_norm": 2.026036262512207, | |
| "learning_rate": 3.448648221552076e-05, | |
| "loss": 0.1494, | |
| "step": 32000 | |
| }, | |
| { | |
| "epoch": 1.1733333333333333, | |
| "grad_norm": 5.352447986602783, | |
| "learning_rate": 3.3828041666117966e-05, | |
| "loss": 0.1484, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 1.208888888888889, | |
| "grad_norm": 2.9670166969299316, | |
| "learning_rate": 3.316960111671517e-05, | |
| "loss": 0.1529, | |
| "step": 34000 | |
| }, | |
| { | |
| "epoch": 1.2444444444444445, | |
| "grad_norm": 6.357540607452393, | |
| "learning_rate": 3.251116056731238e-05, | |
| "loss": 0.1467, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 1.2444444444444445, | |
| "eval_loss": 0.24440895020961761, | |
| "eval_runtime": 31.2456, | |
| "eval_samples_per_second": 32.005, | |
| "eval_steps_per_second": 1.024, | |
| "eval_sts-dev_pearson_cosine": 0.814902241190906, | |
| "eval_sts-dev_spearman_cosine": 0.8211414049575237, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 6.782201766967773, | |
| "learning_rate": 3.185272001790958e-05, | |
| "loss": 0.1522, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 1.3155555555555556, | |
| "grad_norm": 0.9291681051254272, | |
| "learning_rate": 3.119427946850679e-05, | |
| "loss": 0.1412, | |
| "step": 37000 | |
| }, | |
| { | |
| "epoch": 1.3511111111111112, | |
| "grad_norm": 6.588221073150635, | |
| "learning_rate": 3.053583891910399e-05, | |
| "loss": 0.1416, | |
| "step": 38000 | |
| }, | |
| { | |
| "epoch": 1.3866666666666667, | |
| "grad_norm": 7.346938133239746, | |
| "learning_rate": 2.9877398369701205e-05, | |
| "loss": 0.1393, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 1.4222222222222223, | |
| "grad_norm": 7.207787990570068, | |
| "learning_rate": 2.921895782029841e-05, | |
| "loss": 0.1389, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 1.4222222222222223, | |
| "eval_loss": 0.2562263309955597, | |
| "eval_runtime": 31.2811, | |
| "eval_samples_per_second": 31.968, | |
| "eval_steps_per_second": 1.023, | |
| "eval_sts-dev_pearson_cosine": 0.8227387520545976, | |
| "eval_sts-dev_spearman_cosine": 0.826905561534745, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 1.4577777777777778, | |
| "grad_norm": 2.1179184913635254, | |
| "learning_rate": 2.8560517270895616e-05, | |
| "loss": 0.1353, | |
| "step": 41000 | |
| }, | |
| { | |
| "epoch": 1.4933333333333334, | |
| "grad_norm": 2.6916444301605225, | |
| "learning_rate": 2.790207672149282e-05, | |
| "loss": 0.1284, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 1.528888888888889, | |
| "grad_norm": 9.770589828491211, | |
| "learning_rate": 2.7243636172090027e-05, | |
| "loss": 0.1317, | |
| "step": 43000 | |
| }, | |
| { | |
| "epoch": 1.5644444444444443, | |
| "grad_norm": 2.033369779586792, | |
| "learning_rate": 2.6585195622687232e-05, | |
| "loss": 0.1242, | |
| "step": 44000 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 9.705333709716797, | |
| "learning_rate": 2.5926755073284438e-05, | |
| "loss": 0.1228, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "eval_loss": 0.22733546793460846, | |
| "eval_runtime": 30.7521, | |
| "eval_samples_per_second": 32.518, | |
| "eval_steps_per_second": 1.041, | |
| "eval_sts-dev_pearson_cosine": 0.8129372102759819, | |
| "eval_sts-dev_spearman_cosine": 0.8243194932998689, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 1.6355555555555554, | |
| "grad_norm": 6.558931827545166, | |
| "learning_rate": 2.5268314523881643e-05, | |
| "loss": 0.1308, | |
| "step": 46000 | |
| }, | |
| { | |
| "epoch": 1.6711111111111112, | |
| "grad_norm": 2.8348495960235596, | |
| "learning_rate": 2.4609873974478845e-05, | |
| "loss": 0.1231, | |
| "step": 47000 | |
| }, | |
| { | |
| "epoch": 1.7066666666666666, | |
| "grad_norm": 10.423678398132324, | |
| "learning_rate": 2.395143342507605e-05, | |
| "loss": 0.1196, | |
| "step": 48000 | |
| }, | |
| { | |
| "epoch": 1.7422222222222223, | |
| "grad_norm": 4.737322807312012, | |
| "learning_rate": 2.3292992875673256e-05, | |
| "loss": 0.1202, | |
| "step": 49000 | |
| }, | |
| { | |
| "epoch": 1.7777777777777777, | |
| "grad_norm": 8.491903305053711, | |
| "learning_rate": 2.263455232627046e-05, | |
| "loss": 0.12, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 1.7777777777777777, | |
| "eval_loss": 0.21721433103084564, | |
| "eval_runtime": 48.5394, | |
| "eval_samples_per_second": 20.602, | |
| "eval_steps_per_second": 0.659, | |
| "eval_sts-dev_pearson_cosine": 0.8221879391828698, | |
| "eval_sts-dev_spearman_cosine": 0.8276168454271825, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 1.8133333333333335, | |
| "grad_norm": 7.367649078369141, | |
| "learning_rate": 2.1976111776867667e-05, | |
| "loss": 0.1213, | |
| "step": 51000 | |
| }, | |
| { | |
| "epoch": 1.8488888888888888, | |
| "grad_norm": 3.9367151260375977, | |
| "learning_rate": 2.1317671227464872e-05, | |
| "loss": 0.1134, | |
| "step": 52000 | |
| }, | |
| { | |
| "epoch": 1.8844444444444446, | |
| "grad_norm": 0.3449944853782654, | |
| "learning_rate": 2.0659230678062077e-05, | |
| "loss": 0.109, | |
| "step": 53000 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 1.9318583011627197, | |
| "learning_rate": 2.0000790128659283e-05, | |
| "loss": 0.1158, | |
| "step": 54000 | |
| }, | |
| { | |
| "epoch": 1.9555555555555557, | |
| "grad_norm": 2.4510562419891357, | |
| "learning_rate": 1.9342349579256488e-05, | |
| "loss": 0.1073, | |
| "step": 55000 | |
| }, | |
| { | |
| "epoch": 1.9555555555555557, | |
| "eval_loss": 0.22918041050434113, | |
| "eval_runtime": 48.7814, | |
| "eval_samples_per_second": 20.5, | |
| "eval_steps_per_second": 0.656, | |
| "eval_sts-dev_pearson_cosine": 0.8226444171661187, | |
| "eval_sts-dev_spearman_cosine": 0.832783411507352, | |
| "step": 55000 | |
| }, | |
| { | |
| "epoch": 1.991111111111111, | |
| "grad_norm": 8.485190391540527, | |
| "learning_rate": 1.8683909029853697e-05, | |
| "loss": 0.1053, | |
| "step": 56000 | |
| }, | |
| { | |
| "epoch": 2.026666666666667, | |
| "grad_norm": 0.6446801424026489, | |
| "learning_rate": 1.8025468480450902e-05, | |
| "loss": 0.0643, | |
| "step": 57000 | |
| }, | |
| { | |
| "epoch": 2.062222222222222, | |
| "grad_norm": 9.16294002532959, | |
| "learning_rate": 1.7367027931048108e-05, | |
| "loss": 0.0546, | |
| "step": 58000 | |
| }, | |
| { | |
| "epoch": 2.097777777777778, | |
| "grad_norm": 4.509792327880859, | |
| "learning_rate": 1.6708587381645313e-05, | |
| "loss": 0.054, | |
| "step": 59000 | |
| }, | |
| { | |
| "epoch": 2.1333333333333333, | |
| "grad_norm": 0.07099995762109756, | |
| "learning_rate": 1.605014683224252e-05, | |
| "loss": 0.0535, | |
| "step": 60000 | |
| }, | |
| { | |
| "epoch": 2.1333333333333333, | |
| "eval_loss": 0.279130220413208, | |
| "eval_runtime": 55.8907, | |
| "eval_samples_per_second": 17.892, | |
| "eval_steps_per_second": 0.573, | |
| "eval_sts-dev_pearson_cosine": 0.8213308892826775, | |
| "eval_sts-dev_spearman_cosine": 0.8271747105077873, | |
| "step": 60000 | |
| }, | |
| { | |
| "epoch": 2.168888888888889, | |
| "grad_norm": 1.7394822835922241, | |
| "learning_rate": 1.5391706282839724e-05, | |
| "loss": 0.0512, | |
| "step": 61000 | |
| }, | |
| { | |
| "epoch": 2.2044444444444444, | |
| "grad_norm": 7.789730548858643, | |
| "learning_rate": 1.473326573343693e-05, | |
| "loss": 0.0546, | |
| "step": 62000 | |
| }, | |
| { | |
| "epoch": 2.24, | |
| "grad_norm": 10.078393936157227, | |
| "learning_rate": 1.4074825184034135e-05, | |
| "loss": 0.0539, | |
| "step": 63000 | |
| }, | |
| { | |
| "epoch": 2.2755555555555556, | |
| "grad_norm": 2.606584310531616, | |
| "learning_rate": 1.341638463463134e-05, | |
| "loss": 0.0561, | |
| "step": 64000 | |
| }, | |
| { | |
| "epoch": 2.311111111111111, | |
| "grad_norm": 4.760853290557861, | |
| "learning_rate": 1.2757944085228546e-05, | |
| "loss": 0.0478, | |
| "step": 65000 | |
| }, | |
| { | |
| "epoch": 2.311111111111111, | |
| "eval_loss": 0.256197065114975, | |
| "eval_runtime": 55.5249, | |
| "eval_samples_per_second": 18.01, | |
| "eval_steps_per_second": 0.576, | |
| "eval_sts-dev_pearson_cosine": 0.8246413401396585, | |
| "eval_sts-dev_spearman_cosine": 0.8288094370870545, | |
| "step": 65000 | |
| }, | |
| { | |
| "epoch": 2.3466666666666667, | |
| "grad_norm": 1.3447166681289673, | |
| "learning_rate": 1.2099503535825751e-05, | |
| "loss": 0.0555, | |
| "step": 66000 | |
| }, | |
| { | |
| "epoch": 2.3822222222222225, | |
| "grad_norm": 2.37924861907959, | |
| "learning_rate": 1.1441062986422956e-05, | |
| "loss": 0.0503, | |
| "step": 67000 | |
| }, | |
| { | |
| "epoch": 2.417777777777778, | |
| "grad_norm": 1.2358015775680542, | |
| "learning_rate": 1.0782622437020162e-05, | |
| "loss": 0.0449, | |
| "step": 68000 | |
| }, | |
| { | |
| "epoch": 2.453333333333333, | |
| "grad_norm": 0.22912859916687012, | |
| "learning_rate": 1.0124181887617367e-05, | |
| "loss": 0.0482, | |
| "step": 69000 | |
| }, | |
| { | |
| "epoch": 2.488888888888889, | |
| "grad_norm": 9.296670913696289, | |
| "learning_rate": 9.465741338214573e-06, | |
| "loss": 0.0493, | |
| "step": 70000 | |
| }, | |
| { | |
| "epoch": 2.488888888888889, | |
| "eval_loss": 0.26088747382164, | |
| "eval_runtime": 55.5071, | |
| "eval_samples_per_second": 18.016, | |
| "eval_steps_per_second": 0.577, | |
| "eval_sts-dev_pearson_cosine": 0.8255009970943029, | |
| "eval_sts-dev_spearman_cosine": 0.831174307235804, | |
| "step": 70000 | |
| }, | |
| { | |
| "epoch": 2.5244444444444447, | |
| "grad_norm": 1.4696452617645264, | |
| "learning_rate": 8.807300788811778e-06, | |
| "loss": 0.0486, | |
| "step": 71000 | |
| }, | |
| { | |
| "epoch": 2.56, | |
| "grad_norm": 0.014002230018377304, | |
| "learning_rate": 8.148860239408983e-06, | |
| "loss": 0.0483, | |
| "step": 72000 | |
| }, | |
| { | |
| "epoch": 2.5955555555555554, | |
| "grad_norm": 10.814248085021973, | |
| "learning_rate": 7.49041969000619e-06, | |
| "loss": 0.0444, | |
| "step": 73000 | |
| }, | |
| { | |
| "epoch": 2.631111111111111, | |
| "grad_norm": 0.9171813726425171, | |
| "learning_rate": 6.831979140603395e-06, | |
| "loss": 0.0421, | |
| "step": 74000 | |
| }, | |
| { | |
| "epoch": 2.6666666666666665, | |
| "grad_norm": 0.6967930197715759, | |
| "learning_rate": 6.1735385912006005e-06, | |
| "loss": 0.042, | |
| "step": 75000 | |
| }, | |
| { | |
| "epoch": 2.6666666666666665, | |
| "eval_loss": 0.25533053278923035, | |
| "eval_runtime": 55.7954, | |
| "eval_samples_per_second": 17.923, | |
| "eval_steps_per_second": 0.574, | |
| "eval_sts-dev_pearson_cosine": 0.8229336010617173, | |
| "eval_sts-dev_spearman_cosine": 0.8301305406762217, | |
| "step": 75000 | |
| }, | |
| { | |
| "epoch": 2.7022222222222223, | |
| "grad_norm": 5.206503391265869, | |
| "learning_rate": 5.515098041797807e-06, | |
| "loss": 0.0409, | |
| "step": 76000 | |
| }, | |
| { | |
| "epoch": 2.7377777777777776, | |
| "grad_norm": 8.96776008605957, | |
| "learning_rate": 4.856657492395012e-06, | |
| "loss": 0.0456, | |
| "step": 77000 | |
| }, | |
| { | |
| "epoch": 2.7733333333333334, | |
| "grad_norm": 1.4853557348251343, | |
| "learning_rate": 4.1982169429922175e-06, | |
| "loss": 0.0411, | |
| "step": 78000 | |
| }, | |
| { | |
| "epoch": 2.8088888888888888, | |
| "grad_norm": 0.08554021269083023, | |
| "learning_rate": 3.539776393589423e-06, | |
| "loss": 0.0416, | |
| "step": 79000 | |
| }, | |
| { | |
| "epoch": 2.8444444444444446, | |
| "grad_norm": 0.010798577219247818, | |
| "learning_rate": 2.8813358441866287e-06, | |
| "loss": 0.0392, | |
| "step": 80000 | |
| }, | |
| { | |
| "epoch": 2.8444444444444446, | |
| "eval_loss": 0.24324475228786469, | |
| "eval_runtime": 55.6948, | |
| "eval_samples_per_second": 17.955, | |
| "eval_steps_per_second": 0.575, | |
| "eval_sts-dev_pearson_cosine": 0.8258729995042317, | |
| "eval_sts-dev_spearman_cosine": 0.8310916968189412, | |
| "step": 80000 | |
| }, | |
| { | |
| "epoch": 2.88, | |
| "grad_norm": 1.3684927225112915, | |
| "learning_rate": 2.222895294783834e-06, | |
| "loss": 0.0365, | |
| "step": 81000 | |
| }, | |
| { | |
| "epoch": 2.9155555555555557, | |
| "grad_norm": 21.493656158447266, | |
| "learning_rate": 1.5644547453810395e-06, | |
| "loss": 0.042, | |
| "step": 82000 | |
| }, | |
| { | |
| "epoch": 2.951111111111111, | |
| "grad_norm": 7.1114654541015625, | |
| "learning_rate": 9.06014195978245e-07, | |
| "loss": 0.0422, | |
| "step": 83000 | |
| }, | |
| { | |
| "epoch": 2.986666666666667, | |
| "grad_norm": 0.7839590907096863, | |
| "learning_rate": 2.475736465754507e-07, | |
| "loss": 0.0343, | |
| "step": 84000 | |
| } | |
| ], | |
| "logging_steps": 1000, | |
| "max_steps": 84375, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 5000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 32, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |