{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 1.9943342776203967,
  "eval_steps": 500,
  "global_step": 176,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.056657223796033995,
      "grad_norm": 3.4392068491494854,
      "learning_rate": 4.990049701020116e-06,
      "logits/chosen": -0.6828265190124512,
      "logits/rejected": -0.38410842418670654,
      "logps/chosen": -43.54640197753906,
      "logps/rejected": -41.797630310058594,
      "loss": 0.9248,
      "num_input_tokens_seen": 1680560,
      "rewards/accuracies": 0.3500000238418579,
      "rewards/chosen": 0.010606171563267708,
      "rewards/margins": -0.0008467707666568458,
      "rewards/rejected": 0.011452942155301571,
      "step": 5
    },
    {
      "epoch": 0.11331444759206799,
      "grad_norm": 3.6129389925019164,
      "learning_rate": 4.96027801084029e-06,
      "logits/chosen": -0.6389784812927246,
      "logits/rejected": -0.3086641728878021,
      "logps/chosen": -41.581520080566406,
      "logps/rejected": -39.307098388671875,
      "loss": 0.9061,
      "num_input_tokens_seen": 3312576,
      "rewards/accuracies": 0.4414062798023224,
      "rewards/chosen": 0.025327304378151894,
      "rewards/margins": -0.007941663265228271,
      "rewards/rejected": 0.033268969506025314,
      "step": 10
    },
    {
      "epoch": 0.16997167138810199,
      "grad_norm": 3.0775980735311257,
      "learning_rate": 4.910921919235268e-06,
      "logits/chosen": -0.6776367425918579,
      "logits/rejected": -0.33959123492240906,
      "logps/chosen": -41.47238540649414,
      "logps/rejected": -40.021629333496094,
      "loss": 0.903,
      "num_input_tokens_seen": 4967920,
      "rewards/accuracies": 0.5062500238418579,
      "rewards/chosen": 0.031961970031261444,
      "rewards/margins": 0.004943774081766605,
      "rewards/rejected": 0.027018193155527115,
      "step": 15
    },
    {
      "epoch": 0.22662889518413598,
      "grad_norm": 3.747403890464739,
      "learning_rate": 4.842374312499405e-06,
      "logits/chosen": -0.7185826897621155,
      "logits/rejected": -0.3505692780017853,
      "logps/chosen": -41.31022644042969,
      "logps/rejected": -43.4354248046875,
      "loss": 0.887,
      "num_input_tokens_seen": 6638032,
      "rewards/accuracies": 0.5289062261581421,
      "rewards/chosen": 0.029671315103769302,
      "rewards/margins": 0.03373996168375015,
      "rewards/rejected": -0.004068647511303425,
      "step": 20
    },
    {
      "epoch": 0.28328611898017,
      "grad_norm": 3.882390320501067,
      "learning_rate": 4.7551808459778035e-06,
      "logits/chosen": -0.7912204265594482,
      "logits/rejected": -0.4081867039203644,
      "logps/chosen": -40.786190032958984,
      "logps/rejected": -49.43992614746094,
      "loss": 0.8849,
      "num_input_tokens_seen": 8300864,
      "rewards/accuracies": 0.573437511920929,
      "rewards/chosen": 0.027608171105384827,
      "rewards/margins": 0.09296830743551254,
      "rewards/rejected": -0.06536012887954712,
      "step": 25
    },
    {
      "epoch": 0.33994334277620397,
      "grad_norm": 3.689704982904893,
      "learning_rate": 4.6500356005192514e-06,
      "logits/chosen": -0.9003207683563232,
      "logits/rejected": -0.5727058053016663,
      "logps/chosen": -41.962528228759766,
      "logps/rejected": -51.55060958862305,
      "loss": 0.8742,
      "num_input_tokens_seen": 9974336,
      "rewards/accuracies": 0.5796874761581421,
      "rewards/chosen": 0.03460949286818504,
      "rewards/margins": 0.11776359379291534,
      "rewards/rejected": -0.08315409719944,
      "step": 30
    },
    {
      "epoch": 0.39660056657223797,
      "grad_norm": 3.1412412950047406,
      "learning_rate": 4.527775557426648e-06,
      "logits/chosen": -0.9322009682655334,
      "logits/rejected": -0.6008542776107788,
      "logps/chosen": -41.117801666259766,
      "logps/rejected": -54.86797332763672,
      "loss": 0.8839,
      "num_input_tokens_seen": 11635904,
      "rewards/accuracies": 0.5609375238418579,
      "rewards/chosen": 0.026737282052636147,
      "rewards/margins": 0.1322566419839859,
      "rewards/rejected": -0.1055193617939949,
      "step": 35
    },
    {
      "epoch": 0.45325779036827196,
      "grad_norm": 3.3700844594558808,
      "learning_rate": 4.3893739358856465e-06,
      "logits/chosen": -1.0083229541778564,
      "logits/rejected": -0.6674706935882568,
      "logps/chosen": -42.46403884887695,
      "logps/rejected": -58.295433044433594,
      "loss": 0.8793,
      "num_input_tokens_seen": 13334624,
      "rewards/accuracies": 0.5679687857627869,
      "rewards/chosen": 0.029065193608403206,
      "rewards/margins": 0.1736484318971634,
      "rewards/rejected": -0.14458322525024414,
      "step": 40
    },
    {
      "epoch": 0.509915014164306,
      "grad_norm": 3.05020264996686,
      "learning_rate": 4.235932445907152e-06,
      "logits/chosen": -1.08047616481781,
      "logits/rejected": -0.7721234560012817,
      "logps/chosen": -42.22970962524414,
      "logps/rejected": -58.919654846191406,
      "loss": 0.8644,
      "num_input_tokens_seen": 15020256,
      "rewards/accuracies": 0.598437488079071,
      "rewards/chosen": 0.025527477264404297,
      "rewards/margins": 0.17703114449977875,
      "rewards/rejected": -0.15150366723537445,
      "step": 45
    },
    {
      "epoch": 0.56657223796034,
      "grad_norm": 4.048246186351266,
      "learning_rate": 4.06867251845213e-06,
      "logits/chosen": -1.1367661952972412,
      "logits/rejected": -0.8066680431365967,
      "logps/chosen": -42.63392639160156,
      "logps/rejected": -62.10126495361328,
      "loss": 0.871,
      "num_input_tokens_seen": 16652784,
      "rewards/accuracies": 0.6031250357627869,
      "rewards/chosen": 0.02532328851521015,
      "rewards/margins": 0.21386705338954926,
      "rewards/rejected": -0.18854375183582306,
      "step": 50
    },
    {
      "epoch": 0.623229461756374,
      "grad_norm": 3.8527571120579376,
      "learning_rate": 3.888925582549006e-06,
      "logits/chosen": -1.1410269737243652,
      "logits/rejected": -0.853507936000824,
      "logps/chosen": -41.560760498046875,
      "logps/rejected": -60.49627685546875,
      "loss": 0.8671,
      "num_input_tokens_seen": 18309696,
      "rewards/accuracies": 0.6109375357627869,
      "rewards/chosen": 0.03284949064254761,
      "rewards/margins": 0.19434118270874023,
      "rewards/rejected": -0.16149167716503143,
      "step": 55
    },
    {
      "epoch": 0.6798866855524079,
      "grad_norm": 3.4325760299822763,
      "learning_rate": 3.6981224668001427e-06,
      "logits/chosen": -1.1432032585144043,
      "logits/rejected": -0.8466291427612305,
      "logps/chosen": -42.81460189819336,
      "logps/rejected": -65.68302154541016,
      "loss": 0.8697,
      "num_input_tokens_seen": 19989248,
      "rewards/accuracies": 0.624218761920929,
      "rewards/chosen": 0.030167952179908752,
      "rewards/margins": 0.23959490656852722,
      "rewards/rejected": -0.20942696928977966,
      "step": 60
    },
    {
      "epoch": 0.7365439093484419,
      "grad_norm": 6.811587294127594,
      "learning_rate": 3.4977820096439353e-06,
      "logits/chosen": -1.1374213695526123,
      "logits/rejected": -0.8044918179512024,
      "logps/chosen": -42.11437225341797,
      "logps/rejected": -65.19153594970703,
      "loss": 0.8586,
      "num_input_tokens_seen": 21666400,
      "rewards/accuracies": 0.6312500238418579,
      "rewards/chosen": 0.028453171253204346,
      "rewards/margins": 0.24752813577651978,
      "rewards/rejected": -0.21907494962215424,
      "step": 65
    },
    {
      "epoch": 0.7932011331444759,
      "grad_norm": 3.785753444305078,
      "learning_rate": 3.289498969037563e-06,
      "logits/chosen": -1.131552815437317,
      "logits/rejected": -0.8144394159317017,
      "logps/chosen": -41.86022186279297,
      "logps/rejected": -66.08959197998047,
      "loss": 0.8502,
      "num_input_tokens_seen": 23339808,
      "rewards/accuracies": 0.610156238079071,
      "rewards/chosen": 0.031133882701396942,
      "rewards/margins": 0.24614590406417847,
      "rewards/rejected": -0.21501199901103973,
      "step": 70
    },
    {
      "epoch": 0.8498583569405099,
      "grad_norm": 3.2614544616286323,
      "learning_rate": 3.074931327802202e-06,
      "logits/chosen": -1.1494231224060059,
      "logits/rejected": -0.8250181078910828,
      "logps/chosen": -40.82815933227539,
      "logps/rejected": -60.07236099243164,
      "loss": 0.8552,
      "num_input_tokens_seen": 25040384,
      "rewards/accuracies": 0.6351562738418579,
      "rewards/chosen": 0.03533646836876869,
      "rewards/margins": 0.19970139861106873,
      "rewards/rejected": -0.16436493396759033,
      "step": 75
    },
    {
      "epoch": 0.9065155807365439,
      "grad_norm": 4.774897539046676,
      "learning_rate": 2.8557870956832135e-06,
      "logits/chosen": -1.1613296270370483,
      "logits/rejected": -0.8634606599807739,
      "logps/chosen": -41.83013153076172,
      "logps/rejected": -63.50177764892578,
      "loss": 0.8551,
      "num_input_tokens_seen": 26711328,
      "rewards/accuracies": 0.6382812261581421,
      "rewards/chosen": 0.03686064854264259,
      "rewards/margins": 0.22714030742645264,
      "rewards/rejected": -0.19027964770793915,
      "step": 80
    },
    {
      "epoch": 0.9631728045325779,
      "grad_norm": 4.567430928668881,
      "learning_rate": 2.633810713184038e-06,
      "logits/chosen": -1.232783555984497,
      "logits/rejected": -0.9462777972221375,
      "logps/chosen": -39.65287780761719,
      "logps/rejected": -71.8165283203125,
      "loss": 0.8238,
      "num_input_tokens_seen": 28331408,
      "rewards/accuracies": 0.6390625238418579,
      "rewards/chosen": 0.030404197052121162,
      "rewards/margins": 0.3152778148651123,
      "rewards/rejected": -0.2848736345767975,
      "step": 85
    },
    {
      "epoch": 1.019830028328612,
      "grad_norm": 3.564174392242714,
      "learning_rate": 2.410769165402549e-06,
      "logits/chosen": -1.3054012060165405,
      "logits/rejected": -0.9874560832977295,
      "logps/chosen": -38.75739669799805,
      "logps/rejected": -77.87242126464844,
      "loss": 0.7991,
      "num_input_tokens_seen": 29960176,
      "rewards/accuracies": 0.7664062976837158,
      "rewards/chosen": 0.05673448368906975,
      "rewards/margins": 0.410070538520813,
      "rewards/rejected": -0.35333606600761414,
      "step": 90
    },
    {
      "epoch": 1.0764872521246458,
      "grad_norm": 3.639574866464199,
      "learning_rate": 2.1884379164070353e-06,
      "logits/chosen": -1.3101121187210083,
      "logits/rejected": -1.0304794311523438,
      "logps/chosen": -34.01818084716797,
      "logps/rejected": -78.08197784423828,
      "loss": 0.7635,
      "num_input_tokens_seen": 31600560,
      "rewards/accuracies": 0.9125000238418579,
      "rewards/chosen": 0.10332122445106506,
      "rewards/margins": 0.44105643033981323,
      "rewards/rejected": -0.33773520588874817,
      "step": 95
    },
    {
      "epoch": 1.13314447592068,
      "grad_norm": 10.444220653728056,
      "learning_rate": 1.9685867761175584e-06,
      "logits/chosen": -1.3980920314788818,
      "logits/rejected": -1.0776573419570923,
      "logps/chosen": -33.219970703125,
      "logps/rejected": -79.67290496826172,
      "loss": 0.7281,
      "num_input_tokens_seen": 33264656,
      "rewards/accuracies": 0.9156250357627869,
      "rewards/chosen": 0.11125814914703369,
      "rewards/margins": 0.4681531488895416,
      "rewards/rejected": -0.35689496994018555,
      "step": 100
    },
    {
      "epoch": 1.1898016997167138,
      "grad_norm": 9.67004041689324,
      "learning_rate": 1.7529658121956778e-06,
      "logits/chosen": -1.4995694160461426,
      "logits/rejected": -1.1786754131317139,
      "logps/chosen": -33.54408645629883,
      "logps/rejected": -89.48563385009766,
      "loss": 0.7261,
      "num_input_tokens_seen": 34926400,
      "rewards/accuracies": 0.9171874523162842,
      "rewards/chosen": 0.102174311876297,
      "rewards/margins": 0.5680368542671204,
      "rewards/rejected": -0.46586257219314575,
      "step": 105
    },
    {
      "epoch": 1.246458923512748,
      "grad_norm": 4.87623037516046,
      "learning_rate": 1.5432914190872757e-06,
      "logits/chosen": -1.5375168323516846,
      "logits/rejected": -1.2575129270553589,
      "logps/chosen": -34.025814056396484,
      "logps/rejected": -85.2932357788086,
      "loss": 0.7341,
      "num_input_tokens_seen": 36625152,
      "rewards/accuracies": 0.90625,
      "rewards/chosen": 0.10566969215869904,
      "rewards/margins": 0.5016511678695679,
      "rewards/rejected": -0.39598149061203003,
      "step": 110
    },
    {
      "epoch": 1.3031161473087818,
      "grad_norm": 3.215644407756359,
      "learning_rate": 1.3412326551122365e-06,
      "logits/chosen": -1.5861111879348755,
      "logits/rejected": -1.2437673807144165,
      "logps/chosen": -34.28375244140625,
      "logps/rejected": -89.0433349609375,
      "loss": 0.7049,
      "num_input_tokens_seen": 38291568,
      "rewards/accuracies": 0.9281249642372131,
      "rewards/chosen": 0.11062516272068024,
      "rewards/margins": 0.5648654103279114,
      "rewards/rejected": -0.45424020290374756,
      "step": 115
    },
    {
      "epoch": 1.3597733711048159,
      "grad_norm": 3.9025756402857144,
      "learning_rate": 1.148397956361007e-06,
      "logits/chosen": -1.586114525794983,
      "logits/rejected": -1.2419018745422363,
      "logps/chosen": -33.745235443115234,
      "logps/rejected": -88.12962341308594,
      "loss": 0.7101,
      "num_input_tokens_seen": 39968640,
      "rewards/accuracies": 0.9132812023162842,
      "rewards/chosen": 0.10659734159708023,
      "rewards/margins": 0.5604459643363953,
      "rewards/rejected": -0.45384860038757324,
      "step": 120
    },
    {
      "epoch": 1.41643059490085,
      "grad_norm": 11.720053215668802,
      "learning_rate": 9.663223331586018e-07,
      "logits/chosen": -1.5811809301376343,
      "logits/rejected": -1.2872581481933594,
      "logps/chosen": -34.016902923583984,
      "logps/rejected": -84.98761749267578,
      "loss": 0.7449,
      "num_input_tokens_seen": 41625872,
      "rewards/accuracies": 0.9195312857627869,
      "rewards/chosen": 0.10000783950090408,
      "rewards/margins": 0.5234241485595703,
      "rewards/rejected": -0.4234163165092468,
      "step": 125
    },
    {
      "epoch": 1.4730878186968839,
      "grad_norm": 4.372417019080061,
      "learning_rate": 7.964551510152721e-07,
      "logits/chosen": -1.5894551277160645,
      "logits/rejected": -1.2608683109283447,
      "logps/chosen": -34.70787048339844,
      "logps/rejected": -90.22215270996094,
      "loss": 0.7111,
      "num_input_tokens_seen": 43275232,
      "rewards/accuracies": 0.9367187023162842,
      "rewards/chosen": 0.10478956997394562,
      "rewards/margins": 0.574487030506134,
      "rewards/rejected": -0.4696974456310272,
      "step": 130
    },
    {
      "epoch": 1.5297450424929178,
      "grad_norm": 3.1993831808095154,
      "learning_rate": 6.401485933303761e-07,
      "logits/chosen": -1.5827866792678833,
      "logits/rejected": -1.2936339378356934,
      "logps/chosen": -33.80126953125,
      "logps/rejected": -83.7958984375,
      "loss": 0.7256,
      "num_input_tokens_seen": 44948016,
      "rewards/accuracies": 0.9242187738418579,
      "rewards/chosen": 0.10606013238430023,
      "rewards/margins": 0.5161378383636475,
      "rewards/rejected": -0.41007769107818604,
      "step": 135
    },
    {
      "epoch": 1.5864022662889519,
      "grad_norm": 6.440470018992748,
      "learning_rate": 4.986468976890993e-07,
      "logits/chosen": -1.5819790363311768,
      "logits/rejected": -1.285261869430542,
      "logps/chosen": -35.26974105834961,
      "logps/rejected": -88.123291015625,
      "loss": 0.7395,
      "num_input_tokens_seen": 46625616,
      "rewards/accuracies": 0.9421875476837158,
      "rewards/chosen": 0.10738234221935272,
      "rewards/margins": 0.5347738862037659,
      "rewards/rejected": -0.4273914694786072,
      "step": 140
    },
    {
      "epoch": 1.643059490084986,
      "grad_norm": 3.8352938999353468,
      "learning_rate": 3.7307645143367324e-07,
      "logits/chosen": -1.5672367811203003,
      "logits/rejected": -1.2417587041854858,
      "logps/chosen": -33.79491424560547,
      "logps/rejected": -93.45381927490234,
      "loss": 0.7,
      "num_input_tokens_seen": 48305888,
      "rewards/accuracies": 0.9351562261581421,
      "rewards/chosen": 0.1095382571220398,
      "rewards/margins": 0.6097238063812256,
      "rewards/rejected": -0.5001855492591858,
      "step": 145
    },
    {
      "epoch": 1.6997167138810199,
      "grad_norm": 4.623961323984275,
      "learning_rate": 2.644368253507218e-07,
      "logits/chosen": -1.5708250999450684,
      "logits/rejected": -1.291783332824707,
      "logps/chosen": -34.73797607421875,
      "logps/rejected": -92.44465637207031,
      "loss": 0.7164,
      "num_input_tokens_seen": 49996656,
      "rewards/accuracies": 0.9281250238418579,
      "rewards/chosen": 0.10675586760044098,
      "rewards/margins": 0.5859290957450867,
      "rewards/rejected": -0.4791731834411621,
      "step": 150
    },
    {
      "epoch": 1.7563739376770537,
      "grad_norm": 4.154509541527173,
      "learning_rate": 1.7359281684871609e-07,
      "logits/chosen": -1.5739152431488037,
      "logits/rejected": -1.2770020961761475,
      "logps/chosen": -33.74359893798828,
      "logps/rejected": -89.9598159790039,
      "loss": 0.7194,
      "num_input_tokens_seen": 51713152,
      "rewards/accuracies": 0.9304687976837158,
      "rewards/chosen": 0.11068729311227798,
      "rewards/margins": 0.5778743028640747,
      "rewards/rejected": -0.4671870172023773,
      "step": 155
    },
    {
      "epoch": 1.8130311614730878,
      "grad_norm": 4.554210834535941,
      "learning_rate": 1.0126756596375687e-07,
      "logits/chosen": -1.5575604438781738,
      "logits/rejected": -1.2646372318267822,
      "logps/chosen": -33.644866943359375,
      "logps/rejected": -89.74214172363281,
      "loss": 0.7072,
      "num_input_tokens_seen": 53343936,
      "rewards/accuracies": 0.938281238079071,
      "rewards/chosen": 0.1099441722035408,
      "rewards/margins": 0.5738458633422852,
      "rewards/rejected": -0.46390166878700256,
      "step": 160
    },
    {
      "epoch": 1.869688385269122,
      "grad_norm": 3.3860907019997497,
      "learning_rate": 4.8036798991923925e-08,
      "logits/chosen": -1.572768211364746,
      "logits/rejected": -1.2713679075241089,
      "logps/chosen": -34.677574157714844,
      "logps/rejected": -92.39009857177734,
      "loss": 0.7207,
      "num_input_tokens_seen": 55005216,
      "rewards/accuracies": 0.918749988079071,
      "rewards/chosen": 0.11008980125188828,
      "rewards/margins": 0.5942960977554321,
      "rewards/rejected": -0.48420625925064087,
      "step": 165
    },
    {
      "epoch": 1.9263456090651558,
      "grad_norm": 3.553353353036504,
      "learning_rate": 1.4324245570256634e-08,
      "logits/chosen": -1.5646497011184692,
      "logits/rejected": -1.2812663316726685,
      "logps/chosen": -34.568756103515625,
      "logps/rejected": -90.2674789428711,
      "loss": 0.7349,
      "num_input_tokens_seen": 56660496,
      "rewards/accuracies": 0.921875,
      "rewards/chosen": 0.10454072803258896,
      "rewards/margins": 0.572338342666626,
      "rewards/rejected": -0.4677976369857788,
      "step": 170
    },
    {
      "epoch": 1.9830028328611897,
      "grad_norm": 3.351679982914947,
      "learning_rate": 3.982656874917945e-10,
      "logits/chosen": -1.557882308959961,
      "logits/rejected": -1.275282859802246,
      "logps/chosen": -33.40605545043945,
      "logps/rejected": -86.52145385742188,
      "loss": 0.7205,
      "num_input_tokens_seen": 58302912,
      "rewards/accuracies": 0.9312500357627869,
      "rewards/chosen": 0.10033180564641953,
      "rewards/margins": 0.5417515635490417,
      "rewards/rejected": -0.4414197504520416,
      "step": 175
    },
    {
      "epoch": 1.9943342776203967,
      "num_input_tokens_seen": 58638160,
      "step": 176,
      "total_flos": 23775439159296.0,
      "train_loss": 0.7984247827394442,
      "train_runtime": 3659.4063,
      "train_samples_per_second": 12.347,
      "train_steps_per_second": 0.048
    }
  ],
  "logging_steps": 5,
  "max_steps": 176,
  "num_input_tokens_seen": 58638160,
  "num_train_epochs": 2,
  "save_steps": 1000,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 23775439159296.0,
  "train_batch_size": 1,
  "trial_name": null,
  "trial_params": null
}
