{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69d3075bfeebd0caf258b8180334e1df30fc62b5937c94b0a318358c6a9eeaa6","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:38:03.841465Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T08:35:16.435272Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T12:58:08.745243Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2605.08639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08639","snapshot_observed_at":"2026-07-03T12:58:08.745243Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","venue":"cs.LG","work_id":"559bad2a-1ade-45f4-937f-0442b164e557","year":2026},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2605.08639","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:31b2a8b1e967f4d5ecd554c04ae1e9af003851f401e88884aae90ef2e6ac3c18","observation_id":"b2a876fa-2975-4906-84e9-4d18f3f99ad3","resolution":{"observed_at":"2026-07-03T12:58:08.746533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.08639/citation-record","integrity":"/paper/2605.08639/integrity","json":"/paper/2605.08639/citation-record.json","paper":"/paper/2605.08639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Outrageously large neural net- works: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"1dac13e1-18b9-4ed6-9b93-fcada48c33ec","year":2017},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:6a9ea7bf1aa9f055bde6dd2c2e7d215d80090a34c71186e54ded9d4b49a61b66","observation_id":"dff35b60-e754-4dac-a87f-5f0fbb4a0890","resolution":{"observed_at":"2026-05-14T06:28:58.999101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gshard: Scaling giant models with conditional computation and auto- matic sharding","venue":null,"work_id":"79d21394-c519-41cb-8113-70c13f84a022","year":2021},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ebdcc64a1714b7a7bab8d52233c18e7615fd21a10921587e31a7b36bee64132e","observation_id":"52b4106b-93ce-4111-9933-d6c751b7684a","resolution":{"observed_at":"2026-05-14T06:28:59.024843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transform- ers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"0162d209-650e-4c90-80a5-ec8c836c0114","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:2f3c9db9cfaf17eb85bcec690ead913f44072102ca12ee8b88976e725df967e7","observation_id":"f179413e-f69c-4a37-9723-4df3e915bebe","resolution":{"observed_at":"2026-05-14T06:28:59.016199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing DBRX: A New State-of-the-Art Open LLM","venue":null,"work_id":"ba66006b-8cc2-407e-bbfd-3bf215c538d7","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ca973d3f8c42ee5ac2045913b3baddb01e74af6393f3e791363548a23c34f0a7","observation_id":"ecd82fc7-d778-4c60-91dd-5f0394840717","resolution":{"observed_at":"2026-05-14T06:28:59.004084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:d69d4ae56f9541198e34555618f283d6f37f34441f8c261a45ce7c2fb99d29c1","observation_id":"46044026-8da8-4b38-bebe-02303127681c","resolution":{"observed_at":"2026-05-12T01:46:14.870115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:39.110013+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:e5b8c089a28bb9c41fddb76ee52deb85efde524acaf98f2465c996395ba7a9bf","observation_id":"85e6d9d5-5143-4400-88ae-828e652f1cf6","resolution":{"observed_at":"2026-05-12T01:46:14.867213Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:73643005fdd871eae11dfe583dc576930fee312c970d67a536f71b0509ceee15","observation_id":"af418330-8429-4356-97e2-f18e217f2f0c","resolution":{"observed_at":"2026-05-12T01:46:14.876080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:2811bc862d3c8851dc35e1de1d3a0e95b6c108aa8a2459fbbafcd26b00b077d9","observation_id":"ef79a0e6-6687-4f80-9749-e6e0136ae0d7","resolution":{"observed_at":"2026-05-12T01:46:14.873230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:84846a617df6042d321263db09b7382cc5fc3f7944d2262a14ab960be85d56cc","observation_id":"b9beb139-041a-48c5-8ca1-e0ea276e2ab6","resolution":{"observed_at":"2026-05-12T09:28:16.586976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glam: Efficient scaling of language models with mixture-of- experts","venue":null,"work_id":"e1cb2786-fa39-4565-8cc2-287c85cec5f6","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:aef49a8b3646abe77c62ecc801714d727298dd67effbf23d03ce50a8b32f8b70","observation_id":"4ff822f2-3ccd-4f9e-bc5b-7bb03601c371","resolution":{"observed_at":"2026-05-14T06:28:59.020714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed- moe: Advancing mixture-of-experts inference and train- ing to power next-generation ai scale","venue":null,"work_id":"c0c4c872-874c-4675-9334-b8dd38852626","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:f1f4f23ba9da8a6100b347ffadf76aa7cdbccbdec09615b97a4d6a5dc635211a","observation_id":"21a61d10-097b-4f92-9226-519e5e265d26","resolution":{"observed_at":"2026-05-14T06:28:58.994171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"4c98ba30-69f1-43b8-97c5-410ee5260e37","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:44105c14150e8e0d749865db27ae7fcf06f68d86b84870d8c2bea9886cf93b1e","observation_id":"568f501b-5448-4eeb-8040-19bb1e4d07bd","resolution":{"observed_at":"2026-05-14T06:28:59.011896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning","venue":null,"work_id":"ed5d1a02-cab2-4ce6-89a9-0ddfdc85beb4","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:7d2eb124033adf8b7c3a7afbd61fd26d2958cffc49529a6c793d649c3df694c7","observation_id":"71d13990-1ed4-4027-9c1e-577e84dad624","resolution":{"observed_at":"2026-05-14T06:28:58.989243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flexmoe: Scaling large-scale sparse pre-trained model training via dynamic device placement","venue":null,"work_id":"811d5ec3-144e-4cf7-b3d6-4c12168c9827","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:45244d20fab8deaacf2bbae11dcde47309b28b5da3c9fa5715ab802405fe44ec","observation_id":"77bbf96c-60d6-4a09-8f5b-296fff3f7779","resolution":{"observed_at":"2026-05-14T06:28:58.963005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{SmartMoE}: Efficiently training {Sparsely- Activated} models through combining offline and online parallelization","venue":null,"work_id":"ebf225f4-a4ef-4516-85e4-1c751bdda29f","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:b8428156338e6751c7bafb1da95cbca1583c9896774e4a78b0509536811e5262","observation_id":"deb4980a-5017-43e3-991b-5a59f9b5f5e7","resolution":{"observed_at":"2026-05-14T06:28:59.008240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16947","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:58:08.693506Z","title":"Micromoe: Fine- grained load balancing for mixture-of-experts with token scheduling","venue":null,"work_id":"31f6b208-e3ee-4c55-861a-c30acf5f33e9","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:14e7d6da0f54df8129ad67ea3250902fb2a5c5adfb16ac3a020aa194ae19a7b5","observation_id":"7b2f7151-8195-4cec-9a5e-1b88bcb32ff8","resolution":{"observed_at":"2026-05-12T01:46:14.773337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{PopFetcher}: Towards acceler- ated {Mixture-of-Experts} training via popularity based {Expert-Wise}prefetch","venue":null,"work_id":"370c243c-0d41-4db6-814d-14322693e56b","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:73f1444b30aedef39c9d2d696f5bd81295201aa2fc35f156c4abeae05123a45d","observation_id":"f9ad5cd0-4e1a-4ecf-b654-6c62915a71ab","resolution":{"observed_at":"2026-05-14T06:28:58.884605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Laer-moe: Load-adaptive expert re-layout for efficient mixture-of-experts training","venue":null,"work_id":"84730998-63c9-4870-b776-c497cde0c95b","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:3370af32e706fd24ea7f2885b9fec0d29d92465625df2fc9f0d232f59f8a5492","observation_id":"5bd5b82c-3c4c-4369-a810-19e5545c25f0","resolution":{"observed_at":"2026-05-14T06:28:58.935971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.14960","doi":"10.48550/arxiv.2504.14960","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moe parallel folding: Heterogeneous parallelism mappings for efficient large-scale moe model training with megatron core","venue":"Open MIND","work_id":"c907419e-5e64-4e38-aece-ad5867bcef05","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:62fe0a839468ed5b86204962ee551f4225642e63e26c1b16cc48e5d52582c71d","observation_id":"385433df-5e23-49b7-8fc0-dbd1ef95d4af","resolution":{"observed_at":"2026-05-12T01:46:14.788840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:90d1801830691659866fd22e17ec34ad61608fec40431a0e6d9054577a082ae1","observation_id":"ce6e0d2e-58a2-4e5f-a990-bdaa7bf10f97","resolution":{"observed_at":"2026-05-12T01:46:14.863718Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ab5f86d5b2bf42c9984b479f4b1c4625dbab51ac1333124d2bb30059d663f5e8","observation_id":"e6dc883e-635b-4b41-9755-5044ab1dc1b7","resolution":{"observed_at":"2026-05-12T01:46:14.776908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Competition-level code generation with alphacode","venue":null,"work_id":"80a931e5-1be6-4d1b-995c-b182d4d43a51","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:603c79a7d4fa8038997963ef8e8002c19d0eb6674ebb3fab545464e68c8169a8","observation_id":"1b77baf5-dc1f-4d01-8e6a-f27350964c5e","resolution":{"observed_at":"2026-05-14T06:28:58.794293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ad56aa89f09dea8c697a2fec4b1f957b6a837d88fae88a95d1759fef6b977116","observation_id":"1be9df3d-fb67-4348-aab2-2fbd64496764","resolution":{"observed_at":"2026-05-12T01:46:14.784748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:4d635ee544108d547a663e2864951611059739c426b31d5e198c40cca0048d1a","observation_id":"2c3bc7b3-94fa-49e3-a0a5-3fbd26ae892d","resolution":{"observed_at":"2026-05-12T01:46:14.852010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expert Parallelism Load Balancer (EPLB)","venue":null,"work_id":"86bf1e99-3803-495f-80a1-ceabc9bf1ace","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:5b4f194bfcc6bc9cf4a72b36ec3132c184c4299267a40a34490c0addedcbe47e","observation_id":"5d5d2efa-4075-4991-9e0b-cf73ed260b87","resolution":{"observed_at":"2026-05-14T06:28:58.880483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"4498017b-aff5-4ca6-a9b4-571cdd51a2b1","year":2015},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:c2b92604e483e80b3022aaa81e2ab6f19e7f11367baf7b787564eefb663610a4","observation_id":"624d296b-b2b6-4098-be53-8a4a9e9998ae","resolution":{"observed_at":"2026-05-14T06:28:58.931027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep rein- forcement learning with a stochastic actor","venue":null,"work_id":"7cc0759d-cf65-4433-b283-5ec455e2c030","year":2018},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:09d4c4e5b68a5e2455521a6759936e3078a882a883869f4ba4385f44d6ce7cc9","observation_id":"857db13a-d183-4cc8-8bb7-a5ce7a4eaac1","resolution":{"observed_at":"2026-05-14T06:28:58.940727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:5fdebfbd31091ba378301abc3089dbe6fe7511beaf7be8b731221c47ff0ab6fb","observation_id":"dc74dbbc-b1de-43a9-bfa9-aa9bd083e354","resolution":{"observed_at":"2026-05-12T01:46:14.805376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:48:39.913120Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices.arXiv preprint arXiv:2512.01374, 2025a","venue":null,"work_id":"2881a661-1c4c-4e66-abba-aa3a176aadff","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ea96984de6c92fda75a4e55303999e2d13247261b2173a89b60356d1ee8942f2","observation_id":"a6f72534-1f13-44d6-9a98-16638ee235e6","resolution":{"observed_at":"2026-05-12T01:46:14.833281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimization and approximation in determinis- tic sequencing and scheduling: a survey","venue":null,"work_id":"d670282d-fb3b-495f-85fd-3aadccee3209","year":1979},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:c2e1cad18a572a9f93ddabd4d3aa7e4601353386a872603b6e994154bc86a7e2","observation_id":"f2f9a668-a7c0-4f77-b354-b157fbe567a3","resolution":{"observed_at":"2026-05-14T06:28:58.945201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"At- tention is all you need","venue":null,"work_id":"bf85d640-abe8-42f9-9e0c-7031b0331e27","year":2017},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:8411303f41f37c24634c27313e3d7d2c38dc7fdc06477c6f58545fc7622d5b2a","observation_id":"8e7af441-3f0e-408b-99fb-28eb637f96a2","resolution":{"observed_at":"2026-05-14T06:28:58.807726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parame- ter models","venue":null,"work_id":"13577ee1-8385-4403-8314-a0d9c91a72f3","year":2020},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:df064a30c0266e04e5498f56b40fa9dd3b57f868721e759578e48237cfec1856","observation_id":"18f9c5e4-fdf6-46e1-adec-e442c670b004","resolution":{"observed_at":"2026-05-14T06:28:58.798827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:46d8e1268b5a16599c781833768ea999e15ef55a233308d731970125ec2dbe8e","observation_id":"2fd505dd-cf8f-468e-a56b-0ff75cc59c7c","resolution":{"observed_at":"2026-05-12T01:46:14.855673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"02265b92-8656-48a6-b3ca-2400ad9e1843","year":2019},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:1acb36103cc0c738310a6ebfae1b8e91c942f41887bec21a37ae8cab1011c9a2","observation_id":"06914383-ba02-41d5-938b-202de464d0a3","resolution":{"observed_at":"2026-05-14T06:28:58.917601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pipedream: Generalized pipeline parallelism for dnn training","venue":null,"work_id":"782986eb-24a2-4f17-aa3b-478d7aa2fbce","year":2019},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:8e2ffdf63fa08c3f5b6aa8f78f7305d3098626337f4cab33e7be28b603bb38eb","observation_id":"32c4b5cc-8779-46e3-b680-9b2c93e941dd","resolution":{"observed_at":"2026-05-14T06:28:58.926894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"b2ff7ff2-4678-4ec4-a2ae-f9b1f977838b","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:833bf17188828586aeb91b07c5bde98ae413fde9ccbeb30e4c3ada89bb28bafc","observation_id":"bb3e96d9-2d93-4f65-9896-eca7ea46162c","resolution":{"observed_at":"2026-05-14T06:28:58.912608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":"602730d7-e8bc-4e43-8378-0021d003bc7a","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:e57f57e1dafaca2cee681a22b7e182e4100e97fb75eb1fbef80efdcab9992a4b","observation_id":"65345a14-10bf-4d85-9117-c210ec1ff531","resolution":{"observed_at":"2026-05-14T06:28:58.903645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05920","last_updated":"2024-09-25T05:57:51Z","snapshot_observed_at":"2026-07-06T15:25:24.491136Z","submitted_at":"2023-05-10T06:17:50Z","title":"Fast Distributed Inference Serving for Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.05920","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.05920","snapshot_observed_at":"2026-07-04T08:39:41.965931Z","title":"Fast Distributed Inference Serving for Large Language Models","venue":"cs.LG","work_id":"30a55970-0187-4540-943d-f310a5414413","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2305.05920","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:2e0585e84cfcf96383877aea1bc56b3f059d8c62c843be46faac0073925896f4","observation_id":"9317bfce-1349-4e73-8f1d-47f89af2593f","resolution":{"observed_at":"2026-05-17T11:23:46.844514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:e16d5a87278b96f30dc305a56ce587bb9fd585da2976a674c95f8aefb2fc9850","observation_id":"9fb964f2-6b02-4965-8b77-0340e6bd5fd0","resolution":{"observed_at":"2026-05-12T01:46:14.829234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming the long-tail: Efficient reasoning rl training with adaptive drafter","venue":null,"work_id":"6b460f44-8a2a-4379-b671-bf787e6afb1a","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:06a49e4cbd4a0a99f4137a392ea98419c7320f330fe91d53c013cf62e535528e","observation_id":"e3303144-1b90-4337-984c-f1e09be065ac","resolution":{"observed_at":"2026-05-14T06:28:58.908296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2511.14617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.14617","snapshot_observed_at":"2026-07-04T06:49:38.047014Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","venue":"cs.DC","work_id":"03b265b6-317b-4574-a145-82e7e81c521d","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2511.14617","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:c92bbb4916528b0a81157f04746b6e5024364f2ca0168ab27096f319e9913e70","observation_id":"7806e4fe-deeb-45ae-a94f-b608b56dc170","resolution":{"observed_at":"2026-05-12T01:46:14.780484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimizing {RLHF} training for large language models with stage fusion","venue":null,"work_id":"990b7071-5fe8-4cc0-8c96-959b3d9a6119","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:77babf44e339ba5cc5fada3a886b53fee85f644282be99fe18280d95643e6560","observation_id":"d543da68-bab7-4ee2-b074-5d912626231c","resolution":{"observed_at":"2026-05-14T06:28:58.922164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards efficient reward service for rlvr with request- level flexibility and batch-level constraint","venue":null,"work_id":"0dbcbeda-88d6-4c02-a622-ba680ab2f3cf","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:5b477cc2fe99a1bea68edb59ef0056d6cfb258b08ee9173de678b7e97ef9f9fa","observation_id":"b66f0bbe-6517-44e0-8c0b-9ed262dbc682","resolution":{"observed_at":"2026-05-14T06:28:58.958891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the uncapacitated location problem","venue":null,"work_id":"e16ec2c6-aca7-42a6-a488-7f35e087ce1d","year":1977},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:4afbedce4e38ae2d65f93fbdfd07b07ae26f8618299b3806c9c65d6e7598941e","observation_id":"3aa6a3ef-4103-4653-b148-2dc98ca7e855","resolution":{"observed_at":"2026-05-14T06:28:58.894780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear-Programming-Based Load Balancer (LPLB)","venue":null,"work_id":"1aed02c2-dbe7-4eba-84b6-a055d5ae000c","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:e6d28bf3765a4c13bac4f7dd46ad8cdc2674a3f1270958f915b9fd0184beacc0","observation_id":"96e454c5-a57f-4fcc-a685-22268ca5fdfb","resolution":{"observed_at":"2026-05-14T06:28:58.975665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alibaba hpn: A data center network for large language model training","venue":null,"work_id":"5970326b-8811-4d69-be9e-3892870c86a3","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:6862a2bf47e4a8e04eba26841bb272191c2ef277cecca15355c545ebe543a48b","observation_id":"20129cc4-2d8f-4744-9263-5d1853b3153c","resolution":{"observed_at":"2026-05-14T06:28:58.980058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVIDIA GTC: Accelerating Mixture of Experts Train- ing With Rail-Optimized InfiniBand Networking in Cru- soe Cloud","venue":null,"work_id":"0b731028-f73c-4061-9683-2909844bdf43","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:22bd2bd2e21a0b4dd0953c21fbd98cec68e650c14d51aef0e2e05d4f187a2d23","observation_id":"f36e49a2-b4ff-4c96-b2c6-285808a35645","resolution":{"observed_at":"2026-05-14T06:28:58.890336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPUDirect RDMA","venue":null,"work_id":"f799f78f-7ef7-454a-969c-8e442d202550","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:6028a6fde1b48c36c320cc3c5a7ecc8f9fa6a2c8455f0bdfc4b825e7e5ed66db","observation_id":"34f396d0-c592-4030-93ba-9fda397948d6","resolution":{"observed_at":"2026-05-14T06:28:58.898809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimized primitives for inter-GPU communication","venue":null,"work_id":"adb4186e-bced-42f9-9619-fff283d43654","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ce26bcf098ebb516b6ac38233926cc1d537e6366e8d3a227e198db13e9e2f21c","observation_id":"68807d47-bed7-4b07-9a64-eee85f945339","resolution":{"observed_at":"2026-05-14T06:28:58.966717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepEP: an efficient expert-parallel communication library","venue":null,"work_id":"34ae473b-2296-4b74-a430-9174a82446f1","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:c63dddd1abc59a6c0ec9acdbb035cda7cc083ebbceb83f0f6e57d66592a8443c","observation_id":"1b5027e2-0064-412c-9107-87ab95e2bbd8","resolution":{"observed_at":"2026-05-14T06:28:58.984310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{DistServe}: Disaggregating prefill and decoding for goodput-optimized large language model serving","venue":null,"work_id":"f6181ddd-1acc-4689-91c9-5a37f8f7a0c0","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:7514c7b4d08322e551bebfe17e1d38019425e2bc8ddebfaff4fba786dbbdef08","observation_id":"1dcc35f2-baff-4af2-8ad4-820eee02c33b","resolution":{"observed_at":"2026-05-14T06:28:58.866727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megascale- infer: Efficient mixture-of-experts model serving with disaggregated expert parallelism","venue":null,"work_id":"08e3b378-9d40-4890-bf5c-c5489de69ed3","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:fb87c854fb1666452bd84650d3ab0c26fd3e639af38da13d7f04391b402ad0cf","observation_id":"28703dcc-1496-442d-935c-d775a0033ecf","resolution":{"observed_at":"2026-05-14T06:28:58.859126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disttrain: Addressing model and data heterogeneity with disaggregated train- ing for multimodal large language models","venue":null,"work_id":"86b2ae24-865e-4a84-8f57-d4d21e8cc587","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:a0567f79991518d0184f4a08842dd95c6bbce85871aa9a739a208166c40d7864","observation_id":"b8c3b01f-b5d5-4568-a3f5-9f383d52cefd","resolution":{"observed_at":"2026-05-14T06:28:58.876273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.28101","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:16:27.174912Z","title":"Heddle: A distributed orches- tration system for agentic rl rollout","venue":null,"work_id":"5f9f1aad-087f-4b2d-bfdf-0fef31d983ba","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:26c9625cee392e7be32a255e6517d15a76f45e2a065654c348c2c0cfa77982ed","observation_id":"0d51a2e2-d65a-4ec5-9a50-15321224479a","resolution":{"observed_at":"2026-05-12T01:46:14.769379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bounds on multiprocessing timing anomalies","venue":null,"work_id":"3594c288-c8f1-4dd4-ad11-1b30a57f74d8","year":1969},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:c3d77defaeb92cc8fa1f3f6c9314acf361afa1532f474e98a381a086706ffc6b","observation_id":"d4f8504c-7e28-43c0-9149-7e01a9ccae01","resolution":{"observed_at":"2026-05-14T06:28:58.871762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17702","last_updated":"2024-11-22T10:34:25Z","snapshot_observed_at":"2026-07-06T17:36:23.851926Z","submitted_at":"2024-02-27T17:27:47Z","title":"The SCIP Optimization Suite 9.0","version":2},"cited_work":{"arxiv_id":"2402.17702","doi":"10.48550/arxiv.2402.17702","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17702","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv:2402.17702","venue":null,"work_id":"a3c42063-f08e-4420-9673-8fb0cd8f81b5","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2402.17702","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:9fbe6d80c938bf448fedf95902be04bc5bbda4e87aae741b78bf76279906af79","observation_id":"c5a7f206-30f3-45e5-bddc-ea9dca27d731","resolution":{"observed_at":"2026-05-12T01:46:14.793302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slime: An LLM post-training framework for RL Scal- ing","venue":null,"work_id":"eecfe994-88d4-43c7-a9a1-10b37bf107b1","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:3d07e4a0e6f2f38b68337ba75456ddceb81b0cb61b05776e4b1a76d598204bc0","observation_id":"d0431f56-14c5-43fa-89b8-55732931a853","resolution":{"observed_at":"2026-05-14T06:28:58.852858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPU optimized techniques for training transformer models at-scale","venue":null,"work_id":"6c11310c-f78e-42d0-89c2-74a1e484473c","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:4896736292a0a1ec74a2093c87de0eabafd85744706e3b2f362d89e260cb6cab","observation_id":"2be4ef82-d728-4b9f-8c3e-65e47d51bf21","resolution":{"observed_at":"2026-05-14T06:28:58.785432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured lan- guage model programs","venue":null,"work_id":"2b8ddfc3-68df-471b-81c3-d70d1bb059fd","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:f6b1a37d3749400a2a7f9806b008b6a9db0e85db8ca49c05ac0928c3437e1ef3","observation_id":"3af36f7b-c481-4563-8992-d00f68bc5b66","resolution":{"observed_at":"2026-05-14T06:28:58.843832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open Multi-Processing","venue":null,"work_id":"01f6d359-7791-42dc-92eb-c2c0bebf4650","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:8072a7621535f174f2cdc82d3aa3d2d13033468f7b1cd0cc94b7043d83897957","observation_id":"2a85d91b-0d66-485c-861e-6ef7454e3f95","resolution":{"observed_at":"2026-05-14T06:28:58.839050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NVIDIA Hopper Architecture In-Depth","venue":null,"work_id":"925b9448-ffa9-4623-bcb7-9cf3bd640719","year":null},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:9f34415be91a02505eaacb7feaae3f93b66ba80f573e51e6caa2c072723ee6ea","observation_id":"e1477a93-dc66-4203-b21a-10b453d2a826","resolution":{"observed_at":"2026-05-14T06:28:58.848374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9a0038cb-9c95-4c30-b6db-cd569d7efc5c","year":null},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:dbbc36f199305a1cb0567947811ce15f76c8c9b25076498a1407164cfab42c7f","observation_id":"3f851cad-76ab-4529-89ed-ed56d4e247e6","resolution":{"observed_at":"2026-05-14T06:28:58.862623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-3: Fast and accurate atten- tion with asynchrony and low-precision","venue":null,"work_id":"187ae58a-7aa5-4a67-878b-c7b1f890b590","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:193ad871b13642d3317096a9bb6f2a7103dea94d89084e6221f8c69b187bcf0c","observation_id":"2b740753-657e-479f-a5a0-3935b7d11cff","resolution":{"observed_at":"2026-05-14T06:28:58.830705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https: //github.com/NVIDIA/TransformerEngine","venue":null,"work_id":"a397d8b2-5d9f-4c9f-942e-497d0af0822a","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:8566e066fd5ffc1c4488cf1e10f9e683aa825a5b32411a8c0dde6fb32625280b","observation_id":"6832e81d-59a6-4c45-a709-76af756d5447","resolution":{"observed_at":"2026-05-14T06:28:58.835254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ray: A distributed framework for emerging{AI} applications","venue":null,"work_id":"2543a9ac-1352-4634-bf3b-45b5c07c1927","year":2018},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:74295276c9681a878241c245dd49df97e51533f5d043c0008aa3723ada38abdc","observation_id":"11be90ab-bfc4-4ab6-8d3d-685362a04275","resolution":{"observed_at":"2026-05-14T06:28:58.855524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:bbe4ec195969b1f091e573099e814ecc8841841ee1dc249963c5fffe97647d85","observation_id":"e7153983-0537-4ef1-8764-059d129ae801","resolution":{"observed_at":"2026-05-12T01:46:14.840788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:d1810107c0bf8616ffc6cbf36b06adc3d19d84192c1ad1564a71e5a9bc6d3f3e","observation_id":"032e3e72-ffe2-46ba-b2e0-b817a2dac756","resolution":{"observed_at":"2026-05-12T01:46:14.801130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-07-06T21:13:04.549829Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":"2504.15930","doi":"10.48550/arxiv.2504.15930","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation","venue":"ArXiv.org","work_id":"63df3644-702d-4ae6-8e4a-954a41887545","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:e47c952786a609e05af98fcf063a5d50f76a7bbd50bc420fa24da556b81ce174","observation_id":"a4915de7-acd6-45b8-b6a4-9a4118b9a47a","resolution":{"observed_at":"2026-05-12T01:46:14.859743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerat- ing distributed {MoE} training and inference with lina","venue":null,"work_id":"ce983856-c9b1-42d5-926e-7a37a8fc68cb","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:9be09b7586179cbb1804aac2b834e56faf645232b8ea74e299e44dbde2b3e083","observation_id":"80069897-0e6f-4418-aff2-9137cbe7b3c6","resolution":{"observed_at":"2026-05-14T06:28:58.971149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tutel: Adap- tive mixture-of-experts at scale","venue":null,"work_id":"bf234527-7610-4eb9-995b-0ee756385636","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:65682005ff322340d88d4880b7b8a4d250bcdf6ea6e6fd829862f06244e4288e","observation_id":"9a22491d-3788-4847-84dc-16b2a95b2f19","resolution":{"observed_at":"2026-05-14T06:28:58.825534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14685","last_updated":"2022-11-17T11:30:17Z","snapshot_observed_at":"2026-07-06T12:53:10.263419Z","submitted_at":"2022-03-28T12:32:25Z","title":"HetuMoE: An Efficient Trillion-scale Mixture-of-Expert Distributed Training System","version":3},"cited_work":{"arxiv_id":"2203.14685","doi":"10.48550/arxiv.2203.14685","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.14685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2203.14685 , year=","venue":"arXiv (Cornell University)","work_id":"2e1ee085-5760-46f4-b5c5-43daaea289fe","year":2022},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2203.14685","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:07e90b0a27c44e284af15c9bee68b599ba88de69f41405777baa6bcd79420119","observation_id":"f41717dd-3c21-4f74-aba6-9b0211cc8618","resolution":{"observed_at":"2026-05-12T01:46:14.809929Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11432","doi":"10.48550/arxiv.2505.11432","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:43.805821Z","title":"Megascale-moe: Large-scale communication-efficient training of mixture-of-experts models in production","venue":null,"work_id":"d2e5a111-b10c-463f-8ca7-b88ca8a6ff29","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:48ba8aa77e62da4ced327f4bf8fdcd525dc7f1536c041c3606678b365c3ed401","observation_id":"b4645b66-b82b-4d01-b3da-bd583d60d13a","resolution":{"observed_at":"2026-05-12T01:46:14.847449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Centauri: Enabling efficient scheduling for communication-computation overlap in large model training via communication partitioning","venue":null,"work_id":"bc7ec846-2499-4da5-92b2-19c33ea7beb5","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:5aa280ca35bea06da215924f6339389791efb9316a28ba033c8f8fcc093ff173","observation_id":"a00867cb-86da-4ede-8776-33825a23d0d4","resolution":{"observed_at":"2026-05-14T06:28:58.821197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{MegaScale}: Scaling large language model training to more than 10,000{GPUs}","venue":null,"work_id":"e16d8be8-a754-49fa-abbe-19359f27a596","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:4ff4108c3e499d0e938986e58d98ee50994e6c7f0e5144067e8bdbf52c4780d7","observation_id":"71b27ec6-5411-444b-b686-3bb3b9c6fbfc","resolution":{"observed_at":"2026-05-14T06:28:58.790159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comet: Fine-grained computation-communication overlapping for mixture-of-experts","venue":null,"work_id":"685febe5-ebdc-4a91-9dcf-29c6c881bafe","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:544172856e52b056db43c216451e2f406e1a9bcad58de50d6dbc7ac8b9b27309","observation_id":"a999f442-c95e-4305-9e99-7f454c60e9ff","resolution":{"observed_at":"2026-05-14T06:28:58.803518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-07T05:35:13.505081Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":"2406.06858","doi":"10.48550/arxiv.2406.06858","metadata_source":"pith","pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flux: Fast software-based communication over- lap on gpus through kernel fusion.arXiv preprint arXiv:2406.06858","venue":"cs.LG","work_id":"5d0e6adc-6dd2-49cc-8551-dc00433ed79f","year":2024},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:424696394b6a5314253394a419489544fac26e019307013f7778ba2542a2470e","observation_id":"77edfa72-05a8-4614-b0ab-497e1a131a5b","resolution":{"observed_at":"2026-05-12T01:46:14.822291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Janus: A unified distributed training framework for sparse mixture-of- experts models","venue":null,"work_id":"517728de-2908-489b-98df-0c5be445aa44","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:699d03440d37e165da1a80cf320609e7814960044ee5e14efffe179bb5c9719b","observation_id":"817bc4fb-959e-498c-8853-31be95e918e2","resolution":{"observed_at":"2026-05-14T06:28:58.816731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"37889c53-ee41-4d14-9caa-d36bcea024df","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:14372073b22ebdfd171d8de0f1b0a7362a000b15fb8696281640f5462e4cd9e0","observation_id":"276bd38c-7d29-4d78-94fb-87cd95832341","resolution":{"observed_at":"2026-05-14T06:28:58.812129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22560","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:28:58.512098Z","title":"Rollart: Scaling agentic rl training via disaggregated infrastructure.arXiv preprint arXiv:2512.22560","venue":null,"work_id":"21e4b275-4c2c-4896-adaf-a7001b4799c7","year":2026},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:1ab9b68d1ef3b444e57ef20868287a701ce378c207a43a29b34a47bd2752972a","observation_id":"a862306a-ed53-4214-90f2-ca0336c60cce","resolution":{"observed_at":"2026-05-12T01:46:14.818155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast infer- ence from transformers via speculative decoding","venue":null,"work_id":"e042a7aa-9560-4c33-a6d3-e3f3601c6db3","year":2023},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:80a59e4a060340f6742929cbc931703b8ca2b9c6253ee9946f195d629d6df096","observation_id":"8166be66-f00f-4fe1-81e2-72925456e3e9","resolution":{"observed_at":"2026-05-14T06:28:58.949381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ef- ficient rl for llms with dynamic and online speculative decoding","venue":null,"work_id":"44ff389b-acff-4736-a0f2-6453ae21ea1f","year":2025},"citing_paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T01:38:03.841465Z"},"links":{"citing_paper":"/paper/2605.08639"},"observation_digest":"sha256:ac7cc3942c098e3bc8a88273e5efaff274d15457219c8e58eeeeab8c3874d876","observation_id":"10568927-0499-45ab-82f8-6c55c919ff32","resolution":{"observed_at":"2026-05-14T06:28:58.953806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.08639","last_updated":"2026-05-09T03:18:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T03:18:50Z","title":"ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":24,"verified_fuzzy":54},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 1 inbound Pith citation observation for arXiv:2605.08639."}