{"as_of":"2026-08-06T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a46f60989663f5e050493d342ca446499cde12f9ac004f580f7c2a7bf6eca1a","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:03:33.237334Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00395/citation-record","integrity":"/paper/2606.00395/integrity","json":"/paper/2606.00395/citation-record.json","paper":"/paper/2606.00395"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:70a7e332389c99a4340515607b4bbe66a466cddf035cd423bc1b3fca09a80a74","observation_id":"601e7952-ff9f-4d10-926d-5ab1274b2eb1","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Beyond Ten Turns: Unlocking Long-Horizon Agentic Search with Large-Scale Asynchronous","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:ae927895b303010a627de870b4780da091c507f4913e7883f78d848f38351637","observation_id":"c7d0c6b3-d701-40f1-a0bc-237fa1d8f5db","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"slime: An","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:c8063f9127481cf23b8a03d32162de2e0f6a83547c660801aa1d5ef7c6f445bd","observation_id":"7a7abaf1-2ea5-4633-911f-3f67b25653f4","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"International Conference on Machine Learning (ICML) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:fe7ee7678e437c4ff1ae4c4a501cc65e5d61dee5fa47a84f5a9043d7bdb59065","observation_id":"2e63d7da-9204-4200-ab18-6dbb853e081b","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:521d47ef98425fc9a176acbc4f4ef3ab1b885c812e863940eda029415b26c02c","observation_id":"47ae4722-f129-4ce9-aad7-1d823a2e4fbc","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Stabilizing Reinforcement Learning with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:7f9979028a5486449f301db061bc8f29a3f9d34f2541d0356682df5e74e5dc3e","observation_id":"c84ac317-b665-4137-85c0-93e4ddf16f66","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:aa692e3cff069c804a715dbb730e2247d17b426d040af48050b59b645342168b","observation_id":"5e2effac-5341-43d1-af86-e40dd58cb075","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Defending","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:6cfb1f35b6e3c6dd7903c319fe536c039f7d1ae627aeac74c7b07afe13657fb1","observation_id":"240c0077-57fc-4228-8e40-471898fb3be6","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:338ed49c0a2349b2652d6aa30bd5200e57b43921f3c80f0cdd1d2ca41c2ba2c6","observation_id":"77688741-6861-47d9-903e-ea09aa5689bc","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:1b59ba02565464d04413eb264595ca6d5ba818478b493e05dc49bc873cf59980","observation_id":"1719ae6c-acc1-476e-8663-01ff2fdac7b3","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:5a844f5689b12997fe81c4bb01906d13b679fac3e923416e2e5026335b325682","observation_id":"4cbbddf5-fbcf-48c3-bb0f-6e870167d03e","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:22fee6db475e5f776b4e68a022ec1f9db67f0e17c9eee5ea635ab4168a2cd696","observation_id":"459bc508-b22b-47d6-b769-083143fb4ac6","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Journal of Machine Learning Research (JMLR) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:fb44c04aa4cfdac8d408ce5b44a2787ac79f8613d25ab2c799c1c34797ca91f8","observation_id":"778e182d-8048-438e-a116-69aa5f840faa","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:344289d3b4ce16e2b113fedc365b74e628493324ac38563e0cbab9dd444889ca","observation_id":"b8b9df27-b1b2-4316-942b-6d6e37e869a1","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:7fded90f5af208ce0e0461a77f106ee19d39734373a9fe3315171c36cc59d9af","observation_id":"729ff318-5bd6-47ce-acf0-669e10d27bd0","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"International Conference on Learning Representations (ICLR) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:5e0ec4e7c4cd8de85f9ba9689dcc48e423123724af710e70f3f67952db136533","observation_id":"c21f113c-72ef-40dc-b834-96c2ab9ebb42","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:c0cc7aef7e276e064036fe5667e3039daee142da86a86bea892f56e4e65ab6ca","observation_id":"65188976-c90a-476f-8a85-64ae12ad7c5e","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Stabilizing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:936cd1bd1b90b5d0240b8c97eed1ba181c8b37326b8368d4824124cb672d36fe","observation_id":"b3775b59-6df0-403c-a7e7-5ebe4f56417e","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:845f84bb693dc8b0c9a446768e72c7a2218b91f812c53dd9933bdca68441c81d","observation_id":"2fe2a281-041d-4044-87b2-36d6ac7b4ab5","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:6c71a013f0b05942710073d70d75abc86983b6450e6eaf40236e0e01eecb7ae6","observation_id":"25195920-6be6-452f-8e1c-8d2b35a9e9c9","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:c51f37b6d00b34f504f7d7ccbe7992ff196402a96dea6c710bedcc17ea0eeecf","observation_id":"0b0d4a15-d775-4d9b-baa9-f169218cfb8c","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:f4cdea0217e96118795f5517273d1c7dd99817e4ece985a4367cc1700773fe74","observation_id":"a8ef2bc4-7d55-4743-a5b7-ad6978df68fa","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:81ae104004e280136eb1739ab3a8533179342ddae9a15cdf21948ee0b93a771f","observation_id":"35d97435-f3da-4814-b735-d600be395e99","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:887fef9d0e69cde649fa39e6c555dee7c4747a4e006c2ca226c5d7ada1c004f1","observation_id":"7172752c-57c1-41c8-9215-27976de89835","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:13949919931a8168701daedc912cdefb8ee9a7604a7c9b3ae5d9c865489d1d02","observation_id":"b1562903-fe2f-4712-b97d-d74ce4afc91b","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:d27cf7bd8743c4421f2bc3401dc146f677bcc1aac64deaeb9a0c59c0a76be43d","observation_id":"a3eb42c1-b0cb-4376-8097-7772a3e6349f","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:cc112cfa5a7e72c14cbb5fec234b217cd8baf5ee98c3bbb5daa3b61e9c4f6898","observation_id":"6babb518-1682-4db7-b2d7-827a73138dc3","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:bedfa713246be4dbfd82c939de8f95a8a14c561e649c037098c5484c04f76f8d","observation_id":"526f135b-3b7a-42de-a930-62be2b1e83ef","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:ab5e27cc2ad41031b7189ea3b5e1d5e0d841fc183ffcb7ebbd3f8067c5ce048d","observation_id":"0cf921ba-2ec8-4e86-b57a-498f7c728c2b","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:dad016c172504ba4563b873c3f8e58335d108faaca9d0cc281deb2ca33845d50","observation_id":"2826ed17-863e-40e5-81d9-6b4297b3f53d","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"and others , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:a6ace3145b7d744c9ca190b9d87d2037e1c054107f398a5bd4bce58e559e41a3","observation_id":"89e27bea-b2bd-4cee-82c4-db6a38e3e5df","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"American Invitational Mathematics Examination (","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:56ea75286f404bcfdaa04d8a4c2988a0910cc7dfe2ccdf0af741335de2002d26","observation_id":"74a6dd20-9d35-4b77-8db6-df35c8bbd535","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:f1200e8cd42d8da8c7023ca64a07217a327124f2aa03b34306df404a76d49a5e","observation_id":"6d401a0d-11c7-4d00-89df-577fe26b39ed","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:741faf0979366ead50f2ab941e9156936db009e54ee2e0b64602a5c0ae9f766c","observation_id":"5d73dcbf-24c8-4dce-b828-c1c1a5068b7d","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:1de3ad823bd1070853bd1d4ac8506b362980a21a9c056ef05920a1a7ac17a75e","observation_id":"72d1ed1f-78c3-4c55-9ffc-21e6651171cd","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Your Efficient","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:3106bd6794b1d033f9ad1508a958f174e32a8567072812982b62e8e897a421ad","observation_id":"8d214d24-ebe8-4338-97a0-01f55971c26c","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:a352f8e504ad40c7faafacd6edfab55ac20e56d39dc17ded1d350828c218e771","observation_id":"abdb81dd-df3c-4f24-9458-cb460a174cbe","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"and Bai, Yu and Baker, Bowen and Bao, Haiming and others , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:4f01a8e368426dffc8eb04e7970bbec55b3645ef9504ee7e98ed57dfd1f0423b","observation_id":"55ed2b01-107f-4635-b093-a27ea831ea9f","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"arXiv preprint (arXiv) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:6c0cdd57b03af7573ea27ec814ac20f85b9935352befff2ba55e1166b3e6531f","observation_id":"1c515916-535a-4e4a-8646-18b30c371fe3","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"International Conference on Learning Representations (ICLR) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:52ea1db58f37519336917b5883dbbb881c8eedb38fd2ed415906acbe8a01522e","observation_id":"467b8cf3-06de-40df-93ab-3d9aa37371fb","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Neural Information Processing Systems Workshop (NeurIPS Workshop) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:38d4d5328a3d557dd957347ac5400b7ef2aa87c202ccde85f651c05d8cd6a0d8","observation_id":"930d112d-c8aa-4e12-b5db-dd8b0a01ad38","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Sparse Backpropagation for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:15386d214185b2253787ee3bb7763d0fcb317691b085a31afef0cd6e7a3524bd","observation_id":"01763920-0046-4856-b915-e2479e3c17b4","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:6b4808a7126a7127e40c5c87fadfd31a21be6d227b8e7a7efcc30e091ad378fe","observation_id":"6e35df0f-7ba5-410b-8597-a3810479b054","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"International Conference on Machine Learning (ICML) , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:3d02eac0a617a8a0420c0cd6a8ac3f68e266dc8750a12a49357d0373707db203","observation_id":"3fd1ac46-89ed-4d82-b8e9-40f3446ea941","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Harder Task Needs More Experts: Dynamic Routing in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:6a724f85973320e673768ca40b3c7a02e31610131dec9e00a7a7a25b3a9c5f31","observation_id":"b29c460c-5c60-4433-9ec7-56ceaa365e56","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:e5e8800148e4de85b88dfb052d02a4b58ba4f6286f52abd3ff9c52ee29f9a90f","observation_id":"9a7ae7dc-e47b-48d5-82c1-b7915fde82ed","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:03:33.237334Z","title":"Muon Is Scalable for","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T23:03:33.237334Z"},"links":{"citing_paper":"/paper/2606.00395"},"observation_digest":"sha256:f1a5f7e38fcf5275c51fdfbc86bc1c113ff098703ff9b0c4cc392ed850d141af","observation_id":"72445849-fd78-46e3-a045-8366f555c94e","resolution":{"observed_at":"2026-06-28T23:03:33.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00395","last_updated":"2026-05-29T22:28:08Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:28:08Z","title":"PR2: Predictive Routing Replay for MoE-Based LLM Reinforcement Learning"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2606.00395."}