{"as_of":"2026-08-05T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e217c769e6d0b78a81534015bd136cdc2cdb83d85b59474b927b05915bc564cc","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:41:39.266071Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.30445/citation-record","integrity":"/paper/2606.30445/integrity","json":"/paper/2606.30445/citation-record.json","paper":"/paper/2606.30445"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Ng, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:8d7f9084ba41bb32308959a7194ef6e5302013550e4e21d4a4ae5402de50309a","observation_id":"e6ecc6ef-d751-4055-a081-04adab472a1c","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"R., Geist, M., and Bachem, O","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a73cf9f11ef213bb995405924c915517b83a19a48c35fd87463aeb614a271a4b","observation_id":"4197188a-3029-41ef-b840-94aafab0c77d","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:cc2190491baf12ac757d8386eeebf9c59443ea6617ee45bf7e903446fb049f2c","observation_id":"075fac4a-e750-443b-9f34-2f1fac85b87f","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Mitigating covariate shift in imitation learning via offline data with partial coverage.Advances in Neural Information Processing Systems, 34: 965–979, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a17b9bb057a0e0b569c5057e8e4d49d0e2c11044dd3dc9050bdac3c521dc8c4c","observation_id":"65c3ea4b-bb4f-4ec1-bd36-2e919eebf1f5","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18874","last_updated":"2026-06-26T02:22:44Z","snapshot_observed_at":"2026-08-04T15:02:09.340673Z","submitted_at":"2025-10-21T17:59:41Z","title":"Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting","version":3},"cited_work":{"arxiv_id":"2510.18874","doi":"10.48550/arxiv.2510.18874","metadata_source":"pith","pith_arxiv_id":"2510.18874","snapshot_observed_at":"2026-07-10T14:07:06.660787Z","title":"Retaining by doing: The role of on-policy data in mitigating forgetting","venue":"cs.LG","work_id":"f2ef0f39-618b-4eab-9b97-ab014d830155","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2510.18874","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:ecaf7622f4eabb4ccdc7ddaa4ede929635717e6e89e91b64943977c84134febf","observation_id":"b32e285a-b95c-423e-862c-f98e37c62af1","resolution":{"observed_at":"2026-06-30T07:44:21.680586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Jiang, N","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:87e03ff576167939a7a2070dd8ef6fc01b58c04dbdc5732e93e6d6208b949a38","observation_id":"430c45ed-53aa-45f7-9ee2-1b69625823ad","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:23bc1ad885474049bf3b77e3051745d71f74e97dcdada2b2b504136af3c89a87","observation_id":"49b4608b-25d6-4b4c-90d5-f4e347799661","resolution":{"observed_at":"2026-06-30T07:44:21.715939Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:811726661663951b0a6ed2981ad85cafa7b2d4c6e2d3c4888171d6ea6c21f710","observation_id":"a2cb1f82-808c-4719-bfc7-532e68c6104b","resolution":{"observed_at":"2026-06-30T07:44:21.694221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a0a7a80ddebb87fb7fffa8a17dcd40a8ecbafd72ea20e8902bd58a995b1684ab","observation_id":"0d477e39-78e9-4623-83d9-a27348479ae4","resolution":{"observed_at":"2026-06-30T07:44:21.689693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13162","last_updated":"2025-04-02T16:32:52Z","snapshot_observed_at":"2026-07-06T20:53:55.745087Z","submitted_at":"2025-03-17T13:35:55Z","title":"Efficient Imitation under Misspecification","version":2},"cited_work":{"arxiv_id":"2503.13162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13162","snapshot_observed_at":"2026-06-30T07:44:21.684800Z","title":"arXiv preprint arXiv:2503.13162 , year=","venue":null,"work_id":"cdfa3ba3-a5c4-42d8-a43d-a7d67b7eb090","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2503.13162","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:837f637a28b5cc4f210abaa729bc65cbcc24e7cf498ac805288e3cf359b5e480","observation_id":"8d1f14fc-9eb1-4919-ae0a-bef84651709b","resolution":{"observed_at":"2026-06-30T07:44:21.686151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Open r1: A fully open reproduction of deepseek-r1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:78525bf468f412c7a99d9ae3815dfd68ec148c66ac04b5bfdb7d1b62bf785c9d","observation_id":"4ad30175-9af4-4d58-9734-6591a09a9435","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Rakhlin, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:321fea6a12d7dff7df2396cf365311852ce65f8ffeed1d1b4bbaa90e7901a0c6","observation_id":"e9f2345a-3bb7-4d2d-8768-c967fa4b94c9","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Practical contextual bandits with regression oracles","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:9d9e45ecf70e8f6c587a0679a2061b2bc3e1eade91412d2709122fc2137a7f39","observation_id":"adbc819d-0c78-460a-aaee-f658c0746e10","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16730","last_updated":"2023-12-27T21:58:45Z","snapshot_observed_at":"2026-07-30T21:43:41.335404Z","submitted_at":"2023-12-27T21:58:45Z","title":"Foundations of Reinforcement Learning and Interactive Decision Making","version":1},"cited_work":{"arxiv_id":"2312.16730","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.16730","snapshot_observed_at":"2026-07-03T23:29:02.948737Z","title":"arXiv preprint arXiv:2312.16730 , year=","venue":null,"work_id":"d9093a65-bb29-47cd-af70-8e037165002f","year":2023},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2312.16730","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:051d164bcb2c7a3a5d423aad2d8f7018704af4ee41eace4290f967bef2941c4e","observation_id":"dcc258ac-dccc-4fc0-ba6c-3bdc115970d9","resolution":{"observed_at":"2026-06-30T07:44:21.684171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"J., Block, A., and Misra, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:16bb44acc8b34fba3b0f923e1ae9d62badc4755498fc7a102e6ebfd209a48b99","observation_id":"e375f995-898d-4616-8ce7-980ff88982b7","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07453","last_updated":"2025-03-13T23:15:55Z","snapshot_observed_at":"2026-07-31T00:08:50.715250Z","submitted_at":"2025-03-10T15:31:42Z","title":"Is a Good Foundation Necessary for Efficient Reinforcement Learning? The Computational Role of the Base Model in Exploration","version":2},"cited_work":{"arxiv_id":"2503.07453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07453","snapshot_observed_at":"2026-07-03T08:07:45.297854Z","title":"arXiv preprint arXiv:2503.07453 , year=","venue":null,"work_id":"dc135234-0e5d-42d3-8400-e9d9539e3064","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2503.07453","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:8bfd5ff47aed33afae54aebac83888ea3377030a06859cf9c306a18a6f926c81","observation_id":"d44558d4-589e-4d64-bb46-56032da01c9d","resolution":{"observed_at":"2026-06-30T07:44:21.676876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Importance-weighted offline learning done right","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:28fbf0ba8f5e0bb7ef944ba6da80f36cda5cc93067ed92a772e3cc11181d64a5","observation_id":"514081ac-b878-47c2-963e-755dfc9be6a5","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":"2503.01307","doi":"10.48550/arxiv.2503.01307","metadata_source":"pith","pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","venue":"cs.CL","work_id":"f65a84bf-c5b4-4491-a618-18bb263c60e5","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:2a502d56d24ceaa1b6702b9895433a73f1a017377437107875399e438c4e2474","observation_id":"329e5e25-8a11-4114-b9ac-57280cf47c76","resolution":{"observed_at":"2026-06-30T07:44:21.660955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:43.212388+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:4ae57f86122a2dad8c0d869c4b582c6f97041b5de449adb86a9f6924ad49860b","observation_id":"97d1f188-33ff-4a64-82dc-e09b05ef17b1","resolution":{"observed_at":"2026-06-30T07:44:21.691753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:bd816e3d0d1d9e7760f7cbad911271b35b9c27cccd79079e62e87b2aa9f063a9","observation_id":"b872c7ac-445d-4098-9522-e16329086b3d","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"The false promise of imitating proprietary language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:aba3297a3bc095c26c6f24b01315b0d38efba2e2f9e19763e4b7e35624b8cb47","observation_id":"e8833fb0-b182-47b4-9370-24a8a1e22b79","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":"2505.22312","doi":"10.48550/arxiv.2505.22312","metadata_source":"pith","pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Skywork Open Reasoner 1 Technical Report","venue":"cs.LG","work_id":"27740ebb-6704-4ef9-8878-5b81d4269869","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a308f849217886196797c74fed9f006db2821e64a88e0edc4850030c5d59d2c3","observation_id":"2bf18e55-98bd-458e-98d3-e2e489b827eb","resolution":{"observed_at":"2026-06-30T07:44:21.668673Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Measuring massive multitask language understanding.Proceedings of the International Conference on Learning Representations (ICLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:5c4c923d07d5578557c226f38b6f6ac4ddee0d59ea3b30a51791b86fbc39ecff","observation_id":"9b5002de-bb16-47d0-8f82-447d22aed129","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-10T16:57:24.565388Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:df07b29ab28504c3892951d5e065f0e3fa8cdb1f37e50df61afae7e568a17804","observation_id":"1d988d1d-fc52-4f64-964b-808eac0b58de","resolution":{"observed_at":"2026-06-30T07:44:21.720735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"J., Rohatgi, D., Zhang, C., Simchowitz, M., Ash, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:81f3a0e739b0a232209bfd854bf785168d59737df09b1074d754a6e9f1cbdd8c","observation_id":"26ce6a87-3ecd-41bf-893f-212e74ed801a","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"D., Sun, W., Krishnamurthy, A., and Foster, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:ce7d06aad2ead67763d4b18aac0ffa33346100aa9eebff031aacdedb2afc4035","observation_id":"d2fa29c5-d07f-47bc-a639-8f563056cb2f","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.376","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:44:20.900042Z","title":"Teach small models to reason by curriculum distillation","venue":null,"work_id":"c3e67649-d5d0-46ae-b432-8052a8fb7366","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:360600d90a52b910c65c40ce88ef2881b3196e8e14c75840aa9f675309cad493","observation_id":"ddc7794d-b053-4f93-9638-4d82093666cd","resolution":{"observed_at":"2026-06-30T07:44:20.901838Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.08421","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:44:21.717056Z","title":"Coverage improvement and fast convergence of on-policy preference learning","venue":null,"work_id":"f9ac45d3-b42c-4297-a0fb-aed1cce081aa","year":2026},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:3ce5a10ceed651b0ecd1851c3a1e450d73c210b9f96dba895a8281914d7a5e87","observation_id":"6dc6b239-0651-4de7-8802-b22647781dee","resolution":{"observed_at":"2026-06-30T07:44:21.718311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Rush, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:9a837d4f07ad598b7e6af8567f4c9c7a8484d0ceaa9332fa70d9485767ce85f2","observation_id":"46f206eb-ebbb-4e66-97f4-5c7b02b9da37","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"M., Ma, T., and Liang, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:2a1553b2e39827f3ab8a134e454e41f1d82827c7421d90992fb3c3ec773d5cdd","observation_id":"88b622f4-6d1f-4306-b0af-6e1b3356c625","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:4db2a12094905adb72aacebb1e6f0683639137e73242e0efe5d15b65579343df","observation_id":"7b9c6d6a-b457-494f-83a3-274ad822b955","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.12143","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.703884Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":"1c53c246-301b-4c60-9f62-d0330f29c9e1","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:77066f309e726a9b27b212360330dcc058b95a9e0d58b0f909fdc57d3aac5a68","observation_id":"1daa683a-9730-441d-aa12-731c07693706","resolution":{"observed_at":"2026-06-30T07:44:21.725590Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":"2604.13016","doi":"10.48550/arxiv.2604.13016","metadata_source":"pith","pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","venue":"cs.LG","work_id":"42b43df0-4c82-493f-9d9b-1be8c116d9af","year":2026},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:c8c2e094665655fd53a2c9da832d7631f0251d0cbbdd23de5195ba5f79656f88","observation_id":"bfb4fcdf-7b70-486b-af71-298cbce4cab2","resolution":{"observed_at":"2026-06-30T07:44:21.716774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a09714aab3876b46a0715bd25b5870496f67214576b3f77a3d84b297fd54d485","observation_id":"8c68a5fc-1fa5-47c7-8da4-7aacddbfdaf6","resolution":{"observed_at":"2026-06-30T07:44:21.728180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml.20251026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:24.393084Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism","venue":null,"work_id":"bb76b11f-d59b-421e-88c6-fa0920ed09c3","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:6c2342138efb7808104c94430cb28f94aa8778d5a3f546272b3dc06731bc4ecf","observation_id":"071bb425-ae7c-47e7-a37b-65d0bc260cf5","resolution":{"observed_at":"2026-06-30T07:44:20.907739Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:08:02.609025+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Y., Roongta, M., Cai, C., Luo, J., Zhang, T., Li, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:7a2b2b1893dec26a868c13ba0b4f42cfdffb654dd5be98631397b21da73cb862","observation_id":"9f6dfbeb-c5e1-4b47-b02a-aefa074a40f8","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Error bounds for approximate policy iteration","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:d0ecace92c0e62c69ab15bdd7299dd6b9d852aab54023269778766495435ff0c","observation_id":"535fd6ba-9f55-452c-8b69-ed3c15227e91","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:d60936ba2d9a0f2e1bd9c3688c1107aad770214c106ba759d2953a5e64f8f8c5","observation_id":"f25117d1-1e01-4517-92f0-4b015651280f","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:5523ce3ea3f44d95ba8cd8fd0448184ce091c69da1916b23d6982c5a7668d9d0","observation_id":"e207bce3-a813-4af9-aaa5-593dd7bebf7d","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:8ad3e004c45df708c92131a77ed3efc0890a70a4aaf0b1a571ea99e6605a7331","observation_id":"372fedce-f965-4373-9074-a4318bf0b4b0","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:be19d9327464f9c422e57fe82c6ed7c3cff8e1cf9dc5ecd68735147f71fd5989","observation_id":"eea2c163-8c6f-43f2-9a5b-d50fa6a4e6ba","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Toward the fundamental limits of imitation learning.Advances in Neural Information Processing Systems, 33:2914–2924, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:b3ab809a8f6789a739f6c218421acc4185b5451c9203a38c56126018f45e996a","observation_id":"01f04023-31a1-4d6c-8fd9-cdaa49f6e738","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"On the value of interaction and function approximation in imitation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:e09a2b130b0798f43288a832b37cc11bfa65b82305a6dffdeca9cc07eda642dd","observation_id":"57687ae9-7134-4ddd-8b39-318901d0021d","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism.Advances in Neural Information Processing Systems, 34: 11702–11716, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:13670f1da6a8ddda69a053e907857e337a4d2a206b84ab881038bf243a17d136","observation_id":"a7a9aeb8-f620-453b-a73a-2675f5a77010","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12465","last_updated":"2025-02-18T02:52:00Z","snapshot_observed_at":"2026-08-04T14:06:14.837585Z","submitted_at":"2025-02-18T02:52:00Z","title":"Computational-Statistical Tradeoffs at the Next-Token Prediction Barrier: Autoregressive and Imitation Learning under Misspecification","version":1},"cited_work":{"arxiv_id":"2502.12465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12465","snapshot_observed_at":"2026-07-02T12:06:55.433556Z","title":"arXiv preprint arXiv:2502.12465 , year=","venue":null,"work_id":"3e2d86c8-aeee-4d9b-9fc7-d7999275f9c5","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2502.12465","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:c0d3386d4953af231a3eb991e7a3af5d9c8fd0db380636e4ae4ee0795646dd5c","observation_id":"2a212c74-7aa4-494e-88e0-d435fd51322d","resolution":{"observed_at":"2026-06-30T07:44:21.722568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Bagnell, D","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:0d256abaf8d26af0afefe87caea7ae63fa454f63e4ef441230db9a435777b504","observation_id":"cbad912d-9437-40b0-b862-9a8d7517e18a","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:038a22ed39801b01d5751eaf53ef5fb3c7396f3b057c20c354c808807f475b04","observation_id":"3a4556c6-937b-4a99-b035-2d7504350ce5","resolution":{"observed_at":"2026-06-30T07:44:21.694949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:8315afcd6af5d32c4372e9a0a02eff5788cebef1323904514b69e95620cc3fea","observation_id":"6e02cead-b9f5-404f-9506-342a0692c9f2","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:8f59f42d3187a46fb6bd28cd5ef94744be081ce2d492778022453b86b4e2d791","observation_id":"0d4c68e9-8568-45fe-b51e-f274d20b9fb7","resolution":{"observed_at":"2026-06-30T07:44:21.704969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-07-06T22:24:04.107920Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":"2509.04259","doi":"10.48550/arxiv.2509.04259","metadata_source":"pith","pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","venue":"cs.LG","work_id":"0bbcff83-fc2f-439d-a988-e38a72205dd5","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:f7e5aaa46bc6ee8b9bf79f7861342c1366d7d93613b79d1be91451d32320e59d","observation_id":"91b6f3bb-e78c-4e41-8d34-2bd1d8aefff8","resolution":{"observed_at":"2026-06-30T07:44:21.697599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:f44ebfe10988e3e674923efd7eb4da1958d9e47c78804f3785bbe4b3fa5e1315","observation_id":"90af2d49-d326-460b-a8e5-3588fe7ae1fd","resolution":{"observed_at":"2026-06-30T07:44:21.731045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Xu, Y","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:d392115bcf91c91e51852b827c3621d67cdf21a9fe17a855321e18f09ff06712","observation_id":"bc42ebcf-c246-43f2-91fa-658f0a705367","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:44:21.735336Z","title":null,"venue":null,"work_id":"07d6413d-8c09-4a15-adfe-11a6c281ae06","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a9f9f81c21ad42a5ebe1cc6e9088d15328b63e8eb95a3c7431523194a1cdef51","observation_id":"500fff68-4926-46d5-afca-510c176a127d","resolution":{"observed_at":"2026-06-30T07:44:21.736812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Joachims, T","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:83af33c732468565ad8f36f8a509f619433b74aacb9f483b9e1f53fc331e73ff","observation_id":"dac5e4a0-5f53-42b8-b909-a0faaebf5e78","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"A., Wu, S., Jiao, J., and Ramchandran, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:7757046b62b4aa3eade4dbbd150c13b7423ceaad916c0538cea2a686cd19a1d7","observation_id":"539c8a90-60c8-45ce-a0f2-35e51b47d52f","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"and Schapire, R","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:090e080a2ca83fbfa15f5ed9435eff5826e38f1172bc9f321954d562f8ada910","observation_id":"f0f03878-046d-4363-94fa-03d3f5fac845","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:65f310abe7e41c433197cdb73c68a9cfe1e5a2dda47ba63455d055fa47c8c609","observation_id":"e8fc4515-e50b-47dc-a6ef-da31fa0dc109","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"TRL: Transformers Reinforcement Learning, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:da77dee398f6546fb2c908760bf3ea13f3acb84112ab63a5dca8dd03598ae3b6","observation_id":"c4614499-a943-4cec-bbe7-863c423253f5","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Oracle-efficient pessimism: Offline policy optimization in contextual bandits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:e06cdf6c02ed5e4ae377fe032c6ea167ad01339bad88ffdf781be4571cf0fb64","observation_id":"3fe2005c-ef1b-44da-aa88-7162b875dcb3","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:87b7ff4ca5fd042c29a9c970238fd4a2115e26c94d33150fe09a9809fb5e16d9","observation_id":"1e5c3aa2-a3d2-4dfd-aaae-a1fe028437dd","resolution":{"observed_at":"2026-06-30T07:44:21.711026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"J., Krishnamurthy, A., Rosset, C., Awadallah, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:3c30fba4726293d381a5e090839d2d0853b01f57d0339731ddae36f3cd4a12c8","observation_id":"f439881c-abb8-4bfa-a487-04722f306782","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":"2312.11456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-07-03T08:07:45.294768Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint.arXiv preprint arXiv:2312.11456","venue":null,"work_id":"a7265aa9-5ce8-4a96-acfd-3f069003f21d","year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:b36536057a2cdd0d24d527b01d712fda1c934fb9032c944990dedf51e6736048","observation_id":"cec4c83d-8ba5-45b8-b569-d375ceb5c8f1","resolution":{"observed_at":"2026-06-30T07:44:21.719763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:77513ba2634c623694ff77597793f857109be85078c4d3d640ec4039376c77e5","observation_id":"4a6c6593-2f2a-4241-bf63-b04120034149","resolution":{"observed_at":"2026-06-30T07:44:21.702962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":"2602.12125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-09T00:35:48.740330Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","venue":"cs.LG","work_id":"bb968107-1f43-4bf4-aa52-cc58000a6e89","year":2026},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:d494c1b64e9294a60e75cc869c54b5b955cdacf7e8edfd48f0eb5075ee59803b","observation_id":"ad3d0918-f783-4a0d-a8e2-8196820c24aa","resolution":{"observed_at":"2026-06-30T07:44:21.705666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10643","doi":"10.48550/arxiv.2511.10643","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Black-box on-policy distillation of large language models.arXiv preprint","venue":null,"work_id":"1e58a1be-9294-4bd3-8040-3516dcebcd4a","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:9855d2d7520bc2eaf8ed7921147d67995915347adb7de89b3187a6e906f936c6","observation_id":"3cc4f7cc-812d-45bd-8f87-37922110c0a6","resolution":{"observed_at":"2026-06-30T07:44:20.905986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:6a87766afd8fc4ec152abceb179f2d331b0cdb319a6a54e62bb84cd4cadfdafc","observation_id":"e89c053f-f5e3-4677-8fcb-b908766283f2","resolution":{"observed_at":"2026-06-30T07:44:21.713112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:a052c68c8b96bb07f574d19cceeb8134c5d336e95c1669fc015856c79c842a30","observation_id":"b7a0ec17-5518-464c-9918-2a0b2dccfa3a","resolution":{"observed_at":"2026-06-30T07:44:21.734197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:0f41c0191023869fc21419299e085fff95f4b4cf1d459e536897fc17ca9bacaf","observation_id":"fd06f75f-e44a-4cfd-8d14-2893de821aa8","resolution":{"observed_at":"2026-06-30T07:44:20.910562Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":"2403.13372","doi":"10.48550/arxiv.2403.13372","metadata_source":"pith","pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-07-10T14:07:06.654437Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","venue":"cs.CL","work_id":"462b3287-e058-48e3-b5e3-82a5f2a8dc06","year":2024},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:dde76a536889e38a08fd21ec33f636111aaaf650c3d7e9f613152f7358d944aa","observation_id":"a719017c-7e4e-4dca-8e43-1d5bfa4bb9c0","resolution":{"observed_at":"2026-06-30T07:44:21.713644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"ζ 2 l−1X i=1 1[i̸∈ X(D)] # ≥ 1 2 E","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:cf43efa3424baf021233e7ce969dc51a7579fe9de6c350b17528e904db1d0e76","observation_id":"e5d8dd9d-938e-42d4-840c-c9850ca54a55","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:41:39.266071Z","title":"Warmup Supervised Fine-Tuning.To enable RL training, we first perform supervised fine-tuning on the OpenR1 dataset [11] to strengthen the model’s reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:9144e543b47eaa171649f6345b2d340eaa0a9946d45ae870f8f448ec4c3cdfef","observation_id":"d366ecbd-de05-4adf-9b12-847b66d6646a","resolution":{"observed_at":"2026-06-30T07:41:39.266071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":39,"verified_exact":25,"verified_fuzzy":0},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2606.30445."}