{"as_of":"2026-08-04T20:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da7ab4cec68ce157c5ad2d86befb238de0722e7a9ab09d513679e8d18f78b56f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:30:49.157907Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T08:17:45.248813Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"1906.09510","last_updated":"2019-06-22T21:40:03Z","snapshot_observed_at":"2026-08-01T15:40:51.856292Z","submitted_at":"2019-06-22T21:40:03Z","title":"Learning Belief Representations for Imitation Learning in POMDPs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T17:54:12.840437Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/1906.09510"},"observation_digest":"sha256:358351ba41b488aad1edfc87f860bb7c80240e7963cc7baecbcb94898f94112f","observation_id":"6a53853e-3cbc-4f46-8be1-ca49315e7df5","resolution":{"observed_at":"2026-05-25T17:56:06.648842Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T01:42:19.004468Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2410.08146"},"observation_digest":"sha256:49f32cdd2b26e47475e59dc36b41d50f60c9f3a039793438704ae0fbfdce668d","observation_id":"43814708-aa17-4c39-bdbc-ecd51f5ff171","resolution":{"observed_at":"2026-05-21T01:42:19.101281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2512.05335","last_updated":"2026-06-01T17:58:21Z","snapshot_observed_at":"2026-08-03T18:30:46.661968Z","submitted_at":"2025-12-05T00:31:26Z","title":"State-Conditional Adversarial Learning: An Off-Policy Visual Domain Transfer Method for End-to-End Imitation Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T18:22:02.372554Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2512.05335"},"observation_digest":"sha256:0974e27c43a8c176888faf77c1e46357f108f5fbded1b9d8b8be9f8d74730a2c","observation_id":"8b12cbb0-c742-479d-ae10-1566c49eac71","resolution":{"observed_at":"2026-05-21T18:24:18.185166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-08-03T18:30:49.157907Z","title":"Andrew Bagnell","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.05335","last_updated":"2026-06-01T17:58:21Z","snapshot_observed_at":"2026-08-03T18:30:46.661968Z","submitted_at":"2025-12-05T00:31:26Z","title":"State-Conditional Adversarial Learning: An Off-Policy Visual Domain Transfer Method for End-to-End Imitation Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:30:49.157907Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2512.05335"},"observation_digest":"sha256:35019f638caa1269e20c064418e7a4e16f8d5353f5131d4b2e61197eb45c529e","observation_id":"b325bd8a-c583-4862-85b8-638755cfab4a","resolution":{"observed_at":"2026-08-03T18:30:49.157907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2604.10856","last_updated":"2026-04-12T23:37:07Z","snapshot_observed_at":"2026-08-03T04:48:13.528107Z","submitted_at":"2026-04-12T23:37:07Z","title":"BridgeSim: Unveiling the OL-CL Gap in End-to-End Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T15:03:02.833156Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2604.10856"},"observation_digest":"sha256:92d31418c6f37533d577fc0510c3bf63416144aba01293a16570d47d32a0e401","observation_id":"6e09e307-c4c6-4f66-808a-f4b7891234c6","resolution":{"observed_at":"2026-05-11T11:16:09.078118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2604.13733","last_updated":"2026-06-09T22:41:14Z","snapshot_observed_at":"2026-07-12T20:36:58.728415Z","submitted_at":"2026-04-15T11:17:54Z","title":"Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T13:02:45.029951Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2604.13733"},"observation_digest":"sha256:ac598e335da7868cf741a8718af493fbe42cd51a8d15e69f2a0fda541d417ffd","observation_id":"42dd62c3-8446-439d-8c22-aed3812b466b","resolution":{"observed_at":"2026-05-10T13:05:25.050088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-12T20:36:59.298711Z","title":"Reinforcement and imitation learning via interactive no-regret learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2604.13733","last_updated":"2026-06-09T22:41:14Z","snapshot_observed_at":"2026-07-12T20:36:58.728415Z","submitted_at":"2026-04-15T11:17:54Z","title":"Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T20:36:59.298711Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2604.13733"},"observation_digest":"sha256:dc87f2a6bf065cc65e9a58ea02e6beddf592eb48bd1db33f318dca851c575861","observation_id":"22e50df1-5037-4ef0-8ab1-927df1d955fe","resolution":{"observed_at":"2026-07-12T20:36:59.298711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2604.19064","last_updated":"2026-04-21T04:17:35Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T04:17:35Z","title":"The Essence of Balance for Self-Improving Agents in Vision-and-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T03:07:49.043189Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2604.19064"},"observation_digest":"sha256:0b2e44c20f823da5e349d27448d67750d672bdbaf001828507a94a8d53562457","observation_id":"9d5f0629-4a9c-41d1-85c7-20e3b10681a8","resolution":{"observed_at":"2026-05-10T03:08:59.125288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2605.05081","last_updated":"2026-05-06T16:19:29Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:19:29Z","title":"Provable imitation learning for control of instability in partially-observed Vlasov--Poisson equations","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T16:32:45.224829Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2605.05081"},"observation_digest":"sha256:acf32577176ae69a360f98ddced8f2bee315824473893bb25c28f63ea1aa7583","observation_id":"c4838a9d-3bb8-4cb4-b8ff-e2e84a43988c","resolution":{"observed_at":"2026-05-11T18:11:05.274072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2605.12913","last_updated":"2026-05-13T02:40:28Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T02:40:28Z","title":"Revisiting DAgger in the Era of LLM-Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T19:56:06.762156Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2605.12913"},"observation_digest":"sha256:77f35f3e5806d5951b7bd3dc5f3ac44b9ae8c50bb31d7471ea039298a23e758f","observation_id":"3bf08f22-8d83-49dd-b4ca-e8470761cfcc","resolution":{"observed_at":"2026-05-14T19:57:53.264138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2605.30903","last_updated":"2026-05-29T06:38:10Z","snapshot_observed_at":"2026-07-06T23:40:07.833692Z","submitted_at":"2026-05-29T06:38:10Z","title":"Inverse Reinforcement Learning without an Optimal Demonstrator: A Feasible Reward Set Approach","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T23:58:10.258001Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2605.30903"},"observation_digest":"sha256:48e6f86dcde4a007f107740e9e5c03519fb79622cc2f945df16528effc69b237","observation_id":"748ecd4f-f159-4602-a947-a3c939abad0d","resolution":{"observed_at":"2026-06-29T00:02:49.760079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2606.12485","last_updated":"2026-06-10T08:56:27Z","snapshot_observed_at":"2026-07-06T23:51:22.219590Z","submitted_at":"2026-06-10T08:56:27Z","title":"Speculative Rollback Correction for Quality-Diverse Web Agent Imitation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:53:27.839408Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2606.12485"},"observation_digest":"sha256:c4877bcba03fc42ac83a36f45ee900f8cc28fae4b8ae9bc6d7e3720ba1e84171","observation_id":"abd24304-83cf-4192-80fa-107bc7b467b7","resolution":{"observed_at":"2026-07-03T08:17:45.250472Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2606.30445","last_updated":"2026-06-29T15:17:42Z","snapshot_observed_at":"2026-08-02T07:47:38.369955Z","submitted_at":"2026-06-29T15:17:42Z","title":"When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T07:41:39.266071Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2606.30445"},"observation_digest":"sha256:038a22ed39801b01d5751eaf53ef5fb3c7396f3b057c20c354c808807f475b04","observation_id":"3a4556c6-937b-4a99-b035-2d7504350ce5","resolution":{"observed_at":"2026-06-30T07:44:21.694949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":"1406.5979","doi":null,"metadata_source":"pith","pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-03T08:17:45.248813Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","venue":"cs.LG","work_id":"7520e919-9fd9-44ca-8349-03a2f4b1fbcc","year":2014},"citing_paper":{"arxiv_id":"2606.30923","last_updated":"2026-06-29T21:18:21Z","snapshot_observed_at":"2026-08-02T18:20:53.813564Z","submitted_at":"2026-06-29T21:18:21Z","title":"Behavior Cloning is Not All You Need: The Optimality of On-Policy Distillation for Noisy Expert Feedback","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-01T06:21:48.752660Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2606.30923"},"observation_digest":"sha256:4876b8cf2ba26c57813416c2ed7b2192e142afa46ccf35bd9b2ecbd951af9a4d","observation_id":"344e9a74-af39-4882-8b3d-4db7ce7e542f","resolution":{"observed_at":"2026-07-01T09:45:39.360449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-07-11T17:03:13.686066Z","title":"arXiv preprint arXiv:1406.5979 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04574","last_updated":"2026-07-06T01:02:30Z","snapshot_observed_at":"2026-08-01T16:46:47.409193Z","submitted_at":"2026-07-06T01:02:30Z","title":"A Few Teacher Steps Go a Long Way: Cost-Efficient On-Policy Data Augmentation for Agent Post-Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T17:03:13.686066Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2607.04574"},"observation_digest":"sha256:a750c8030aae2a30607d56be28624cc395cc62d8b67407da2f6b934b27723a75","observation_id":"a7b4f5be-d21c-4bb6-9bb3-2a82f49e70c9","resolution":{"observed_at":"2026-07-11T17:03:13.686066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.5979","snapshot_observed_at":"2026-08-01T02:58:29.334255Z","title":"arXiv preprint arXiv:1406.5979 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25308","last_updated":"2026-07-28T05:39:01Z","snapshot_observed_at":"2026-08-03T23:19:45.573741Z","submitted_at":"2026-07-28T05:39:01Z","title":"CAST: Game Solvers as Turn-Level Teachers for LLM Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T02:58:29.334255Z"},"links":{"cited_paper":"/paper/1406.5979","citing_paper":"/paper/2607.25308"},"observation_digest":"sha256:53cae39012a97995e5de18fe43df76cad7147e47f3931de80aa7627713819ebd","observation_id":"d8c4c4d5-f76d-4998-a8ce-c3d174e4721d","resolution":{"observed_at":"2026-08-01T02:58:29.334255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1406.5979/citation-record","integrity":"/paper/1406.5979/integrity","json":"/paper/1406.5979/citation-record.json","paper":"/paper/1406.5979"},"outbound":[],"paper":{"arxiv_id":"1406.5979","last_updated":"2014-06-23T17:00:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T03:47:05.007723Z","submitted_at":"2014-06-23T17:00:28Z","title":"Reinforcement and Imitation Learning via Interactive No-Regret Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:1406.5979."}