{"as_of":"2026-08-12T04:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:228b08dd862f43a04ce46a4a76591807f2d04123cca38b29a769fd1f30aa7562","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:09:27.590185Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T21:47:36.272825Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"1907.02874","last_updated":"2019-07-05T14:59:41Z","snapshot_observed_at":"2026-08-02T19:43:12.434694Z","submitted_at":"2019-07-05T14:59:41Z","title":"Attentive Multi-Task Deep Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T02:25:00.765509Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/1907.02874"},"observation_digest":"sha256:f37ddecc31aedff25e59272d1a039649b3015d02f07fe54c100beff64fd241b8","observation_id":"9bbcc9ef-b5f9-43d7-926e-fff712bd30c2","resolution":{"observed_at":"2026-05-25T02:25:14.673926Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T20:57:51.360357Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2202.03286"},"observation_digest":"sha256:e91e44f00f5adf2555431265a87e55e1a607f2a7bb4105d49e0f5bc3aff4b6c3","observation_id":"b06cf659-0c8d-4075-8eee-f93eac5afe06","resolution":{"observed_at":"2026-05-11T20:57:51.836919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":287,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:79ec3ede02c8faf1fbb6b47feb39bb931232c4422e2f492cf8b2c1bd0bf455e0","observation_id":"b5f2b6c2-94f6-4b43-89a0-7f17f3947cb0","resolution":{"observed_at":"2026-05-17T14:43:30.299758Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"2407.15134","last_updated":"2025-06-06T13:37:30Z","snapshot_observed_at":"2026-08-07T21:47:56.938563Z","submitted_at":"2024-07-21T12:08:54Z","title":"Proximal Policy Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T23:09:42.421333Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2407.15134"},"observation_digest":"sha256:04b33e02597d1d9dfa9a2e163c1a2f969c316c856560ffcfe7fc4e4cd1044d49","observation_id":"0070de22-2eaa-4108-927a-28b1890f182b","resolution":{"observed_at":"2026-05-23T23:13:36.922605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-11T22:09:27.590185Z","title":"Kickstarting deep reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03803","last_updated":"2024-12-05T01:56:01Z","snapshot_observed_at":"2026-08-11T22:02:21.560379Z","submitted_at":"2024-12-05T01:56:01Z","title":"Towards an Autonomous Test Driver: High-Performance Driver Modeling via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:09:27.590185Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2412.03803"},"observation_digest":"sha256:d6b1da018257e95f4deafc7bf7582c17b7aea22415f58b89aca8ac7e52cf6f1f","observation_id":"b3d45bd2-b340-4d88-ae73-794929bd22c4","resolution":{"observed_at":"2026-08-11T22:09:27.590185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-11T17:11:13.064499Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.09388","last_updated":"2025-02-12T10:55:54Z","snapshot_observed_at":"2026-08-11T17:03:14.230094Z","submitted_at":"2024-12-12T15:56:20Z","title":"All You Need in Knowledge Distillation Is a Tailored Coordinate System","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:11:13.064499Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2412.09388"},"observation_digest":"sha256:bea32c5de2880f34adec8ca850518a6c8e17b24760ee14be455a2e9abe495c6f","observation_id":"92c2c69f-d3e7-4a1b-bb6f-741fa4ca8df8","resolution":{"observed_at":"2026-08-11T17:11:13.064499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-11T14:56:14.680961Z","title":"J., Zidek, A., Osindero, S., Doersch, C., Czarnecki, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11499","last_updated":"2024-12-16T07:18:02Z","snapshot_observed_at":"2026-08-11T14:49:34.317949Z","submitted_at":"2024-12-16T07:18:02Z","title":"Embodied CoT Distillation From LLM To Off-the-shelf Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:14.680961Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2412.11499"},"observation_digest":"sha256:ceeba1f5c5a8d6dfab080fdda5d9a61a33536864422afc94be09367868c29b1d","observation_id":"0b5891fb-3032-4457-a142-a333a4535392","resolution":{"observed_at":"2026-08-11T14:56:14.680961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-06T23:42:21.762144Z","title":"Kickstarting deep reinforcement learning.arXiv preprint arXiv:1803.03835, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16590","last_updated":"2025-06-19T20:25:52Z","snapshot_observed_at":"2026-08-10T16:35:09.804895Z","submitted_at":"2025-06-19T20:25:52Z","title":"Energy-Based Transfer for Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:21.762144Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2506.16590"},"observation_digest":"sha256:d2d39418bf3e1f7ff8be3c8d05b74ba70af81c147fc270e48f3aa404431aa5c6","observation_id":"0c28a6a4-bf45-4af6-8a3d-eac8f7dd2c37","resolution":{"observed_at":"2026-08-06T23:42:21.762144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-05T22:05:05.921845Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.07616","last_updated":"2025-08-21T06:17:25Z","snapshot_observed_at":"2026-08-08T03:30:30.635878Z","submitted_at":"2025-08-11T04:51:43Z","title":"ThinkTuning: Instilling Cognitive Reflections without Distillation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T22:05:05.921845Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2508.07616"},"observation_digest":"sha256:c5d2cc3a862c6365ca39b1e7efa28e06c66722ef91a0b0b39afe2438c84b0970","observation_id":"0b143ffd-91bf-4246-9cb8-0f381273ab27","resolution":{"observed_at":"2026-08-05T22:05:05.921845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-04T14:44:15.083396Z","title":"Kickstarting deep reinforcement learning.arXiv preprint arXiv:1803.03835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.23730","last_updated":"2026-05-28T14:53:43Z","snapshot_observed_at":"2026-08-09T17:44:40.916466Z","submitted_at":"2025-09-28T08:20:22Z","title":"EAPO: Enhancing Policy Optimization with On-Demand Expert Assistance","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T14:44:15.083396Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2509.23730"},"observation_digest":"sha256:90e5e36a823d05bf9fa553116a5234eb45d2fccd71c67eedbba9c96204ae8310","observation_id":"1f63d06b-0b17-4988-93e5-828fe488091a","resolution":{"observed_at":"2026-08-04T14:44:15.083396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"2606.17386","last_updated":"2026-07-15T20:07:32Z","snapshot_observed_at":"2026-08-07T18:01:05.744084Z","submitted_at":"2026-06-16T00:45:01Z","title":"TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T02:27:51.946679Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2606.17386"},"observation_digest":"sha256:5fb9f47a3897a8439ba99f85d1fec9679e0f206c8d1b388eeca8f727bea24cff","observation_id":"63603a1f-eb18-448c-9a70-5af36f61f324","resolution":{"observed_at":"2026-07-03T18:38:49.978324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-02T11:08:39.028689Z","title":"Schmitt, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.17386","last_updated":"2026-07-15T20:07:32Z","snapshot_observed_at":"2026-08-07T18:01:05.744084Z","submitted_at":"2026-06-16T00:45:01Z","title":"TerraTransfer: Learning End-to-End Driving Policies Without Expert Demonstrations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T11:08:39.028689Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2606.17386"},"observation_digest":"sha256:cb27e853cbbc1db0208912fadd9d86dd14ba89234ebb3f8e19367799e52304f9","observation_id":"665fdad2-4582-4307-9275-b3d615d47f89","resolution":{"observed_at":"2026-08-02T11:08:39.028689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"2606.20705","last_updated":"2026-06-15T18:00:11Z","snapshot_observed_at":"2026-08-03T09:14:16.750732Z","submitted_at":"2026-06-15T18:00:11Z","title":"MotionPyramid: Hierarchical Motion Representation and Residual Interfaces","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T04:14:41.060330Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2606.20705"},"observation_digest":"sha256:3cc4b28da4f2450d7a3f28d93e54696bb7f21aabbab5555710b7e3418b984407","observation_id":"d55c6583-052f-4f63-8556-312c744e48f4","resolution":{"observed_at":"2026-07-03T17:18:44.290147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1803.03835","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-10T21:47:36.272825Z","title":"Kickstarting Deep Reinforcement Learning","venue":"cs.LG","work_id":"9a37690b-0f5f-424b-81b7-3b1b8bea9157","year":2018},"citing_paper":{"arxiv_id":"2607.06772","last_updated":"2026-07-15T01:13:04Z","snapshot_observed_at":"2026-08-09T09:14:52.942610Z","submitted_at":"2026-07-07T20:05:22Z","title":"Efficient Long-Horizon Learning for Learned Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T21:40:06.294302Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2607.06772"},"observation_digest":"sha256:2d8052faf09aad00770c8e785135bf7e79c39eec7c3960b2b085cf14a8e504c8","observation_id":"52ca7b67-a72c-4c0f-b474-31b7fc32263c","resolution":{"observed_at":"2026-07-10T21:47:36.289563Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-07-14T15:58:06.643463Z","title":"Schmitt, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.06772","last_updated":"2026-07-15T01:13:04Z","snapshot_observed_at":"2026-08-09T09:14:52.942610Z","submitted_at":"2026-07-07T20:05:22Z","title":"Efficient Long-Horizon Learning for Learned Optimization","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T15:58:06.643463Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2607.06772"},"observation_digest":"sha256:73e8ea019d123f6ce5a20dc5032f48d16ce93b1455847ecdd4ee325788d8632d","observation_id":"d380fda5-b604-4a91-8d03-f0e006fcaa4a","resolution":{"observed_at":"2026-07-14T15:58:06.643463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-02T08:16:52.647887Z","title":"Schmitt, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.06772","last_updated":"2026-07-15T01:13:04Z","snapshot_observed_at":"2026-08-09T09:14:52.942610Z","submitted_at":"2026-07-07T20:05:22Z","title":"Efficient Long-Horizon Learning for Learned Optimization","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T08:16:52.647887Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2607.06772"},"observation_digest":"sha256:53743238cf8925c143fc1ebdb0cd680f82cc0924a55d86b74fe6ce2873604321","observation_id":"f6b3ff2b-e8ba-4721-bba3-699c5eb6393d","resolution":{"observed_at":"2026-08-02T08:16:52.647887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-02T08:39:40.941485Z","title":"Schmitt and J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19399","last_updated":"2026-07-06T05:24:25Z","snapshot_observed_at":"2026-08-09T17:44:25.982067Z","submitted_at":"2026-07-06T05:24:25Z","title":"Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T08:39:40.941485Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2607.19399"},"observation_digest":"sha256:0d014859451da14b6a38c5341b0658139401b003dd584ca1e5b39d86d9889113","observation_id":"d68ed56d-7968-4fa7-afb0-f96d69f4236a","resolution":{"observed_at":"2026-08-02T08:39:40.941485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1803.03835/citation-record","integrity":"/paper/1803.03835/integrity","json":"/paper/1803.03835/citation-record.json","paper":"/paper/1803.03835"},"outbound":[],"paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:1803.03835."}