{"as_of":"2026-08-08T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f695139d14972c40237d28fc37035731c2d9736bb3525b7609ff406b41f5917","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:06:47.517274Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03568/citation-record","integrity":"/paper/2506.03568/integrity","json":"/paper/2506.03568/citation-record.json","paper":"/paper/2506.03568"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:49.073429Z","title":"Learning to drive in a day,","venue":null,"work_id":"b3353e8b-7ffe-4ab6-8a31-723401a8e3e2","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.996668Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:595b01ca7ba5dc9eb46f2dda777929d586f0d5e65a191d98eab6db5da666ce60","observation_id":"b953d159-f33d-4b89-859a-3537b2c5e1ab","resolution":{"observed_at":"2026-08-07T11:06:49.081032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-07T11:06:47.054690Z","title":"End to end learning for self-driving cars,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.054690Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:42253f8cd5b9aec6eb8723cee0c5606e4ef4def5d88357d26e9a54be98881b82","observation_id":"ea909278-58b2-43ac-9010-e526a626c62c","resolution":{"observed_at":"2026-08-07T11:06:47.054690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.062703Z","title":"Dense reinforcement learning for safety validation of autonomous vehicles,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.062703Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:fe8644510f0f06a35f51abe13c5d42cb2aa5dee21a4dba75db47828ef385fae5","observation_id":"26b284c1-6c32-4c92-bd57-e8d5f8d7c391","resolution":{"observed_at":"2026-08-07T11:06:47.062703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:49.007735Z","title":"A survey of deep RL and IL for autonomous driving policy learning,","venue":null,"work_id":"07e04c05-68c0-42a5-bd1f-802362ec3283","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.074645Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:a10f1e944a387f5fda706da4fe155ab49382f31ab72d701304fe1ddc37f52060","observation_id":"b9599d1f-fd6d-4551-a9b6-ad054c3bd309","resolution":{"observed_at":"2026-08-07T11:06:49.016724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.987418Z","title":"A survey on autonomous vehicle control in the era of mixed-autonomy: From physics-based to ai-guided driving policy learning,","venue":null,"work_id":"5b36d9fe-8800-4ce1-820a-d70e0f48ff27","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.080690Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:81dab856cab1fabb89428d706c77d1297e99ef32a8de0a53771e1157a1b17364","observation_id":"a10452b6-967f-4279-b900-5e0790312f10","resolution":{"observed_at":"2026-08-07T11:06:48.994054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.087129Z","title":"Deep learning for safe autonomous driving: Current chal- lenges and future directions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.087129Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:77ffa8600bc957e1ad44a31f21fc0f6ccd60fbaca647cffe627bb58dc676d8e8","observation_id":"d6c01a77-4c2a-4f80-91d0-67b85257cbb5","resolution":{"observed_at":"2026-08-07T11:06:47.087129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.092742Z","title":"Survey of deep reinforcement learning for motion planning of autonomous vehicles,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.092742Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2f3a143f98ce509092d9daccbf95de3177856a9154fe1306acb8b1a557b807ca","observation_id":"70e94c2b-9b6d-496f-9258-84821eaebf43","resolution":{"observed_at":"2026-08-07T11:06:47.092742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.099754Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.099754Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:a024ea6e40c70e7364e400487b4416967e307913b93705df86a6adaa1d0b2014","observation_id":"33fc5d1f-f2a8-4f43-b19f-8a3c79b377b0","resolution":{"observed_at":"2026-08-07T11:06:47.099754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.930759Z","title":"Deep reinforcement learning for autonomous driving: A survey,","venue":null,"work_id":"3e6e721f-7562-4500-bad8-b0b074c421d7","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.108862Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:906fc3fa9ba29c41fb81996d4f2f8f6544abbd9b3da0dd1a6d843572f383ce56","observation_id":"fbac7cfb-67d7-4cd9-9adb-34ae7100f6ce","resolution":{"observed_at":"2026-08-07T11:06:48.938561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.905627Z","title":"End-to-end urban driving by imitating a reinforcement learning coach,","venue":null,"work_id":"ed3980fa-f28e-485d-80e4-b89b33ba6702","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.119541Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:3eabf71c5c49a92d7fff7e552b12be4f5f80c1fff8bb388a2305a05726cb1146","observation_id":"2a382cf7-ee65-43e4-a623-303b4ec4c4fa","resolution":{"observed_at":"2026-08-07T11:06:48.913663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.875926Z","title":"Reward misdesign for autonomous driving,","venue":null,"work_id":"3acfa2e1-0a13-4fc5-9698-82000c73103e","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.129878Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:f09867a5689b22cc798a92bdab992fe1bbda18d6736758327aa7a1520ec4949e","observation_id":"69b0d92e-7f70-4794-a84a-fc54ae364c6a","resolution":{"observed_at":"2026-08-07T11:06:48.887744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-07-06T07:15:51.575438Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-07T11:06:47.141529Z","title":"Scalable agent alignment via reward modeling: A research direction. arxiv 2018,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.141529Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:981ab0bd5577f696ea675c1fb992531c7f620e80653887e5cb020580ebd9fc8f","observation_id":"5d2bb129-4ecb-4225-92d3-85b487ae0178","resolution":{"observed_at":"2026-08-07T11:06:47.141529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13295","last_updated":"2025-08-27T11:15:11Z","snapshot_observed_at":"2026-08-07T18:07:08.742124Z","submitted_at":"2025-02-18T21:32:24Z","title":"Demonstrating specification gaming in reasoning models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13295","snapshot_observed_at":"2026-08-07T11:06:47.152726Z","title":"Demonstrating spec- ification gaming in reasoning models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.152726Z"},"links":{"cited_paper":"/paper/2502.13295","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9766ed90430bcf455ac75c3a1085c20dbc244291dca1a35f6f47c3809ca06e6e","observation_id":"c5789285-6345-42fd-8fa0-d698171dc58a","resolution":{"observed_at":"2026-08-07T11:06:47.152726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.854186Z","title":"Toward human-in-the-loop AI: Enhancing deep reinforcement learning via real-time human guidance for autonomous driving,","venue":null,"work_id":"743dd9ed-9140-482d-8000-071492ad2092","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.159984Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:4b2fb3394d0a14d5bb1c29931632d6ff6fddc28e9dfb044d38868d1d396e73c2","observation_id":"3ecdb816-979a-4115-8595-9a98158cc2fd","resolution":{"observed_at":"2026-08-07T11:06:48.861260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.834767Z","title":"Hindsight credit assignment,","venue":null,"work_id":"dc00d699-3807-4b65-8478-382aad998703","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.176862Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:3c1fcba5b20c4a44ecc715e79dd737196949bd10c53f9655830117dcf0dbdd98","observation_id":"e200d637-9a49-4c9b-bcf8-f7d3425a8012","resolution":{"observed_at":"2026-08-07T11:06:48.841270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05173","last_updated":"2017-07-17T14:13:40Z","snapshot_observed_at":"2026-08-03T08:03:37.092983Z","submitted_at":"2017-07-17T14:13:40Z","title":"Trial without Error: Towards Safe Reinforcement Learning via Human Intervention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05173","snapshot_observed_at":"2026-08-07T11:06:47.203825Z","title":"Trial without error: Towards safe reinforcement learning via human intervention,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.203825Z"},"links":{"cited_paper":"/paper/1707.05173","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:7350fe4f9d073f2a7430937f89ac1c09374816bd9e30def9f81703a61f63eba7","observation_id":"37afddd2-4f33-41ff-8d6a-2707ab0e72bc","resolution":{"observed_at":"2026-08-07T11:06:47.203825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.813298Z","title":"A survey on imitation learning techniques for end-to-end autonomous vehicles,","venue":null,"work_id":"3dca44b4-fe25-45f5-82e1-0dfc7d2c2903","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.211989Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:5b84c842122664e1784e253918bf2d4b376d8962404a7801bd8445167a0bdded","observation_id":"7435c22e-26b8-487a-b920-9a468755d7a3","resolution":{"observed_at":"2026-08-07T11:06:48.820149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.777646Z","title":"Conditional predictive behavior planning with inverse reinforcement learning for human-like autonomous driving,","venue":null,"work_id":"432ff650-d308-438a-8750-e08755436a0d","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.224555Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:334c6a6e7eac012fcf6a63b93de4a600f2d47651e3a965d419604fb3ee4adeaf","observation_id":"43b0205f-a0b0-4a5c-84ba-28463da293fb","resolution":{"observed_at":"2026-08-07T11:06:48.790007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.739988Z","title":"Pattern recognition and adaptive control,","venue":null,"work_id":"b440c3c5-6d5d-42b7-8f59-0d1488b0a2aa","year":1964},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.230363Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9dedb5d9ac246e544ba9cf26932ac02b595cf212f555876308268b45ba23e1e9","observation_id":"52d91390-1107-4988-9158-bdb23e1d15f6","resolution":{"observed_at":"2026-08-07T11:06:48.747424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06711","last_updated":"2018-11-16T09:06:54Z","snapshot_observed_at":"2026-07-06T07:15:07.903595Z","submitted_at":"2018-11-16T09:06:54Z","title":"An Algorithmic Perspective on Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06711","snapshot_observed_at":"2026-08-07T11:06:47.235938Z","title":"An algorithmic perspective on imitation learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.235938Z"},"links":{"cited_paper":"/paper/1811.06711","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:e1956c20f1f78fa241e5c93c9f7ad6dd06a3f2ceb65fe903cf48557aacdfd3d7","observation_id":"a4696d27-913a-475b-a557-d457f26f83c7","resolution":{"observed_at":"2026-08-07T11:06:47.235938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.719632Z","title":"Learning a decision module by imitating driver’s control behaviors,","venue":null,"work_id":"df618f5d-d346-4fee-bfbe-3515ef32ee8b","year":2020},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.242273Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:8a90aeb3387ad73289dd4b1b25b45e756e4f3f241e77c19c54edec3236aa6a14","observation_id":"2f971b72-1e49-456d-8b9a-ff91feb8d2ef","resolution":{"observed_at":"2026-08-07T11:06:48.726411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14497","last_updated":"2021-04-26T17:38:23Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:54:25Z","title":"Conservative Safety Critics for Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14497","snapshot_observed_at":"2026-08-07T11:06:47.251327Z","title":"Conservative safety critics for exploration,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.251327Z"},"links":{"cited_paper":"/paper/2010.14497","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:43aa063a8ae7acc6b4c1f62a256df6435f70f3fd297d9c844af55de415f4d7bd","observation_id":"33693b59-16e0-45ff-8b2c-7ff49c725d71","resolution":{"observed_at":"2026-08-07T11:06:47.251327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-07T11:06:47.259634Z","title":"Behavior regularized offline reinforcement learning,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.259634Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:dfa289f8febdea6166addc0be301130e86c2a3bf1f5dbc71c86628eb4a841be8","observation_id":"9ab2d0dd-d2b1-4721-b75a-7bfb2264ad49","resolution":{"observed_at":"2026-08-07T11:06:47.259634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.698071Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"9588f1ff-1383-416b-a839-9b838ae67476","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.267759Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:a8328f76c122a2d91e22d34a1051155972f5a05be7cc1eca3baa5ba9e827dd87","observation_id":"7e335325-1715-4ac0-a391-11f2cc86de03","resolution":{"observed_at":"2026-08-07T11:06:48.703985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.667981Z","title":"Adversarial inverse rein- forcement learning with self-attention dynamics model,","venue":null,"work_id":"3b9cc6f7-298d-4539-893a-f51504f75767","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.274511Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:da6cbbb34da2a98ebe3ae4c7c5a4781577c6e55d492378a550cb313adb439855","observation_id":"0098b27e-2e4b-42a2-a36d-324d9d0fd4e7","resolution":{"observed_at":"2026-08-07T11:06:48.675772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.641108Z","title":"Efficient reductions for imitation learning,","venue":null,"work_id":"1918ef2e-f1e7-41d4-9ea2-eb15fa9f0144","year":2010},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.301201Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9890c3c9649209b666475982534ccf999cdf26a0deddd95523a03d0502557028","observation_id":"9434015b-8421-4144-b37f-18da759de9d6","resolution":{"observed_at":"2026-08-07T11:06:48.648437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.613972Z","title":"Exploring the limi- tations of behavior cloning for autonomous driving,","venue":null,"work_id":"e5ae480e-d9cf-46db-a463-de24b761069f","year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.314152Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:3167ca9fe3dde4a62453690748d20a1ca1303ac711928b8c4697e3683ce429c1","observation_id":"4442ef43-f0c1-432b-9059-456c2821fa2c","resolution":{"observed_at":"2026-08-07T11:06:48.625527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.583762Z","title":"Behavioral cloning a correction,","venue":null,"work_id":"1d470922-a6e7-4f12-af27-a6b98164da6f","year":1995},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.320883Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:dd29b64c5804ff3ab020d21dfdc189d594e25cd0277d8f13abdea9bf9bffb9d6","observation_id":"6bf27769-625a-48d1-ab28-945048db412f","resolution":{"observed_at":"2026-08-07T11:06:48.590978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.549120Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and go through self-play,","venue":null,"work_id":"52d107f5-d7db-41aa-9a2f-e96e22d57f12","year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.328632Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:e4a87a63fd5808a7774c327e1e1935acc61b03a8a1bd3cc8433c88f8c1cd7ebb","observation_id":"ec8175b5-24a6-42d4-bdcc-c042ea77d078","resolution":{"observed_at":"2026-08-07T11:06:48.561472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.525863Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning,","venue":null,"work_id":"34e3834f-27db-4f0d-9508-7a9ac65754be","year":2011},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.335160Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:7511158c5499f64c485ba07e654ad4173879b227123b0b2c1cd0c4cb127ee09a","observation_id":"024cbaec-61db-4023-908b-e53548811411","resolution":{"observed_at":"2026-08-07T11:06:48.533279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06450","last_updated":"2016-05-20T17:40:16Z","snapshot_observed_at":"2026-07-06T04:57:02.729338Z","submitted_at":"2016-05-20T17:40:16Z","title":"Query-Efficient Imitation Learning for End-to-End Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.06450","snapshot_observed_at":"2026-08-07T11:06:47.345392Z","title":"Query-efficient imitation learning for end-to-end autonomous driving,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.345392Z"},"links":{"cited_paper":"/paper/1605.06450","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:5680731aa5df1507e5f168da2c2aad25150f8997e96abdb9b147589313503005","observation_id":"f1763acf-d4a0-4831-a456-b69e1506e204","resolution":{"observed_at":"2026-08-07T11:06:47.345392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.354950Z","title":"Hg-dagger: Interactive imitation learning with human experts,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.354950Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:b8bf3c4cc8c76a5928783d81f5646c835b2a68042fb7cea5335402e313eb3855","observation_id":"70cfac0c-e7e9-4dfc-a259-3032037c6108","resolution":{"observed_at":"2026-08-07T11:06:47.354950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.481572Z","title":"Thriftydagger: Budget-aware novelty and risk gating for interactive imitation learning,","venue":null,"work_id":"9c3d9e8a-82d3-459f-9682-9d2ac336908a","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.379002Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9c0d33f195d6f3bd6de31fd6b4863edcae9579378eb241d8ea4ea132d0efbda1","observation_id":"8d0258af-51c5-4dba-a66c-2a63b26941c0","resolution":{"observed_at":"2026-08-07T11:06:48.489799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.455265Z","title":"Expert intervention learning,","venue":null,"work_id":"526cb14f-9be9-4ff7-b6f6-7b826be2fddd","year":2021},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.384324Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:4d584b06bc19d7c537c22dd5a648eaa7a5a694021cbbf1c76141b6212b68c8a4","observation_id":"9a20d808-d509-43e5-b925-2926ac9b8c0d","resolution":{"observed_at":"2026-08-07T11:06:48.467741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06733","last_updated":"2020-12-12T05:30:35Z","snapshot_observed_at":"2026-08-08T09:13:13.875761Z","submitted_at":"2020-12-12T05:30:35Z","title":"Human-in-the-Loop Imitation Learning using Remote Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06733","snapshot_observed_at":"2026-08-07T11:06:47.390201Z","title":"Human-in-the-loop imitation learning using remote tele- operation,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.390201Z"},"links":{"cited_paper":"/paper/2012.06733","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:10f286d26cf77e90075cca80b695644a4b71800546b2156c3947d0d3e617c768","observation_id":"93b1d758-f991-4c18-92d1-157a51a2a22b","resolution":{"observed_at":"2026-08-07T11:06:47.390201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.427202Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":"bcc3097b-f2ee-4668-a49a-ebff5d50c7db","year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.398761Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:09a0dfd5e0c17bf729294e6443f90d21352b39cba25b0774a7f1620329bc9bd1","observation_id":"5cc54a30-2cf5-4e27-bca1-c6b64468a705","resolution":{"observed_at":"2026-08-07T11:06:48.434427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.399860Z","title":"Batch active preference-based learning of reward functions,","venue":null,"work_id":"a1c49309-11bd-44c6-a6f1-09a4b130f300","year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.404330Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:dea5f7e7c2b7409a659621f7642d39e59e1f75eae7051ca947c0a16b44146fa7","observation_id":"558d2604-d8a2-45cd-96b4-1858083f53f1","resolution":{"observed_at":"2026-08-07T11:06:48.407579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08928","last_updated":"2019-06-21T03:00:36Z","snapshot_observed_at":"2026-08-02T22:07:19.765753Z","submitted_at":"2019-06-21T03:00:36Z","title":"Learning Reward Functions by Integrating Human Demonstrations and Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08928","snapshot_observed_at":"2026-08-07T11:06:47.410249Z","title":"Learning reward functions by integrating human demonstrations and preferences,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.410249Z"},"links":{"cited_paper":"/paper/1906.08928","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2f2651c7ddad505165218967b0d1cd6a7ea95a7afb78c11203584cfb7bb6e9e1","observation_id":"64f9f942-7044-4d1b-b85d-3446d11595d6","resolution":{"observed_at":"2026-08-07T11:06:47.410249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.371225Z","title":"Efficient learning of safe driving policy via human-AI copilot optimization,","venue":null,"work_id":"0d07c085-f337-4a25-a878-dc89824bba10","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.416144Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:82e20b3180bff54c8e89b17e0593cb4af0c3fe7daaca4f2494139430722b6bdd","observation_id":"67e09e0c-5b81-46f2-8a1d-49f877c648b0","resolution":{"observed_at":"2026-08-07T11:06:48.378955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.345350Z","title":"Learning from active human involvement through proxy value propagation,","venue":null,"work_id":"0ef8e79c-b689-4a45-b627-6d44931f2688","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.421979Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:a83c16f5ea3667d43c71cfa28a7b565a901e7facef2800a44a78b30073a770b5","observation_id":"67936181-90d0-495a-866a-28f330be8d8c","resolution":{"observed_at":"2026-08-07T11:06:48.353963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-07T11:06:47.427864Z","title":"Meta-world: A benchmark and evaluation for multi- task and meta reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.427864Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:2bb2155742b69536032fab6ef45472553951ba4fe13bba58c1b5f2d95d371ad4","observation_id":"ace12819-7be9-4dbb-8251-53a121e283b2","resolution":{"observed_at":"2026-08-07T11:06:47.427864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.324985Z","title":"Socially situated artificial intelligence enables learning from human interaction,","venue":null,"work_id":"0a2e328f-13fd-484c-a762-4e0297039478","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.433857Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:b0c5932ca882dec9a66cc973b54d143561dd72dfc37ed18964af14034c90b4c5","observation_id":"355d23c3-b0f1-4007-80e5-e2862f3e8c3b","resolution":{"observed_at":"2026-08-07T11:06:48.332758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.291735Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"1a2362a6-635d-4121-8fdf-6b7a1883034c","year":2018},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.439626Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:acef85412a7d5652dc9b1c95acdd5f477300094209dc5911801bb418363ac451","observation_id":"268b589d-5665-465a-8013-6846a2e03e11","resolution":{"observed_at":"2026-08-07T11:06:48.301583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.252913Z","title":"Human as AI mentor: Enhanced human-in-the-loop reinforcement learning for safe and effi- cient autonomous driving,","venue":null,"work_id":"cbcf073d-11f9-4810-8c66-e1426ba2f0bb","year":2024},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.446612Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:4f116bf91d8b79d74adaea2e665f8c5347f88b66700d59d7934b5aeceef93838","observation_id":"09d7c262-872f-4a76-b8bb-ab18800494a0","resolution":{"observed_at":"2026-08-07T11:06:48.271114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.226513Z","title":"Guarded policy optimization with imperfect online demonstrations,","venue":null,"work_id":"aad2bf1d-e6ab-45f3-94c0-dc1e2cec9e81","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.451753Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:3fee1ad3a10209e66cc7da0a65799ef92ab861bdf01ed3aa80c78ce8e0e153af","observation_id":"dd045378-b146-4e55-9cf1-b5559197a214","resolution":{"observed_at":"2026-08-07T11:06:48.234155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.197640Z","title":"Trust region policy optimization,","venue":null,"work_id":"7f9370e3-f99d-4f32-885b-7ba6cba710b6","year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.457418Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:bc0a916089b8844ef293bc4d533e6de3b2c4a1e688f47982c9145791aa12539c","observation_id":"d56724d3-6b63-4773-84a8-f20f074ef99b","resolution":{"observed_at":"2026-08-07T11:06:48.209925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.168947Z","title":"Metadrive: Composing diverse driving scenarios for generalizable reinforcement learning,","venue":null,"work_id":"c35b0109-3509-47f3-bfe1-0d14ea6d517f","year":2023},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.462594Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:9aefd5ffdea504a540fb6fadb99802c0f932c395cf32bf34399f2f4bcaf34ec1","observation_id":"fbc2e929-024c-40ff-8841-12f2dfc434be","resolution":{"observed_at":"2026-08-07T11:06:48.176999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.143468Z","title":"Responsive safety in reinforce- ment learning by pid lagrangian methods,","venue":null,"work_id":"4e371576-3ebc-492e-aab2-2c3c2f7b8bce","year":2020},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.468686Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:e3842d1982e4354fca678cb897a5567a3ea0725462dd9c3b7b4e849221315883","observation_id":"b46c8c8a-366e-447a-bee1-d91116c5d1d4","resolution":{"observed_at":"2026-08-07T11:06:48.150462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08550","last_updated":"2020-11-03T05:46:51Z","snapshot_observed_at":"2026-08-07T08:54:28.901497Z","submitted_at":"2020-02-20T03:36:39Z","title":"Learning to Walk in the Real World with Minimal Human Effort","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08550","snapshot_observed_at":"2026-08-07T11:06:47.474001Z","title":"Learning to walk in the real world with minimal human effort,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.474001Z"},"links":{"cited_paper":"/paper/2002.08550","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:7f420791a23e2ae084282392853d7c1d86456754a92bc2f91acca0cf125ff5fd","observation_id":"8d55fd2c-4562-4271-8430-f18d391150b2","resolution":{"observed_at":"2026-08-07T11:06:47.474001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.113722Z","title":"Conservative Q- learning for offline reinforcement learning,","venue":null,"work_id":"8ebf8522-962a-445e-8ba1-3394e90f748b","year":2020},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.479725Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:b7e705ef9821d6db00a3fe91f012479dde089c1cc9e78ae7585a6e2f0609b72a","observation_id":"f771110b-c8bf-4dda-8076-11d34b2454a5","resolution":{"observed_at":"2026-08-07T11:06:48.125073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:06:47.485274Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.485274Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:1a8e625e0b5c9c207605d0e7891ccee3220fc9f2c528aab348854902b28be9c4","observation_id":"2b598292-45f2-4e28-9d94-55dfe16f77f7","resolution":{"observed_at":"2026-08-07T11:06:47.485274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.078340Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors,","venue":null,"work_id":"41345775-4eda-44b8-9c9c-2773a413fbc6","year":2022},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.497444Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:cdd0501928505a9330bf74580597f395b6835119246cf8ddff024480dbe252f4","observation_id":"389de93b-200b-4f6b-aa22-ce32ef49726e","resolution":{"observed_at":"2026-08-07T11:06:48.085564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.052859Z","title":"A framework for behavioural cloning,","venue":null,"work_id":"f644c4ed-a5de-425d-a582-132e1fc39bd4","year":1999},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.504779Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:25f4a71a74ae340969cc36c42415a278b21ad0c67489ccfae7a7f224f3552974","observation_id":"0b2a3f9b-c5c4-4ba3-8bb6-24d538ca433f","resolution":{"observed_at":"2026-08-07T11:06:48.059247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.026368Z","title":"Generative adversarial imitation learning,","venue":null,"work_id":"9c163fe9-47db-4529-96b5-1448acd805ce","year":2016},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.511187Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:18e024b461fd042c1f13ecf2e116c0fa450b4db568545b19bc287f7fd7a96c34","observation_id":"ee91778d-321a-480a-a9dd-e402f4b66a43","resolution":{"observed_at":"2026-08-07T11:06:48.037949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.985279Z","title":null,"venue":null,"work_id":"d8ccf6b7-efa0-44a4-a134-381ae31e347f","year":null},"citing_paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.517274Z"},"links":{"citing_paper":"/paper/2506.03568"},"observation_digest":"sha256:47404f40d41451b10f3af3f6e852cb6dfa8c71484e4f24e43f1237aa597eb64f","observation_id":"ec87f5b9-e218-4ec9-9066-043b308dffc2","resolution":{"observed_at":"2026-08-07T11:06:47.999906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03568","last_updated":"2025-06-05T02:35:36Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T10:57:31.810767Z","submitted_at":"2025-06-04T04:31:10Z","title":"Confidence-Guided Human-AI Collaboration: Reinforcement Learning with Distributional Proxy Value Propagation for Autonomous Driving"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2506.03568."}