{"as_of":"2026-08-23T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6300a70dcb3f935ff8e420541ebd904344edb2300208650454eddd67832ab4d9","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T06:00:50.704572Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.04712/citation-record","integrity":"/paper/2509.04712/integrity","json":"/paper/2509.04712/citation-record.json","paper":"/paper/2509.04712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.503049Z","title":"A survey of autonomous driving: Common practices and emerging tech- nologies,","venue":null,"work_id":"450aa684-58aa-481f-a0ab-91520bcc0fa3","year":2020},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.507442Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:59b11dacabb24eadc96f4507b040a15ce92e480de529ee01aa275f84ad344fa0","observation_id":"ee52a3a2-f5b2-4319-a44f-364d299d5565","resolution":{"observed_at":"2026-08-05T06:00:51.509243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.478599Z","title":"Lane change and merge maneuvers for connected and automated vehicles: A survey,","venue":null,"work_id":"10f67e8c-8b74-437f-bc6c-d5134938a364","year":2016},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.513003Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:00b8d3d4c28e6a8d58aa7c78d07923d34149c480686e15ac9e7105be62a6ab57","observation_id":"0cb7e546-170d-4ba8-8088-1d89d2e43943","resolution":{"observed_at":"2026-08-05T06:00:51.485506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.456283Z","title":"Automated lane change controller design,","venue":null,"work_id":"af5f0da8-1f26-4193-9005-c1008b87af9d","year":2003},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.518589Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:8a76c9f05814e055cd58aa1c001cd0ce814be38a3ea01b474f04620765288a31","observation_id":"c93f8b65-980f-45c8-a51a-d3fb682a2c58","resolution":{"observed_at":"2026-08-05T06:00:51.463003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.428017Z","title":"Traffic dynam- ics: studies in car following,","venue":null,"work_id":"da2805e2-5bde-4be8-9aa2-9d7eab610535","year":1958},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.523478Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:902a6c4a220d607d074a852639420c01c9df371bc6f332e23e93a2fa32234a39","observation_id":"0f9284b2-f756-4e47-8754-778eb9f38f79","resolution":{"observed_at":"2026-08-05T06:00:51.434134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.399412Z","title":"A behavioural car-following model for computer simulation,","venue":null,"work_id":"10095791-e4f8-455c-aa43-86d8dfd83553","year":1981},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.529563Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:a1acfc8e84dd06ac14f745e4c1dcc36a3b17246f7f62c8a7135695cd6e094d18","observation_id":"f33213f1-b4a5-466d-837b-0d1dfb435c13","resolution":{"observed_at":"2026-08-05T06:00:51.409275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.535468Z","title":"Congested traffic states in empirical observations and microscopic simulations,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.535468Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:84b913d591c6e09ec7a0cd479eee75c55b99c136f9558fd67f3e39b33621c7b5","observation_id":"8b341eb3-75a1-4475-bca7-c7d6930636bc","resolution":{"observed_at":"2026-08-05T06:00:50.535468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.541460Z","title":"General lane-changing model mobil for car-following models,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.541460Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:2a0d63be8ef1d3f5f9a90953a8de5f6c7f7a0cbdb69f58de51d75e98f058b5e4","observation_id":"20015de6-1c5c-4f10-aa39-1b2aa8b98703","resolution":{"observed_at":"2026-08-05T06:00:50.541460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.339351Z","title":"Driving intention recognition and lane change prediction on the highway,","venue":null,"work_id":"eaf0a7f8-eae3-4b6f-b1a2-3efc61dc7d1b","year":2019},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.546470Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:89f823276c4b166451b08d58b0e5dcc78577af19a94dfaba0116d19c60156891","observation_id":"6715f95c-e45f-4db3-8ba8-878f389d535c","resolution":{"observed_at":"2026-08-05T06:00:51.349165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07316","last_updated":"2016-04-25T16:03:56Z","snapshot_observed_at":"2026-07-06T04:53:59.754200Z","submitted_at":"2016-04-25T16:03:56Z","title":"End to End Learning for Self-Driving Cars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07316","snapshot_observed_at":"2026-08-05T06:00:50.551475Z","title":"End to end learning for self-driving cars,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.551475Z"},"links":{"cited_paper":"/paper/1604.07316","citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:f2245f760e206d50d7eab585133e758bb44ac84aa6ea14069c8b514ff4375bc7","observation_id":"c24b7b92-da87-4042-8347-13feec93eedd","resolution":{"observed_at":"2026-08-05T06:00:50.551475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07911","last_updated":"2017-04-25T21:25:41Z","snapshot_observed_at":"2026-08-16T01:14:39.628559Z","submitted_at":"2017-04-25T21:25:41Z","title":"Explaining How a Deep Neural Network Trained with End-to-End Learning Steers a Car","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07911","snapshot_observed_at":"2026-08-05T06:00:50.557642Z","title":"Explaining how a deep neural network trained with end-to-end learning steers a car,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.557642Z"},"links":{"cited_paper":"/paper/1704.07911","citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:6dcda9d00154609f52a5955b3c3826cf7fd23944ccac416971e3ee7230465e7d","observation_id":"375a326f-43e9-4b16-9a36-85937ffbcd2e","resolution":{"observed_at":"2026-08-05T06:00:50.557642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.310962Z","title":"End-to-end driving via conditional imitation learning,","venue":null,"work_id":"15e31e09-631f-4fbe-9f65-5b12d5be7c39","year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.563235Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:85bfdb5a253b3d9038e552963942d00a6c39ad007825d8be876e2673ff2872a7","observation_id":"55b9b7e8-12ba-4701-a5b2-05f268b3e490","resolution":{"observed_at":"2026-08-05T06:00:51.319836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.285453Z","title":"Urban driving with conditional imitation learning,","venue":null,"work_id":"90f67fb5-fe87-473c-a17b-5b91a1a84a99","year":2020},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.567984Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:42a3fe556889cc407cee9ac58a627a4ad928849999887fdbf8223b2ce59f8ef5","observation_id":"36b2f5bc-7278-495e-8fb1-8b47a0162173","resolution":{"observed_at":"2026-08-05T06:00:51.292253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.573228Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.573228Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:ffef313d7a9afd6c1ae65942f1ad7f01e51bab4c2279f970a4cb00b73492f7c2","observation_id":"55972cc3-481a-460e-a29a-3e839dd90330","resolution":{"observed_at":"2026-08-05T06:00:50.573228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T06:00:50.578999Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.578999Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:71d9ba592e23f7539d770dbc89760678111b60a8628e57ae2a7a0a378c2b6a1c","observation_id":"d9bb2ed2-0075-4f50-a6b6-bf88234ca509","resolution":{"observed_at":"2026-08-05T06:00:50.578999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.584294Z","title":"Soft actor- critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.584294Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:1c966578376ec4b184859ba736ec48edb07a64c3d037e000c8362de5e0eaa17d","observation_id":"0beb63b8-ef8f-4cca-a6c2-26501b0a1cd7","resolution":{"observed_at":"2026-08-05T06:00:50.584294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14992","last_updated":"2025-01-25T00:00:11Z","snapshot_observed_at":"2026-08-20T23:12:04.790037Z","submitted_at":"2025-01-25T00:00:11Z","title":"Extensive Exploration in Complex Traffic Scenarios using Hierarchical Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.14992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14992","snapshot_observed_at":"2026-08-05T06:00:50.794346Z","title":"Extensive Exploration in Complex Traffic Scenarios using Hierarchical Reinforcement Learning","venue":"cs.LG","work_id":"80c0abb1-b8c4-490c-a9cc-65107a91bee3","year":2025},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.589688Z"},"links":{"cited_paper":"/paper/2501.14992","citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:61c82d9fa983bfb20d0df1b352e4ccd7d2887b318a7141ef92a9867a9e5b98be","observation_id":"c6c14dc3-1631-44ad-a571-876a55ac214f","resolution":{"observed_at":"2026-08-05T06:00:50.800160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.233638Z","title":"Exploiting hier- archy for scalable decision making in autonomous driving,","venue":null,"work_id":"ae9f8dab-367e-4ba6-be92-ceb7bd304b6f","year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.595194Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:09a0f922596caeda8107166d6035530ceb105ec3fbf1905ed7daacf3600e3254","observation_id":"f30b5aa9-2645-4da6-b0cb-3c763ee0f7fa","resolution":{"observed_at":"2026-08-05T06:00:51.241149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.209139Z","title":"Learning hierarchical behavior and motion planning for autonomous driv- ing,","venue":null,"work_id":"0a1849a2-c5bf-4df1-8305-f53bb471ab50","year":2020},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.600298Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:1016d42bdbba2efdb897636203f0e61309b0040ec859c87ba118d1c4ad0b8dea","observation_id":"82cfd841-8194-4b4f-a592-e118644d4a2f","resolution":{"observed_at":"2026-08-05T06:00:51.214963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.189223Z","title":"Deep hierarchical rein- forcement learning for autonomous driving with distinct behav- iors,","venue":null,"work_id":"a180993e-8325-4da4-bc5b-7018722182b1","year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.605747Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:fcf637c2f75e931fa388ffbed5e9a8f5922fb7b7b31b2f6e7cf87ff7ac98420e","observation_id":"442e7056-f63b-42d2-9cec-8e1fe35220f9","resolution":{"observed_at":"2026-08-05T06:00:51.195558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.167084Z","title":"A rein- forcement learning approach to autonomous decision making of intelligent vehicles on highways,","venue":null,"work_id":"2f149ada-e0ef-476a-855f-eaa148526cb3","year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.611238Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:efb1de24f8fdae1d8df9bb43edd7f1671385403e34250d62da53bdd09eab54f9","observation_id":"9530e4af-1363-4bc5-8a88-e4d940d0f112","resolution":{"observed_at":"2026-08-05T06:00:51.173646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.146494Z","title":"Integrating deep reinforcement learning with model-based path planners for automated driving,","venue":null,"work_id":"eac10139-76d3-44ab-a3ec-da72f113b814","year":2020},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.616865Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:b5dc9b1156be1bc50919e79125b4b324b417162f74391986e1221bc6a2058fd9","observation_id":"9b9c98ce-ed79-45fd-a6dc-46550f4f3f75","resolution":{"observed_at":"2026-08-05T06:00:51.153412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.125315Z","title":"Lane change decision-making through deep reinforcement learning with rule- based constraints,","venue":null,"work_id":"51a7f78c-658d-48b0-af73-16de086f1b0f","year":2019},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.622546Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:8fe9bfccf406622d2988d4ba0b5d12abf78041a35952b051f60d3cec36efeeaf","observation_id":"3a1a448e-32d0-4c06-8cad-5fbcedbb70ff","resolution":{"observed_at":"2026-08-05T06:00:51.131439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.104218Z","title":"Combining reinforcement learning with rule- based controllers for transparent and general decision-making in autonomous driving,","venue":null,"work_id":"ab6253e4-0174-4815-a461-47f1cdb082b6","year":2020},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.627359Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:a19d0e78358d7020334365c4d8deb17c2fc30e3f64b302a5197fb5fcc827130a","observation_id":"202b78e6-34ee-4f55-b85d-e941086fc858","resolution":{"observed_at":"2026-08-05T06:00:51.110195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.080101Z","title":"A combined reinforcement learning and model predictive control for car- following maneuver of autonomous vehicles,","venue":null,"work_id":"b9f8c4c9-23f5-4913-9140-94842570758d","year":2023},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.632114Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:c484fcb6a50c9c8fdd8685f0924f29ed9f664f99c24a19943cc7b5bf1da69952","observation_id":"6948b72f-e7b5-4b3e-a656-133b06883507","resolution":{"observed_at":"2026-08-05T06:00:51.087262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.058052Z","title":"Combining reinforcement learning with model predic- tive control for on-ramp merging,","venue":null,"work_id":"d84be1c8-0eca-4e74-a10b-9d0e4fd88b28","year":2021},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.637756Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:eef820617044412d99f5decd0958b9f73a1b529b964c8f7c4d9ad208a40a4ccb","observation_id":"29d92c44-477d-48f7-b5f3-3535411ff1ed","resolution":{"observed_at":"2026-08-05T06:00:51.064224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08464","last_updated":"2019-06-20T07:05:20Z","snapshot_observed_at":"2026-08-19T20:24:07.091357Z","submitted_at":"2019-06-20T07:05:20Z","title":"A Hierarchical Architecture for Sequential Decision-Making in Autonomous Driving using Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1906.08464","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.08464","snapshot_observed_at":"2026-08-05T06:00:50.767166Z","title":"A Hierarchical Architecture for Sequential Decision-Making in Autonomous Driving using Deep Reinforcement Learning","venue":"cs.RO","work_id":"1aec5244-613e-4715-86e8-73af196e1e48","year":2019},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.642885Z"},"links":{"cited_paper":"/paper/1906.08464","citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:ca75a689ec090445f594d152ed0cff6cc9cee78d106b8fcc8bbef37963cdf132","observation_id":"fb03a919-7a64-4c50-8a76-44a78b66fd6c","resolution":{"observed_at":"2026-08-05T06:00:50.774633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.037510Z","title":"Driving decision and control for automated lane change behavior based on deep reinforcement learning,","venue":null,"work_id":"0e6ae5a7-91d8-4d47-b7e4-e94ce523c43b","year":2019},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.648314Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:6a42a81bbdf8bd0d65eaa69e3d2bdb884484d29760a8cbf34eb3f47dd9af1e93","observation_id":"94b4fe8e-3b93-44d9-8ac6-7d5ae5304ca8","resolution":{"observed_at":"2026-08-05T06:00:51.043596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:51.017860Z","title":"Prioritized experience- based reinforcement learning with human guidance for au- tonomous driving,","venue":null,"work_id":"454d2dde-5637-4ba2-8104-3c44a1d5196b","year":2022},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.653383Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:33a30f3acc95e659b7f1b5edd41f0c8b8dab36772743721f7a0b6f3bfbdfb520","observation_id":"2ad53c79-efa3-406a-94ca-e017a3af85d7","resolution":{"observed_at":"2026-08-05T06:00:51.024417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.991772Z","title":"Learning to drive in a day,","venue":null,"work_id":"0b20eaf8-fe58-40c4-b6b8-18604dfa0a51","year":2019},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.658528Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:6f55a394be162e3c6b071a3f971a7edec0a6263d8de2dd1bdef4affd65a5c812","observation_id":"27b91336-1d58-4653-afa1-78e13170692f","resolution":{"observed_at":"2026-08-05T06:00:51.002152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.972563Z","title":"Efficient deep reinforcement learning with imitative expert priors for autonomous driving,","venue":null,"work_id":"49ff8775-36b7-43c8-b87b-562dcefd2e7e","year":2022},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.663239Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:9f0950baa7ce08d6fb573707fc711d5c3a61195cc253841345f56b6047fa35e8","observation_id":"3b472d54-e28a-4949-b19b-de8fe36f6896","resolution":{"observed_at":"2026-08-05T06:00:50.978928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.668241Z","title":"Imitation is not enough: Robustifying imitation with reinforcement learning for challenging driving scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.668241Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:82140eee4fed2f9a4c5bc8e39d7fe37799c239dc9f323ff32022aecf77a66bba","observation_id":"6bda6f56-dce9-46bf-9fa5-8cbe3c6a03d7","resolution":{"observed_at":"2026-08-05T06:00:50.668241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.944458Z","title":"Boosted bellman residual minimization handling expert demonstrations,","venue":null,"work_id":"344f2d56-d2fc-4497-9dbd-a2fc07c1f412","year":2014},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.672879Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:b6a9bb96b3171fac68a47e0fd065df7a9f2b3b5248831634fde7505471da657e","observation_id":"19369424-5080-40a3-b3f4-36d24e2bd34e","resolution":{"observed_at":"2026-08-05T06:00:50.949614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.678081Z","title":"Deep q-learning from demonstrations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.678081Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:6b7f1891c1d981ff23f7b808b4f03e4c51e6f15ffb87d949b28631e87a96a16f","observation_id":"46d406f3-6250-4d75-a145-16ba275627c3","resolution":{"observed_at":"2026-08-05T06:00:50.678081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.683143Z","title":"Reward learning from human preferences and demonstrations in atari,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.683143Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:a8cf780bc944e2b9c80170dc2df7f00214a65539f418d2b2778f0d63db5db2c6","observation_id":"e453e3c0-12a8-4260-b396-4acb29cf25ab","resolution":{"observed_at":"2026-08-05T06:00:50.683143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11108","last_updated":"2019-09-25T18:44:47Z","snapshot_observed_at":"2026-08-19T12:21:53.633748Z","submitted_at":"2019-05-27T10:29:31Z","title":"SQIL: Imitation Learning via Reinforcement Learning with Sparse Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11108","snapshot_observed_at":"2026-08-05T06:00:50.687992Z","title":"Sqil: Imitation learning via reinforcement learning with sparse rewards,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.687992Z"},"links":{"cited_paper":"/paper/1905.11108","citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:bf1b24cefd19d522a5c027bcda2e35e045142892d551d04a6155c15292a6f33c","observation_id":"10074819-6656-4277-8120-92136c49b0d5","resolution":{"observed_at":"2026-08-05T06:00:50.687992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.901710Z","title":"An environment for autonomous driving decision- making,","venue":null,"work_id":"e6e432d4-4985-416a-9f81-94e6a5b963db","year":2018},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.694491Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:3ff6d10f1b118b403cde1a347279a64df9a8def979f46a35458e0b2146ae681e","observation_id":"55434cac-0246-4a85-b7ec-c8d4ce512d71","resolution":{"observed_at":"2026-08-05T06:00:50.907365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.880676Z","title":"Conservative q- learning for offline reinforcement learning,","venue":null,"work_id":"f583855e-d8c2-4a2c-b612-00fd017bd2ee","year":2020},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.699611Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:3e467da1081480326960277abe016937fc674f33ec7a09524b3ae702019d73c9","observation_id":"319d0981-1e94-4a81-a857-42912ccd75b6","resolution":{"observed_at":"2026-08-05T06:00:50.887294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:00:50.704572Z","title":"Generative adversarial imitation learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:50.704572Z"},"links":{"citing_paper":"/paper/2509.04712"},"observation_digest":"sha256:d75fed7a4ee14179b6041fbffe191d6ec9641fd0612cc654a25f0fba47167a0e","observation_id":"fc2ea35e-942f-4094-a434-f69b9e4cf02c","resolution":{"observed_at":"2026-08-05T06:00:50.704572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04712","last_updated":"2025-09-04T23:56:26Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-21T10:59:12.144763Z","submitted_at":"2025-09-04T23:56:26Z","title":"Bootstrapping Reinforcement Learning with Sub-optimal Policies for Autonomous Driving"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2509.04712."}