{"as_of":"2026-08-05T23:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0482bcf40587005f289763578aa1653acb710f8cfa26c94524957ec02bd63faf","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.05172/citation-record","integrity":"/paper/2605.05172/integrity","json":"/paper/2605.05172/citation-record.json","paper":"/paper/2605.05172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.548591Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":"ab34e2a8-2ec1-4e3c-904d-9f66f83d6143","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:c9767888d60c946d301dc258bc8da90db96c06c52b13efa287fdd5acec55b15a","observation_id":"5602730c-eea9-4bb8-8ab6-0d835fcdfff0","resolution":{"observed_at":"2026-07-07T11:13:41.550048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.541323Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":"254f3e41-dfc9-44e8-9fa5-7891002351cd","year":2023},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:26b89b2925f84125797df45028ef73e96ca6cba6fc5a9daa62435e489d19ad83","observation_id":"ec675fdf-0f16-4ab3-9ae9-fe4362c8e060","resolution":{"observed_at":"2026-07-07T11:13:41.542569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5743.2025","doi":"10.1109/icra55743.2025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2025 IEEE International Conference on Robotics and Automation (ICRA), pp","venue":null,"work_id":"69abf874-f559-4fcb-a658-fd7f3a6a2304","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:aca6aa054f5ff824356a549309df825dc8f894d1453c3e39e397bde55928d58d","observation_id":"40fb11ec-a401-4d49-9371-4915c8b53d7d","resolution":{"observed_at":"2026-06-30T23:25:06.449172Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T00:49:15.263628+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T00:49:15.263628+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.577175Z","title":"Learning under misspecified objective spaces","venue":null,"work_id":"5f290333-2ae3-4272-aebd-e364d774998b","year":2018},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:5515d81c6d32732a4132d625ad5c3cf398bbcef130c47032ce919467a8cfb054","observation_id":"afcec783-e7ff-49f7-b16c-ba5c6cc6b472","resolution":{"observed_at":"2026-07-07T11:13:41.578393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.552472Z","title":"Berkeley UR5 demonstration dataset","venue":null,"work_id":"08f754ab-1c23-44aa-8108-238ec3a55096","year":null},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:0458d4428336e36ea31c9c7f5016c92bf9c6785085aa759c222e66f1494dd03f","observation_id":"cee03278-b4c2-46c0-bdda-6fe75859e134","resolution":{"observed_at":"2026-07-07T11:13:41.553573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.580875Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":"09017a14-db54-4c44-9196-5977c687955d","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:64ccbec79031c35783dd711969f92945af8cd49c71c05ae74d6491c2d46ecfd9","observation_id":"fbda2b36-d222-40b5-8850-acf6c272cfd7","resolution":{"observed_at":"2026-07-07T11:13:41.582066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.17564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T23:25:07.015250Z","title":"Accelerating residual reinforcement learning with uncertainty estimation","venue":null,"work_id":"7c5701b9-719c-4210-94bb-d013d0dab73d","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:9963bf047a5e102af354962ddcb7c5ba918ea0959d53337943f30d6bf5298711","observation_id":"090b4944-1677-4cef-9417-cdb2076198fa","resolution":{"observed_at":"2026-06-30T23:25:07.016936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:2b44eaddab37e8799566ad63b4a08a08d46489f86b8e6a46c456cad78a57c632","observation_id":"d828322f-2d29-4f44-a7f2-160889b7446b","resolution":{"observed_at":"2026-06-30T23:25:07.008761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-07-06T08:26:47.571015Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"1910.01708","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-07-04T19:30:07.900798Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","venue":"cs.LG","work_id":"399c3bf3-740c-41a8-bb6b-dfe1ea43e56d","year":2019},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:c8305932fa90b8631a8c86fcc4f1ac6227babee83ed218f35f516b82a3f484ce","observation_id":"b301ab83-4438-49ac-8af7-1f2ce61b8075","resolution":{"observed_at":"2026-06-30T23:25:07.011373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.582657Z","title":"Iq-learn: Inverse soft-q learning for imitation","venue":null,"work_id":"c9ef5f63-3e15-4b78-bd20-125d4be8ec09","year":2021},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:6b9d0eea3ba617e82ec8ad51b5e506e2303ced723dba0f9c6ea609ad21ce39ee","observation_id":"04ade8ca-0c7f-45bc-b8bf-78c093134bd8","resolution":{"observed_at":"2026-07-07T11:13:41.583858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.588108Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"b4cf1292-ef08-42d8-a4ef-6791a2adce77","year":2018},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:9feb3125d604d730234e6bbdeb81f53997f3c9966d2c35d16281c5b307b8f337","observation_id":"61193c24-ff50-4af3-9647-2e0712bb3ca6","resolution":{"observed_at":"2026-07-07T11:13:41.589328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.575384Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":"7b3b091d-33e5-4f7d-8c05-8187f9d3fb9b","year":2023},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:76848b9b2bf1fa3ef7f3b7dbc19dc876c556fc1f4281e25a8e9287f5219a4e97","observation_id":"ef12c4ca-ea25-453b-b74f-dac739faf1bc","resolution":{"observed_at":"2026-07-07T11:13:41.576621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:59:34.153323Z","title":"Streaming flow policy: Simplifying diffusion/flow- matching policies by treating action trajectories as flow trajectories","venue":null,"work_id":"fb89a567-a5f3-4b94-9dcc-7817cd6093cc","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:e31631d15bc5ce5ce6ab16b384435cd0761745fdd26f356e43e0811f929ebc17","observation_id":"dc07ca71-9f12-4533-ad96-e30468b741cf","resolution":{"observed_at":"2026-06-30T23:25:07.017300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.568422Z","title":"Residual reinforcement learning for robot control","venue":null,"work_id":"1267bad3-b23f-41c9-a672-101abd49df3b","year":2019},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:618c48dc8d7e8aaac8f559d182f21eaa930dbbc730476d3020fdd146ee9f937d","observation_id":"5e3db33b-65f0-477a-8864-9fe2681b38eb","resolution":{"observed_at":"2026-07-07T11:13:41.569539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.570087Z","title":"Kochenderfer","venue":null,"work_id":"dbf24a76-deda-4e4a-b191-9e658616463d","year":2019},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:7f59e8d213ba3a5a6ffa4833a63d8ba6add242ba72d885e4319f1d5a3e3bad46","observation_id":"3479c9a6-c299-4550-8fdd-defdc43c8018","resolution":{"observed_at":"2026-07-07T11:13:41.571173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.573495Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"5053c5ef-f54e-4535-b208-96bde72e71fa","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:0c7ba60e3d3b7434fdb002ee006e5ff21b9aee30768b0c774323e164edf4ff15","observation_id":"266fc8f0-5368-481c-8e22-1dc227da4630","resolution":{"observed_at":"2026-07-07T11:13:41.574748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.571748Z","title":"The boltzmann policy distribution: Accounting for systematic suboptimality in human models","venue":null,"work_id":"47913088-3baa-41db-b834-d21b89e3edc6","year":2022},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:bf469355983ee004f018525b2ce6bfade42f3bc05b69a8203683395d1ea1f636","observation_id":"b38b8777-5ff5-4285-9591-7cbe021e792d","resolution":{"observed_at":"2026-07-07T11:13:41.572938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:755926f1ebda1dfb3fba9212db2f29f3f76fb44dbad9e62d13b53aca891851ee","observation_id":"e7b46636-abdd-4eff-9a6b-205ad4755113","resolution":{"observed_at":"2026-06-30T23:25:07.019630Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:e16dd5ad80ca405d48c4860f291cf25c0c5d15f213262a3ad512b783fd431924","observation_id":"1ee4fa5f-567e-4480-84f9-50f2fd84a1bc","resolution":{"observed_at":"2026-06-30T23:25:07.009290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.556049Z","title":"Individual choice behavior, volume 4","venue":null,"work_id":"d6965283-6578-4959-81e9-013119fa9203","year":1959},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:0f3a388724e32feaa9ba48bc1209554f078973abb3124cdededbdeec2ad6c45d","observation_id":"f085d9e5-5610-4152-938a-fb62dacf2d2d","resolution":{"observed_at":"2026-07-07T11:13:41.557216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.559588Z","title":"Serl: A software suite for sample-efficient robotic reinforcement learning","venue":null,"work_id":"7717f843-c337-4836-8cf2-2958b9162605","year":2024},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:e7a1e473cfbc0f1d1b4108f00d457f6a6fa0b6227b44853e268797f8f0ee9bb7","observation_id":"8d774425-0168-4a58-9545-731ade182813","resolution":{"observed_at":"2026-07-07T11:13:41.560789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.557756Z","title":"Fmb: a functional manipulation benchmark for generalizable robotic learning","venue":null,"work_id":"b5485416-cdbe-4911-a609-d888a0d02295","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:b365f633208b652e414fb106784dbcedfa1cccb07be37f6f64d4b742d16a73ff","observation_id":"c8491618-9b9e-4e45-9760-05d901a53835","resolution":{"observed_at":"2026-07-07T11:13:41.559032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.563105Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning","venue":null,"work_id":"b19e5121-8150-4120-a0ae-715e16c30f5f","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:5a8a465e8c40878262c6b0670e1a43291fc62086a6bce76d1f63f846491ee5ec","observation_id":"ff3fb84b-bc06-4e46-b90a-2969a314c33e","resolution":{"observed_at":"2026-07-07T11:13:41.564289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.713928","doi":"10.1109/icra.2015.7139282","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Predicting human reaching motion in collaborative tasks using inverse optimal control and iterative re-planning","venue":null,"work_id":"0484f4b4-8a7d-4dda-9de8-840923d83146","year":2015},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:56d726a5a382b85c56eec4064489fabaee735a78a62e8c48a07e4dd214f993c7","observation_id":"1f0865d0-68a8-4228-885e-25fde3669b47","resolution":{"observed_at":"2026-06-30T23:25:06.444836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06085","last_updated":"2021-06-23T05:17:45Z","snapshot_observed_at":"2026-07-06T09:04:22.596181Z","submitted_at":"2020-03-13T02:25:28Z","title":"Learning to Generalize Across Long-Horizon Tasks from Human Demonstrations","version":2},"cited_work":{"arxiv_id":"2003.06085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.06085","snapshot_observed_at":"2026-07-04T08:59:42.173646Z","title":"Learning to generalize across long-horizon tasks from human demonstrations","venue":null,"work_id":"8c9ac350-e92a-4cba-bd81-de8c3c76a76b","year":2003},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2003.06085","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:eab6faf4d1b73995b5c9407d04874c89cbd62fb631439f7e8637e7718ec3a59d","observation_id":"d185f49e-a74c-4841-818b-4e1d1deb8645","resolution":{"observed_at":"2026-06-30T23:25:07.013978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2108.03298","doi":"10.48550/arxiv.2108.03298","metadata_source":"pith","pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","venue":"cs.RO","work_id":"6a4c95c5-540e-4854-946d-c7c8a6c540ba","year":2021},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:646564ae9d2307d056c01f00ef8b9bd49ddbca6ba479715ac385f7fb2af71c6d","observation_id":"5539257a-b5de-4170-bcb4-15e5ffda870c","resolution":{"observed_at":"2026-06-30T23:25:07.019368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.566645Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":"ff2fb6d6-a9c7-4195-b50c-60cf4009ec6c","year":2023},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:8ee0cd504ee3a63d505e62ba04b445d1f441149e2529cdf91a29a71624b4a81f","observation_id":"ce945726-8c85-482b-b5c2-109058879548","resolution":{"observed_at":"2026-07-07T11:13:41.567832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11435","last_updated":"2022-11-15T00:13:24Z","snapshot_observed_at":"2026-07-06T14:08:22.637175Z","submitted_at":"2022-10-20T17:34:59Z","title":"Learning and Retrieval from Prior Data for Skill-based Imitation Learning","version":2},"cited_work":{"arxiv_id":"2210.11435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.11435","snapshot_observed_at":"2026-07-01T10:45:42.668245Z","title":"Learning and retrieval from prior data for skill-based imitation learning","venue":null,"work_id":"29d4a24a-4b20-4818-ab6f-ecc7cb33092c","year":2022},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2210.11435","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:7aff714b7f4847cb6df884c938fe96902ccb3339061333f797bc0fa12d4ed8b2","observation_id":"4eaf58da-2f1a-4a59-8d03-2afb824aa92b","resolution":{"observed_at":"2026-06-30T23:25:07.024819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.586231Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","venue":null,"work_id":"c67bc930-7d3e-49a5-9f62-b24a9fc810e0","year":2018},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:725f91913b6dd37d212b0f330d5f0a258196e9fdbb04c8970e2d9d9b1b3c7a66","observation_id":"8bc422b2-a28b-42b8-ba0d-84a302031e91","resolution":{"observed_at":"2026-07-07T11:13:41.587523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.550660Z","title":"Efficient reductions for imitation learning","venue":null,"work_id":"fa4fe131-036a-4913-b8c1-83dcda43d0bd","year":2010},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:6f7a043bafc14a152f384d5c1ab1a5da562c3aa8b0448747eb821cf81729d006","observation_id":"18fb4877-2f9c-401e-a47a-1b5f33f24ea7","resolution":{"observed_at":"2026-07-07T11:13:41.551896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.544881Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":"97210c6d-3586-4b82-a172-675f79a8b493","year":2011},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:d765be6e58eaaa9ebe503a69dd9badc329c321dc61a54a0db2d7ab710eadac11","observation_id":"edba41ed-d8bd-404c-ab17-5a5529852dba","resolution":{"observed_at":"2026-07-07T11:13:41.546104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T23:25:07.013124Z","title":"Quantization-free autoregressive action transformer","venue":null,"work_id":"dae64ea9-5e23-411c-a9a8-1c6e1432e760","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:8fc34390b2efc23194310f60da32c2b8de7180e762cb11d3f1c5337d73dd32e0","observation_id":"87a40884-94be-492d-b050-86649de82208","resolution":{"observed_at":"2026-06-30T23:25:07.014602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06298","last_updated":"2019-01-03T18:11:15Z","snapshot_observed_at":"2026-07-06T07:21:24.277262Z","submitted_at":"2018-12-15T14:47:21Z","title":"Residual Policy Learning","version":2},"cited_work":{"arxiv_id":"1812.06298","doi":"10.48550/arxiv.1812.06298","metadata_source":"pith","pith_arxiv_id":"1812.06298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Residual Policy Learning","venue":"cs.RO","work_id":"fbdcb791-93df-43ff-9c10-353c4bb178eb","year":2018},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/1812.06298","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:627559e9e6f56f7592a2f0961becfbd146b44930feaf7aa81cc9ac884cfdf0ad","observation_id":"db5fba52-cb65-4be0-aec6-226e5f585cd7","resolution":{"observed_at":"2026-06-30T23:25:07.021746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:cadf620eefe46c7a0e29a9f65172732a77f543a61ce753cf60085868b1ea7fb5","observation_id":"fad9eb19-1d8d-4ff4-9d9e-0ec0316b1377","resolution":{"observed_at":"2026-06-30T23:25:06.995578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.579038Z","title":"Image augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":"bb01c42c-9f2b-4987-a475-3f0d87eb729a","year":2021},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:f5a62f3316e44101a4b8909927837c3e96f5dbc28ec08e7b5d2158cb73498c69","observation_id":"fad6c837-a116-4a1e-9048-48c49ec8ba58","resolution":{"observed_at":"2026-07-07T11:13:41.580296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-07-06T20:09:05.798010Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":"2412.13630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-04T10:29:45.616079Z","title":"Policy decorator: Model- agnostic online refinement for large policy model","venue":null,"work_id":"6481a773-21bb-487b-bad8-5c6d5af9cd6c","year":2024},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:bec672a1b64e445051ebb8090b8d47457a1a89c75d619770d195ee354c1afc1a","observation_id":"361f3720-953c-4b56-907f-ef6db5555a0c","resolution":{"observed_at":"2026-06-30T23:25:07.000747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.546681Z","title":"Deep imitation learning for complex manipulation tasks from virtual reality teleoperation","venue":null,"work_id":"bb0cb449-67e4-4f37-9f58-64c41439c5ec","year":2018},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:f5cd5aa6edbb6c04785ad48ab60d13aca8fb73b74317958d1b1d30ccf43548ea","observation_id":"ffb24849-a9e4-4a2c-888b-6c08219be25b","resolution":{"observed_at":"2026-07-07T11:13:41.547957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.584434Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"dab6140e-956a-43df-9e93-ff91cb427882","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:e450fdd0e0f05bd253801209e313bcee29691f0d0935586348901a52ebe1ed39","observation_id":"14de2f99-8035-4933-a6fe-fe78f40067df","resolution":{"observed_at":"2026-07-07T11:13:41.585649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:14:09.057454Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"48fc07f1-c31f-4d6f-9c64-61366ba8e156","year":2016},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:9224ce134d16a90359856976972b7ec3166141decc65a95204a401f77a29a6eb","observation_id":"274594d7-c1da-4d05-8b44-8b9a730cc74c","resolution":{"observed_at":"2026-07-07T11:13:41.591028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.554187Z","title":"Estimating mixture entropy with pairwise distances","venue":null,"work_id":"37496223-a5d1-43a0-abe5-a145f8215d86","year":2017},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:25d39bef10e19f38ba1899ee50ce1eb270f8dac8c0c258049c79fb9080a5d03b","observation_id":"a3ead827-a68e-4013-91a0-c583278eb055","resolution":{"observed_at":"2026-07-07T11:13:41.555446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.543097Z","title":"Fmb: a functional manipulation benchmark for generalizable robotic learning","venue":null,"work_id":"68d420e4-0588-4803-a6fa-ada0c7cea0a1","year":2025},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:b08927fe42ee9ce67e06b918063facc30d6407533cb53ad69222f8ff5576b3d1","observation_id":"12b3a106-9801-4736-8660-4e89ea1cb8ba","resolution":{"observed_at":"2026-07-07T11:13:41.544286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.561347Z","title":"Agentlace, framework for distributed agent policy, May 2024","venue":null,"work_id":"7bfdbaf3-0933-40c4-a0af-f0f84aa04e09","year":2024},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:f9d129ed549b5fcdd372a92c1a8a892a2f481781bd9798a8fa0d778d104989ac","observation_id":"44fe016b-b099-4bbc-8b46-a938939b96a6","resolution":{"observed_at":"2026-07-07T11:13:41.562573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.564874Z","title":"Daydreamer: World models for physical robot learning","venue":null,"work_id":"3edfdd75-89e7-4046-9e7b-090f21a42cc4","year":2022},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-30T23:24:57.811919Z"},"links":{"citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:4987ea75e4a08a8a0488ef08001dbbb55896ba8705a0eadb8bd71691de613314","observation_id":"4366d565-8ed3-4f19-b8de-df3e23f2dbb7","resolution":{"observed_at":"2026-07-07T11:13:41.566097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06298","last_updated":"2019-01-03T18:11:15Z","snapshot_observed_at":"2026-07-06T07:21:24.277262Z","submitted_at":"2018-12-15T14:47:21Z","title":"Residual Policy Learning","version":2},"cited_work":{"arxiv_id":"1812.06298","doi":"10.48550/arxiv.1812.06298","metadata_source":"pith","pith_arxiv_id":"1812.06298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Residual Policy Learning","venue":"cs.RO","work_id":"fbdcb791-93df-43ff-9c10-353c4bb178eb","year":2018},"citing_paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1812.06298","citing_paper":"/paper/2605.05172"},"observation_digest":"sha256:e2694c527b2de161052b3143050a1b1686ce32eab4941d14d4a18498c320b632","observation_id":"366ee27e-4144-432c-9abc-a9622a296745","resolution":{"observed_at":"2026-06-30T23:25:06.452640Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05172","last_updated":"2026-06-27T19:43:22Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T16:56:38.912629Z","submitted_at":"2026-05-06T17:40:11Z","title":"When Life Gives You BC, Make Q-functions: Extracting Q-values from Behavior Cloning for On-Robot Reinforcement Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":28},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.05172."}