{"as_of":"2026-08-06T02:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5779dbcfd36533985adc87987526c514a3df48ed6f9b8da520ca9f2f7867fdd0","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T14:57:49.542416Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T12:43:44.697996Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.09866","snapshot_observed_at":"2026-07-30T12:43:44.697996Z","title":"Robo-ValueRL: Reliable value estimation for offline-to-online reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23782","last_updated":"2026-07-26T17:58:47Z","snapshot_observed_at":"2026-08-05T21:21:45.801676Z","submitted_at":"2026-07-26T17:58:47Z","title":"$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-30T12:43:44.697996Z"},"links":{"cited_paper":"/paper/2607.09866","citing_paper":"/paper/2607.23782"},"observation_digest":"sha256:028d35b17c27e369296906e21a38648840271f6224034d67fefdc7e733a50074","observation_id":"6b1a3c85-36e6-4578-8995-10c26abf813b","resolution":{"observed_at":"2026-07-30T12:43:44.697996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.09866/citation-record","integrity":"/paper/2607.09866/integrity","json":"/paper/2607.09866/citation-record.json","paper":"/paper/2607.09866"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Awac: Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:34bc8db6f9dda6cb24ad3b1f4776dcfc8136c12b2d0fde25ff99e71eacab3db7","observation_id":"50263556-4fdd-426a-a44b-99cbef037a72","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Conservative q-learning for offline reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:4d997da6a3d47a6d257c920e18f6e84135afdc263e6a1aba4743521f3abc9fd4","observation_id":"051a79f4-edb9-404c-9c5c-746357829210","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:0adc2006bc8db5b12f5c2ebe7fda444da654baa96eea9a1dfbbb1519d3b9a7bb","observation_id":"623b2441-4071-4c53-b7c7-3d43ad02936c","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:3ce0374fe69d113c456e1f426b5ea0cad158e73a7027677d4c2ec6642cfb7a86","observation_id":"0f2ffcc6-3379-4e72-91c1-cb495c81f928","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:fa99f10252d3ce6de0577114208e8ab86c51fd55c728c354c5f8df8ba8260368","observation_id":"d50bb420-ea63-497a-bb52-ee7f17ec3121","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:980806d265d8a1a00b71ce6ee4030561bb1b718b2e7f4c38c7df71704a9d8f3d","observation_id":"8445b5e4-8191-43f2-a1fc-1bc1ea8050e9","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Openvla: An open-source vision-language- action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:6825c707b296b4983b0a6e41a3053eb5b90edcde39c966b532e290769a543a09","observation_id":"9b397f97-aa47-4945-8f6e-221215a5d993","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"π0: A Vision-Language-Action Flow Model for General Robot Control,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:1ecd991afb075c930794978b4d7e72fc9f375bedceb1514224768c436139c173","observation_id":"03721b18-45f2-40e6-a1d3-f46270a7da22","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:f4ed548d9a40506f95475ca92b36bf0b14604fb822e4701f031da3d2edec36e2","observation_id":"84616b7e-f9f1-429e-a5e2-0640efb96b00","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Pre-Training for Robots: Offline RL Enables Learning New Tasks in a Handful of Trials,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:cd6140e42e3201da920b6e0c019d160a6a422cb53bafc7ad99bb6f92ac1801f4","observation_id":"a75baee0-3cc4-416e-bc08-7f9b85f4ba01","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Robogene: Boosting vla pre-training via diversity-driven agentic framework for real-world task generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:d62188b14ab8079e75e6a0fdec3a19fb7d66ebac935f9c292e5dcd08f71227c0","observation_id":"b3ef8537-bbc0-4c71-8f3c-a1a2c3f39bf8","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:6539314566c6782d7ec736d9151f726c6581c92e17fe74aba668a25b52def984","observation_id":"559fdc21-c558-4510-a35f-b9c28a9b35ad","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Robot fine-tuning made easy: Pre-training rewards and policies for autonomous real-world reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:da80b293764fd0970e60d7be27f222b4d4ab574142b94eea4fead770925534d4","observation_id":"6526585b-7244-4585-9e09-75c595bd4552","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"SimpleVLA-RL: Scaling VLA training via reinforcement learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:bcac79a5d977b6cdc5b28ada82059c1cd6e1f38d4b8b68cea61875831688bdf5","observation_id":"d624c465-0148-49aa-87d7-86dc0e5cd2a4","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Phoenix: A motion-based self-reflection framework for fine-grained robotic action correction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:98e36c8b0a149d0d3fb34fdda5f033cdee1cf7c83fb5c7bebc2555f09e7c3f01","observation_id":"83f35c30-b2bb-4d69-af1c-60065ff9e5c6","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Human-assisted robotic policy refinement via action preference optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:d492b94d63c225e8ec756b03b2e13710e6f30129f3a1024073167ee63b0b9a39","observation_id":"f2045532-314d-4c85-a6ca-4600ffe36e44","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Geco-srt: Geometry-aware continual adaptation for cross-task sim-to-real transfer,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:a1d897b0cf6bccfdcc630619f5990b8a3d3fbbe9d5bd658df200095f1cf27723","observation_id":"20bceca7-f507-43cf-a628-f4099186667d","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Deep reinforcement learning that matters,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:6c267c2d5c3ff74f70778aa8a7237f39e6af9a738a5e467d7179f6383bbc7e2b","observation_id":"00a3e352-de63-40a0-83fe-51e1bd0933c4","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Deep reinforcement learning at the edge of the statistical precipice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:a56e5ea7b32589eb2bc2d5b844c41ad8e9798060cf3f80e4ddaf5293c1498e46","observation_id":"1e02aa08-7bf9-43d5-a0a0-13023ab3e298","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00416","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Learning while deploying: Fleet-scale reinforcement learning for generalist robot policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2605.00416","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:5853bb96fdb22580899248a1fb3125b42e659046a4a639a6b7122698b5a69e41","observation_id":"30afc46d-77f9-40f2-8f24-ea6c22132644","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Suf: Stabilized unconstrained fine-tuning for offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:d875c157890690fe25eba1d51a4c0673a22980293831d57692120a83c498eea4","observation_id":"9673a0d2-f7e2-4726-9280-033af1e9cb7d","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:ae800bec1af8c266cade81c934d9dce04b20314b954435d51242520d1a3c8e6d","observation_id":"08d22497-249b-4301-9a13-2298ccc79f4f","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"pi*0.6: a vla that learns from experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:3ccf6c4480d7cc1c6ef558fa0fbeccf863d162a4540f80e3b4ef329633489208","observation_id":"c96d70e9-1539-4d9a-aae2-51cb3d61555f","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"What matters in learning from offline human demonstrations for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:302baf31f0f61d303d7f46fdcbd5363fb968a19625fdafc5724dace565bd10cf","observation_id":"bec0c268-5d8b-4cce-ac01-c31138ed87c9","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:0bd078e80e717716996c13e9bd515768598390eee65b90249ee6a7087fdf2a4c","observation_id":"d1b91834-faa6-4088-ba45-e858cee524ea","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Gr-rl: Going dexterous and precise for long-horizon robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:2367e28c7f9deae0e67cafa7ca5172847979c427d7ce0803a4dd9e74e1227552","observation_id":"b6f568c5-bf70-437c-bc2a-3641a8206244","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"VIP: Towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:70cf991c6d38424bff3299f1047354e01e809960303c762583225e075f8c2028","observation_id":"e193dcf8-6894-4db5-a786-093a6109a036","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Conrft: A reinforced fine-tuning method for vla models via consistency policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:fad54f63d758f5325e3d2d734df3c3202d66210bd0a056319afb2c2528a53fef","observation_id":"f44fa275-83f7-426b-8b2b-95ead89734fd","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Consistency policy: Accelerated visuomotor policies via consistency distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:dd17a02438a2cd55974df13241a5ddd29428472f75f23a97eba9b88ab88c4c85","observation_id":"a9070b42-f7ad-4792-a1c6-c43588c3b3d6","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Learning from imperfect demonstrations from agents with varying dynamics,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:ed7d8aca3040901162adc78d9e3d93e976028aa821c1c9ef80e2b10aa3710cf4","observation_id":"fe0da0c2-cabb-49b3-b450-035efd82fe4c","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Curating Demonstrations using Online Experience,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:57a91cf140345d42471a12b8503203663f52a31f4b9d2e1b0eaaf21ac9fa4ca0","observation_id":"e5838b69-9958-44a7-b038-f18b9a758597","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Octo: An Open-Source Generalist Robot Policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:2ab45aef4d4abff591792dc6b5869238bfbf93c7b6fbd7d65d134b8441460755","observation_id":"b63129a2-b76e-4db5-8709-cb0878d0d636","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Xr-1: Towards versatile vision- language-action models via learning unified vision-motion representations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:6fd5be5df2960ba8262cd8e259bb5efa5191eeaae81a8368549b3f75d985c553","observation_id":"9cad58b3-f1b7-4482-996c-1e9d086702ba","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:fe0fca8504ce07c339aeba64a1b21f7575df37c159ea5ff4926240432de9d135","observation_id":"03b5fe24-5f32-4c28-886b-63ce8d60a4c2","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:943b1dc9e476477ddebb376513d9ae3b9e42ab699fd224768311f450954fce93","observation_id":"20092fc2-7cd1-4b61-ac37-8abc71913b09","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Policy expansion for bridging offline-to-online reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:f826c06da5e665767bed35ce055628e89caf114541e70f63b26413b0eb82619b","observation_id":"8f15ee8c-276a-4511-83e5-30b498f521ce","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Q-transformer: Scalable offline reinforcement learning via autoregressive q-functions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:b84990ecb2962d01830ee7894c7d7a31e65ebc13294adec92a381dd2c29ce56d","observation_id":"70cea663-cafb-4c94-a5a9-5709e7c4cba8","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17396","last_updated":"2023-03-30T14:08:31Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T14:08:31Z","title":"Finetuning from Offline Reinforcement Learning: Challenges, Trade-offs and Practical Solutions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17396","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Finetuning from offline reinforcement learning: Challenges, trade-offs and practical solutions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2303.17396","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:237af6970156dfa56db59da8dbbd208cb206145a44662ecf6051d52712a04d5b","observation_id":"ca81e43d-d058-45b3-b7a0-2de550c049aa","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Learning to predict by the methods of temporal differences,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:05433bdb7b5dfe58787e9c3b5735e77d3b71ebd82f0aee162caa259de545d746","observation_id":"017da096-c3f4-4e4d-b475-bf100d9f0af6","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Analysis of temporal-diffference learning with function approximation,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:2b20f8d51e7bda62f99d4f0b2bbadb09e3fdb1c1a18ea0faa9dbc8227591b9cf","observation_id":"4b495f60-d9ed-4301-a628-679387c354db","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Fast gradient-descent methods for temporal-difference learning with linear function approximation,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:85d8f3285c2df61ad26b0d7f397a34ed6cbc41d451e92b452110bd65ac46b41e","observation_id":"a43b8e8c-b242-4990-aca5-fcafd790b9cc","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:af4ad7c1a6be176c39467487a04ae8f8e21801bb4c8fdcf690094ebe26999eef","observation_id":"d1605b3e-a32b-4eaa-9741-10af9dab2970","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Benchmarking deep reinforcement learning for continuous control,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:e15f7f8283ada68066174f52e228b1fc4cc41bc96f08e4bfdebde4eec535d258","observation_id":"241cd020-8f64-4623-8456-a3dfb70ce679","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:29c6f1096940cb36d5aeae9c661612b9bc12d0f0f52927369f6e09931c71b345","observation_id":"624625ae-12fc-4932-a403-aa7e35dca02f","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"A vision-language-action-critic model for robotic real-world reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:74fa29628b7c1e9543011f776f5f44285829cf9ff3058a4869cd76081413a517","observation_id":"3d6d0eaa-823d-4128-9f18-ba2cce5b14e1","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"RL-VLM-f: Reinforcement learning from vision lan- guage foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:7d97dd2b71c0bef1857f8843d12b54b99794d4f9a6a24c754e97da0ebeaa719b","observation_id":"ba35709e-b3b6-4f60-bdf0-0ea88ec5b6a9","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Rank2reward: Learning shaped reward functions from passive video,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:22644f163e93ac388d067c4655f8ac63fdb698733307a74a6ee7b3a78d63dc2e","observation_id":"b79ed692-067a-4099-ad10-64436323d7fb","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Vision language models are in-context value learners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:bb8fef2662962407b850068c0b093522569f8dc48a06f31d4773659d68227080","observation_id":"b56a7533-ef9d-4c49-9dee-33ddf266a7cf","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Universal value function approximators,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:d4e3945fa74dcb416a3a78a87b1888bed9f661eb396f2526b237494407654787","observation_id":"04c12ceb-5905-4279-b561-25c82c8f7040","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08168","last_updated":"2026-04-09T12:28:14Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T12:28:14Z","title":"ViVa: A Video-Generative Value Model for Robot Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08168","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Viva: A video-generative value model for robot reinforcement learning,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2604.08168","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:7f7134be0e941f4fd15c3defb2271ddea3a6b5a2d3f962863b8c978803912fc0","observation_id":"89aca5ee-1b6f-4425-82bb-501a60a67579","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.24742","last_updated":"2026-06-23T16:07:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-23T16:07:48Z","title":"World Value Models for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.24742","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"World value models for robotic manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2606.24742","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:a7ec92c67567962e2e5f11125901480805893195a3e5fcadc64571329789d56a","observation_id":"f395872d-654a-471d-9996-46b1785f3507","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Paligemma: A versatile 3b vlm for transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:87948fb6a35276e99856c2c90390e6b7aad6c53d7021a7fe80300f5039f51963","observation_id":"72620089-25b1-4214-b74b-ca1710b1e33f","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:bfa712b3f7a67c85e1e8acd545357fa653c3e8606435d9e1b319b7000446a79d","observation_id":"1d1623da-494e-4b9a-924c-b9adf44cce9b","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Perceiver: General perception with iterative attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:238b02e0de40f036f8db8d77e153260ebf4984e5bdef3eb26ebd5294892a7b23","observation_id":"21da14cf-bbe1-453e-b7ff-e99db9d5d115","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"Stop regressing: Training value functions via classification for scalable deep RL,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:1d0376b35c60a42ce9ea983b571a24fc9806a9116375345b555d14ae40614c7a","observation_id":"5dcfd6e7-403b-45c6-a4b6-1fdd5f111023","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T14:57:49.542416Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T14:57:49.542416Z"},"links":{"citing_paper":"/paper/2607.09866"},"observation_digest":"sha256:8ebd0bf6944805bc5707040b0ca2fef5e623bb79edc583214ad8c1439ed50403","observation_id":"803bbc2e-3f95-4b7c-b088-455ba9a92ae3","resolution":{"observed_at":"2026-07-14T14:57:49.542416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09866","last_updated":"2026-07-10T18:01:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-04T22:27:56.916894Z","submitted_at":"2026-07-10T18:01:05Z","title":"Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2607.09866."}