{"as_of":"2026-08-04T22:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:30ec44acb43ab9e336e9927b061a605563a403f7be1b9eda68af9bb4485e051f","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T23:44:37.937519Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T07:49:04.825693Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T09:59:44.623252Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"cited_work":{"arxiv_id":"2603.10282","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.10282","snapshot_observed_at":"2026-07-04T09:59:44.623252Z","title":"Update-Free On-Policy Steering via Verifiers","venue":"cs.RO","work_id":"43239bbe-09bb-4cea-9874-550d2f2f0551","year":2026},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2603.10282","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:4a3496a5fe31f53062a9a0aa0f8d6b25761fa74e350290e0e50f5924656c2ebb","observation_id":"b7b92bc1-0050-48c4-acbe-3b3b9dc122a4","resolution":{"observed_at":"2026-07-04T09:59:44.624465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"cited_work":{"arxiv_id":"2603.10282","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.10282","snapshot_observed_at":"2026-07-04T09:59:44.623252Z","title":"Update-Free On-Policy Steering via Verifiers","venue":"cs.RO","work_id":"43239bbe-09bb-4cea-9874-550d2f2f0551","year":2026},"citing_paper":{"arxiv_id":"2606.29201","last_updated":"2026-06-28T05:01:27Z","snapshot_observed_at":"2026-07-07T00:03:12.330608Z","submitted_at":"2026-06-28T05:01:27Z","title":"Behavior Uncloning: Distilling Mode Redirection into Policy Weights without Inference-Time Steering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T07:49:04.825693Z"},"links":{"cited_paper":"/paper/2603.10282","citing_paper":"/paper/2606.29201"},"observation_digest":"sha256:f686a2e565d5df79bea9a2176ea650fcf545547b7b7edae9d46bffedcf260d61","observation_id":"5cc91ec5-46c6-491c-8dc0-3db97183c7cf","resolution":{"observed_at":"2026-06-30T07:54:22.221272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.10282/citation-record","integrity":"/paper/2603.10282/integrity","json":"/paper/2603.10282/citation-record.json","paper":"/paper/2603.10282"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:fa9e97d0283ed8e86265f7d5ccbd9c7d21a3552dd5eb6ef6f5e6c3f320525cf0","observation_id":"b458c64e-d34e-4084-bbc3-8dc903467df9","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:1586a8e5ce486a14592eac1d2fcc1206063e8f34abe0e9739c8801659df497df","observation_id":"ec083a6f-bb15-4d7c-b2af-3a7d0a568bf0","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:b575a5572e24647ee64f3c0414b9bcffc607a758bd7fd8eaaf69b4cc64c13ecc","observation_id":"251fe879-9c30-4fb8-a078-3081649ed30f","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"π 0: A vision-language-action flow model for general robot control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:e293bd19138a16e28d92a721f182b1d672709b0a07937f7c25154f297b8c1bef","observation_id":"4352bd92-01bf-48d6-8248-5a25c8b1c5be","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:a77bab9eae71c3c75db5b2eb8ee8f89f07ebdf70ed3b909c80fe1fcee503bf95","observation_id":"99d45fd4-3fee-4dc3-b3a3-55fd57257ecb","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"What matters in learning from offline human demonstrations for robot manipulation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:bd0e6f0c7f75e182588c60f19cb0ec5019f8cf3198217020aeaa870d24c705a4","observation_id":"e30a4cdb-9f72-4481-8535-86653da50461","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"A reduction of imitation learning and structured pre- diction to no-regret online learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:6a00bd2aa453a0408c599297c76ae96d5b6a2351f3d130f24315d9f25116fab2","observation_id":"8e5db4ea-44f2-4bd4-9dbb-4b3a3387be0f","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Fighting copycat agents in behavioral cloning from ob- servation histories,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:2950ca544b6b2f1870a252fdc6b31831593d4104dd912c83a1225290e046cf9a","observation_id":"d5b73c3a-838c-44c6-88b8-2c2a465a8337","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Implicit behavioral cloning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:ce2e037414a6025f28bbc00b555d68de936392bd6f1e14c88ea2086bffca66ac","observation_id":"96a4faa8-1147-44b4-88eb-7cdd86131131","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06733","last_updated":"2020-12-12T05:30:35Z","snapshot_observed_at":"2026-07-06T10:23:43.246202Z","submitted_at":"2020-12-12T05:30:35Z","title":"Human-in-the-Loop Imitation Learning using Remote Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06733","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Human-in-the-loop imitation learning using remote teleoperation,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2012.06733","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:531b73f46474188541ca25d735be6470c54da64e2acfb12c043fc5f81e70e820","observation_id":"a3a8be01-3ea7-4dd0-bda0-397501c4f50c","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Behavior transformers: Cloningkmodes with one stone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:10f1c1ec2f15f8f98b35489b34e41cd34ddfd7f7bbf719b774f5d82e364692c4","observation_id":"0b3a935e-b90a-4643-9a07-42843266dd71","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:cbfeb58eb4392bd07be815223ec1d7a585c76a7834b437b37d3758d66b899e58","observation_id":"6bb49b78-be5f-4876-b2cd-498b3ac10b03","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Data quality in imitation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:2db9e0dc0dbb0efc86cfcb70a38916703aae5f2ffc77692de29575b25c9df141","observation_id":"9c994b07-11c8-4b0a-93d3-b178d2bbed71","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Hg-dagger: Interactive imitation learning with human experts,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:fb5a7077532cc97269a5c732bdb2bd08253ca6eac9b9d980108654449495f9d1","observation_id":"65a131d0-61fa-4890-8c20-fe387551de5f","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Dart: Noise injection for robust imitation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:105f66a837bbfdc38fed047ebfbf7c3dd29a403b537a33e2327153b9085896c8","observation_id":"9fe8249a-0028-45ec-a2e1-fffd94c92ce8","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Inference-time scaling for diffusion models beyond scaling denoising steps,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:9dfe32bd6a5c74864ff365f2fab3f03f34e9b25b2f483faca56d3042c083dd41","observation_id":"a103dd7d-0ca2-437e-b755-e5519c68a125","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Inference-time scaling of diffusion models through classical search,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:b77a5710e6bf973b68ecfe86360b85d590ac5168feb11ec1df1374aa5ec46490","observation_id":"81fd325d-c2c4-4af3-9915-e57bacce70b6","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Universal guidance for diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:35503a5a0e615a489cdc1864dc0e2c57be000829c5f06b44cae659ecb6e5ca2f","observation_id":"a9b1c9e6-4caa-4a2f-a85b-4257d267a118","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Dynaguide: Steering diffusion polices with active dynamic guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:260ee93a74932df49c9152e6a9d87dde4f5e7db2702477334fc518d6cd1ccfa7","observation_id":"136da44f-7fcf-4eb0-97a1-c3d8e39f21fb","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Inference-time policy steering through human interac- tions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:7431c569db9ae11e1843da080073bb2003acf2c4eec86da959ff5750628de7e2","observation_id":"2d2003d0-bd8d-4867-b0ae-fd22179a5421","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"From foresight to forethought: Vlm-in-the-loop policy steering via latent alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:1ce599aefa8b7229708602835e0493163433ea03af27db00ee2b43360dc69063","observation_id":"0223b433-cf1f-4b7f-9c24-937c7dce20cd","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Fine-tuning reinforcement learning models is secretly a forgetting mitigation problem,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:50263c2d9114010ca89b15f3934facf602a5c847416aa0c9436d325a031a03f3","observation_id":"333d83c1-d898-4070-9cff-ddcff4b97d7e","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Robocat: A self-improving generalist agent for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:cfedd92cf2cb09e3a0cd70debc1e48924b721a95327f1bbbe6a89968944bd020","observation_id":"6768c286-cdfa-4714-aa92-7e99f1afcc3c","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Sime: Enhancing policy self-improvement with modal- level exploration,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:7af1384ab2efa37821290106f4d5aa59d6b014a98a61eac0bc67e63d9307ac45","observation_id":"d19371eb-a5cb-4f21-81de-07130a9a0bf5","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Soe: Sample-efficient robot policy self-improvement via on-manifold exploration,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:ac6c93b9ae1724f3d3385850b2e1485533721516e803fe7dc70e96589f568673","observation_id":"f1792a51-8ef0-4483-9753-e4280d59978b","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Selfi: Autonomous self-improvement with reinforce- ment learning for social navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:6761d1471cd5324e94bd2d192f3c5a6302c2e7c7a60f9514bb8b85f14002e040","observation_id":"26de344e-0a88-4b24-b07d-a11605ab8029","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Awac: Accelerating online reinforcement learning with offline datasets,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:82a20745dcc1265d49c731b5b87302031f32aaaaf8155256857b2aef1b84292f","observation_id":"bec5b23b-0178-42f0-ac97-d33b2a8c5717","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Self-improving embodied foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:1b0fd6b87990bc986dc38b78a6a15faf5dd458b03ceae1a57d22c33e65d1db06","observation_id":"177b5958-2f6d-4caf-bd64-c000e2a447fb","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10179","last_updated":"2024-10-11T16:30:24Z","snapshot_observed_at":"2026-07-06T18:00:39.863947Z","submitted_at":"2024-03-13T17:50:32Z","title":"Scaling Instructable Agents Across Many Simulated Worlds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10179","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Scaling instructable agents across many simulated worlds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2404.10179","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:38cfa5f878090f75dca027a4fbbf74908792fada7e85e1d7f6e7fe858775e0dc","observation_id":"f3f34b0d-c82e-4882-8232-b0ced5d43091","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Seil: Simulation-augmented equivariant imitation learn- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:4e429ef7d692266ccf442876852bb576427337708785203d042aae724b92e807","observation_id":"0a91c47b-ddc0-4bb8-886a-204ae4ff0e0f","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Self-augmented robot trajectory: Efficient imitation learn- ing via safe self-augmentation with demonstrator-annotated precision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:d90bc918b8dcade328599b0cd2e1878a3a9d6ab642227c4cfd71ffd451cd4402","observation_id":"d544eb13-b496-4c01-b33c-8b239665a5c8","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Curating demonstrations using online experience,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:72ec17027a7f937dfc0b0bf4f07f7d52ea601c0a13343a7258111c935fe66439","observation_id":"bd9fcc78-4b49-476c-a6e3-fec1e2facd9b","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Is conditional generative modeling all you need for decision-making?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:76527c2a029d8af9cf751f093b247ca565b422d3b6eda9b8c539f925299cf760","observation_id":"bfa3b500-bf5c-4b2a-950e-7c42c4aca8d6","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-07-06T21:32:57.510891Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Diffusion guidance is a controllable policy improvement operator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:cc4603981dd383e9af05726d9b046d48c498fba94cc1890b79547f399872854e","observation_id":"99916ee1-1754-44d0-ac18-3fa2ad6c56d5","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Bidirectional decoding: Improving action chunking via guided test-time sampling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:9d6f04eb0f96d3c66ace4bd5f317fc79f0f5fa2b123ed1ef04840e0a207d6616","observation_id":"bc5198ba-3e43-4280-8cea-1eeee4990551","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Steering your generalists: Improving robotic foun- dation models via value guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:86bc59b5b34f4f1b1e6d4dc898b4fa8e0c3c3f19e6b7b0198c071a8f03468115","observation_id":"95cb89bc-bd91-4549-980e-0c8003013f87","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Steering your diffusion policy with latent space reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:c5f19bcab34a5d1490a14a56bc872638382b2dd3009d753f85ca88cf90c2e312","observation_id":"815357fc-fe62-4997-abb1-ac14439895e2","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Behavioral cloning from observation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:0253eb32b0793d5b1bce60cd3addab7dc05b05c290ba64f53e7192e1283be436","observation_id":"88977c50-aab6-4d56-b40a-eba76f4b4f04","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:31060d2638ea018fbedd1cc43d076d3154da9ca79606d8de706f84f2a1178ce4","observation_id":"2f832458-e998-4444-9632-c5872fa4ea9a","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:f6bca09ccffc3cb4cee04b2a58349e98dfd7d2e65dcf0748995b79dc4341c983","observation_id":"7a428a7c-712a-4176-953d-daa0d2d510f2","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:616db96a22102271a6ee2aa9706ee0c162af6bfaa80f48dca334b275ca168737","observation_id":"8e9bd8bf-a950-4289-b188-a9d51f0deec5","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:a3e4cfa35de7dd0f5d20ff833bb75f5eb51f7d0d0d1c84bd81ecc51e874ac57e","observation_id":"c47ee81d-eab6-48a2-8679-a87ef6beb72f","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Implicit generation and generalization in energy-based models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:74df121d68a0140c9df31b067c47066be5c92164d41fb270eead5150d64c2006","observation_id":"cf62e0ac-6c58-417e-b5ff-85a99dfabc72","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:123a44db1054a2797e7bd2249977397cede97da31bab0d167cdda34fc031fda5","observation_id":"d6c36d89-dcc2-475b-b267-023495955fb2","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Dimensionality reduction by learning an invariant mapping,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:583a3f86d617ef46a3bf6b3b909deef7dc1d95e367c216fbd76ae35387a1e235","observation_id":"574db489-54dc-426f-9ce1-3fc2ca63b8cb","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"A smooth sea never made a skilled SAILOR: Robust imitation via learning to search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:752b8fe7593d7510305bf57ec086abfb06841e8df4125283a888b587ba3d0230","observation_id":"243b8656-6784-4354-a18a-a96244682ddf","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:181eb1722d93cbc3045f7ed39fa1b5c3a53fcb39a2dfa6223600791508826597","observation_id":"5ca6822d-0c68-49c1-adfe-7083820cd263","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:ecaeabe25b9acd876829e9738b1f46640edf8193888dd2be0375b5175d5a8eda","observation_id":"3bc3b7c0-3cff-48f0-b901-bc1f141e678b","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00043","last_updated":"2018-04-13T13:30:28Z","snapshot_observed_at":"2026-07-06T06:07:05.119814Z","submitted_at":"2017-10-31T18:31:11Z","title":"Unsupervised Machine Translation Using Monolingual Corpora Only","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00043","snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Unsupervised machine translation using monolingual corpora only,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"cited_paper":"/paper/1711.00043","citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:503c00b0b5cdafacf5a549693b30844928b8221dfe07d564ad31ceab8b6fae83","observation_id":"5505ee8e-646f-4dc9-999a-d6e526b0fb0f","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Interval estimation for the difference between independent proportions: Comparison of eleven methods,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:bc298204fc2448be3885166a5e480dc2e23037e67e0253fa9cef995f96c241d1","observation_id":"136942d0-f594-4853-a099-165c3cac9fee","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:33e2d95f659baf78a63dff6e7eef8de636b118a01a7619ee405a5920253a0f5e","observation_id":"78780e70-87c6-4ce7-8b3d-444b53de9727","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T23:44:37.937519Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T23:44:37.937519Z"},"links":{"citing_paper":"/paper/2603.10282"},"observation_digest":"sha256:6d22b63ec35f957ddcb73bae7eb170d876aaf227f78b145cfd4a5c5a2cbb6315","observation_id":"9ffd1e20-75a3-429c-ac98-4640ad659f07","resolution":{"observed_at":"2026-07-14T23:44:37.937519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.10282","last_updated":"2026-06-01T15:49:03Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T18:48:18.111006Z","submitted_at":"2026-03-10T23:55:52Z","title":"Update-Free On-Policy Steering via Verifiers"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2603.10282."}