{"as_of":"2026-08-11T08:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8499adcfbd13033cb879a35ec139f31c339444cabd637c9c6b68b88d919d2ee7","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T00:02:55.449923Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.03065/citation-record","integrity":"/paper/2605.03065/integrity","json":"/paper/2605.03065/citation-record.json","paper":"/paper/2605.03065"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":"2303.08797","doi":"10.48550/arxiv.2303.08797","metadata_source":"pith","pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","venue":"cs.LG","work_id":"c2c7dd8f-fbfb-4591-89ec-9a3a0e6744bd","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:b691010cf49057e8c14e6dc87cee4a4d355ac33c4cc2dd7ff36bf68fed877040","observation_id":"6ac0b1b8-3d1f-4090-841c-1f42b4993154","resolution":{"observed_at":"2026-07-01T00:05:09.676445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/72.279181","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T00:05:08.772068Z","title":"Learning long-term dependencies with gradient descent is difficult.IEEE Transactions on Neural Networks, 5(2):157–166","venue":"IEEE Transactions on Neural Networks","work_id":"a6a7d71d-d4b9-4f4a-bd34-e010d6b09479","year":1994},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:8997ae632743bb9234f1a39e5ee69e228f8a0549ebf8a48d0d2fb04ea9f48a32","observation_id":"e96d7d8c-10ea-4970-aa9e-90730a5b9759","resolution":{"observed_at":"2026-07-01T00:05:08.773784Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T12:50:01.36483+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T12:50:01.36483+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2305.13301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-07-08T19:25:32.506868Z","title":"Training Diffusion Models with Reinforcement Learning","venue":"cs.LG","work_id":"67684dda-3930-452a-b91a-36cbb8e2e219","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:063ed176293b1e27194aabbd6f37cbde8417b3ba20723bf50bc7c33f7d262751","observation_id":"76562e94-ed6e-4e04-9278-9e2fe6457c2a","resolution":{"observed_at":"2026-07-01T00:05:09.726625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:6b78d132f900c74ab831cad0a62e91ade236a9c0180edb48ed13dcb5f166298a","observation_id":"22b44d03-983e-4d85-bc96-bb9f0b07a5bc","resolution":{"observed_at":"2026-07-01T00:05:09.678913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:c5ae2c69f744a06e82392dbdbd06993b4e4f427070dabfc85221c5d0e0570f8e","observation_id":"8d89a0db-29e9-447b-acf6-4dc613ddc45c","resolution":{"observed_at":"2026-07-01T00:05:09.681731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-07-06T10:32:46.366651Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":"2101.05982","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-07-01T00:05:09.694789Z","title":"arXiv preprint arXiv:2101.05982 , year=","venue":null,"work_id":"0c1147c0-154a-4b5b-9dfc-2b504c4b9b3e","year":2021},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:fc344a0d123af2ffe7e235d409cf6e09fd02b86c4a0b3155d890af8beca18643","observation_id":"2c6efab4-06a8-4f45-a19c-dc765a6f0c1a","resolution":{"observed_at":"2026-07-01T00:05:09.696207Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04137","last_updated":"2024-03-14T04:36:31Z","snapshot_observed_at":"2026-08-08T17:26:38.829859Z","submitted_at":"2023-03-07T18:50:03Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","version":5},"cited_work":{"arxiv_id":"2303.04137","doi":"10.48550/arxiv.2303.04137","metadata_source":"pith","pith_arxiv_id":"2303.04137","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diffusion Policy: Visuomotor Policy Learning via Action Diffusion","venue":"cs.RO","work_id":"2dce18e6-f07a-4f57-8a81-e71c3e6a293c","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2303.04137","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:d8bad6d47662d71b00ad3eeea64e5a1b28d1f2897c689db21453525e5aee4201","observation_id":"f24fe5e6-d9d2-48d8-a029-14f0bc103e8c","resolution":{"observed_at":"2026-07-01T00:05:09.688829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-08T11:51:09.954364Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"cited_work":{"arxiv_id":"2507.07986","doi":"10.48550/arxiv.2507.07986","metadata_source":"pith","pith_arxiv_id":"2507.07986","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","venue":"cs.LG","work_id":"9d0d5260-497c-4e71-8714-2a6320a486d6","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2507.07986","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:c57c4bf0d7fcdcd56745205646f7e3f815825a0e6acc5f03d9e2dfabcb480603","observation_id":"ec093a9a-b7b7-49a3-a3ab-a27d39b7e0b2","resolution":{"observed_at":"2026-07-01T00:05:09.712302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01561","last_updated":"2018-06-28T06:54:39Z","snapshot_observed_at":"2026-07-06T06:21:49.379500Z","submitted_at":"2018-02-05T18:47:30Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures","version":3},"cited_work":{"arxiv_id":"1802.01561","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.01561","snapshot_observed_at":"2026-07-04T14:09:52.701191Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures","venue":"cs.LG","work_id":"9bbfa31b-454d-4174-923d-06e74e0c6cab","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1802.01561","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:7bc4019ac9ecda7d0f9017f4864052e71aa23611204b6bc2c16837feeb67fe5b","observation_id":"c400599a-47be-4c03-b5fc-8696aad2b151","resolution":{"observed_at":"2026-07-01T00:05:09.721995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.364906Z","title":"Implicit reparameterization gradients","venue":null,"work_id":"b1c6ed9b-9b92-478b-9c51-62c4c532827c","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:e3ebf7b3758f7c27c0693c33ae05c4d97bc913305f486f27d23edf1231a0d29a","observation_id":"718720ac-6e24-4d11-9a34-0e915dc477d5","resolution":{"observed_at":"2026-07-07T09:33:36.366090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-08-11T03:25:10.354390Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":"2410.12557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-07-04T17:09:58.784233Z","title":"One Step Diffusion via Shortcut Models","venue":"cs.LG","work_id":"4017f821-b436-40dd-a38d-0b3bb52f7d99","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:f4a26d2367b78f941722f24b71dab7eb275b687356e3860fd8a2af65693f3b09","observation_id":"1fa0c259-8845-4328-bd98-786bfbffb5aa","resolution":{"observed_at":"2026-07-01T00:05:09.693742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:50abc8426c2e64b0b5bd6c410d178ae91f74bd90714ad19b396b9a4d452e8cc2","observation_id":"7f2b5ac5-f29a-402d-86da-8695f7888a87","resolution":{"observed_at":"2026-07-01T00:05:09.698570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.368420Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"65688e4e-9752-4f67-a379-4f61fc03c868","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:431b62e1d5344d164b367800f4b226008f2437be0a634097cab0734820c530ff","observation_id":"826bc7b6-a777-46cd-8bec-b6b2a8ac091f","resolution":{"observed_at":"2026-07-07T09:33:36.369650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-10T09:36:39.578860Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.11956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-07-04T13:39:51.078263Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":"ad002352-9797-48d1-b2ea-543ce79e8165","year":1910},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:1c25cbb7d64ee9b64e086be0b895a71d2c5acdb22f44e6d36e044ab7cdc5c84d","observation_id":"242da48d-3abb-4790-885d-79a84a51b9fd","resolution":{"observed_at":"2026-07-01T00:05:09.684233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:13:41.588108Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"b4cf1292-ef08-42d8-a4ef-6791a2adce77","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:3dabbe3b2dc7e4a61af26fa4695f64e88eba6ead8eafdbe9e115bac1c13f5276","observation_id":"9b1a8f0b-ebef-4659-bae9-c20cdb464f3a","resolution":{"observed_at":"2026-07-07T09:33:36.363407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:04:25.358219Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"710c2647-33ba-4734-bf16-86558f94d824","year":2020},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:bedd9e2686d3767c8a20f4b9ed4a1021cfe7cd131f3e0ca1c90140d625828698","observation_id":"1758a274-10c2-421a-84d9-a9a2f6b67ff3","resolution":{"observed_at":"2026-07-07T09:33:36.367851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":"2407.13399","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-07-04T01:09:19.256384Z","title":"Audrey Huang, Wenhao Zhan, Tengyang Xie, Jason D Lee, Wen Sun, Akshay Krishnamurthy, and Dylan J Foster","venue":null,"work_id":"3094f15f-8fc6-4f4e-be20-4b5192edcb91","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:ed6e28c54513fa5906cb41f4e1e2d3a3ad13c6256e117d219dcf2f7f1162d088","observation_id":"e3f67899-95f2-467a-8963-69b9da1675cc","resolution":{"observed_at":"2026-07-01T00:05:09.669377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:92119af72f233b372b3c22cd10b63e87ef104913fd6d08e07ef37779cbd4f58c","observation_id":"3533448f-c5f0-4446-b417-5e2ad50e496f","resolution":{"observed_at":"2026-07-01T00:05:09.718397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:9b70e82a146e1b05adfb4c035b1c05a88e966050001b34c9a6fc577e2da34ea0","observation_id":"f07f14f8-a433-4c7b-85e9-fe3c158a7592","resolution":{"observed_at":"2026-07-01T00:05:09.666809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.069069Z","title":"Rl-100: Performant robotic manipulation with real-world reinforcement learning","venue":null,"work_id":"a238fe03-5281-4ba1-9da7-5b7129dad2c6","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:b80551711279f3c9b95adf260a1eb59d01fffe42f621a7a1bc692ce3006c6a49","observation_id":"20ee65ab-e992-42e3-8906-0af0ad9a33db","resolution":{"observed_at":"2026-07-01T00:05:09.661869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"cited_work":{"arxiv_id":"2507.07969","doi":"10.48550/arxiv.2507.07969","metadata_source":"pith","pith_arxiv_id":"2507.07969","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Action Chunking","venue":"cs.LG","work_id":"d9b89a8b-b7ed-44cb-8c55-09d4c2b6e8a5","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2507.07969","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:78582a1f87cdc2dec2b38b8c0f0919fccf71414d47ed9a1f48e7cd010c2708d3","observation_id":"ac7c232e-910f-48e8-b43d-f7cc059fd905","resolution":{"observed_at":"2026-07-01T00:05:09.703276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:d5cac5607146e085be130c47eb43d28e967649c41d1dc20409e121a949c316d2","observation_id":"d1670ae1-8dc0-4b81-9e93-0f62e2754523","resolution":{"observed_at":"2026-07-01T00:05:09.710124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.359448Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":"450529c7-8b52-4c47-9149-8eef3d45d082","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:a03431357afcf0c32a7e6d3a6be6a6d8deedd160b26e960d24a77746f324ec45","observation_id":"875e7b2c-640a-4a2e-8ceb-1985281c6e68","resolution":{"observed_at":"2026-07-07T09:33:36.360744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":"2505.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-07-09T02:25:55.898592Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","venue":"cs.CV","work_id":"bf1e8e81-ff31-401a-a5dc-d9c49df168ab","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:0e032eb56d29940562a461ac20b219173eca396b0e32a79e2daccd8fb41d946b","observation_id":"4cd68232-5d9f-45f6-bc62-2fee9011ed3b","resolution":{"observed_at":"2026-07-01T00:05:09.659427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:787b3d1922f52c5405c6f4d8a0557d8bdc9b75e70562b448aa1dcae0c7fbb09f","observation_id":"25748936-99cd-4c1e-9a20-cd462e37b2ca","resolution":{"observed_at":"2026-07-01T00:05:09.664320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":"2108.03298","doi":"10.48550/arxiv.2108.03298","metadata_source":"pith","pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","venue":"cs.RO","work_id":"6a4c95c5-540e-4854-946d-c7c8a6c540ba","year":2021},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:5e8fe8bb61a91f036f1c49dd1218a314c3685e5ff80d4dc2ad3c867fc29db799","observation_id":"51d81c37-bc1c-4839-b742-29f641082b59","resolution":{"observed_at":"2026-07-01T00:05:09.671629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":"2412.06685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-07-04T09:59:44.649113Z","title":"Policy agnos- tic rl: Offline rl and online rl fine-tuning of any class and backbone.arXiv preprint arXiv:2412.06685","venue":null,"work_id":"2a03f472-6dc4-47bc-b5f8-af24611f1bb0","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:2b5fa9d6a318ed6ec0a57daa68c89ed8449b5db98dc89342acb9fe4993936fb5","observation_id":"c6b3ca7a-5ffb-44a1-9f66-0bf9626af0c8","resolution":{"observed_at":"2026-07-01T00:05:09.674048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21053","last_updated":"2025-08-01T13:04:28Z","snapshot_observed_at":"2026-08-07T22:31:18.221722Z","submitted_at":"2025-07-28T17:59:57Z","title":"Flow Matching Policy Gradients","version":2},"cited_work":{"arxiv_id":"2507.21053","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21053","snapshot_observed_at":"2026-07-04T06:19:37.772072Z","title":"Flow matching policy gradients","venue":null,"work_id":"bcbefc91-1cf0-4ec8-934d-2446d3ca740f","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2507.21053","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:a081bbe7d8228e9ba6cba1b670335ba195fd278619eef04772508ffa60fa506d","observation_id":"d1f51504-4b4f-4ca0-9bee-40f1946ef096","resolution":{"observed_at":"2026-07-01T00:05:09.701041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03426","last_updated":"2020-09-18T01:56:41Z","snapshot_observed_at":"2026-08-02T15:32:07.466568Z","submitted_at":"2018-02-09T19:39:33Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","version":3},"cited_work":{"arxiv_id":"1802.03426","doi":"10.1037/adb0001138","metadata_source":"pith","pith_arxiv_id":"1802.03426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UMAP: Uniform Manifold Approximation and Projection for Dimension Reduction","venue":"stat.ML","work_id":"54c15172-6304-4008-a3b6-c4cc0803c054","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1802.03426","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:c6f6b7d301ef1763a650310a6a40609f6eecb729f982af01e9ba7d6725441963","observation_id":"61bda8c9-cd75-41ab-89db-a16147a5a301","resolution":{"observed_at":"2026-07-01T00:05:09.686495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-25T15:24:07.856203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T15:24:07.856203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.361474Z","title":"Steering your generalists: Improving robotic foundation models via value guidance","venue":null,"work_id":"3a067615-1527-472c-a639-81aece67e268","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:6cb3eeec8330da5055b93c98eaaa0d12c4a4319e614e06a249c402c3aa32b5af","observation_id":"f28012cd-88ca-40cc-a7a6-200d7b3d585a","resolution":{"observed_at":"2026-07-07T09:33:36.362708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.365782Z","title":"Self-imitation learning","venue":null,"work_id":"66d6eac8-809b-4443-8a3d-29446e3bdfa6","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:ede088d7875172c8e6818f2c7908851feedd8fbcd8397adde11861c742baecce","observation_id":"82bbdec9-a19b-4bc5-ac61-840847a6ec38","resolution":{"observed_at":"2026-07-07T09:33:36.366900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.354288Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"ee9aa0b5-5aed-4ffd-b640-d1eec1f8e893","year":2022},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:cce0980e70d69723a0652c53ff86ba0e62552f966218cb1eb8bd2844e6eb651c","observation_id":"96f5956d-98bf-4472-abc2-40c0ee4b1942","resolution":{"observed_at":"2026-07-07T09:33:36.355488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01809","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:19:43.461685Z","title":"Much ado about noising: Dispelling the myths of gener- ative robotic control","venue":null,"work_id":"cab94379-b09c-4084-8de9-d49329d27cd0","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:ab75c850ec5951b8a85b6eab77a490bb0f65154caa123d71b0e59f978e33361d","observation_id":"74ca1875-142c-4ee6-9ada-bfd5271e0c0c","resolution":{"observed_at":"2026-07-01T00:05:09.654833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:0b16a38d64d76e95872b61c08f4b6e3f1d5129ac61eafcdcb8b05cf2e73dc4c7","observation_id":"05fabe9c-601c-4697-9543-92f0a4db82a2","resolution":{"observed_at":"2026-07-01T00:05:09.657171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:04:01.036320Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"b0ae75e0-8e63-4a82-a889-6637cc42d57e","year":2018},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:65ccb1af0c3cd7e7ecdff3e62275a9d09938f5abc64be9a8488cffd04c79fa45","observation_id":"cc0b41cb-7127-422d-a17a-d2688821a6a0","resolution":{"observed_at":"2026-07-07T09:33:36.357630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:39bd443e065ced0ec307fa5c864cf5311a57bd48d201cc6e0bb85c2d71f040b4","observation_id":"0fb987d5-a3af-463b-96b2-97cc4f8c2ef1","resolution":{"observed_at":"2026-07-01T00:05:09.691460Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.354469Z","title":"Information Theory: From Coding to Learning","venue":null,"work_id":"8d6a0e25-7bd1-4a8b-957a-58eab1c5aa36","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:70a6ab2bf266af8386d46f5c2c7b125f77a8a1436e61d17866df55b7f222ac7f","observation_id":"f35b40ff-a3e3-4c8a-bb2d-b5bc8413b31c","resolution":{"observed_at":"2026-07-07T09:33:36.355896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":"2409.00588","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-07-04T09:59:44.479162Z","title":"Diffusion Policy Policy Optimization","venue":"cs.RO","work_id":"c665cf26-fe05-4f5a-96cf-3be3407fa976","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:68578f7c9df4cf2339e3ab5a0a751b1fd705acbeb76ecf8a315e22592bdfae38","observation_id":"2af59ee1-3ad0-4010-935a-3ed5a7f4f754","resolution":{"observed_at":"2026-07-01T00:05:09.649912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.363194Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"c6402802-c650-4d78-8b22-0fed31fe8dab","year":2022},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:c6847fbd4d8f435a92e7fffc7ef7aca0c0737b13d7c6b2c14da28fec9ad47977","observation_id":"e22bb612-fe09-4054-9c4b-2cc9240603dc","resolution":{"observed_at":"2026-07-07T09:33:36.364361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.357806Z","title":"Trust region policy optimization","venue":null,"work_id":"674981ca-8dc5-497b-ae29-fc1eae61766d","year":2015},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:106a318d101c0a02f800105b0657a9fef009bea21b6b84dc8e21921e03b4d5c2","observation_id":"2f2da0d9-5324-4f28-8621-91f535dd0509","resolution":{"observed_at":"2026-07-07T09:33:36.358942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:67bc0876d1237d772c8076551e665af79a04fc06dd2c022916c50e1c13f5d2e1","observation_id":"4e406356-796c-47db-a645-4c6fcdf9c760","resolution":{"observed_at":"2026-07-01T00:05:09.647772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-09T06:45:47.107738Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:df509de13729022900db2ecc35810e22a4e17ba6f4b9fec4f03d5cb296831c7c","observation_id":"9de63b67-d0db-426d-ae15-87987fce5a98","resolution":{"observed_at":"2026-07-01T00:05:09.652333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:b57de2363981d2609064583b08e20424a262c0c3b3ed39f8c71c1078eba70f01","observation_id":"1c1afc29-c1c9-4d50-826b-43b5ac824d9c","resolution":{"observed_at":"2026-07-01T00:05:09.707869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:d6c5d7a1949fb1c9599195e62717894b21cfbd75356d731d05566eaa7652ec84","observation_id":"641428c8-6308-451c-952c-4f35cf1e688b","resolution":{"observed_at":"2026-07-01T00:05:09.705464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.356099Z","title":"Consistency models","venue":null,"work_id":"29ef97e5-1595-42a8-ae37-700711b13c20","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:512746297595aa7e40e0b2aec29668db0fcfee67df8d9a1fa499de677b9b9bc7","observation_id":"4da2841a-48e1-41ad-906f-22b7e271b714","resolution":{"observed_at":"2026-07-07T09:33:36.357242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.346401Z","title":"Do differentiable simulators give better policy gradients? In International Conference on Machine Learning, pages 20668--20696","venue":null,"work_id":"b8f05858-f4eb-44be-8e4a-6f5d86ea4898","year":2022},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:81ce468e16ff307d1e329550eec107d47b5fb4181242c79ceeaa8314f13ccbc6","observation_id":"5d78a724-dce9-4cc4-8e7b-f394573bde90","resolution":{"observed_at":"2026-07-07T09:33:36.347971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.367425Z","title":"Jump-start reinforcement learning","venue":null,"work_id":"af1710b1-7464-4498-badd-eb3545496887","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:6ca946d72459901e023315ad437165fbdca632188608645e8a5fec23045917d7","observation_id":"2b5dd790-ece3-4e16-a3d3-9ba8769b83a4","resolution":{"observed_at":"2026-07-07T09:33:36.368553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-08-08T08:13:32.220639Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2506.15799","doi":"10.48550/arxiv.2506.15799","metadata_source":"pith","pith_arxiv_id":"2506.15799","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","venue":"cs.RO","work_id":"9a890f5d-e935-4243-a46c-3637ed62e501","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2506.15799","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:7822fa26869e4f5089f5f2de7362d7003164f2242573fe65faddd1e66c50a230","observation_id":"a3361abc-5bee-4405-a918-7a7159f73ee3","resolution":{"observed_at":"2026-07-01T00:05:09.640722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.350563Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":"e23bce25-388b-4f96-b0b0-d73cc9f11d03","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:46953f6fa5d1191d7324978cb883835043071e80271bd1987e983f9ddd115b48","observation_id":"9b275baa-22b5-4e01-9924-3de4269dfa18","resolution":{"observed_at":"2026-07-07T09:33:36.351717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.369295Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":"9d890635-bdc9-4ada-a49f-5d9eeecba772","year":1992},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:6bfd7dbbcbb89c3d05e86f6d96f70b79eaad1717cc3be052ebef9313d301ae7d","observation_id":"b0014d3f-484a-48b6-8972-c028d1cd7f9e","resolution":{"observed_at":"2026-07-07T09:33:36.370461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T09:33:36.350740Z","title":"Diffusion models for robotic manipulation: A survey","venue":null,"work_id":"f84389b0-e682-4ad8-9922-6c0275bd9bbf","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:0e4b0e36d5d92334202fab495d2e9a234e7b928ef62720af63055aad832ce99c","observation_id":"64634089-8a90-4fd4-9cc1-cbc55417b948","resolution":{"observed_at":"2026-07-07T09:33:36.351866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04307","last_updated":"2019-07-09T17:46:17Z","snapshot_observed_at":"2026-07-06T08:06:38.202146Z","submitted_at":"2019-07-09T17:46:17Z","title":"Multilingual Universal Sentence Encoder for Semantic Retrieval","version":1},"cited_work":{"arxiv_id":"1907.04307","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.04307","snapshot_observed_at":"2026-07-01T00:05:09.713445Z","title":"Multilingual Universal Sentence Encoder for Semantic Retrieval","venue":"cs.CL","work_id":"bf497995-00b0-4ba1-9399-3ecf03b3789a","year":2019},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/1907.04307","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:2d05fd098f0a299aeee376732a38ada4cd115ab16f6923e4cf4d1979a54ebbea","observation_id":"672855d0-1ae7-4527-81e8-11987f4ee878","resolution":{"observed_at":"2026-07-01T00:05:09.714639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:18:22.949906Z","title":"Flow policy gradients for robot control","venue":null,"work_id":"d1e248f4-3884-4203-ac1c-e33d7c3c4537","year":2026},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:9668eaa477e0d30ba8792d90c54378a320801ecef6f46908ffba9d3af22b07fd","observation_id":"4124e0b7-f1b1-489f-b42e-b4610a8c1a21","resolution":{"observed_at":"2026-07-01T00:05:09.724331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.01083","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:46:33.607080Z","title":"Affordance-based robot manipulation with flow matching","venue":null,"work_id":"42103fee-a04c-4ef8-8c44-07f06d918942","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:31860620422fe762fe4ddb31a9467f4b2010827a98ef1448498f14a35e2e4fc1","observation_id":"975da54b-5f96-4560-b4d1-21dcb172b1fc","resolution":{"observed_at":"2026-07-01T00:05:09.638373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.09061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T06:17:41.616812Z","title":"arXiv preprint arXiv:2507.09061 , year=","venue":null,"work_id":"0c26ae08-6f32-43e6-93eb-3f44b48fd389","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:5698371a4d363ba6c6f47cde6c11828e7e8eca6c87269de623eb2c0b31a527d3","observation_id":"122ca670-a47d-4927-8753-a54de95dd54c","resolution":{"observed_at":"2026-07-01T00:05:09.643171Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22094","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:07:23.723756Z","title":"arXiv preprint arXiv:2505.22094 , year=","venue":null,"work_id":"42e82916-6b94-4acc-9e01-3e78964a96d1","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:98dda685442216c8b1958696f3430e518cb5335e826614c56f6cb35fcd2f4dd0","observation_id":"77c6309b-ae97-4580-a1c6-82345a315b12","resolution":{"observed_at":"2026-07-01T00:05:09.645589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":"2304.13705","doi":"10.48550/arxiv.2304.13705","metadata_source":"pith","pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":"cs.RO","work_id":"6fe159e0-fa73-481a-88d4-4719c15140be","year":2023},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:c33b614729731400fdf77689a8fc9ca65037178ef70c06d8c61d0405d9304a45","observation_id":"a10e5ef2-f1fb-4953-b599-84cc3723bbc4","resolution":{"observed_at":"2026-07-01T00:05:09.635889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07762","last_updated":"2025-07-02T08:19:18Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:57:12Z","title":"Efficient Online Reinforcement Learning Fine-Tuning Need Not Retain Offline Data","version":3},"cited_work":{"arxiv_id":"2412.07762","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.07762","snapshot_observed_at":"2026-07-01T14:25:45.826205Z","title":"Efficient online reinforcement learning fine-tuning need not retain offline data","venue":null,"work_id":"cfa99d28-5e4a-4e2f-984c-446feb05b799","year":2024},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2412.07762","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:fea5ebd03f954ba18a2ce7fc4bddb2fe50d67854eb3939878099356949312b4e","observation_id":"5b4de9fb-0cae-4a8d-a72f-9485efdf5270","resolution":{"observed_at":"2026-07-01T00:05:09.633737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":36,"verified_fuzzy":18},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2605.03065."}