{"as_of":"2026-08-10T03:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34b9b13fce6d9cf592389ed9f9258f9ad45b1c38340ac1b876b5f1e45721d284","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:30:23.710832Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:51:28.966906Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T12:43:17.233166Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"cited_work":{"arxiv_id":"2509.04063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04063","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.04063 , year=","venue":null,"work_id":"33a1475b-c02e-497e-96d1-f4f93d4a89a7","year":2025},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2509.04063","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:ef111069477740bf1d4101afd4a6c272d68e53c1ae2e733c7c89eafdd9a21110","observation_id":"0515b405-0150-47b2-86a7-06e4b120a5ca","resolution":{"observed_at":"2026-05-18T07:31:02.908493Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04063","snapshot_observed_at":"2026-08-04T05:51:28.966906Z","title":"Balancing signal and variance: Adaptive offline rl post-training for vla flow models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.15257","last_updated":"2026-08-02T20:22:57Z","snapshot_observed_at":"2026-08-07T11:00:16.440130Z","submitted_at":"2026-03-16T13:24:58Z","title":"HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:28.966906Z"},"links":{"cited_paper":"/paper/2509.04063","citing_paper":"/paper/2603.15257"},"observation_digest":"sha256:727fd1d39a2681ca46a062293f2c9b9c7d7117cd71bf55971ca19b070d7366f1","observation_id":"523fe429-f1b8-4cb6-8c19-09b961db3bf4","resolution":{"observed_at":"2026-08-04T05:51:28.966906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"cited_work":{"arxiv_id":"2509.04063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04063","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.04063 , year=","venue":null,"work_id":"33a1475b-c02e-497e-96d1-f4f93d4a89a7","year":2025},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2509.04063","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:b11e493cc614b7a576dec748bd77029c278c7875803810962b97ed5a527ea22a","observation_id":"6ef27ad8-2026-4fda-934b-461fa5a9a422","resolution":{"observed_at":"2026-05-20T12:43:17.235496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04063/citation-record","integrity":"/paper/2509.04063/integrity","json":"/paper/2509.04063/citation-record.json","paper":"/paper/2509.04063"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:23.444500Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.444500Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:f212f5905f49a0e5157a08c78d599eb4bafdc2cb6f70ddf0f93312140e0620e8","observation_id":"3e864b4a-3641-41f4-a30f-edb30d1a5381","resolution":{"observed_at":"2026-08-05T10:30:23.444500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:23.451025Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.451025Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:2a5cc3027a67189a1224a6c62e80c6f4b9dba8ee413a1eb040412abc7da7f71e","observation_id":"22c3cd8a-a31b-4e15-af7b-55d50703bf4e","resolution":{"observed_at":"2026-08-05T10:30:23.451025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.514316Z","title":"B.; Jaakkola, T","venue":null,"work_id":"0d677c98-8092-42b5-9b88-0b7d6cb4aefb","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.457237Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:e139a01900e61dae229e5fea7c29a553adddad6577def4615cc2789499263594","observation_id":"27ed1442-1a51-4744-899a-bc5d90be4341","resolution":{"observed_at":"2026-08-05T10:30:24.520293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:23.463943Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.463943Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:461ed69ccc77a9e332d3ba60373e6b8ac2fa787a90cb4c93440b3e314c6896ca","observation_id":"57708748-ee58-4c4c-af3c-4baef8fcf1a6","resolution":{"observed_at":"2026-08-05T10:30:23.463943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T10:30:23.469543Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.469543Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:5ce1def0e50d676a24971595fd59dbfda0125ac541f8c867f1659cfe86eb5a76","observation_id":"49033faf-97a7-4f53-9d63-22125454ec02","resolution":{"observed_at":"2026-08-05T10:30:23.469543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-05T10:30:23.475841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.475841Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:14adef8eed2a146fa062e6c59e7ff45dda1813eef37a8c09b10a46ce5946f2a6","observation_id":"aebd0cbe-21f0-4217-8ae9-d1bdccd21934","resolution":{"observed_at":"2026-08-05T10:30:23.475841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T10:30:23.481852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.481852Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:d5c5db914bfe9563c7beda377548501450657c46ca633f1b9747cb46d11e7b55","observation_id":"fa1a897c-afaf-4e44-9a1c-d5a82059ee22","resolution":{"observed_at":"2026-08-05T10:30:23.481852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T10:30:23.488324Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.488324Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:36e9482e0dcd4694852db19d377f603a0b5a785067c95a7f6d4769d0dd6786bd","observation_id":"d63c2495-1ddf-4d7f-88f7-592d5332d574","resolution":{"observed_at":"2026-08-05T10:30:23.488324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.484586Z","title":null,"venue":null,"work_id":"d98f2fcf-f158-4d31-b49a-6c75604ea342","year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.495241Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:003b3a2c67e10c5328b721b23bf8c97585fbaf41a1f12bdb68cd579a49d2c9ff","observation_id":"c214714c-c744-48ab-87ce-77d35e271900","resolution":{"observed_at":"2026-08-05T10:30:24.490508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.466203Z","title":null,"venue":null,"work_id":"ad28f6ed-0ddb-48ed-a48d-d2c0783e87fd","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.500979Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:3a1d56f5538fa0cf7f3a7cad9c6dc082ef5dcc38704edf70e112b467b9e82b1a","observation_id":"c308da86-c944-4c17-bc8f-eba9bc4d20ae","resolution":{"observed_at":"2026-08-05T10:30:24.471335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.448906Z","title":null,"venue":null,"work_id":"bafd796e-82da-4088-9628-4475335cb274","year":2021},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.508419Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:c15ada1d2c0a282c1ea30754ffc091b9dedf2431ea0c8b4c9227067c45dbfe0c","observation_id":"bb9929da-5aa4-48c0-abff-d109b0443be8","resolution":{"observed_at":"2026-08-05T10:30:24.454442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07366","last_updated":"2019-12-14T02:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-06-19T17:50:12Z","title":"Neural Ordinary Differential Equations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07366","snapshot_observed_at":"2026-08-05T10:30:23.515915Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.515915Z"},"links":{"cited_paper":"/paper/1806.07366","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:8e6522540713ecefadf3bccc746217a16a79dd86ec07d89ee9cfd14bb7554c31","observation_id":"dfe423ff-3d87-449c-a8c7-b60679f9a6a8","resolution":{"observed_at":"2026-08-05T10:30:23.515915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08259","last_updated":"2025-01-14T17:15:27Z","snapshot_observed_at":"2026-08-06T07:18:39.680193Z","submitted_at":"2025-01-14T17:15:27Z","title":"FDPP: Fine-tune Diffusion Policy with Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08259","snapshot_observed_at":"2026-08-05T10:30:23.521640Z","title":"K.; Tomizuka, M.; and Romeres, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.521640Z"},"links":{"cited_paper":"/paper/2501.08259","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:79a0dfa2eabdc05bbdaa6ac244387ccf9af2357d4440ec7ab3985cc0871fafc4","observation_id":"f3e1c7e4-be1d-42dd-a51d-db9aa39d679a","resolution":{"observed_at":"2026-08-05T10:30:23.521640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.431248Z","title":null,"venue":null,"work_id":"c83be979-8898-4e14-b183-d5c783551cab","year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.527844Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:754e2551c071faa16e1207c81a3534f6e6f56318b915d6cde1fdc78b4021348b","observation_id":"7dace495-c2da-4461-814f-4faa88315a76","resolution":{"observed_at":"2026-08-05T10:30:24.437323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.413165Z","title":"S.; Lynch, C.; Chowdhery, A.; Wahid, A.; Tompson, J.; Vuong, Q.; Yu, T.; Huang, W.; et al","venue":null,"work_id":"abf961c9-1dec-4fa4-b522-efdc998ecd21","year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.533520Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:840058534626aee86ab5d0163411b1b7ffc7777e807e84d12dfe53b9c6ec1efa","observation_id":"f6f29c4d-4779-4f8d-9a3b-b6b65dca152f","resolution":{"observed_at":"2026-08-05T10:30:24.419516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16664","last_updated":"2025-01-28T02:53:48Z","snapshot_observed_at":"2026-08-06T21:08:23.353594Z","submitted_at":"2025-01-28T02:53:48Z","title":"Improving Vision-Language-Action Model with Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16664","snapshot_observed_at":"2026-08-05T10:30:23.538701Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.538701Z"},"links":{"cited_paper":"/paper/2501.16664","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:344d679afb9aa320f7ee601b9c87468a858bae2bb9cfdcf59a01270ddb8a9c7e","observation_id":"35ba3196-ca77-4c1e-8e83-1549cb75e2ac","resolution":{"observed_at":"2026-08-05T10:30:23.538701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-05T10:30:23.546728Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.546728Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:998258737b54543b9493453feddef3f922433d16d5d2b7277c7419f91a082969","observation_id":"06c6519d-9fdc-4bb8-9e5e-546e23baea4f","resolution":{"observed_at":"2026-08-05T10:30:23.546728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-05T10:30:23.552915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.552915Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:1a1ed42b514ba1ad3a840e1d417c9e3e5051b3894cc4335b435224f179ab2256","observation_id":"ce01b314-0f73-42dd-81e9-bb2039a2668e","resolution":{"observed_at":"2026-08-05T10:30:23.552915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.396970Z","title":null,"venue":null,"work_id":"a402e11e-4345-4d47-8a2a-3cc37b5bee0b","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.558652Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:ecd8911a10c158759c5f3d39fd7684acfd52491f70650c98061e1ddc82cc3ebf","observation_id":"4f31f06f-4b50-42b9-ad72-780caa8b1bbb","resolution":{"observed_at":"2026-08-05T10:30:24.401852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T10:30:23.563766Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E.; Lam, G.; Sanketi, P.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.563766Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:fe73c1ae5f1e0d627298112e1619573598913015bd021d71f066d300b06ff808","observation_id":"a8d857f0-8d2b-45f4-a6b8-b9b67151b6f9","resolution":{"observed_at":"2026-08-05T10:30:23.563766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.375383Z","title":null,"venue":null,"work_id":"5beea029-e06c-4da0-9568-5b2f8c8aa58f","year":2019},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.570311Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:85449886684e8b2db38cca27a64d7fff40abe1a19e8bb3ece605d6404a4930ee","observation_id":"e284bcf8-56be-4f37-b6e2-3a5bd1de3fd5","resolution":{"observed_at":"2026-08-05T10:30:24.382885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T10:30:23.576111Z","title":"R.; Fu, C.; Lunawat, I.; Sieh, I.; Kirmani, S.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.576111Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:c9bfb4ccc4bd96ca5abb39835980d9ba33235885899c9663641577374f768e2d","observation_id":"79743d51-d3a7-4fd5-a3a7-23ca43a66281","resolution":{"observed_at":"2026-08-05T10:30:23.576111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T10:30:23.582107Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.582107Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:b3203fa920822401192ec6d6c0ebe7981b261f7c8e2089e159128203151a851f","observation_id":"fe88a4da-8409-4ba1-9ecd-04a26d19ce36","resolution":{"observed_at":"2026-08-05T10:30:23.582107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-05T10:30:23.587313Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.587313Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:6d806a695fee630f4beb36682a154009a2861c869337f5a78e0138bf4aab19ea","observation_id":"1bdee1ee-8647-4c50-93e4-15dd49ab6174","resolution":{"observed_at":"2026-08-05T10:30:23.587313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T10:30:23.593021Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.593021Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:41e20caf1a36e7a747bc33135096e10e7aec55e76a35d3860cdffabdc9578335","observation_id":"2a368fcf-5caa-4743-9d43-14b625537fab","resolution":{"observed_at":"2026-08-05T10:30:23.593021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.355683Z","title":null,"venue":null,"work_id":"c93ed788-7e30-4dcb-b954-cbbbb13fadd3","year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.598619Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:d246c9f2208c5488702394fd62a0767025e4cd97eac0034da50b5d5d9c1f4833","observation_id":"6e05dbf2-4666-4a20-870d-2f28538071a6","resolution":{"observed_at":"2026-08-05T10:30:24.361360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-05T10:30:23.605483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.605483Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:407a9d05328189d8cde8ebe9dc097211e2072740b4fd901324dc979c66b8b653","observation_id":"7cc1bd6a-b221-4f54-b7e7-2c0543864e5a","resolution":{"observed_at":"2026-08-05T10:30:23.605483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06685","last_updated":"2024-12-09T17:28:03Z","snapshot_observed_at":"2026-07-06T20:04:01.034597Z","submitted_at":"2024-12-09T17:28:03Z","title":"Policy Agnostic RL: Offline RL and Online RL Fine-Tuning of Any Class and Backbone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06685","snapshot_observed_at":"2026-08-05T10:30:23.611023Z","title":"S.; Gao, T.; Sampaio, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.611023Z"},"links":{"cited_paper":"/paper/2412.06685","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:93e69cef51e7ee538b9decc6435ec0682458941f7b6d697df7970d3f4b268688","observation_id":"cdd8c86c-0b3b-4f1a-af6f-f9b4914be986","resolution":{"observed_at":"2026-08-05T10:30:23.611023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.337347Z","title":null,"venue":null,"work_id":"dc8bec7e-2ef4-4049-a6ab-3e851d811989","year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.616193Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:c8660043b88500c967eedddd023761fa1ca1d6d5abad7caadd8f764eb585c971","observation_id":"2f15b711-1537-4c34-acf5-e1a2688baef3","resolution":{"observed_at":"2026-08-05T10:30:24.343397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13816","last_updated":"2025-02-24T21:05:58Z","snapshot_observed_at":"2026-08-05T20:44:16.574781Z","submitted_at":"2024-10-17T17:46:26Z","title":"Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13816","snapshot_observed_at":"2026-08-05T10:30:23.621321Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.621321Z"},"links":{"cited_paper":"/paper/2410.13816","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:103e7ff1d0c5b21ed8d81d7af702c93aa2a6e54d49a735e90db3d0faf1360eae","observation_id":"f81a2e7d-54e7-48a4-a8d8-e0ffe599cf5c","resolution":{"observed_at":"2026-08-05T10:30:23.621321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.320472Z","title":null,"venue":null,"work_id":"d11d502e-24f7-4a34-b2d7-db40de498fd5","year":2007},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.626576Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:ca62bb45d21feb19eb89e55414a4a04897b760af5fd72308176a5e424b8a6bba","observation_id":"536ba1d1-401a-476c-bf6a-ebd0758db317","resolution":{"observed_at":"2026-08-05T10:30:24.326271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-05T10:30:23.635769Z","title":"E.; Wenzel, F.; and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.635769Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:38dc5f5df6901f8d37d1a65b69f265de35f64dea9f0ede8e57be7376178d626a","observation_id":"ffee3e7b-3f88-4282-9ee9-d2b050e62ed1","resolution":{"observed_at":"2026-08-05T10:30:23.635769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T10:30:23.641166Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.641166Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:b472a1ecd70a5a829a535afe18e267d6b02e95e243082232cde917c2505c6cdc","observation_id":"d44e2bf0-3e45-4016-bd0e-0320436923be","resolution":{"observed_at":"2026-08-05T10:30:23.641166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-08-05T10:30:23.646643Z","title":"a henb \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.646643Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:7d751f8da91d0ae47e00ab41e77e8f5bd9ed743ae8c84f24850e13219f9ce1ef","observation_id":"8bc3f0bd-77b6-4e4c-9cbe-07689334638b","resolution":{"observed_at":"2026-08-05T10:30:23.646643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-05T10:30:23.652369Z","title":"M.; Ghosh, D.; Walke, H.; Pertsch, K.; Black, K.; Mees, O.; Dasari, S.; Hejna, J.; Kreiman, T.; Xu, C.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.652369Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:4d943654eaaecc594d44b49e93d1eda70ea67c715ee91ce9c3183b02017acaf6","observation_id":"63d5175f-027b-465e-8d22-c3e5fbc4fa6b","resolution":{"observed_at":"2026-08-05T10:30:23.652369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.303267Z","title":"J.; and Zhou, M","venue":null,"work_id":"35832b92-3579-4953-b878-ff82a0a7665a","year":2022},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.658056Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:8961c5268824ca595299558ea75021914862d2333e1d599aa6f872d036cb4dfb","observation_id":"b8a9a791-599a-409c-89db-a0c000554697","resolution":{"observed_at":"2026-08-05T10:30:24.308875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:30:24.283286Z","title":null,"venue":null,"work_id":"42cdffb7-a1c9-4b25-94d5-59ea927b26a3","year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.664002Z"},"links":{"citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:0f10daead86704040e2b1327f1dc523d0b896f1afae0703c8ebfdd843959da80","observation_id":"dd6f62e4-7bcf-4126-aae7-ce8dc1fdf77f","resolution":{"observed_at":"2026-08-05T10:30:24.289673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07395","last_updated":"2025-05-12T09:48:03Z","snapshot_observed_at":"2026-08-07T15:47:55.977732Z","submitted_at":"2025-05-12T09:48:03Z","title":"ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07395","snapshot_observed_at":"2026-08-05T10:30:23.670740Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.670740Z"},"links":{"cited_paper":"/paper/2505.07395","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:d11f180c44f4ec99e07256d67a60425d2b6e04863ba50def018b521018050955","observation_id":"c66a75f6-4f55-462d-b786-087c9b8bb200","resolution":{"observed_at":"2026-08-05T10:30:23.670740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04975","last_updated":"2025-03-06T21:10:12Z","snapshot_observed_at":"2026-08-07T17:23:30.914733Z","submitted_at":"2025-03-06T21:10:12Z","title":"Energy-Weighted Flow Matching for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04975","snapshot_observed_at":"2026-08-05T10:30:23.678531Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.678531Z"},"links":{"cited_paper":"/paper/2503.04975","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:9ee653f1b58179faab19a7f010ba2e7c32dcad0a38f1d1d219148e23e7f8b90c","observation_id":"94d2adb0-a693-488f-9d59-14070dd5b872","resolution":{"observed_at":"2026-08-05T10:30:23.678531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T10:30:23.688049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.688049Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:32b2cc313a34f431850007c278e47d16b52bcb97f1cbd223ee19eaaa0e42f52c","observation_id":"02898c68-a010-4aa3-adf2-0cfe4243bf80","resolution":{"observed_at":"2026-08-05T10:30:23.688049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08007","last_updated":"2025-03-11T03:13:45Z","snapshot_observed_at":"2026-08-07T17:14:29.980290Z","submitted_at":"2025-03-11T03:13:45Z","title":"MoRE: Unlocking Scalability in Reinforcement Learning for Quadruped Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08007","snapshot_observed_at":"2026-08-05T10:30:23.695864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.695864Z"},"links":{"cited_paper":"/paper/2503.08007","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:f4890f79eec3fbaaf7a6d93c43e64bd75f1669948615b0bbaf322814ec474990","observation_id":"8630cad3-afcf-41be-86f7-535f15cd85e6","resolution":{"observed_at":"2026-08-05T10:30:23.695864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13443","last_updated":"2023-12-07T20:49:03Z","snapshot_observed_at":"2026-07-06T16:51:10.736675Z","submitted_at":"2023-11-22T15:07:59Z","title":"Guided Flows for Generative Modeling and Decision Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13443","snapshot_observed_at":"2026-08-05T10:30:23.703140Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.703140Z"},"links":{"cited_paper":"/paper/2311.13443","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:dd5d57f662cb405f9ba6ea1333635c2580f0d1965d27d3237cfce810bd5b009f","observation_id":"6ef7b8c5-a478-446f-a696-a7c7126604be","resolution":{"observed_at":"2026-08-05T10:30:23.703140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08740","last_updated":"2024-06-02T10:15:53Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:30:03Z","title":"Reinformer: Max-Return Sequence Modeling for Offline RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08740","snapshot_observed_at":"2026-08-05T10:30:23.710832Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.710832Z"},"links":{"cited_paper":"/paper/2405.08740","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:10495b1dc075e41b595bd1ec8010184d39f3099db6577392c94d99321b0a63fc","observation_id":"5f98f877-341c-4bed-be13-e0f6251079c8","resolution":{"observed_at":"2026-08-05T10:30:23.710832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2509.04063."}