{"as_of":"2026-08-23T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae6e0ee95f2182865390a3f9a6babd48a32106689facb1a2ed487bfc7f89ed8b","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T12:17:04.321971Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10369/citation-record","integrity":"/paper/2607.10369/integrity","json":"/paper/2607.10369/citation-record.json","paper":"/paper/2607.10369"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:a84666557f017e8df800dde4050fec8273d2cdfda3c460b0808ba7c01bc3387d","observation_id":"e3a52a83-f9c2-49cc-9321-81be568368df","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:12dbe5b341a87a57687d2130256a1179863932b4622117a07464c91477c77768","observation_id":"ef21963e-d8ae-48e4-84d1-a43e62538c49","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:a1e1d9c6f4f7e25e9394d4ba8a663cd5c4e59de5329513ed1e8c90b3ebe4312c","observation_id":"d52eb109-f24f-46a2-9be7-408248a22a4e","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-08-20T22:25:56.255434Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:43d13c7cdb3756512055ac709685c2fd5aad03121f82d4fabb81beb9ae0eb9c1","observation_id":"3e2bfffd-5bad-490a-a380-f90c59b1e669","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:9414ef7766d32ba34fd1d879a2674eeb71877666fbdf57716da953e2783d13fa","observation_id":"2f7fe648-3b43-4ff0-9337-cacfaca41c65","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Zhang, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:5dd8f689bf50d469a4ab2dc73d180c30e97eb530fef44d7208426cf81f64f879","observation_id":"8e3f693e-8fbe-45cb-af02-16391c9e5f8a","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:fd560451724cc928c2d3a3ff000a22a5e3fb4987eec6f5af3c821915c19e9170","observation_id":"7782f1ac-74fc-4fa3-b872-10ab6c42d23d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:f4b8860ccce0567f999036f79a731d08dd2c39ad7f11e810535371d3a45a88ef","observation_id":"836107ff-4737-4282-9915-c445a2d1ae2c","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12691","last_updated":"2026-06-20T06:22:27Z","snapshot_observed_at":"2026-08-13T03:32:53.422908Z","submitted_at":"2026-02-13T07:46:37Z","title":"ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12691","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2602.12691","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:fc1d50c713cba309bf90be532c46c2c74cdfdcfca5c82e65b7212c87066e60d0","observation_id":"a78e56bd-2d28-4f0e-870d-50abbf61d4ca","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:caf38ad798dbde20eed2c22a6d114bf6c2cd2a324c89e6923246d4215e76e794","observation_id":"d5cfd1f1-0283-45fa-b01e-4bf7bceb24fe","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3997eee140a2eda0f11fc05569cc4dcd3452febb1ac76658569fa72c7636cbbf","observation_id":"68ce2915-4659-4dd2-8152-e3bc85d2c75d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Zhang, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:76888da69baba62f56c908bac1cda85e3265ec5ad8f0ad808bf9899429ec2352","observation_id":"2357260e-8191-4294-953a-bf3fb003962f","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Li and S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:66b10df13c4efaca2608e9d7cbfd950d3ad81b3063bb3304862aff6daff46f69","observation_id":"50e6bac8-5ece-4ef7-b4fa-e1371a16fe65","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:ddce7acce457c4b6ee89b5005a33848a95b1cbb62e5142d301166ff28dbbb2bc","observation_id":"a298ed67-c7e6-42f6-b4e1-e0bd1f352c8d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Psenka, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:4c54a831ff2a2a10b5151122ac6bc6e0be23b1167b45a98e562c8b4dd881b5a0","observation_id":"1a4037ea-2f6e-4467-b041-ba9c88377968","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Dhariwal and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:0c7750a2b7d6e6f74d610f092be1adb186fec827a63d13de78c2f09e202a999e","observation_id":"1bea8a4a-abff-4ac5-9217-b20ffffe553d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:02d760a0f75b83ac479413a44885da6a717c9c224d2c78286c7143536b3f0ff7","observation_id":"fe77ece6-0252-4df6-a068-8db8737a3d1e","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3bab4b052b22af300aaafafb1ec1ce6f2eb670ffa2e5220dbc107e15e8ff47de","observation_id":"1ac9b40f-4602-4c16-b28b-20e100e218d8","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Wagenmaker, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:17758539baf4c71bbdb253353dcf033446dfa85b09e1c99731d4accdfb6378c0","observation_id":"a0e5e943-9738-4301-b0d8-9a7b50e5dcce","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:d890b202ee87490527caec2908d447312903bdf0b791357b24967b74a919944c","observation_id":"09f96cb2-5d4c-4937-9b72-e7a75203e72a","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07986","last_updated":"2026-04-30T00:00:17Z","snapshot_observed_at":"2026-08-21T14:27:55.752123Z","submitted_at":"2025-07-10T17:57:46Z","title":"EXPO: Stable Reinforcement Learning with Expressive Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07986","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2507.07986","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:7bd05d88fb79cf9df3b842c80248ea02798a20ee148a1357eb83822b1361c620","observation_id":"98841fcb-6820-4066-8270-288a44250960","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:c7f0e15c4302465afe4e738f136a1980bcbc0df5f386f822fa08ec2f4f701af0","observation_id":"69729a88-8d38-4724-9cb8-30d33c01515f","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Hansen-Estruch, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:92960b8b9c138056e4c86778fee5df65ba0f2b8086fccda2e48652e4b1a55657","observation_id":"48ed7a5d-2b4a-4819-81cd-b5855a481e28","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:04339d147468c340ef9f87b3c1615cfbc444a71e5be9202ff82935ac9f8dd736","observation_id":"3f48f188-377f-4590-91e2-3d892fd256b3","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23073","last_updated":"2026-04-30T20:04:38Z","snapshot_observed_at":"2026-07-31T07:02:53.376869Z","submitted_at":"2026-04-24T23:57:45Z","title":"RL Token: Bootstrapping Online RL with Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23073","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2604.23073","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:50b801561016ea1a774d8f34321d7a2f4b61e73334f2b2d01c93df89b9de00d6","observation_id":"54ba558f-9cb8-4c17-b7db-0154713494a2","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02581","last_updated":"2026-06-19T14:04:42Z","snapshot_observed_at":"2026-08-17T19:36:56.374780Z","submitted_at":"2025-12-02T09:49:26Z","title":"Training Diffusion Policies via Prior-Mapping Co-Evolution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02581","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2512.02581","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:afe70e8b3bdd02c2235761f18ed75d70dcde816e7ade847657e8b9c1e12d6b6f","observation_id":"b3fbc09c-86a0-43de-84e9-4e1179feb6b1","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26006","last_updated":"2026-06-24T16:23:18Z","snapshot_observed_at":"2026-07-07T00:00:21.918469Z","submitted_at":"2026-06-24T16:23:18Z","title":"FORCE: Efficient VLA Reinforcement Fine-Tuning via Value-Calibrated Warm-up and Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26006","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2606.26006","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:84211741a30825a01068fd73178c0a426b33659158681fb6ba8cebaea6e9f814","observation_id":"d63c9ed7-7f00-4cac-bf17-822edc0286fc","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:83b08ca37c0a316403fff9a2ed203b2a4291516624f54f49ceccfd332ee2a230","observation_id":"405a6e6e-a03f-4800-8f5c-ed1fd658b44e","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Fujimoto and S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:eccabb327b2fa808b9798f367b1c83fae16f2aa2a88ac447e73c18e17dcf90b0","observation_id":"ce697ca0-eaad-46b7-a187-24738b59059d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Tarasov, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:0dd3c5f2dc3d9564e89be1567d0d646f43ad88432c32aa0e37e484926339ca46","observation_id":"8b58d147-edb4-4c9f-bac5-a68fbf3cb65d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:2813f12be1941d0824c156f90cd9ed3d9c800514b39683daacbcdb66e3c81dd0","observation_id":"0a2213f1-6a4b-46e7-87aa-53272e42cc17","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:fd9058bfbd631c5f7cc940c249d9c07ccbcf916ca25ffd8eb1147914266f5da6","observation_id":"83752e9b-4e2e-488d-bc6c-6032e8f45bf9","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Lipman, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:dada8700ed30b823e2e1ff7cf333fd3e7019e77d8b3d1e65266c2a65d6f2441d","observation_id":"a87cfcea-d5f6-4df3-ab1d-c4254353157c","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:6a83772bf226d362e9f5e8b7fca6ac1b76f2af404236fd4b096e8df3ed5dc3ce","observation_id":"1023bfa8-06a8-4cf7-9774-be74ac71bfcd","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:fc20d09add66218f792fe6e4ec08b01a6e63ddf5c408bd3c862d7d57dcf7d724","observation_id":"a24fb3b9-dc74-4df6-ad09-b9b3817bb5ce","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:62c9fe9ab21d4c5406a7c3498f9298caf48e6940ce04e72d73a8cbc1dbe69c1b","observation_id":"140f2870-f264-4dca-8a8b-9d7f4fae5104","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:bc46a7d7e5661fe4cbfa7228e3e9a7d924efe520069d6b61fcc11ddf793c9fca","observation_id":"6759b4fe-f5a4-4949-9a97-178a772003e4","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:10990ffdbaab04e517e9115d4311345e51e968a6248296d4c729b9bcc1ff950b","observation_id":"6043cb2e-79f4-49b5-9766-3ec3111860d3","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22303","last_updated":"2026-06-21T02:10:21Z","snapshot_observed_at":"2026-08-11T00:08:47.743899Z","submitted_at":"2026-06-21T02:10:21Z","title":"FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22303","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2606.22303","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:dd50024d4af3a5d6a54e1598979a1488dbd8ad7b740b4aca101c05d50897fbe5","observation_id":"626df4f7-ce84-428f-a2b0-8b20bfc80fc5","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Silver, G","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:537ba113fcdbb0f9b5b1ce55eddc258400ef9fd2e9863d3a7829f50d411daa78","observation_id":"e56e7e16-af36-4a73-8a40-8d6c8b9c4271","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Fujimoto, D","venue":null,"work_id":null,"year":2052},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:94d1f6fabdde0b4662a159b9012ad132cfbc467fed682ac569b88d9699b669f4","observation_id":"8057eb7b-eb57-43d3-8702-234304c8e5dd","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Kumar, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:850b65783ceb0da9819e60effeed5f5cbef1020c99705b84fdcff681244acb71","observation_id":"2c63b930-ca2f-4c0e-be9f-eb08fd2e95d8","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Ding and C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:961794e5f214dc5fac90b54652700767795d1ee2f615af5cc0b66c9be2988679","observation_id":"afc80e6f-2370-44b0-be05-6523663acff2","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:090fb333aa68479551ce9f58a8988247c6327ec25e2fbca0c4a471d0764db19f","observation_id":"62e3bdd7-9a63-44b5-94fd-39fa2d9725eb","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22866","last_updated":"2025-05-28T20:59:22Z","snapshot_observed_at":"2026-08-15T00:30:27.129086Z","submitted_at":"2025-05-28T20:59:22Z","title":"Scaling Offline RL via Efficient and Expressive Shortcut Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22866","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Espinosa-Dice, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2505.22866","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:0c22fa2d13e40eb708d83781eb0ac1865bd4262aa3a9c88f32631055c2515fb0","observation_id":"d005ac5f-b984-4097-bbba-cd9df75f9fdc","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:bd55613dc99c3a762b3d004cde3a33137865a2b74ad488ace873449ec8e94675","observation_id":"b2e636dd-b767-488a-9f7f-9fd203a9bb3b","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:37cb28ee761e7c22beb3e868671306172dd50d50d5d7d06e8b06e37ce2f2509a","observation_id":"4eae8e56-b79b-488c-a58b-3c74d91837eb","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Barreiros, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:f3226b0f2a01bddad666b9ffa6c844c44c03bf9b1769a7d96a047c079576d824","observation_id":"da6b58ac-8161-4037-90ab-e8044e5b0e51","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01223","last_updated":"2024-02-23T14:42:57Z","snapshot_observed_at":"2026-08-16T14:46:32.788105Z","submitted_at":"2023-11-02T13:23:39Z","title":"Diffusion Models for Reinforcement Learning: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01223","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2311.01223","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:767e437482928c83bbcc840d00b863b01caf14ca3910fa07bef29de23e2e4914","observation_id":"9ee80221-eceb-4d0f-ba47-ce763e985432","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13734","last_updated":"2024-07-18T17:35:32Z","snapshot_observed_at":"2026-08-19T19:21:54.959926Z","submitted_at":"2024-07-18T17:35:32Z","title":"Understanding Reinforcement Learning-Based Fine-Tuning of Diffusion Models: A Tutorial and Review","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13734","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Uehara, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2407.13734","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3d2d7ccea31121d6aa0e4e26a9b36f4a1dac62546f1e3ea7707a13d70233092e","observation_id":"84839a2f-4fdb-43af-b06c-18df8cdbe559","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Zhang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:d76926e1761f143c4e9defaf50c56651d1037827111cbd54c4ec4e9bb570701a","observation_id":"6cbf6255-7ec3-4b3c-a116-a23461d7d096","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:d19f02cd42e43557401afa0fd2a6570eaee273a0c9c7a6c10b80e85eb569ef5a","observation_id":"f292d37d-d166-4589-a7e5-fb5d54c57d5c","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:332fbdf32525b4c563f08638edf47e0f3ad5b9ffc9813ed1c606360c2cbb71f9","observation_id":"1958137e-9eca-4154-adee-b358be662da3","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:30c28e140aa02baee02f2784da343ba0938146e5b893d7366bf244c88c655d61","observation_id":"d9e31bbc-5dc8-42e2-b14d-d6c90d10a36e","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-21T04:28:08.666883Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Frans, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:05886e477ee9bf4ca89c8f9da6f4ff4081cca7d2a6c896fe11f4203841784fe1","observation_id":"e2819e81-cf32-47a0-9c56-7434a032f4f6","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03698","last_updated":"2025-06-26T14:45:55Z","snapshot_observed_at":"2026-08-17T13:32:17.299701Z","submitted_at":"2024-09-05T16:55:33Z","title":"Quantum optimal transport with convex regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03698","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Domingo-Enrich, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2409.03698","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:958a3a7ca269c3e5de7aadb092c4c00723e9d8e6d1613182c81eacb5b4f0aeb5","observation_id":"4ccd9938-f15e-42e8-a9c1-8fe89360592d","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15194","last_updated":"2024-02-28T09:21:46Z","snapshot_observed_at":"2026-08-20T07:42:16.420034Z","submitted_at":"2024-02-23T08:54:42Z","title":"Fine-Tuning of Continuous-Time Diffusion Models as Entropy-Regularized Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15194","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Uehara, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2402.15194","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:6dcf5aa33742ab1b1b61e3a637853c0ed773800192a3b36db382d3e76b8ec910","observation_id":"3be2a054-2ad4-4cfa-a279-26e45b44ddbc","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Bergmeister, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:34cb03fd22e732a39366fcf4588672b454ca8ecf2d44f7757a9c3dba6f1c5baf","observation_id":"acfee1eb-6306-4223-9725-910c9573a7e0","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06583","last_updated":"2026-05-07T17:12:47Z","snapshot_observed_at":"2026-08-11T08:04:18.772776Z","submitted_at":"2026-05-07T17:12:47Z","title":"Improved techniques for fine-tuning flow models via adjoint matching: a deterministic control pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06583","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2605.06583","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3ca8bfb74d67375ff1e21dd9680eb8dfa0e7227972970dd852ce4a85cf2389a6","observation_id":"c1fc527d-c6a0-4d81-b703-a71a72a9f411","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11480","last_updated":"2026-05-17T04:29:17Z","snapshot_observed_at":"2026-08-17T20:30:58.825647Z","submitted_at":"2026-05-12T03:55:12Z","title":"Efficient Adjoint Matching for Fine-tuning Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11480","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2605.11480","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:c08046d5d828649a552d2d0df79bd3fce44cd0e49fd8ca7b7cde611ed20911ee","observation_id":"8c93aced-4fd3-44ba-9b6e-638c743f2eb8","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16677","last_updated":"2024-12-12T18:40:16Z","snapshot_observed_at":"2026-08-19T00:04:57.769548Z","submitted_at":"2024-07-23T17:44:54Z","title":"From Imitation to Refinement -- Residual RL for Precise Assembly","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16677","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Ankile, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2407.16677","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:98912f13b127b95640bb52a652041e19bfe0f4d0b1ffa273c620f04b3c317d78","observation_id":"72b515ed-2a1f-4c0a-8007-c15185185721","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13630","last_updated":"2024-12-18T09:06:16Z","snapshot_observed_at":"2026-08-17T02:23:12.518804Z","submitted_at":"2024-12-18T09:06:16Z","title":"Policy Decorator: Model-Agnostic Online Refinement for Large Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13630","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2412.13630","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:3ff5ed7b68412704223c81cb959b630277b243360364396ccc86130e8be88af6","observation_id":"dd34a979-2de1-4501-af9e-250173936c66","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:9b37d1c92a8719d6f6c386a35b4b90b368c86844f436b2a8ef22a24dab1447e7","observation_id":"4d7effe6-83ba-4f24-8689-cc013abe0866","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:21a4871455d4f45a001713a2d7673c969e7618e717d3c5f5c80730d617414870","observation_id":"609cfcf9-fabf-48b2-8295-1e1189386497","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05333","last_updated":"2024-02-28T13:48:09Z","snapshot_observed_at":"2026-08-16T14:54:00.206000Z","submitted_at":"2023-10-09T01:29:17Z","title":"DiffCPS: Diffusion Model based Constrained Policy Search for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05333","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/2310.05333","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:b8ff0dfc19c28a8dc37f3caa6b3d243a58e7fc4661c6cd3a6359c225833eb93f","observation_id":"b4065469-9bb8-4996-ab0d-9738cd5af3a7","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:af87b3ad7e5c2ed8f741b17a4fd87ae12d4d2314d43b9d9f3c9e6a044be690e5","observation_id":"9d012863-51cd-4da2-aa1c-4d2e4753f6c7","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":"Hendrycks and K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:acb7449d249b1558109b2e67e07a7b559338868f6e841e6480bdff0aa87cfbcb","observation_id":"df9418cb-fb0e-4e1d-9767-9e17b0a8a68a","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:a392ba685e40c846b6a52fb9ca888cde63cd8672a19aa4ad58812cf62e29d6fe","observation_id":"92697b6e-374a-4753-819e-0900fe5eb8ef","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-14T12:17:04.321971Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-14T12:17:04.321971Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.10369"},"observation_digest":"sha256:4a9f2f90b55b1fa1d1394107478a882f822cfd384f655a70038a286e6c975cb0","observation_id":"7b563fe2-8c7e-4de4-bae2-6ca0a6edc460","resolution":{"observed_at":"2026-07-14T12:17:04.321971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10369","last_updated":"2026-07-11T15:45:12Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-21T13:59:50.623070Z","submitted_at":"2026-07-11T15:45:12Z","title":"VINE: Taming Generative Control Policies for Reinforcement Learning"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2607.10369."}