{"as_of":"2026-08-09T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef3281f529b32253e3c3302081b5dcdd8bc4f3c52ecd25b408b56c92a0465504","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:38:41.768698Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-14T19:48:48.725800Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2502.05855"},"observation_digest":"sha256:370bb6c7073dc05555c137079de5c38abbab360b5e172833b90093625a7a98d7","observation_id":"83a3fcea-f4b4-4d05-886d-741da72770f3","resolution":{"observed_at":"2026-05-14T19:48:48.806390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2503.03480","last_updated":"2026-04-19T06:23:17Z","snapshot_observed_at":"2026-07-30T14:07:10.544745Z","submitted_at":"2025-03-05T13:16:55Z","title":"SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T01:27:33.123243Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2503.03480"},"observation_digest":"sha256:ef1d084d62f982fb0de5541f8cfa45728419821e642306fc0f35ebdd6fbcfded","observation_id":"d799988c-429d-4e5f-9812-7004b9454f9e","resolution":{"observed_at":"2026-05-23T01:32:22.363054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T15:09:24.367362Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2503.06669"},"observation_digest":"sha256:1c7ac243e2503d247e99872031834676964815e8969bc7e7b6652df79b52982d","observation_id":"2fe91573-9106-4706-b7c4-aa0c4edc2f88","resolution":{"observed_at":"2026-05-11T15:09:24.594651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T15:28:06.883492Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2505.06111"},"observation_digest":"sha256:2bca82d5c4689e370cb681368c4d594a3d0e93d9cf4dd19256e2c2bf1836ed81","observation_id":"a6898c71-0575-4ffd-8d6e-122c1bd2b242","resolution":{"observed_at":"2026-05-12T15:28:06.959009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:d82762442e1c8ed468c171e02b01901dd624320a87d30e2b926264f3233c4be4","observation_id":"a50457bd-f4cd-4f9a-a775-a7e4dfb9c6c6","resolution":{"observed_at":"2026-05-16T12:55:40.398126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-07T11:11:40.572064Z","title":"Grape: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03350","last_updated":"2025-06-03T19:43:58Z","snapshot_observed_at":"2026-08-09T00:38:29.639641Z","submitted_at":"2025-06-03T19:43:58Z","title":"Adversarial Attacks on Robotic Vision Language Action Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:40.572064Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2506.03350"},"observation_digest":"sha256:7f3374a9eb919154ae707437374906c7307ddac101a1918355d7adb90be4b124","observation_id":"4bface85-924a-42ee-a04b-36476e85f515","resolution":{"observed_at":"2026-08-07T11:11:40.572064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-07T00:40:37.279568Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":258,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:37.279568Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:26a6fa75107668d02b8bb6a7fbe2501155a17843b29d6f41c83d717c5105b94b","observation_id":"29e67213-daad-427c-b70d-6acbf6f1b574","resolution":{"observed_at":"2026-08-07T00:40:37.279568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:2a02485d1b8944b54cd559b7ed5ad47225bef29dbace0c5446fe5485ed113a36","observation_id":"8878e613-9cc9-4eda-923c-404de6112c0d","resolution":{"observed_at":"2026-05-17T20:28:16.109526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T10:30:23.688049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04063","last_updated":"2025-09-04T09:48:43Z","snapshot_observed_at":"2026-08-06T19:50:15.003871Z","submitted_at":"2025-09-04T09:48:43Z","title":"Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T10:30:23.688049Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2509.04063"},"observation_digest":"sha256:32b2cc313a34f431850007c278e47d16b52bcb97f1cbd223ee19eaaa0e42f52c","observation_id":"02898c68-a010-4aa3-adf2-0cfe4243bf80","resolution":{"observed_at":"2026-08-05T10:30:23.688049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:11.189795Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2509.09674"},"observation_digest":"sha256:1fcc2cdcbe2ed1c5e1420cf059c266f78693be7f8d6321401023ee6141e12e36","observation_id":"fd5ff45e-a0ba-4ba4-952a-a685a8f4638b","resolution":{"observed_at":"2026-05-15T08:02:11.464210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-04T10:24:57.958256Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09976","last_updated":"2026-06-25T14:25:12Z","snapshot_observed_at":"2026-08-04T10:24:54.103532Z","submitted_at":"2025-10-11T03:11:18Z","title":"Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:24:57.958256Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2510.09976"},"observation_digest":"sha256:bfaf7205d72472f80a85381efb3765945a514fcaceb2ff6b78acca6a70e1ecdf","observation_id":"54f664df-f197-40ff-89df-f5497b457f57","resolution":{"observed_at":"2026-08-04T10:24:57.958256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2510.12710","last_updated":"2026-04-09T08:55:45Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T16:44:39Z","title":"Reflection-Based Task Adaptation for Self-Improving VLA","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T07:28:11.187479Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2510.12710"},"observation_digest":"sha256:f4d094f579c2c66fd006f8b072399014e723794cae340cad76048d7f3417655c","observation_id":"40ef77c0-734c-44db-9fd0-8c8f4fb483ea","resolution":{"observed_at":"2026-05-18T07:31:02.933528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2510.17640","last_updated":"2026-08-05T02:51:23Z","snapshot_observed_at":"2026-08-08T23:09:05.210442Z","submitted_at":"2025-10-20T15:21:12Z","title":"RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T06:10:47.309028Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2510.17640"},"observation_digest":"sha256:1fb0a3ecdf00ec54ca74da1757cc4622ea1b83d1c4269781b0524fb5d1b5e2ae","observation_id":"a64082d7-3ec8-4d36-bd0f-2c30aa744d6b","resolution":{"observed_at":"2026-05-18T06:10:57.868145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:752678e9e5074f820fee0dfa5e1ce94bf9fa6027e5969d4ea130f29446269e40","observation_id":"1dd654af-0a47-4061-a394-7a1a3f3bf613","resolution":{"observed_at":"2026-05-12T10:34:59.387695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2511.15669","last_updated":"2026-08-05T03:23:59Z","snapshot_observed_at":"2026-08-08T23:09:08.696409Z","submitted_at":"2025-10-31T05:26:16Z","title":"DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-18T03:09:09.713822Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2511.15669"},"observation_digest":"sha256:73ed94c68ea48505606484f2c3cbdaa82dedb9cb7be6f7bcbecf93791ff3484d","observation_id":"eb701436-3068-4bac-a2b7-ca52cf2f6edc","resolution":{"observed_at":"2026-05-18T03:10:48.869856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-03T13:53:27.515205Z","title":"Grape: Generalizing robot policy via prefer- ence alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.22539","last_updated":"2026-07-02T08:55:28Z","snapshot_observed_at":"2026-08-06T03:03:38.906157Z","submitted_at":"2025-12-27T09:40:54Z","title":"VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T13:53:27.515205Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2512.22539"},"observation_digest":"sha256:478c6bd80486e5578c75efee594b381b722599197c6725993f605a427fb39d4d","observation_id":"fd542b69-2fa3-45a5-a2df-22e01d8028ab","resolution":{"observed_at":"2026-08-03T13:53:27.515205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2602.09023","last_updated":"2026-05-19T02:18:04Z","snapshot_observed_at":"2026-08-02T13:36:40.045905Z","submitted_at":"2026-02-09T18:59:52Z","title":"TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:53.818915Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2602.09023"},"observation_digest":"sha256:31fc068d71ab654065ba00219fb517512b6bedd48579b3d15c7910c1371224ce","observation_id":"62cb33a6-30c1-48ce-b3d1-b892d91f022f","resolution":{"observed_at":"2026-05-21T13:14:10.900849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-13T16:10:12.689957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.28730","last_updated":"2026-05-26T17:56:39Z","snapshot_observed_at":"2026-08-06T10:59:04.687049Z","submitted_at":"2026-03-30T17:46:31Z","title":"SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T16:10:12.689957Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2603.28730"},"observation_digest":"sha256:c9835f8c812756717d8b25dfacca2b2af54705e5f005522587e04f88403cc776","observation_id":"904c8a16-d0a8-4b19-8bae-3e0284a62a0e","resolution":{"observed_at":"2026-07-13T16:10:12.689957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-02T05:19:22.679378Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T05:47:17.494531Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:0b920c7d2afd3c9cc8e0ad95ac1a1b7e55fef8eaba6af054a711674ddb230eaf","observation_id":"42866686-c264-452a-a320-63705cc5313b","resolution":{"observed_at":"2026-05-12T10:31:30.009180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-02T05:19:22.679378Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.352130Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:a7f1a644c2cc6ae34cdb22312c9416ae8253dc0d326ef02b39fff2dcc43f9b1f","observation_id":"e7e21ad5-2002-4d86-9cfb-3157990b3a32","resolution":{"observed_at":"2026-05-11T22:17:03.135989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T19:31:38.069592Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:df9ca689c2ee23d5f0c7085cad6b84e2006311c79c4e8f0a26817a73950fb27f","observation_id":"5605a0c1-a662-42a1-acba-56c0b3227373","resolution":{"observed_at":"2026-05-11T15:36:10.861354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.00416","last_updated":"2026-06-03T08:01:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:20:26Z","title":"Learning While Deploying: Fleet-Scale Reinforcement Learning for Generalist Robot Policies","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-01T08:05:47.128354Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.00416"},"observation_digest":"sha256:336b5709319c082b8b0de6bf9533b19d6ac2347518b97c54e357a718ff14e22a","observation_id":"8446b9d6-3128-4dda-b251-182de97f9328","resolution":{"observed_at":"2026-07-01T08:15:32.297095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.08774","last_updated":"2026-05-09T08:00:59Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T08:00:59Z","title":"ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T01:40:22.192349Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.08774"},"observation_digest":"sha256:3d7379c37b09345bc3051e09c12431ee77b1bc74faba06a58476d25bde3bde44","observation_id":"14c156f9-c290-4a3b-b2ff-a42e8914e864","resolution":{"observed_at":"2026-05-12T01:41:19.940732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.09410","last_updated":"2026-05-10T08:24:05Z","snapshot_observed_at":"2026-08-02T13:43:45.064816Z","submitted_at":"2026-05-10T08:24:05Z","title":"RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:39:32.715650Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.09410"},"observation_digest":"sha256:cd3201a21a0a5e96c8d73c4d8b63e54fc0a0466a05cd8a91c4e2c9235c29045e","observation_id":"406737e0-8593-4ee5-98f8-7b550cf92ba6","resolution":{"observed_at":"2026-05-12T06:01:25.984235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.12167","last_updated":"2026-05-12T14:15:16Z","snapshot_observed_at":"2026-07-06T23:23:54.142937Z","submitted_at":"2026-05-12T14:15:16Z","title":"From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T04:44:03.661688Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.12167"},"observation_digest":"sha256:e547812b5b7572e4f8af724ae2b1d491869b36bdf389b4acdf06a857982e7d24","observation_id":"5e16325d-038d-4ed9-998a-680fd90a8f0c","resolution":{"observed_at":"2026-05-13T04:57:17.884932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.17486","last_updated":"2026-05-17T14:55:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-17T14:55:32Z","title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","version":1},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-05-20T12:39:50.004269Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.17486"},"observation_digest":"sha256:e70c19c235adf9cf94bef85dfd5c20d475bde564930cb547c258acd249e9edc1","observation_id":"c38a1916-b160-4388-893a-8d8bf55445c7","resolution":{"observed_at":"2026-05-20T12:43:17.293277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2605.19580","last_updated":"2026-05-19T09:22:49Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:22:49Z","title":"PAPO-VLA: Planning-Aware Policy Optimization for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:12:26.907425Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2605.19580"},"observation_digest":"sha256:e362bb2132ebe4ad12cfa85f4d8ab584b36852ec63d07ae07e7bf77c8bf53fba","observation_id":"5114bd6a-3171-4846-b807-df20d8a2dfa4","resolution":{"observed_at":"2026-05-20T05:13:03.383440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.01036","last_updated":"2026-05-31T05:56:28Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:56:28Z","title":"Position: Good Embodied Reward Models Need Bad Behavior Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:17.337336Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.01036"},"observation_digest":"sha256:23c0b8431cacb03ade15d77195ed12cdd894267236658b2fe4fcc3c7148b56a0","observation_id":"9a8982b7-5c89-4284-bcae-25bde5ea9884","resolution":{"observed_at":"2026-06-28T17:22:24.973243Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.05468","last_updated":"2026-06-03T21:47:43Z","snapshot_observed_at":"2026-07-06T23:45:28.379468Z","submitted_at":"2026-06-03T21:47:43Z","title":"FlowPRO: Reward-Free Reinforced Fine-Tuning of Flow-Matching VLAs via Proximalized Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T05:38:11.089753Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.05468"},"observation_digest":"sha256:0213dd643c4b81be00bfbd324ebd02819bb440478e04cf25814a0ed202273b1f","observation_id":"02a91f91-65be-4ab1-a6f7-ca0aaa2d4ece","resolution":{"observed_at":"2026-07-02T09:06:49.389175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.12372","last_updated":"2026-06-10T17:38:24Z","snapshot_observed_at":"2026-08-06T11:07:11.202179Z","submitted_at":"2026-06-10T17:38:24Z","title":"UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T09:46:59.746745Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.12372"},"observation_digest":"sha256:6d8b6f882431571aa8491178c1e9141d615fc6626c4d5d81b8d35fb753db8487","observation_id":"7f8b034d-70c4-4bbb-b528-7fe26894c452","resolution":{"observed_at":"2026-07-03T10:58:02.728427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.12550","last_updated":"2026-06-10T18:01:06Z","snapshot_observed_at":"2026-08-02T12:19:26.092564Z","submitted_at":"2026-06-10T18:01:06Z","title":"Foresight: Iterative Reasoning About Clues that Matter for Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T09:35:05.441401Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.12550"},"observation_digest":"sha256:afeb9e13174a83615cd7e956967fd4053c06d1852c565b1b790ee1a47228ea52","observation_id":"627851db-f62c-4f08-9b3e-9bb97f8af871","resolution":{"observed_at":"2026-07-03T11:28:04.175007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-02T11:31:37.690666Z","title":"GRAPE: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14409","last_updated":"2026-07-20T07:32:26Z","snapshot_observed_at":"2026-08-05T17:41:55.223171Z","submitted_at":"2026-06-12T12:45:18Z","title":"Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T11:31:37.690666Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.14409"},"observation_digest":"sha256:6f33c880d47d4458e5ddd060369e05f826175dbdd93b742b6dd28aad107cf5c1","observation_id":"f7277805-4317-4e28-9e61-fc005ca76c40","resolution":{"observed_at":"2026-08-02T11:31:37.690666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.20698","last_updated":"2026-06-15T08:58:37Z","snapshot_observed_at":"2026-08-06T18:32:43.826239Z","submitted_at":"2026-06-15T08:58:37Z","title":"SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T04:13:22.598591Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.20698"},"observation_digest":"sha256:bde6b139657e3e96b98517bd374cf6faa843a5b27b152411d07968e8b9c8f770","observation_id":"62cfe2bf-a65b-4d10-9fe0-c2e626669ab7","resolution":{"observed_at":"2026-07-03T17:18:44.353030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.20698","last_updated":"2026-06-15T08:58:37Z","snapshot_observed_at":"2026-08-06T18:32:43.826239Z","submitted_at":"2026-06-15T08:58:37Z","title":"SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T04:13:22.598591Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.20698"},"observation_digest":"sha256:c3cfe439b6190d4e2f8ed73dd68062accd9f5b63681a6a5a1e09379c2b6f4036","observation_id":"dd067f52-1652-4806-8e97-4d554a3ac16d","resolution":{"observed_at":"2026-06-27T04:20:31.958581Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.22860","last_updated":"2026-06-22T05:07:08Z","snapshot_observed_at":"2026-08-06T11:26:10.711774Z","submitted_at":"2026-06-22T05:07:08Z","title":"HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T08:45:04.483217Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.22860"},"observation_digest":"sha256:5abf69e12f7f355591f4997cb34694c8299d936932443717e48fb74ed54d43b0","observation_id":"3e82a913-f3bb-4323-ad4c-b10b8512e9dc","resolution":{"observed_at":"2026-07-04T10:29:45.655525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.23640","last_updated":"2026-06-22T17:30:24Z","snapshot_observed_at":"2026-08-02T09:22:48.099895Z","submitted_at":"2026-06-22T17:30:24Z","title":"Learning Process Rewards via Success Visitation Matching for Efficient RL","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-26T09:20:35.062060Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.23640"},"observation_digest":"sha256:ce55084b84165a0b342340123bb1a3c65ea2cdd3e0c00f2e2ca639a35d9fec6c","observation_id":"37132ba4-8cb9-454d-87ad-233ba7680559","resolution":{"observed_at":"2026-07-04T09:59:44.474130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.25800","last_updated":"2026-06-24T13:17:59Z","snapshot_observed_at":"2026-07-07T00:00:12.737052Z","submitted_at":"2026-06-24T13:17:59Z","title":"ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T20:22:16.508280Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.25800"},"observation_digest":"sha256:6ff3268b7fb809502a754453b0bd9fdb511fe6b44637834b7690927004ede1de","observation_id":"276ca8c9-6be5-404b-8e94-6c71abf6c499","resolution":{"observed_at":"2026-07-04T20:20:07.062167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.29892","last_updated":"2026-06-29T07:31:41Z","snapshot_observed_at":"2026-08-02T16:37:27.749603Z","submitted_at":"2026-06-29T07:31:41Z","title":"Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T06:02:15.781538Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.29892"},"observation_digest":"sha256:e35f0fb29d7819c917e22811d0cde81b5fe049d377b2220d31481ca0b945d2ef","observation_id":"f7e59c4a-1b10-4957-ab3e-fd326e41c4b5","resolution":{"observed_at":"2026-06-30T06:04:21.163124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.31157","last_updated":"2026-06-30T05:35:18Z","snapshot_observed_at":"2026-07-07T00:04:53.774826Z","submitted_at":"2026-06-30T05:35:18Z","title":"Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-01T06:38:44.170473Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.31157"},"observation_digest":"sha256:0bf523541ac9f5da6f7b5642baf3cbb88ca44f8e40073715dc52a9b6eaa1d785","observation_id":"5c19d9a5-74d1-4f82-8f75-e53ecebe2fc2","resolution":{"observed_at":"2026-07-01T06:45:29.789741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2411.19309","doi":"10.48550/arxiv.2411.19309","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grape: Generalizing robot policy via preference alignment","venue":"arXiv (Cornell University)","work_id":"5bd96935-22ff-44dd-b907-e5d9bba0d61f","year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-06T23:11:22.545657Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T04:58:28.971536Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:9d25bcf363561b163f60db1bce3ead32fee3336ea340e5dd03dd8f4fe0d94026","observation_id":"534908e9-3bd8-4b9e-a92e-584e4d8aa8a2","resolution":{"observed_at":"2026-07-01T10:55:41.966122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-14T16:55:18.028851Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-06T23:11:22.545657Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T16:55:18.028851Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:55b9bbf87e73a24171d219ec036c24b59d2fb129422080b6decef1395dfdd7d4","observation_id":"2d48f57a-1bc6-4b95-bcde-dd18adfd100a","resolution":{"observed_at":"2026-07-14T16:55:18.028851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-04T02:32:19.142604Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-06T23:11:22.545657Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T02:32:19.142604Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:994e0c7dbc323bc192e5fbb97e018d625176822b99954ad26f386b3066fc17d3","observation_id":"1b5e5b47-3b10-4bcf-8972-443f065ab236","resolution":{"observed_at":"2026-08-04T02:32:19.142604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-07-30T14:45:01.915411Z","title":"GRAPE: Generalizing robot policy via preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T14:45:01.915411Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:09dfcdf28b6f37540e762a8c2bec2cbca38f2b6fd36c8660f18372c959fbf3f7","observation_id":"2f0f7346-005b-42ac-ba88-c2df11dc3a3b","resolution":{"observed_at":"2026-07-30T14:45:01.915411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-01T10:23:14.040221Z","title":"GRAPE: Generalizing robot policy via preference alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26991","last_updated":"2026-07-30T04:10:42Z","snapshot_observed_at":"2026-08-06T10:54:05.264923Z","submitted_at":"2026-07-29T14:49:56Z","title":"RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:14.040221Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.26991"},"observation_digest":"sha256:7e0de2bfb72e98f0a2e18c46fe886b82d1eb9c69efa94f8f87a4705fc184478f","observation_id":"8247ecf9-282f-4cea-99d9-e682e690fe3f","resolution":{"observed_at":"2026-08-01T10:23:14.040221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-01T01:32:25.304633Z","title":"Grape: Generalizing robot policy via preference alignment.arXiv preprint arXiv:2411.19309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27782","last_updated":"2026-07-30T07:14:39Z","snapshot_observed_at":"2026-08-07T16:30:55.760479Z","submitted_at":"2026-07-30T07:14:39Z","title":"RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T01:32:25.304633Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2607.27782"},"observation_digest":"sha256:0963fd6460216db4ae10739e908b1b6b1d2466681d0aea7dd89641fe488d8639","observation_id":"a95f753a-b662-479e-bbb8-80748f72cebb","resolution":{"observed_at":"2026-08-01T01:32:25.304633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19309","snapshot_observed_at":"2026-08-07T19:38:41.768698Z","title":"Zhao,Q.;Lu,Y.;Kim,M.J.;Fu,Z.;Zhang,Z.;Wu,Y.;Li,Z.; Ma, Q.; Han, S.; Finn, C.; Handa, A.; Liu, M.-Y.; Xiang, D.; Wetzstein,G.;andLin,T.-Y.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05999","last_updated":"2026-08-06T13:07:56Z","snapshot_observed_at":"2026-08-09T01:12:11.992268Z","submitted_at":"2026-08-06T13:07:56Z","title":"Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T19:38:41.768698Z"},"links":{"cited_paper":"/paper/2411.19309","citing_paper":"/paper/2608.05999"},"observation_digest":"sha256:599829d26d43bfb1dff7652e73256b58afae10657928e855ec846346be9dd8c7","observation_id":"97963ac0-26fe-4a7e-b568-b59535017128","resolution":{"observed_at":"2026-08-07T19:38:41.768698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19309/citation-record","integrity":"/paper/2411.19309/integrity","json":"/paper/2411.19309/citation-record.json","paper":"/paper/2411.19309"},"outbound":[],"paper":{"arxiv_id":"2411.19309","last_updated":"2025-02-04T08:49:11Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-31T23:24:14.896271Z","submitted_at":"2024-11-28T18:30:10Z","title":"GRAPE: Generalizing Robot Policy via Preference Alignment"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2411.19309."}