{"as_of":"2026-08-05T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4804e977076adeff0da958a11b3f5ad66809d5fe2ed525a3051544472be490be","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:31:03.548002Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08520/citation-record","integrity":"/paper/2606.08520/integrity","json":"/paper/2606.08520/citation-record.json","paper":"/paper/2606.08520"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":"2503.20020","doi":"10.48550/arxiv.2503.20020","metadata_source":"pith","pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini Robotics: Bringing AI into the Physical World","venue":"cs.RO","work_id":"f7c5ce10-8364-4fbe-964f-2802b81c3a98","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:cabe7aa22d2b80a27ce76ac9147eba27edea8cc32bdbba4ed8609e70b0abd439","observation_id":"29dcf011-73a4-4cc3-88c5-01f114b961a8","resolution":{"observed_at":"2026-07-02T22:57:26.612481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20012","last_updated":"2026-04-21T21:40:58Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T21:40:58Z","title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","version":1},"cited_work":{"arxiv_id":"2604.20012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20012","snapshot_observed_at":"2026-07-03T15:28:34.397095Z","title":"EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training","venue":"cs.CV","work_id":"25e9c948-c8e5-4c08-960b-6cafa2591f3d","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2604.20012","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:578564171e29644514eb664d8b5f316bdea715751d9d77dd9a3f7dcc250a3215","observation_id":"460bb0ff-50d3-465a-a812-b69b7402c516","resolution":{"observed_at":"2026-07-02T22:57:26.615010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11766","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:37:42.924974Z","title":"Igniting vlms toward the embodied space","venue":null,"work_id":"a0f111cf-bd1b-4bc6-ad3a-f8ffbc1045f4","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:ef6dd7b5316136bf97847b785b3f1d5f06d3edc767faa4cc6595e3f27f62c852","observation_id":"4e6a4262-53c0-4e82-ab77-aff0862c6221","resolution":{"observed_at":"2026-07-02T22:57:26.628205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:07:47.711193Z","title":"arXiv preprint arXiv:2602.12684 (2026)","venue":null,"work_id":"d4ca4245-5a33-487c-83b0-988ef4c60db7","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:9986251c2521edb584ff3f2fea8a9de7a190aa04d1fd6d61bc57999365f50f41","observation_id":"ef10b2c3-edfc-4521-8e6a-30964501aaa6","resolution":{"observed_at":"2026-07-02T22:57:26.622739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:416ca784955f2332615de601203ab37aa0d434d335b12096b579833463a66f14","observation_id":"1592a1a8-d3a3-4d4a-b020-51085000774b","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:761e84597134921cb56847aa624e9289e91032c6256a13fc6fd2e33a9ce19e15","observation_id":"14f6b857-9e3e-40bc-99fa-2e39facb714a","resolution":{"observed_at":"2026-07-02T22:57:26.645410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.803123Z","title":"A systematic study of data modalities and strategies for co-training large behavior models for robot manipulation","venue":null,"work_id":"2914c6aa-5a4a-44eb-8e37-2b9466c70969","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:00110edbb2a0fa5bb154d73277f16609e82005af093909d275dd5abb9dd00b3c","observation_id":"fb9e9331-da8a-47c4-b19d-cdf6ac22a7b1","resolution":{"observed_at":"2026-07-02T22:57:26.650394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Chatvla: Unified multimodal understanding and robot control with vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:f3c0e3264c153d09b75c563c986855a8bd422c6c115eac3e1667190ff9cb8c83","observation_id":"22637b58-5be2-4d69-ab4a-92a833b5b291","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:b23beeb94f441351be99d5dfc8df2b0d79552222f91aff4e4009d5c057bcb9ea","observation_id":"5da27947-44cb-4286-bb46-a924cee80148","resolution":{"observed_at":"2026-07-02T22:57:26.647847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:11bf0d1ed8c7c1b8171559c49c4047ea4464dd2e94b60f4a0585e3a7bbe1eff1","observation_id":"46e5ad93-4708-4fca-aea1-78ce8dec9fce","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.21112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.897588Z","title":"Eo-1: Interleaved vision- text-action pretraining for general robot control","venue":null,"work_id":"b512941f-aa42-401d-9e2e-c336dbb630ef","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:ba68e7879a33fc23bbf3d983d0ba0e5870ea4e6e2d00176e6232f2f5143d5a3f","observation_id":"e7f7a941-d341-4a4e-a830-2890fd0b7133","resolution":{"observed_at":"2026-07-02T22:57:26.642726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":"2507.15493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-07-10T04:16:48.751910Z","title":"GR-3 Technical Report","venue":"cs.RO","work_id":"7f3b800b-0146-4c37-b178-0801cd4270db","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:166db4e50021ae034d9019f4b48b2a4989f884ff6ca28625c1651aab6102942c","observation_id":"a911f3f1-358f-4c94-91fa-773766c3f1e8","resolution":{"observed_at":"2026-07-02T22:57:26.677005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00576","last_updated":"2025-08-30T18:04:19Z","snapshot_observed_at":"2026-08-05T13:31:08.573875Z","submitted_at":"2025-08-30T18:04:19Z","title":"Galaxea Open-World Dataset and G0 Dual-System VLA Model","version":1},"cited_work":{"arxiv_id":"2509.00576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.00576","snapshot_observed_at":"2026-07-08T07:14:45.460259Z","title":"Galaxea open-world dataset and G0 dual-system VLA model","venue":"cs.RO","work_id":"568af32f-f647-4c11-a106-65ddfa305082","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2509.00576","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:d0ba1fe1351948f2884397fa258dab121e517ff75aeae0a33cf2aa774bb25666","observation_id":"05feb8e7-087c-42d5-8eba-960c42c48d81","resolution":{"observed_at":"2026-07-02T22:57:26.673881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Knowledge insulating vision-language-action models: Train fast, run fast, gener- alize better","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:ebaa238105d22354d2288f36aea79d9eee8fa70658a4cc31a53a0de998415bae","observation_id":"9a1d4219-70fa-482e-a2e7-b454a33a5ad4","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":"2601.18692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-07-10T07:26:54.460833Z","title":"A Pragmatic VLA Foundation Model","venue":"cs.RO","work_id":"9b5a37fb-5c5d-4fbb-a804-d518173f2011","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:886bc5e3ebeb52b97c286986622340c652b00474ba47dbe7cbc8db3693a96f35","observation_id":"e010a228-eaf8-46c1-b883-7cf153fb5c90","resolution":{"observed_at":"2026-07-02T22:57:26.678999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:a23a233e1a5fface260bea0a11db11e837215d0a1793d585d46b5212274e537d","observation_id":"477ab6b8-3c21-442e-b7cc-f2d28d8bb2f0","resolution":{"observed_at":"2026-07-02T22:57:26.674115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:eb69e7d902fb550ca9a34f0d3f1b80ab7e078fbccd7cc133b84e9d67acfc502e","observation_id":"cedb128f-31bc-4cfa-8442-5722a19a0ea6","resolution":{"observed_at":"2026-07-02T22:57:26.671406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04952","doi":"10.48550/arxiv.2512.04952","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Faster: Toward efficient autoregressive vision language action modeling via neural action tokenization.ArXiv, abs/2512.04952","venue":"ArXiv.org","work_id":"8fb5c8e4-6a2e-429a-a6f4-60b96b099a06","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:729d5c7a91ba2686ff474c261a709e4b0951fce1b35a81f00f5af83a1ce16ba8","observation_id":"7dd4a909-461c-4f8e-b9cd-0129c9d8f77a","resolution":{"observed_at":"2026-07-02T22:57:26.681722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03309","last_updated":"2026-05-30T09:29:28Z","snapshot_observed_at":"2026-08-03T12:30:32.952137Z","submitted_at":"2026-01-06T09:58:24Z","title":"VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2601.03309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03309","snapshot_observed_at":"2026-07-04T11:19:48.912353Z","title":"Zhang, X","venue":"cs.CV","work_id":"02ccd335-a745-48b8-bacf-fa8fc7fbb688","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2601.03309","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:d502f2cd0b84ee98079335ab5c299f171f1f651598ae82e9ef065fb02a977149","observation_id":"c8fc0162-4792-4fc5-956d-ab8b054215cd","resolution":{"observed_at":"2026-07-02T22:57:26.647132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:19:48.924000Z","title":"Ac- tions as language: Fine-tuning vlms into vlas without catastrophic forgetting","venue":null,"work_id":"a8b7692b-84b1-4310-984e-5a3de309c6a0","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:8233315b0c967f36110cd4c56bd60b9eff497bc21deaff373c1f9d8aeb52d6b5","observation_id":"2c35d1c4-abc9-4c55-945c-d0f17d0d0ff2","resolution":{"observed_at":"2026-07-02T22:57:26.659245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T11:29:50.781481Z","title":"Internvla-a1: Unifying understanding, generation and action for robotic manipulation","venue":null,"work_id":"b503bc61-19a8-4a18-99bc-5b86ac149193","year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:03147100245c58f2bd7514f0e2c773b91ef09f678a104dc891b714fd3b0b30a0","observation_id":"e26e08bd-e99d-4c0a-a476-3ee6c1c12b0b","resolution":{"observed_at":"2026-07-02T22:57:26.656442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-07-06T21:27:51.964897Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":"2505.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-07-04T10:59:46.871127Z","title":"Sanketi, and Ken Goldberg","venue":null,"work_id":"9057ea9c-38d5-4d10-bc50-8c79fb2d9cf2","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:aac2218a307914c75684f0aad41e4a8c917dabcead9da922a8868055b85a0742","observation_id":"6d129ccf-4039-44f3-a1d0-427ab9ba868a","resolution":{"observed_at":"2026-07-02T22:57:26.630648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:d77326be18d6b896ce8b0f2fb0d1663019ada9e30bb5e801f9a65bed4f14eff2","observation_id":"701eabf1-8228-461c-a46c-7db94ea50895","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Embspatial-bench: Benchmarking spatial understanding for embodied tasks with large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:6f34df8504e74293b9e450838d1329474e42dedc3cb457e32710f23f412a519b","observation_id":"cd253d67-0c96-4767-9da7-3b10e9415ae4","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Roborefer: T owards spatial referring with reasoning in vision-language models for robotics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:157c27f903112a5daa4505e2a9080296d17f6c954b16e9469b9cb1d22317d422","observation_id":"63018ce9-77f5-4a14-90a8-1cfafef2806f","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":"2406.10721","doi":"10.48550/arxiv.2406.10721","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":"arXiv (Cornell University)","work_id":"af457b2b-ad31-4178-ae3c-b18aaa2623ec","year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:c70a7fa6eb460b40f5ba32aad8440d617407eba19a332c2be9142d42951a9d64","observation_id":"814a907f-5180-4204-9aa0-d918b211eebe","resolution":{"observed_at":"2026-07-02T22:57:26.625464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:b23c00bda5bb6ce7729d52e644dfb0b0d5e1e6ed05dc65d3faa944888b99b3b0","observation_id":"a11db8bf-714e-49f6-950a-13c186bb2ccd","resolution":{"observed_at":"2026-07-02T22:57:26.684079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-07-06T21:51:19.351544Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":"2507.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-08T12:04:50.478072Z","title":"Robobrain 2.0 technical report","venue":"cs.RO","work_id":"b5af43a7-ae6e-46b6-afdd-0e8e4a3a5da2","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:e8f46e8c0e3033b65861402deb907a8434128448ed7c9f8aec129f22069cf0f7","observation_id":"321c1fc5-bf7f-4f15-a02b-395bb2b7be90","resolution":{"observed_at":"2026-07-02T22:57:26.661631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":"2511.16518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-07-05T11:41:02.521274Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","venue":"cs.RO","work_id":"d195ae66-288b-40f6-9dc0-c6a4c02fc03d","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:f9c71d15190d4b9609f6eeb43f3053b4cf637406ac99518a73004f51726cb377","observation_id":"5e7b8b53-e5e9-4e87-86f1-3828d3965072","resolution":{"observed_at":"2026-07-02T22:57:26.666647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17001","last_updated":"2026-05-13T17:20:33Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-21T07:10:31Z","title":"Unify Robot Actions in Camera Frame","version":2},"cited_work":{"arxiv_id":"2511.17001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.17001","snapshot_observed_at":"2026-07-02T22:57:26.662723Z","title":"Unify Robot Actions in Camera Frame","venue":"cs.RO","work_id":"08a7d279-75b9-439e-a90d-6d452c42a323","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2511.17001","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:6b627fcc625edba89deceb854eb1c7b711b337658c2c1a3751f71f6f17522f44","observation_id":"9d7360df-869f-4e25-88a0-e7c80dd2894c","resolution":{"observed_at":"2026-07-02T22:57:26.663913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:6aadfcc7ac6624caa63c37adcd2b162bc269436b4811405c4e9341d4054c76a2","observation_id":"540329be-a789-4f8c-ae5c-fef726a31720","resolution":{"observed_at":"2026-07-02T22:57:26.620183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:969205ba8a8b8a6c71e39eb28243e631b7e048d8cc3428509ac1171bc86c50b7","observation_id":"3eae0e49-d2a0-46a1-91fa-d0b3f4407521","resolution":{"observed_at":"2026-07-02T22:57:26.636927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:e29ae4ff299bd5614525486a0d02af95a4b6c23e0abf635786deb7d326fa4ed0","observation_id":"698a2985-af00-4ae2-a4af-853a6e81ddd2","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":"2405.05941","doi":"10.48550/arxiv.2405.05941","metadata_source":"pith","pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","venue":"cs.RO","work_id":"7f4ca6cb-1b94-454c-9623-b52441b74b61","year":2024},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:d7cb42aadba1f89573601666ec62c18d33ef129a04ac5ec3fdbce6d6b4c25413","observation_id":"ae7641ee-7863-4a21-942e-d342a29113a9","resolution":{"observed_at":"2026-07-02T22:57:26.640254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Vlabench: A large-scale benchmark for language-conditioned robotics manipulation with long-horizon reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:280a12e0e869dc8cb9e0cbf613945c804e60f0a047aa31fe12d2e9e8aa7dd9cb","observation_id":"bd49973d-68c3-4196-905a-e52aa94c36a0","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Bridgedata v2: A dataset for robot learning at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:6272bb12903919f446b51c3bd8ebb9895e247b5e6863a51228b5ccfc7ddab619","observation_id":"c871eba9-716d-45e1-a9bd-551bc47b7ccb","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Vla-os: Structuring and dissecting planning representations and paradigms in vision-language- action models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:978b391b58fea40c113ccc6ef24d44191869ab131b6187555cdcbd2fe22d9b02","observation_id":"2478e3dd-b18f-4f24-a019-cb1338381a44","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:7eecc92bb21049f83265001ac192d1756fe1f9c339dc7be18ae5e02e8f6a649b","observation_id":"37f66123-0fbc-4c61-861c-776f06427abc","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:69b4212213d401475bf1db1bfce5b8b9c7d9784f4587a08b79e8ab3e27ebb939","observation_id":"63632920-b112-483c-aeb2-90d0b005252a","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"COL\", positioned in the center-right of the scene, to the left of the","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:f5d155d73f7abd6001c5fbb536c8a3ea65a4f905d96835c20f164c49e5389f2e","observation_id":"e925a7e5-0c83-4db2-80e2-9cf8d79fc35f","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:31:03.548002Z","title":"bike” → “bicycle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T18:31:03.548002Z"},"links":{"citing_paper":"/paper/2606.08520"},"observation_digest":"sha256:a1c6114f68a3ac55bd8042d05e3807259ec33631c7e26ffa11f4522e6b2586ab","observation_id":"d06cd3c9-3fb2-4e9d-a0ef-cbc759b44cec","resolution":{"observed_at":"2026-06-27T18:31:03.548002Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08520","last_updated":"2026-06-07T08:57:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:57:51Z","title":"Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":14,"verified_exact":24,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2606.08520."}