{"as_of":"2026-07-27T08:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad9e072e984dfba62d16f268ce5b096bacc28af6fc4919291161315b935bfa64","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T19:24:59.678266Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-27T06:30:09.085275+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.08288/citation-record","integrity":"/paper/2606.08288/integrity","json":"/paper/2606.08288/citation-record.json","paper":"/paper/2606.08288"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2508.19236","doi":"10.48550/arxiv.2508.19236","metadata_source":"pith","pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-07-10T23:37:43.221441Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","venue":"cs.RO","work_id":"921d4c77-1e8b-489d-987a-1c0c990e5ce8","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:bbbf348fac2d1f41681565a6c37dddedf1866054003e6dbeea08968321ffd9bc","observation_id":"ce05b789-c25e-4ad8-aefa-d980a80d3f04","resolution":{"observed_at":"2026-07-02T21:57:25.762081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":"Zhang, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:ddb7b3ca312ac61d796e8a9c1dc54691e8078dfea4203b072c4104010d6c1578","observation_id":"becc91f0-7c5e-40ad-966d-c2bf4ebcf923","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:09:15.358268Z","title":"arXiv preprint arXiv:2512.00903 (2025)","venue":null,"work_id":"c7dfeff4-12af-40bb-8371-a7770ae32856","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:ee5f8dae8ae9bf63437e301afd846cee2ed8171f29e2120fc19b36ae49cbc7dc","observation_id":"2eb12937-44fc-4ccf-89c3-577d3d8e5d4a","resolution":{"observed_at":"2026-07-02T21:57:25.710510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:fc4e7a21ae6575f11260e6dd7a1393ce88290104254360ea179e3aedfa7fbedf","observation_id":"cfbe9513-1ec6-4c9a-8f79-d598c81abb64","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:64fb28af6227df90ead5021061b10a0fd41dbda9c18abb6387ce643f7dbe866f","observation_id":"8b93af0e-33a2-44b4-9df4-cc1df77a8f0b","resolution":{"observed_at":"2026-07-02T21:57:25.751865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":"2410.24164","doi":"10.48550/arxiv.2410.24164","metadata_source":"pith","pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T00:07:42.817654Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","venue":"cs.LG","work_id":"f790abdc-a796-482f-a40d-f8ee035ecfc2","year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:b05d5eea351a98b39f39860c9f79b08920aa30491140fcc2ccaaf4ea38d28d42","observation_id":"156890f2-867b-4121-9a9a-d00ac2c57b6b","resolution":{"observed_at":"2026-07-02T21:57:25.735303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2501.09747","doi":"10.48550/arxiv.2501.09747","metadata_source":"pith","pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-07-10T11:47:02.947207Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","venue":"cs.RO","work_id":"83a8f966-6cfa-4f21-81f3-87440aae238f","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:84153b895e0af7183099e24ba4fe5f01728766ec70dc59c49fae8a6aa5a76b84","observation_id":"8af34bbe-6bfb-45e3-9f78-ebfcf4dc37b6","resolution":{"observed_at":"2026-07-02T21:57:25.699680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":"2411.19650","doi":"10.48550/arxiv.2411.19650","metadata_source":"pith","pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-07-10T23:07:48.078477Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","venue":"cs.RO","work_id":"4b158d3e-3dff-4412-85cd-baa879465a5e","year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:5efab741ae2123cd562386df37885cf62fe86a14bcbd068ac73a242b0ec90161","observation_id":"ffcb9b3b-187d-4318-900c-d4215ace0d81","resolution":{"observed_at":"2026-07-02T21:57:25.738024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:488d640f4feb1b4967d2df2deb5b5d6e92c9e58c6d6d82c770769b3a827dffec","observation_id":"9f41bb32-00b0-45e7-b573-a07046c8f4e8","resolution":{"observed_at":"2026-07-02T21:57:25.702364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":"2501.15830","doi":"10.48550/arxiv.2501.15830","metadata_source":"pith","pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","venue":"cs.RO","work_id":"592041b3-3ca2-4836-8dd4-f8095d8a692b","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:11a4a24484b68ffc9b1444d5f9b35c015af9d5dd498018d3058f9def6a4ff727","observation_id":"581a61b9-9261-46c9-9733-c7830f2512e9","resolution":{"observed_at":"2026-07-02T21:57:25.756816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:082197a9bbffa4111ee625419ea2f3515cac202d2e7cb980918df3016ec0dc90","observation_id":"d157af41-867b-4a11-b9e6-1f66828c8a26","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:d2c2d3ac9add63a24db2e5605018e4ebfe7449daf5dc4b8c8c384de4e8165938","observation_id":"6b62b554-68a2-414a-8234-d8c1fe871d20","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:7315efb167586286d74f8ba90a609cc8eafa6b9e4257645055333e16f381ab19","observation_id":"ef517cfb-94c8-48b0-ad92-65304edec5ec","resolution":{"observed_at":"2026-07-02T21:57:25.726769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":"2502.19645","doi":"10.48550/arxiv.2502.19645","metadata_source":"pith","pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-10T23:37:42.946293Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","venue":"cs.RO","work_id":"04f46bb3-4346-47e8-bf09-c75d91f96e87","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:db1f71f48f204c627223f5747285cb1bb080637564faea50409faefd7578d6f5","observation_id":"498c6401-9056-4f3a-94fa-75904084d967","resolution":{"observed_at":"2026-07-02T21:57:25.693532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13375","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:39:17.350063Z","title":"Depthvla: Enhancing vision-language-action models with depth-aware spatial reasoning","venue":null,"work_id":"16c300ae-4c10-4266-aa06-0541694dec38","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:709282d5c9dab6e55a8dc5f15d6d6ad32831fae22f339dd7a3f27901072c71dd","observation_id":"71343440-3b93-471f-a36c-b5f5fcb6cf60","resolution":{"observed_at":"2026-07-02T21:57:25.716245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-07-06T22:11:52.522787Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":"2508.09071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-07-03T17:38:43.940925Z","title":"Geovla: Empowering 3d representa- tions in vision-language-action models","venue":null,"work_id":"602b66af-32d5-4baa-a248-8f0013efdf1d","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:f3bbd96a2847c83a0a909255b1345dd9aefaf594db3f5aed9670cabab67a5765","observation_id":"8e4205c0-1ddb-4ee1-8255-a97cdf6b1ef5","resolution":{"observed_at":"2026-07-02T21:57:25.707491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-07-10T23:37:43.136584Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:aff8fa88a7795cb4e2bb55ba2317669f7b29f8d8f4db0b5e18274377d6c7eec4","observation_id":"2402edc9-e6ec-49c1-b578-9dd740c8c2c0","resolution":{"observed_at":"2026-07-02T21:57:25.704961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-11T00:07:42.794081Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:72e0c50078601ee6d5c5d1973a217adbfb570bb2a7419a89acfad8bc1edbff63","observation_id":"768a1dfc-9793-4bf3-9fbc-67263ada5245","resolution":{"observed_at":"2026-07-02T21:57:25.721533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19816","doi":"10.48550/arxiv.2506.19816","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CronusVLA: Towards Efficient and Robust Manipulation via Multi-Frame Vision-Language-Action Modeling, October 2025","venue":null,"work_id":"98421727-12e6-4220-9a07-01a1e8870d40","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:ff7634008521377c26638bf83f5120463aa1f9aa2834849b6baf41c8d79c6151","observation_id":"d9851de9-8024-4d7e-99f3-68a64ee8818f","resolution":{"observed_at":"2026-07-02T21:57:25.697103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:6b9e1f5a041c12649fa8e5163d79f54607da3419e84f876fe374acfedb2baa07","observation_id":"217c62d7-b4e9-46d3-ab4b-f6c4ca5cd1eb","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:bae45d0f0bf423f2a964223e772faa882e7b4f173fe29e9076b48312e6f34c71","observation_id":"e4c2ff33-422d-4016-aeba-894820670023","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:57:25.711641Z","title":"Trace anything: Representing any video in 4d via trajectory fields","venue":null,"work_id":"12812f95-7e62-4b1a-9dc2-7b311ac03e21","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:fac4df61097aa37f5983ffc033707ee2d137df6f76b1990736e84d6835a60a77","observation_id":"fb060526-1fa9-40d8-8d21-26095040bf59","resolution":{"observed_at":"2026-07-02T21:57:25.713111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2506.18088","doi":"10.48550/arxiv.2506.18088","metadata_source":"pith","pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-10T23:17:45.135806Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","venue":"cs.RO","work_id":"9b985126-4a2f-4bdf-b014-2a7524ec634e","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:215d148abf0a6dd3abf889b9f54b6120f2c37e734dd573c7b5cfcc8ba08bb2eb","observation_id":"f00ef7e2-b30b-4424-ba4b-485ec509f887","resolution":{"observed_at":"2026-07-02T21:57:25.754458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:f5abcf3dbfdb43c3202ea86fdb6fab2cb6a020f8695d178b4eafeb74eea97d92","observation_id":"9269021e-873f-4f82-8099-cdb00cb4c987","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:31190d30cccd8162b365176f464dd0446af7340d4ee634ad3dfdee9133335971","observation_id":"5f054e17-2df1-40e7-a0e7-f942ec319d3c","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:60133d990350f7724b1abbc39577fd5a8291abec2a43ae62e4fb2eba35adacd6","observation_id":"9ab60834-1517-4c93-8cc2-a947c51bd141","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:8b914f740067df972ea23bef8bf6bb0e557068b3bcbcc4f18eadaf8dd7de978f","observation_id":"d9716eb4-de8c-4874-ae94-e9098efe21f0","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:63c0f1d437fc236bcd59b0c4e64ea17fff6460f1174925519dbdb960e8730e83","observation_id":"1e0cc53f-fd11-44e9-b8dc-6c5cdb61da02","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":"2405.12213","doi":"10.48550/arxiv.2405.12213","metadata_source":"pith","pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-07-10T10:07:00.871229Z","title":"Octo: An Open-Source Generalist Robot Policy","venue":"cs.RO","work_id":"f9ca0722-8855-48c3-a27a-0eefb7e19253","year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:32068239d2d2055fa2551e2165a3b704643ac2133a9242e3965bf19e5bf2812b","observation_id":"652fb105-eece-4ba1-b0ad-8b8bf1792673","resolution":{"observed_at":"2026-07-02T21:57:25.749161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:6ff341135ac7854ba283e824ff4bf80303ad7f6e91d42399909e9f6f228927d6","observation_id":"fab6cebd-c809-4fa9-9d93-d225e592c9e5","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":"Zhang, H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:84785ba32016fdef26a43a09cf8e62c5257d6e8148446fff795203702378dc87","observation_id":"69adf6e2-2811-40b8-9a01-97732760ea24","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":"Zhang, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:9e67f8d7850cce392179095399a3232811a18a5ee812f3bfb6d9309d846b05c5","observation_id":"554c9f69-63dc-41e6-a147-412a5047a2f4","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:b424334d754d5779c54473b1c63e33f8f74205357b36827491d403f72d314c05","observation_id":"c6d4c726-9ca3-4f6b-a893-f2f31d90d125","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":"2511.10647","doi":"10.48550/arxiv.2511.10647","metadata_source":"pith","pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-07-11T02:27:48.889599Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","venue":"cs.CV","work_id":"0a54b500-1e9d-46c2-85eb-8e16cbac8461","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:fa8a17cf5d707dbf3b91d810db06dea01f8d99d850a51c0b324d6dcbf2591e7f","observation_id":"6fe3be94-6bcd-4e0b-9e04-8ec7204ef008","resolution":{"observed_at":"2026-07-02T21:57:25.732526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":"2403.03954","doi":"10.48550/arxiv.2403.03954","metadata_source":"pith","pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","venue":"cs.RO","work_id":"bded01e1-c070-4537-a75a-ace4c75d0c95","year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:4cb2bc9de37932e1de5f746e3b52eaa218d66b3f7f05428f5ca5796edd42ab97","observation_id":"878ae31b-5786-4ec6-8300-61ffcc300683","resolution":{"observed_at":"2026-07-02T21:57:25.724203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:120f5cbfcb4497051fe1b974af7472635a1353241fa3f6c573d4867fc546a1cb","observation_id":"64ff470c-fdd1-472f-be2b-7ad1cf611cab","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:50f2f5981cd0856e075242bdd3cdb7e221c6d33c94540ff7c8d91d9872e1995a","observation_id":"45763600-7ac1-4857-a38c-8d389a926c86","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":"Cheng, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:75273f6f5e73c49208604c8b05b4bd454d6dcd62c0cc75f2ad30039b466b8321","observation_id":"ec757dfe-6c51-410a-b5f8-fb8e0931426b","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:1947b16fa13a9f5380b7466a331414416e3ca4b8702f8905e6778737666cfd50","observation_id":"49f4cc9a-3a38-4f48-a4cc-9fbf10a12dba","resolution":{"observed_at":"2026-07-02T21:57:25.759560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:aa20fd4337dc6b583491718225de31af875b6266452e883e7866e56befb6b19f","observation_id":"603351d7-d17e-48df-bbf8-1a8bb783900e","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T21:57:25.717385Z","title":"Uni4d-llm: A unified spatiotemporal-aware vlm for 4d understanding and generation","venue":null,"work_id":"7fee3cd7-00fd-4876-ac85-175f5e14349a","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:720b0fbeaa918363a4c34e24ae9a651043b67fe44b1b059a9ce86d138e772a20","observation_id":"b1f3cf34-060b-4fe8-9831-de9326a93a0d","resolution":{"observed_at":"2026-07-02T21:57:25.718869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:db746451edfc254e3657896ae7b50b7e649e40a5de67626e29346a30491b5744","observation_id":"3648172e-7a98-4b01-95a3-e5d6e98c42e5","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:5acfc44bf5881193b86091df17e82a298d98d14282245919b96cba54c68585c1","observation_id":"2cb1e2c2-3027-47c4-b9e1-feebc1202b0e","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13142","last_updated":"2025-05-17T17:33:08Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T18:59:01Z","title":"Pre-training Auto-regressive Robotic Models with 4D Representations","version":2},"cited_work":{"arxiv_id":"2502.13142","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.13142","snapshot_observed_at":"2026-07-10T18:47:31.667981Z","title":"Pre-training auto-regressive robotic models with 4d representations","venue":"cs.RO","work_id":"e40e0608-53fd-4169-839a-4f2d15dcbdc9","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2502.13142","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:4d7b0f3dbcb4b14e898f29c39331c35483dd39ac6d16184956901761b1c8ae1c","observation_id":"9eb5a276-23d4-43d7-890b-6dcd5dc968f0","resolution":{"observed_at":"2026-07-02T21:57:25.743676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05994","last_updated":"2021-05-12T22:38:30Z","snapshot_observed_at":"2026-07-06T11:08:59.470370Z","submitted_at":"2021-05-12T22:38:30Z","title":"Neural Trajectory Fields for Dynamic Novel View Synthesis","version":1},"cited_work":{"arxiv_id":"2105.05994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.05994","snapshot_observed_at":"2026-07-10T10:47:02.166139Z","title":"arXiv preprint arXiv:2105.05994 , year=","venue":"cs.CV","work_id":"47cff43e-991f-4553-9d81-ea92b5b87c06","year":2021},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2105.05994","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:970cb5af7b2de3948755ef478bf6ce6efcddd9c5214d0442ccc94f5df03dfb72","observation_id":"f08aa2ac-4c9c-451b-afb8-a89123181fac","resolution":{"observed_at":"2026-07-02T21:57:25.740540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T19:24:59.678266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:9db9aaa19ef10d335b3703cfaac5d4f504b082df19eb2828dfc07ce74d2f6b2e","observation_id":"6ebf40ba-dea9-4853-8205-d2a028f21c76","resolution":{"observed_at":"2026-06-27T19:24:59.678266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:28:34.394066Z","title":"arXiv preprint arXiv:2511.01571 , year=","venue":null,"work_id":"2f914294-330b-44dc-8bd5-0af8aeb4d522","year":2026},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:375c56bbd32d4c6974241eae29555d5123089cafcf0df510c4471fb622e6e1b2","observation_id":"ad24dc02-c92c-4c89-9992-fce227d07633","resolution":{"observed_at":"2026-07-02T21:57:25.729601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-10T23:07:47.672265Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T19:24:59.678266Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.08288"},"observation_digest":"sha256:10ba45088ef0d1c388d7178e36d1bf773ae31675d3391db5f57bde4b69f98f6d","observation_id":"58812ddd-6497-42cb-aa55-ef4f8947772d","resolution":{"observed_at":"2026-07-02T21:57:25.746354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-27T06:30:09.085275+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.08288","last_updated":"2026-06-06T18:20:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T18:20:02Z","title":"MotionVLA: Injecting Geometric Motion into Vision-Language-Action Model"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":22,"verified_exact":25,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-27T06:30:09.085275+00:00","source":"crossref"},{"observed_at":"2026-07-27T06:30:01.563335+00:00","source":"retraction_watch"}],"thesis":"As of 27 July 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2606.08288."}