{"as_of":"2026-08-07T12:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e233fb202b26fd026d9daf3e10789b483507efec5376fdb17f8a6467228ac37","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:19:50.356389Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04633/citation-record","integrity":"/paper/2608.04633/integrity","json":"/paper/2608.04633/citation-record.json","paper":"/paper/2608.04633"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:46.396151Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.396151Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:971b6b5847ec746a3ec6e3f32db10f6ef84f70c51e1389623839c34a2595618c","observation_id":"26f9b6b8-c9c3-4892-ab74-7105435e5b9f","resolution":{"observed_at":"2026-08-06T20:19:46.396151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T20:19:46.446123Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.446123Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:5f10c1233c07397b07a7d7af6f462be0e7bcd1ab79fc41fefbeba6d6ee3b6aa2","observation_id":"3f472e05-b48c-4833-8843-c2850544695d","resolution":{"observed_at":"2026-08-06T20:19:46.446123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-06T20:19:46.520992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.520992Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:e4c74173d52dd8d7d0e601e9c8c36471be6d39ae636a55989e31b428fbd4c4cb","observation_id":"b922b83f-7d15-4061-8911-9e7cd6d05b4e","resolution":{"observed_at":"2026-08-06T20:19:46.520992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-06T20:19:46.577353Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.577353Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:d19658da2abfcb26eb74c419ee98dea1723b344dbbd9a00d89e14c2c0f9ff1ac","observation_id":"e68b6461-d7a1-4051-8dcd-6f2b3aea963b","resolution":{"observed_at":"2026-08-06T20:19:46.577353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.772175Z","title":null,"venue":null,"work_id":"b60d27c6-f4e0-460d-8279-68e1719ae45c","year":2026},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.671171Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:5014f44899fcff9b7ef695fc852441c2f8a1a2cd96f710f3ad4f390ccf14fe98","observation_id":"5194fd60-de51-48a8-aec8-e97196c28576","resolution":{"observed_at":"2026-08-06T20:19:52.863591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09071","last_updated":"2025-08-13T16:47:50Z","snapshot_observed_at":"2026-08-07T01:01:25.526564Z","submitted_at":"2025-08-12T16:46:05Z","title":"GeoVLA: Empowering 3D Representations in Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09071","snapshot_observed_at":"2026-08-06T20:19:46.803171Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.803171Z"},"links":{"cited_paper":"/paper/2508.09071","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:bd25bcae88be309445bdc5d8bcfd8dc8adcdd5b28db942140766c847e6cfda8b","observation_id":"db459a88-3610-46fd-9aaa-6187dbaf2234","resolution":{"observed_at":"2026-08-06T20:19:46.803171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:46.923578Z","title":"Singh, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:46.923578Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:22283284a34b9346c6a669760e0d8a3c334de6e98cbfa06132075d4b39d53d1f","observation_id":"9cd5a458-dec3-4ee2-b750-754efc5b8c04","resolution":{"observed_at":"2026-08-06T20:19:46.923578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.003040Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.003040Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:f4874d7b10da204847b9b7db7cd7c2c8ea85f126a15f64941b010eb3bcd92914","observation_id":"92770e72-495c-422f-923d-8c5a48bad184","resolution":{"observed_at":"2026-08-06T20:19:47.003040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.078147Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.078147Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c0428be1495710ad8a859938f7013f615309967aef4fd2b5c91b3ecb23b81926","observation_id":"13e9efc7-a1bd-46c6-8d49-60b75febcc95","resolution":{"observed_at":"2026-08-06T20:19:47.078147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.521227Z","title":null,"venue":null,"work_id":"c4e0898e-ffcd-407b-a085-e8be80197239","year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.155194Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:fe686d22edbe5852b57aebcaa0afdfb0047dcfefba9e50233a7e85250ea70f4a","observation_id":"ab78dc4e-908e-443f-8b81-016d8a0891fd","resolution":{"observed_at":"2026-08-06T20:19:52.636357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.208817Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.208817Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:3d2d4718ea7c2be4d070964d8406d736bcb1f2493785b9b2268e2b26ae8b5722","observation_id":"1e5c079e-cc74-487e-944a-c312cd13ca68","resolution":{"observed_at":"2026-08-06T20:19:47.208817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T20:19:47.275991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.275991Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:0a923cae7161a78def55d2f382fe03bd17073ed3691fd21424b35026521d949b","observation_id":"1f34d831-2310-4095-a423-78be06bfecb4","resolution":{"observed_at":"2026-08-06T20:19:47.275991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.321746Z","title":null,"venue":null,"work_id":"c48adf06-c4dd-422e-847f-d6b156e89772","year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.359540Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:be53324796917266b61ea26699550bf523d319bbb3a1be3cb77d6517e95f9a6a","observation_id":"677ce944-fbae-4bbe-babe-38852f0f9f5e","resolution":{"observed_at":"2026-08-06T20:19:52.408288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T20:19:47.403646Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.403646Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:21be5c333f1ac1e75ed6fe3de94162f19403286200c0e9e0b5e8f81bf5c46b6d","observation_id":"6238bce0-fabf-42d2-a31d-6f4a6730eef1","resolution":{"observed_at":"2026-08-06T20:19:47.403646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:52.113954Z","title":"O’Neill, A","venue":null,"work_id":"e1073c33-7927-4298-869f-5d081888432a","year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.510694Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:ceb25bf15ffe51fb5967214d2685646b70832bba2eba536649406cd628d2d15e","observation_id":"def2df4a-59f4-4fa3-9f90-ec4a4a19695f","resolution":{"observed_at":"2026-08-06T20:19:52.215031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-06T20:19:47.572949Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.572949Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:30331ded21ee635c519bf4dfd9aff88c4e7702cd7dfe8cb745dd185e33c4a6c0","observation_id":"567b9100-3b8f-489b-9b99-5978f5f252dd","resolution":{"observed_at":"2026-08-06T20:19:47.572949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-06T20:19:47.653884Z","title":"Zheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.653884Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c231b130563951ad11acb74d107293d289486a85a6d7ea299f80c758bc6f9b12","observation_id":"a909a4b9-f254-43ae-83a7-e22beb324557","resolution":{"observed_at":"2026-08-06T20:19:47.653884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-06T20:19:47.739039Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.739039Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:c2aa93841e1b3e8db9e5aa0f5d3c44a8697d0704906e1bf3b7dd31b407faf577","observation_id":"29970e42-475e-44e3-9b81-74697dd96599","resolution":{"observed_at":"2026-08-06T20:19:47.739039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10631","snapshot_observed_at":"2026-08-06T20:19:47.832939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.832939Z"},"links":{"cited_paper":"/paper/2503.10631","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:4671c8326a937fdbde0b405a7f145bb97872368cef4bdaa11396e35ac1867d84","observation_id":"22e3fb0a-6958-4a39-a54f-fa6f9591b62a","resolution":{"observed_at":"2026-08-06T20:19:47.832939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:47.896250Z","title":"Shridhar, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.896250Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:cfb7654cf427ff9ee2b5e2d2d34374c5aa6c4f8db594986ab226dcd188ca5e7a","observation_id":"d55763d2-e79f-4c5a-aa60-919c89b1877a","resolution":{"observed_at":"2026-08-06T20:19:47.896250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17817","last_updated":"2023-10-19T19:36:31Z","snapshot_observed_at":"2026-07-06T15:48:55.605324Z","submitted_at":"2023-06-30T17:34:06Z","title":"Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17817","snapshot_observed_at":"2026-08-06T20:19:47.935248Z","title":"Gervet, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:47.935248Z"},"links":{"cited_paper":"/paper/2306.17817","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:41168e080a9d55dca957964c4bbf2c5552a35b20e2ad52c9ef892595f0b36b34","observation_id":"5947d0b1-08dc-443b-a0ca-54017e52ee19","resolution":{"observed_at":"2026-08-06T20:19:47.935248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:48.011334Z","title":"Goyal, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.011334Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:ea59a4ffd6168acbe4a14e47c15f7de6fd05e4587a5a632ac8558f6ca82bce86","observation_id":"43fa7b85-4d46-44ac-9aa4-378678dda7dc","resolution":{"observed_at":"2026-08-06T20:19:48.011334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08545","last_updated":"2024-06-12T18:00:01Z","snapshot_observed_at":"2026-07-06T18:29:53.755897Z","submitted_at":"2024-06-12T18:00:01Z","title":"RVT-2: Learning Precise Manipulation from Few Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08545","snapshot_observed_at":"2026-08-06T20:19:48.095191Z","title":"Goyal, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.095191Z"},"links":{"cited_paper":"/paper/2406.08545","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:6831cb5e828a45bf54d633d6e41ce8b951d101c77e3578f3a0ce6b0704d71715","observation_id":"3da0a491-2e47-4f1f-95f8-48f090164ce9","resolution":{"observed_at":"2026-08-06T20:19:48.095191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10885","last_updated":"2024-07-25T14:30:22Z","snapshot_observed_at":"2026-07-06T17:31:17.058043Z","submitted_at":"2024-02-16T18:43:02Z","title":"3D Diffuser Actor: Policy Diffusion with 3D Scene Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10885","snapshot_observed_at":"2026-08-06T20:19:48.187917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.187917Z"},"links":{"cited_paper":"/paper/2402.10885","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:3efa7885d95e35cfbddc4da165b74563e56babdc6572f24bcb6566a01def4ee6","observation_id":"e1e07334-0fca-48ef-b91e-2331ec311f7d","resolution":{"observed_at":"2026-08-06T20:19:48.187917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00807","last_updated":"2026-05-14T15:06:31Z","snapshot_observed_at":"2026-07-06T22:43:55.785732Z","submitted_at":"2026-01-31T16:34:52Z","title":"Any3D-VLA: Enhancing VLA Robustness via Diverse Point Clouds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00807","snapshot_observed_at":"2026-08-06T20:19:48.268018Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.268018Z"},"links":{"cited_paper":"/paper/2602.00807","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:51530ff10cff784683084f945740ac44c4cdfc8480cb01e9e5ff1c2a2b4f4afb","observation_id":"b1fd0a23-d6f6-41c7-a9e3-d7f7e487a763","resolution":{"observed_at":"2026-08-06T20:19:48.268018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21970","last_updated":"2026-06-26T10:58:23Z","snapshot_observed_at":"2026-08-03T14:00:20.137728Z","submitted_at":"2025-12-26T10:34:20Z","title":"StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21970","snapshot_observed_at":"2026-08-06T20:19:48.331513Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.331513Z"},"links":{"cited_paper":"/paper/2512.21970","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:1b8cfe448520883dd47f34602c886ac7eae836921d37e3bbd2ccf42c7a234df6","observation_id":"752060ec-438d-4d3c-ad9e-06c242fde276","resolution":{"observed_at":"2026-08-06T20:19:48.331513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.900072Z","title":null,"venue":null,"work_id":"738ef9a1-acbd-4bb7-a7e2-7da18994edff","year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.393864Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:4ef74ba0ba0a7a15f7c38ceea0e43d13a383e070adff7ecd8cc3da6632489259","observation_id":"c046748c-8091-4aee-bbdd-93269d49b7a9","resolution":{"observed_at":"2026-08-06T20:19:51.983253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14836","last_updated":"2026-06-09T10:47:44Z","snapshot_observed_at":"2026-08-05T03:01:04.996856Z","submitted_at":"2025-10-16T16:11:18Z","title":"QDepth-VLA: Quantized Depth Prediction as Auxiliary Supervision for Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14836","snapshot_observed_at":"2026-08-06T20:19:48.478639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.478639Z"},"links":{"cited_paper":"/paper/2510.14836","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:50f23ffac04645966c62e7f9e240d10cc9f14dbfaf961b0dc0db10bc968b6666","observation_id":"cc182fc0-0a71-483b-a2dc-10046dc23220","resolution":{"observed_at":"2026-08-06T20:19:48.478639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04447","snapshot_observed_at":"2026-08-06T20:19:48.534851Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.534851Z"},"links":{"cited_paper":"/paper/2507.04447","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:241253c276329aa82276fa2bfce9ffa702dfe9e8e956c84cfa92d8638448c88b","observation_id":"25f249e9-f40e-49e6-b0ef-f99092c85327","resolution":{"observed_at":"2026-08-06T20:19:48.534851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07060","snapshot_observed_at":"2026-08-06T20:19:48.590609Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.590609Z"},"links":{"cited_paper":"/paper/2601.07060","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:ab70a7f0f105646b750e9b8cf0026ebfa7e134c060feb554383eeb8ee099f188","observation_id":"767aec74-c80d-4bca-8b52-692215445dc4","resolution":{"observed_at":"2026-08-06T20:19:48.590609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07982","last_updated":"2026-05-05T14:55:01Z","snapshot_observed_at":"2026-08-04T10:05:27.686733Z","submitted_at":"2025-07-10T17:55:08Z","title":"Geometry Forcing: Marrying Video Diffusion and 3D Representation for Consistent World Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07982","snapshot_observed_at":"2026-08-06T20:19:48.667454Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.667454Z"},"links":{"cited_paper":"/paper/2507.07982","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:bb382585de077a32b832ec647b056b98541ec9503efff8e5ec099bf457fa12ba","observation_id":"a8669714-812a-40b7-8883-a0c45c288110","resolution":{"observed_at":"2026-08-06T20:19:48.667454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:48.767277Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.767277Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:cd21f4a89bf3e29002568a197ca590eace8386154ec996ea4d7497a5fd6875c6","observation_id":"cd9d14f8-9612-487f-8ec8-2cde133f0f58","resolution":{"observed_at":"2026-08-06T20:19:48.767277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:48.843593Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.843593Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:b7845ea23de6e105ce79da564f4e56766829afac89c8f78171eaa06e95530feb","observation_id":"06563ac3-47a8-4429-baa6-b30e995206c1","resolution":{"observed_at":"2026-08-06T20:19:48.843593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:19:48.975765Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:48.975765Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:0b2ca36d462c7e77dc4d1a2a889822f56b09338f656fe72eddbe9b6921a231bc","observation_id":"d672b3e2-c805-4b58-81a8-5925afb5e535","resolution":{"observed_at":"2026-08-06T20:19:48.975765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13139","snapshot_observed_at":"2026-08-06T20:19:49.097273Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.097273Z"},"links":{"cited_paper":"/paper/2312.13139","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:b5eaf6bbd257c53ba9c28c1855732f31626626e9809740e9732dd8441d9906e0","observation_id":"cc9f1646-a4c2-418a-b34c-61d6444f36c1","resolution":{"observed_at":"2026-08-06T20:19:49.097273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.645138Z","title":"Rombach, A","venue":null,"work_id":"8e7f3b74-3a0b-43d2-a202-3a2e5d551e32","year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.191361Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:4fbae9cdeef333f6b4c3b188571db6fd847ea12f5bbc16e426efd0e53cd0da96","observation_id":"23102af3-4a0e-486f-b583-ba540c05c04d","resolution":{"observed_at":"2026-08-06T20:19:51.738404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:49.316462Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.316462Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:52db9e1ad1e82d1cbdde3e71c5c4f8cdfacdd70610da2c499b8c4ec48ffade71","observation_id":"1c149296-e834-440a-89e7-1cfb36079b83","resolution":{"observed_at":"2026-08-06T20:19:49.316462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:49.424569Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.424569Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:8faf4404e83c31cfc2dc3163954ad4725c1e43db3639413b2300021a415ca1d5","observation_id":"1a4a7068-291a-4154-a9ff-248e47bae85a","resolution":{"observed_at":"2026-08-06T20:19:49.424569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.421833Z","title":null,"venue":null,"work_id":"3ed9577c-6179-4188-b530-8d0e2872fb99","year":2022},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.557016Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:197abce3365c8081f4356e2de07b3a182123bb95366398d8af21b21a849198a5","observation_id":"37bcff39-8ec9-46f8-838f-803038cf6f9b","resolution":{"observed_at":"2026-08-06T20:19:51.501211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-06T20:19:49.656649Z","title":"Shukor, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.656649Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:fdb7089044da0f5d7a17c6e3a8637e3824498853b3a3c27961e8ac9f4f6687cf","observation_id":"d46dfc98-2a71-4997-be37-2ba63028c1af","resolution":{"observed_at":"2026-08-06T20:19:49.656649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:49.758226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.758226Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:8c50d686bf265c5aaafcc78b6274668ac3220fbcbe138b231da50d11a8dfb67e","observation_id":"ef3bd510-365b-4b64-a3ab-bce873a810f5","resolution":{"observed_at":"2026-08-06T20:19:49.758226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14803","last_updated":"2025-05-04T04:28:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T12:48:40Z","title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14803","snapshot_observed_at":"2026-08-06T20:19:49.893880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.893880Z"},"links":{"cited_paper":"/paper/2412.14803","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:06ff38621bc634da66fa49fe650adad144463d34102ad9ccd906dd7dca25d70f","observation_id":"c004a486-b24f-41c0-8c5f-aa26d8d09415","resolution":{"observed_at":"2026-08-06T20:19:49.893880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:51.212359Z","title":null,"venue":null,"work_id":"9569f5ee-e87c-4a4e-9b3c-d8fc08d046ff","year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:49.988923Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:3a72473ad88de06a1f5e94478074b1255eae0cf8abfd93bbba26a53cdd7a90d1","observation_id":"58340e5a-1563-48b3-8529-a965af4e892c","resolution":{"observed_at":"2026-08-06T20:19:51.283184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-04T13:24:32.760498Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-06T20:19:50.092976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:50.092976Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:64e22f5e5f85ef14783feee2beb537ca2ed16bc3bff43a9b8bb4d57efaea1a77","observation_id":"479ab36c-5a63-4a51-90f5-cdbe56196a57","resolution":{"observed_at":"2026-08-06T20:19:50.092976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:19:50.211537Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:50.211537Z"},"links":{"citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:22578ff66be33e53abe68f472d8dcc46fc8f501f8a741a36aacfe95d17e50028","observation_id":"6e930a4c-d7e0-4273-b5c3-18d9d8fce342","resolution":{"observed_at":"2026-08-06T20:19:50.211537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-06T20:19:50.356389Z","title":"Khazatsky, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:50.356389Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2608.04633"},"observation_digest":"sha256:b97f386dd13e310dc21e8423913d0bd34e28a4efc9fe1ea7aeb1a5f6a4fd6b93","observation_id":"c57b9e74-d5e7-4767-8b1f-30d0aa36d0b2","resolution":{"observed_at":"2026-08-06T20:19:50.356389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04633","last_updated":"2026-08-05T09:49:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T11:45:38.227223Z","submitted_at":"2026-08-05T09:49:02Z","title":"Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2608.04633."}