{"as_of":"2026-08-07T06:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b687624b09aec172568d14017fe0ece313ffd450eb8e7bd9b53efbc646ed47b3","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:16:43.272519Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13429/citation-record","integrity":"/paper/2607.13429/integrity","json":"/paper/2607.13429/citation-record.json","paper":"/paper/2607.13429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.412095Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.412095Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:8c186c2109d72cabc8c14168468ac5f97250def3217d1652a9ecf65d7418b64d","observation_id":"a432cfa3-76c1-4fd3-9698-236feff41fb0","resolution":{"observed_at":"2026-08-02T05:16:34.412095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T05:16:34.505191Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.505191Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:06a79bf3907e0171c367b036c99d70fc0568ab6aa48a5f467129ca75eba9c3c7","observation_id":"c9b6e919-35e8-4215-a4a3-9cfc1be29f38","resolution":{"observed_at":"2026-08-02T05:16:34.505191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T05:16:34.559271Z","title":"Bjorck, F","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.559271Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:21e24dd6ae6cb406606098c03c82413c01da0f098f90bbbc0408f36d72822a5d","observation_id":"07f2292b-54fe-48bb-9a87-b7d2d1d9dff5","resolution":{"observed_at":"2026-08-02T05:16:34.559271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.679010Z","title":"Black, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.679010Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:015e37fb0da313e4713dc82df0b62de49741ebc0e93d8b27b18d04c18cd2b143","observation_id":"3e3df50f-96c2-40d6-b56c-aa79e2e10b96","resolution":{"observed_at":"2026-08-02T05:16:34.679010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:34.802725Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.802725Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:8fcb96da567417565a2b584c81afad11e1ce3366014897c1a9f8372ff07e8a63","observation_id":"0e0c6efa-09a3-4ff5-9c6d-66c04fd76c97","resolution":{"observed_at":"2026-08-02T05:16:34.802725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T05:16:34.868707Z","title":"Brohan, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:34.868707Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:bdb6d0dfaf2ae6684defe4f701c6e8ea4cd5b22a5d81927645e0ded6f72c8671","observation_id":"6835202a-90c7-42b4-9725-e9ad684f7328","resolution":{"observed_at":"2026-08-02T05:16:34.868707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08001","last_updated":"2025-02-06T12:37:15Z","snapshot_observed_at":"2026-08-04T13:24:32.760498Z","submitted_at":"2024-10-10T14:57:51Z","title":"Towards Synergistic, Generalized, and Efficient Dual-System for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08001","snapshot_observed_at":"2026-08-02T05:16:35.003275Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.003275Z"},"links":{"cited_paper":"/paper/2410.08001","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:25e60dd4d7fbb92c174a8572f229ea8d4bcd26dbbadd1419ea0efa93b95546e5","observation_id":"fba8c69d-dc65-4904-8871-741c40bad58b","resolution":{"observed_at":"2026-08-02T05:16:35.003275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-02T05:16:35.162232Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.162232Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:48611ec6272c8b76a9b3b09b636cd6228110a73a4ed300ef3115ed3f26940eb3","observation_id":"c49029a8-8853-425d-8c99-ad9837583979","resolution":{"observed_at":"2026-08-02T05:16:35.162232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:35.236280Z","title":"Cadene, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.236280Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:4332465e1ff4333bc4de25ae18fc6d1ce4dfbb328da168b654f107e33bbb79bb","observation_id":"ad7e238b-e0d0-4901-9ac4-9b147e7c67c4","resolution":{"observed_at":"2026-08-02T05:16:35.236280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-07-06T21:27:51.964897Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-02T05:16:35.354226Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.354226Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:0d23e06652c1e34dcb978f67ca06f8b1059ec58137d3b63a07113e35c4164c9f","observation_id":"f7c34079-fe85-4677-91b1-0d98d1ed7f7e","resolution":{"observed_at":"2026-08-02T05:16:35.354226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:35.477940Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.477940Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:997eab7e30491d1d176f17c30a20a9416c636f2ddd5d55d1718d63081d278c1f","observation_id":"32058b83-d7af-40d9-bab9-98943ad2668d","resolution":{"observed_at":"2026-08-02T05:16:35.477940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03912","last_updated":"2025-05-06T18:35:07Z","snapshot_observed_at":"2026-07-06T21:19:58.642378Z","submitted_at":"2025-05-06T18:35:07Z","title":"OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03912","snapshot_observed_at":"2026-08-02T05:16:35.598245Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.598245Z"},"links":{"cited_paper":"/paper/2505.03912","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:846ef8ce47d2894293a27df5898f9c770d4fffe688328dfa2fcf676c37d30ea9","observation_id":"1f3625b7-ab88-4dbf-95f6-bce3991d687b","resolution":{"observed_at":"2026-08-02T05:16:35.598245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:35.721285Z","title":"Dalal, U","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.721285Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:10f011e2177e63bc8e0fd4058c4d7650abd0d7c08c602e861a292cbe959f931e","observation_id":"b6905f22-e289-43b1-a258-59fdea5d2c27","resolution":{"observed_at":"2026-08-02T05:16:35.721285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09741","last_updated":"2026-04-20T07:40:50Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:57:06Z","title":"Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09741","snapshot_observed_at":"2026-08-02T05:16:35.845001Z","title":"Dalal, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.845001Z"},"links":{"cited_paper":"/paper/2510.09741","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:69139799a06a6275643f0d8493995938e8f7eb4823046bab743d88e465c82185","observation_id":"d3549312-bb1a-42eb-bf81-4e7934d8cacc","resolution":{"observed_at":"2026-08-02T05:16:35.845001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-eacl.304","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dalal, M","venue":null,"work_id":"bbf4b729-585b-4e6a-9592-da020c4d6360","year":2026},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:35.975709Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:497e7424b005ef888b904ba9e90d434ddb2e5e3f0d04cdb866486b33b709355b","observation_id":"6eea48aa-4c67-4b1a-a756-535462f0c025","resolution":{"observed_at":"2026-08-02T05:18:28.886464Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:36.094018Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.094018Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:4a3cae231119f08c58e89b9d7b592dcdb909a5863a744eb2e99977cdb8fd7a9d","observation_id":"13fe496d-df95-46ed-b9cd-2c3070c61821","resolution":{"observed_at":"2026-08-02T05:16:36.094018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:36.214548Z","title":"Dasari, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.214548Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:22a0b5bd4c98d5945ddfc3d6b2e937cfd64adaf180023f7a5e5332f53e923d91","observation_id":"3643ba16-ed2f-42c8-bf0c-c1501d53511b","resolution":{"observed_at":"2026-08-02T05:16:36.214548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11812","last_updated":"2024-08-21T17:57:51Z","snapshot_observed_at":"2026-08-03T05:45:43.939088Z","submitted_at":"2024-08-21T17:57:51Z","title":"Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11812","snapshot_observed_at":"2026-08-02T05:16:36.310772Z","title":"Doshi, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.310772Z"},"links":{"cited_paper":"/paper/2408.11812","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:360b436b85a3cd73d0d32229325ca938c3771c483bc207cc59bdc13266f55037","observation_id":"3f1f803b-08ed-44fd-8da8-47d6811afa53","resolution":{"observed_at":"2026-08-02T05:16:36.310772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:36.395912Z","title":"Douillard, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.395912Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:1a412c58da1db1902fb3f21ba656a3d95ea84eeea5966ce47a34fb1f98c25dd6","observation_id":"947ce380-dba8-4bbd-95d6-278613e7cb6d","resolution":{"observed_at":"2026-08-02T05:16:36.395912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T05:16:36.543711Z","title":"Driess, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.543711Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:555677d2955145c972a2231b1a5fc487bcf1a29f33450dd83815a1206cbddc58","observation_id":"7b226fce-12e8-4fa9-9b2e-6ad4443603e5","resolution":{"observed_at":"2026-08-02T05:16:36.543711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23705","last_updated":"2025-05-29T17:40:09Z","snapshot_observed_at":"2026-08-04T23:25:15.750324Z","submitted_at":"2025-05-29T17:40:09Z","title":"Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23705","snapshot_observed_at":"2026-08-02T05:16:36.686137Z","title":"Driess, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.686137Z"},"links":{"cited_paper":"/paper/2505.23705","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:2c047bcc3cb58d86bb74ad118529fe13df1026473960610a3318a661030b3143","observation_id":"cbf9c5b8-a28c-4adb-be9f-cd70fd74a5bd","resolution":{"observed_at":"2026-08-02T05:16:36.686137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-02T05:16:36.791671Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.791671Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:13971d61473ffc0023bf82b7df59554033d28bfddcee2481a88e51ee3edde242","observation_id":"cbf63f98-3a4f-4f12-aa44-a059d1d94596","resolution":{"observed_at":"2026-08-02T05:16:36.791671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:36.867295Z","title":"Florence, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.867295Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:84cc512a6299ab4356c1b25eb6917040eaab7ad226ba192258042099f64a9d1f","observation_id":"f29d606c-0a66-4f37-91ba-62e395821720","resolution":{"observed_at":"2026-08-02T05:16:36.867295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-06T22:14:34.013503Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21876","snapshot_observed_at":"2026-08-02T05:16:36.966727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:36.966727Z"},"links":{"cited_paper":"/paper/2506.21876","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:59114fe9c67060b22e5f2812b30f06227f034341b1394c208e95aa53f2728c8a","observation_id":"d023fc94-0bd3-4f98-b89b-fe4b2cc8c1be","resolution":{"observed_at":"2026-08-02T05:16:36.966727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.074055Z","title":"Goyal, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.074055Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:cb1116568ba80b2d7509f13103822588dfb93a4cea1a35dc6148d62c284c9533","observation_id":"778c49e9-3e36-4bb2-8e6c-f1df377e5155","resolution":{"observed_at":"2026-08-02T05:16:37.074055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.183980Z","title":"Gretton, O","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.183980Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:99ac3f5de9ca9874dceacbdba7aa21acebd9180f0f60da5459737f31402d310e","observation_id":"6c5a7fde-dedc-402f-b954-b4b2a60868b4","resolution":{"observed_at":"2026-08-02T05:16:37.183980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.264901Z","title":"Grover, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.264901Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:9ccd222bc86a529a628bd35fd5bb565a493ff44f96af739d04b2e0a5d6c39df5","observation_id":"5453f99c-0668-465c-96a8-042432dd0083","resolution":{"observed_at":"2026-08-02T05:16:37.264901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-02T05:16:37.430307Z","title":"Hinton, O","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.430307Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:471b92310623c62d5e35f797bff9d8b52bb45ea76bb67e2130828e5c20591cd0","observation_id":"db151cd0-3904-4ca5-a5e5-a919a17afc78","resolution":{"observed_at":"2026-08-02T05:16:37.430307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.584883Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.584883Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:55bc0083e4d60dbba1de292e38d1034ffc645e564d5a2eaa95b9686408313591","observation_id":"67885b24-e7a2-4acd-8d5d-b7ea1f2be22d","resolution":{"observed_at":"2026-08-02T05:16:37.584883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.676828Z","title":"Huang, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.676828Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:05b69591886705b5748fedee15972cb5f457dc87ff84ff5394bc020320fa4b02","observation_id":"44310586-cd9f-456d-9306-8d22e08377cf","resolution":{"observed_at":"2026-08-02T05:16:37.676828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.734747Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.734747Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:b9414482c8d3ad4ce283888402463325d72e95ad6bbda99d68ac51caa88c549c","observation_id":"f02a61ac-bba8-4ee1-b553-946fc4bd75be","resolution":{"observed_at":"2026-08-02T05:16:37.734747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12705","last_updated":"2025-06-17T22:33:35Z","snapshot_observed_at":"2026-07-06T21:26:01.534136Z","submitted_at":"2025-05-19T04:55:39Z","title":"DreamGen: Unlocking Generalization in Robot Learning through Video World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12705","snapshot_observed_at":"2026-08-02T05:16:37.830845Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.830845Z"},"links":{"cited_paper":"/paper/2505.12705","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:b82111217ba2351c7c32c5344b0e6069db5271fde0b9216a2254f014907ff748","observation_id":"bfde45b6-b184-4787-a247-bc5b1b2704ac","resolution":{"observed_at":"2026-08-02T05:16:37.830845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:37.917153Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:37.917153Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:58313ebbd6314805bb6b7cf716d2f0542cd7cb85dac1920c29f4ab641930e6e5","observation_id":"ca319ef3-06b2-4d0f-a68c-dc7051fd0f70","resolution":{"observed_at":"2026-08-02T05:16:37.917153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.005009Z","title":"Kachaev, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.005009Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:3e00208f6a1d76ebe92465a673b6d0f298a10dec5bc25b7ef8217000448cc425","observation_id":"b3d314e1-2732-4d87-ad71-7786b8c8ac60","resolution":{"observed_at":"2026-08-02T05:16:38.005009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.205886Z","title":"Karamcheti, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.205886Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:1dc01cb29d769b0941ed85bf185cb52c5470226b4fe2b33eaaefd9c8c9be4385","observation_id":"fd1748a1-de63-4a88-8c25-0688e53a9cb5","resolution":{"observed_at":"2026-08-02T05:16:38.205886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.262556Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.262556Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:71b109027318ae13a268f7b71bfebe4336a0a061f57b67f79ac79a77fd4a8f47","observation_id":"9c9ccfd9-3dd8-4c17-8aaa-b57bcf40c97f","resolution":{"observed_at":"2026-08-02T05:16:38.262556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-02T05:16:38.354158Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.354158Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:ca04512f81e8d94f59e14eefd5d1d5a47da26a975218ff0e66ba9a1a67a15478","observation_id":"8d871b69-6434-4444-a107-39eef16b63ac","resolution":{"observed_at":"2026-08-02T05:16:38.354158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.472393Z","title":"Kirkpatrick, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.472393Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:5ca5aada113b4313e1f64494a30ee98a5395b85f02ca7a3aa5a959f877a5dd6f","observation_id":"5ab6d06c-5f4d-408d-b7b7-ae9deff93cce","resolution":{"observed_at":"2026-08-02T05:16:38.472393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.533572Z","title":"Kornblith, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.533572Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:a48cc0930924ab8fc7ed6e0ce8ecbe8c0cc0878f855b768f97b7df0369059f4b","observation_id":"85ca4eba-5cc3-46e5-87d7-27e836a6525d","resolution":{"observed_at":"2026-08-02T05:16:38.533572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-02T05:16:38.640645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.640645Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:3652c2617903e92a68aff5e7dde5401def889be01572f7ac8d3d4d7f23c0c3d1","observation_id":"f63768b8-483d-48c3-bd2d-b794e5ad7bb9","resolution":{"observed_at":"2026-08-02T05:16:38.640645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.719849Z","title":"Li and D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.719849Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:06b9191a3a614d236c8fa5ac94372b77b3eb08a81ca0dda8406938c58c3819b7","observation_id":"cd773209-a3a1-4cfd-8b6c-67e9527a4a12","resolution":{"observed_at":"2026-08-02T05:16:38.719849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.805697Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.805697Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:a762c077590ce9e3d83fd195d3cc4d9dc9d98bfc2377965dce495c66815b8d47","observation_id":"d8c36caa-88c3-48f4-832a-c45683e1f3ed","resolution":{"observed_at":"2026-08-02T05:16:38.805697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-02T05:16:38.875488Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.875488Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:5eee7455a0f63c6fd23166ed4d12a79da5bde2a70c3be289144bf9d4c93c086f","observation_id":"54fea40b-07c2-4328-bae1-71a7d0e0786e","resolution":{"observed_at":"2026-08-02T05:16:38.875488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:38.976561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:38.976561Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:722f4101c6cb460d7218712853ab417ac671450998a3a4b5b94a12bc1fcfa8de","observation_id":"ddaa59e2-dbf6-4953-8cb0-a2f2ba6ac4c1","resolution":{"observed_at":"2026-08-02T05:16:38.976561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-02T05:16:39.037330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.037330Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:9ac2a77fa4bef6058eff1bb3e8712cced8a2e7460791cdf3366de1eb8adac7ea","observation_id":"abaa6dbb-2b60-4800-b87b-6bcf1600c0b0","resolution":{"observed_at":"2026-08-02T05:16:39.037330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.06334","last_updated":"2018-05-17T16:12:16Z","snapshot_observed_at":"2026-08-04T09:18:49.772826Z","submitted_at":"2018-05-16T13:59:20Z","title":"Auxiliary Tasks in Multi-task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.06334","snapshot_observed_at":"2026-08-02T05:16:39.099942Z","title":"Liebel and M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.099942Z"},"links":{"cited_paper":"/paper/1805.06334","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:01000bbe55e52d59e5aa4c5209529c6e0bd69ccc5105f77a41b56c5a717a15f8","observation_id":"d9cc3983-6d1e-4ce9-8ef2-363af7e7061a","resolution":{"observed_at":"2026-08-02T05:16:39.099942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.146064Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.146064Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:7fa6dde64b158c90f398afff386a08b0f67005f5acaa3be7ca6cf9b20c4b90b3","observation_id":"083834b2-7300-4db7-a335-2383232d0c39","resolution":{"observed_at":"2026-08-02T05:16:39.146064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.198043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.198043Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:5842e679d8774b536f1ba445ec49083d6e55ebea6c2d67fb0e8114ef1598d2cd","observation_id":"a9cdeef2-57ff-4d66-b249-32e3c9a3d104","resolution":{"observed_at":"2026-08-02T05:16:39.198043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.277548Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.277548Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:72acd15807f86b303fd766442ad8414567f4287c091a81a026373845599ffef8","observation_id":"028bb42c-bece-4f60-b64f-a5f0f7207c2e","resolution":{"observed_at":"2026-08-02T05:16:39.277548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.361790Z","title":"Majumdar, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.361790Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:98a3b1b6aa5d9acaab8fcbd8b2deb7681884af2fd1a1b2d2a572db3745c7c9b4","observation_id":"0a8ef4b4-b72b-4691-9794-77a5cd43c80c","resolution":{"observed_at":"2026-08-02T05:16:39.361790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.435523Z","title":"Mukhoti, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.435523Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:9d55d30e86a960cd1e5d683de64c1f7cbfe715c5f80398e36e70ed2b4d59654c","observation_id":"c3ea42b2-bdbf-4c90-a98e-3259c4f9b2a1","resolution":{"observed_at":"2026-08-02T05:16:39.435523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.574852Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.574852Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:c84b26cc98f6f793f868cdb30a3e4ea37f25e719eac27fd242d90030646b4b0f","observation_id":"c55db469-457e-4fb3-b0c7-193f60c48318","resolution":{"observed_at":"2026-08-02T05:16:39.574852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.675335Z","title":"O’Neill, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.675335Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:fd0423c86763abd33776bd5e039394f7a88238cc06e264c164759edb040049ce","observation_id":"1f6d6f8b-99dd-4034-b715-e1d583bf59c3","resolution":{"observed_at":"2026-08-02T05:16:39.675335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.725660Z","title":"Oquab, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.725660Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:7a1812ace5de215c88d703813b86dff114c2e554b82bca87aa801bce48c293b1","observation_id":"06e6390d-0d8c-4dcd-a061-36ff55058469","resolution":{"observed_at":"2026-08-02T05:16:39.725660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T05:16:39.787031Z","title":"Pertsch, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.787031Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:e4d8558162a1d20b708ff292281af93d5d17627f34593ff5f66707cc9f7a0ba6","observation_id":"19a5e168-4a03-4a8c-b82c-b3f605f6536e","resolution":{"observed_at":"2026-08-02T05:16:39.787031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:39.933010Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:39.933010Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:6f928cb5ea7d497dc37dc8fba337f9c0d067ed8b751e562b9add5b87b7a03517","observation_id":"f2a35faf-61c8-4163-ba10-e87a01e9232f","resolution":{"observed_at":"2026-08-02T05:16:39.933010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T05:16:40.074425Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.074425Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:21f171ceff42eea62bbad10c448838ec1b4d136b316a43d0929b253cc936a1ee","observation_id":"9a7d65cc-e808-49d6-ab55-5a83e915bb8a","resolution":{"observed_at":"2026-08-02T05:16:40.074425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:40.196662Z","title":"Radosavovic, B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.196662Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:f22843dcc612a4a58c59d5822aaeeff3282f2c368ebbc6150b82618ea32d667d","observation_id":"7331922d-8f5c-4933-9a9e-26e711998672","resolution":{"observed_at":"2026-08-02T05:16:40.196662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:40.423093Z","title":"Radosavovic, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.423093Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:5a82c5c8be86b7ccd54ee0158e42eff2c79d7364df79d498acd69f9c0593d47c","observation_id":"142a6134-c2b3-4bfc-85ef-c37f68468b95","resolution":{"observed_at":"2026-08-02T05:16:40.423093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02767","last_updated":"2021-11-04T11:48:19Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T11:48:19Z","title":"RLDS: an Ecosystem to Generate, Share and Use Datasets in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02767","snapshot_observed_at":"2026-08-02T05:16:40.524567Z","title":"Ramos, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.524567Z"},"links":{"cited_paper":"/paper/2111.02767","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:0552498b152dc49cfd78ae3ccc913a2308f7ac23565ba3583c86ebb0de1bf89f","observation_id":"ca8d1961-63c0-4489-b5d5-66a0139b273d","resolution":{"observed_at":"2026-08-02T05:16:40.524567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-02T05:16:40.636913Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.636913Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:022c7ed7bc942504f5a9750ce50b4ef77fa1165aea55a2a10a097a8cf01d56cf","observation_id":"c2a4dbc0-6706-4dd0-89b2-13d129bca8fd","resolution":{"observed_at":"2026-08-02T05:16:40.636913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:40.736569Z","title":"Reuss, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.736569Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:92236203eed6283dad617269fbc070488df5b3259d3407bf846ae5607fa2e670","observation_id":"0b4467a4-3982-44ad-b300-c8fcccc2f0ba","resolution":{"observed_at":"2026-08-02T05:16:40.736569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:40.851373Z","title":"Rigter, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.851373Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:d63254d91b761c62f87c329ff12b9ea8949fcce363afd89efbe70453b4d9efca","observation_id":"8b2b7956-5f08-4420-bf77-33ae8ccf4041","resolution":{"observed_at":"2026-08-02T05:16:40.851373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:40.938351Z","title":"Romero, N","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:40.938351Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:246841c97c65f80aa474493463d6fe82b9496294ff5f8d06ed21ada914e9a4b7","observation_id":"17503204-a2a4-40d0-92a8-cdd3044f16c3","resolution":{"observed_at":"2026-08-02T05:16:40.938351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:41.002552Z","title":"Routray, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.002552Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:e1a0d65f3ccc4d0f24495cf755c0d78a33e948f139a8968fbb05ed2007a3bc35","observation_id":"aa781301-7d24-45cf-80d4-5269f13283ad","resolution":{"observed_at":"2026-08-02T05:16:41.002552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-02T05:16:41.128944Z","title":"Shukor, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.128944Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:391a995af562ae313b4f10e801df5a56dafd6523dcd7c26a10e4cde310028c42","observation_id":"fb4bf39f-cdc0-4840-b5e5-8966438b5801","resolution":{"observed_at":"2026-08-02T05:16:41.128944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:41.202942Z","title":"Singh, V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.202942Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:19a26936a28386787c0f5fbeb703b6f65b1b14ac889d88f40bed3fb19d0b73aa","observation_id":"17237611-9e7c-4840-8fe6-2d3c06c5bca2","resolution":{"observed_at":"2026-08-02T05:16:41.202942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-02T05:16:41.306473Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.306473Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:4764ec7157d47518a19aaa64b38e6dcbfbc699be3ee8d10a1680c23a1e6ccbed","observation_id":"432ac8cd-3b5a-4d82-bd7f-38db2c5679f7","resolution":{"observed_at":"2026-08-02T05:16:41.306473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-08-02T05:16:41.414796Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing.arXiv preprint arXiv:2604.05014, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.414796Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:eee114929d01e9b2947a82088158fc3b9efac52580b36bd67717234d6a066615","observation_id":"98d42bb4-cad9-44c5-a299-e790cd1f49d9","resolution":{"observed_at":"2026-08-02T05:16:41.414796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-02T05:16:41.585501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.585501Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:e80e3dcc0315dc5289c279f6cd2842659811cff2b38e92bf156fbcdc7a9c7515","observation_id":"bb4c4980-7df0-4b6a-a66a-144ae1c920a9","resolution":{"observed_at":"2026-08-02T05:16:41.585501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:41.721918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.721918Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:374deed4f81011361e1c33148607d94676185359c303c41267a0e2e5cdf5fd1f","observation_id":"74bbf02b-11fb-4a47-bbee-ad2bde815c5f","resolution":{"observed_at":"2026-08-02T05:16:41.721918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:41.862581Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.862581Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:5a54259a0ba2c53a2abea693303edc9d477544924714a67820b703bff7ca143f","observation_id":"16e2a841-c349-46bd-9a31-1b7a7cbbed17","resolution":{"observed_at":"2026-08-02T05:16:41.862581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-02T05:16:41.979296Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:41.979296Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:f6f1a8f952f71abc8368b5adca224c992ec3b2ea98abbc36f2c73d240bd04b1b","observation_id":"a4f677f2-1158-4d14-a2e2-fb5d0e5a5a62","resolution":{"observed_at":"2026-08-02T05:16:41.979296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:42.145680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.145680Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:d9af2acdd7d66822b91750167bf5c91f8f9320a4e65769474ec1bfb0d8f34fe5","observation_id":"a005c2bf-dea8-4b41-bcd3-18a5fd755ec1","resolution":{"observed_at":"2026-08-02T05:16:42.145680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T05:16:42.271935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.271935Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:b5d1039d0ad8dc8b4dcca4f65fbff7823c6acb43a22195a9973b40cb4b7defea","observation_id":"d6eda565-5c5b-4ccb-9517-ac46d5896b21","resolution":{"observed_at":"2026-08-02T05:16:42.271935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:42.374488Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.374488Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:0590b975ef9bdf451217c93cce05cf8c12d8660c6f876ab73abdbe602acc61ea","observation_id":"986d9619-0c4b-4506-8428-9ce99bc7cdba","resolution":{"observed_at":"2026-08-02T05:16:42.374488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:42.467879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.467879Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:6f711a9f9d923b08ab71018aedc2f7140c1df9bffb821fee88f86c63605b97f1","observation_id":"99966d89-e574-4b73-8c04-63ee477dcdf0","resolution":{"observed_at":"2026-08-02T05:16:42.467879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-02T05:16:42.554809Z","title":"Zawalski, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.554809Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:58201168624c41d0ae1f1fbc68282cd24a278020efec9142ba5a0890ca2e63cf","observation_id":"83ff9adb-1577-4629-a12b-d5ed49065b5f","resolution":{"observed_at":"2026-08-02T05:16:42.554809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:42.725416Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.725416Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:2469b31d66c63d72d990d8cd8e34f7e62d8fffe1db1c07ad9e8613dea33d135d","observation_id":"852dc5f4-ead3-444a-900d-6a84b09eeeb0","resolution":{"observed_at":"2026-08-02T05:16:42.725416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03827","last_updated":"2026-05-25T08:44:07Z","snapshot_observed_at":"2026-08-07T03:52:23.114381Z","submitted_at":"2025-10-04T14:56:40Z","title":"LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03827","snapshot_observed_at":"2026-08-02T05:16:42.876107Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:42.876107Z"},"links":{"cited_paper":"/paper/2510.03827","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:9099630ac33474031925e732efa0b484bebd076c99ae443a89f0a9329ab0de75","observation_id":"a6b515d6-a881-446b-80af-08b3a00e6b02","resolution":{"observed_at":"2026-08-02T05:16:42.876107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-07-06T21:31:54.566899Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21906","snapshot_observed_at":"2026-08-02T05:16:43.005296Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:43.005296Z"},"links":{"cited_paper":"/paper/2505.21906","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:a809f786d96068a816fa338c7e86d9a5e1fc2df71aee44a0e0cb8cfd20afea87","observation_id":"731e90b9-b286-469b-b613-037f883a850c","resolution":{"observed_at":"2026-08-02T05:16:43.005296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-07-06T20:39:43.403470Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-02T05:16:43.132982Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:43.132982Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:2394cb3d5c98b85bbd189bc9e5314122a0534b4de51ee8789990d344729f17c3","observation_id":"5d4e160d-c8c2-441f-ad35-0690867a9bb5","resolution":{"observed_at":"2026-08-02T05:16:43.132982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:16:43.272519Z","title":"In this current state do you think the robot has completed the task:{task}? Answer in one word yes or no","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T05:16:43.272519Z"},"links":{"citing_paper":"/paper/2607.13429"},"observation_digest":"sha256:6c678e7a0193ca10829b7c817cc2ddbc6a2d6116c8ca01daf4ba4d4b7cebd032","observation_id":"e9a0490a-52fa-41e6-8708-50145d267600","resolution":{"observed_at":"2026-08-02T05:16:43.272519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13429","last_updated":"2026-07-15T04:13:54Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T13:36:46.009743Z","submitted_at":"2026-07-15T04:13:54Z","title":"Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2607.13429."}