{"as_of":"2026-08-09T12:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c4766f6d9e7968a06e18e4d597d8a6f324fb11bedd1f75a8d21a3942cf653f0","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:01:44.151987Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03052/citation-record","integrity":"/paper/2608.03052/integrity","json":"/paper/2608.03052/citation-record.json","paper":"/paper/2608.03052"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.07993","last_updated":"2026-05-19T11:30:49Z","snapshot_observed_at":"2026-08-02T02:27:22.352995Z","submitted_at":"2026-04-09T09:01:43Z","title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07993","snapshot_observed_at":"2026-08-08T01:01:44.071866Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.071866Z"},"links":{"cited_paper":"/paper/2604.07993","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:a5cbe13d320aff1cfeb107fba318951721f4020b572ff3c33d0461bcc0b7b982","observation_id":"afc253b5-1f6b-43c1-bb74-6511dc44c14d","resolution":{"observed_at":"2026-08-08T01:01:44.071866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.04639","last_updated":"2026-05-26T02:02:04Z","snapshot_observed_at":"2026-07-15T15:08:20.077091Z","submitted_at":"2026-03-04T21:59:32Z","title":"RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.04639","snapshot_observed_at":"2026-08-08T01:01:44.084075Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.084075Z"},"links":{"cited_paper":"/paper/2603.04639","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:2515a20fd4a365647e04145f7695fe9926078264a3a3a571a4f959a865f925f6","observation_id":"8a3b5760-2bc7-46e0-a334-855dcc767c0e","resolution":{"observed_at":"2026-08-08T01:01:44.084075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11865","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.984583Z","title":"Davies, Y","venue":null,"work_id":"f815bf94-772d-4c73-ab26-534fa399753f","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.087910Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:7b34a2ccbc637aafafa0bd51f75b4216984cba6f1431f486a26dfc8172c71ad8","observation_id":"cc10f7a7-1860-46b7-8577-790329b85c56","resolution":{"observed_at":"2026-08-08T01:01:44.989531Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-08T01:01:44.094721Z","title":"Intelligence, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.094721Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:c38b5e9bf14a50711d1fde10414300ff91f19829879c9e6e992f678d5fe5249b","observation_id":"af6f9f4e-56ad-43f8-817a-cb06c02ca0cd","resolution":{"observed_at":"2026-08-08T01:01:44.094721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T01:01:44.098166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.098166Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:7736fbef100c9bce81ddd8509e9a8f198730a6e602f95fc7799700ddae1d0801","observation_id":"203c76f1-4b45-4a9f-ac77-aeb8ac7954d1","resolution":{"observed_at":"2026-08-08T01:01:44.098166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.12032","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.525174Z","title":"2602.12032","venue":null,"work_id":"b2521210-5ff9-4812-ad7d-8dfb99ed79b2","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.107978Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:99046990bac87cdecf10efb031766e0cce638bf37410f79b90366fd9b95c5c4a","observation_id":"c83c44b3-fcb4-4aba-8afe-dc0c84019d49","resolution":{"observed_at":"2026-08-08T01:01:44.528761Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:45.032670Z","title":null,"venue":null,"work_id":"fbb41e98-4a39-46ce-98b5-d8cc3e428cb5","year":2026},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.111421Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:f8676d8a6e8caeebfb85fc6955876f08685c660cd643f6bbcce194a6b156efa4","observation_id":"0d5b8cb8-3eeb-498b-9b0a-d553c6637214","resolution":{"observed_at":"2026-08-08T01:01:45.035967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-08T01:01:44.115129Z","title":"URL https://doi.org/10.1609/aaai.v40i29.39677","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.115129Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:0a2b210bf184410d0eeab63365e5abeabcb07774dbfceb087034020a4aa7a910","observation_id":"d9ce61a8-bbd2-4c14-8313-63116db4ecd5","resolution":{"observed_at":"2026-08-08T01:01:44.115129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-08-08T01:01:44.118690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.118690Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:538696daadd3bb716cfe5fd5ca71d43ab791bc1b3fcf7cdc2274c31f5956ca0c","observation_id":"e54940ea-f858-4887-9295-6bd8d2cf92cc","resolution":{"observed_at":"2026-08-08T01:01:44.118690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-08-08T01:01:44.122151Z","title":"URL https: //doi.org/10.48550/arXiv.2602.06575","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.122151Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:095f216acf54d3f14160cc4f77533b8ce4565aaa898f3e3b66760fc28c0b877d","observation_id":"8c5ad290-f9e0-4386-bc10-c1d1fc7b6ee2","resolution":{"observed_at":"2026-08-08T01:01:44.122151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2512.20166","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.429634Z","title":null,"venue":null,"work_id":"e4bef21d-8465-413f-b15a-59babffb9e88","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.125411Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:35b8998add573a9fae3818b40801b10a40a8725b061bf30f1f582ae245ebce41","observation_id":"c3e3f441-ea11-4b9d-870b-847031eba6c7","resolution":{"observed_at":"2026-08-08T01:01:44.433068Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24642","last_updated":"2026-05-23T16:18:41Z","snapshot_observed_at":"2026-07-30T07:41:42.487489Z","submitted_at":"2026-05-23T16:18:41Z","title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":"2605.24642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24642","snapshot_observed_at":"2026-08-08T01:01:44.716122Z","title":"Understanding the Impact of Geometric Foundation Models on Vision-Language-Action Models","venue":"cs.CV","work_id":"cabd1743-5236-41db-a6c7-dd773b7f2300","year":2026},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.132304Z"},"links":{"cited_paper":"/paper/2605.24642","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:27ee984801c3ae8043c6c25e43f00321cbe3e90ad855cbcc926887253ba92a7a","observation_id":"35f2b077-8ae6-4598-8b4e-67b33e60a9da","resolution":{"observed_at":"2026-08-08T01:01:44.721229Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.135594Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.135594Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:0d3bb04c0d6288602eeba9b65b3e56e4dd745b5cb9f62cda21b0263599b460be","observation_id":"30f870f2-dca5-419c-9ab7-5c38ad0279b5","resolution":{"observed_at":"2026-08-08T01:01:44.135594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.14133","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.355495Z","title":"2601.14133","venue":null,"work_id":"09df3340-7195-4cc0-bca3-2245d384b7e7","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.138844Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:722ef9d9494d2e2e61613dcc90a680c5d0d72e1c3563d530fea19d446b05223f","observation_id":"463d4e7e-96de-4c03-b6ea-a74878bc71d5","resolution":{"observed_at":"2026-08-08T01:01:44.358840Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.142251Z","title":"Zhang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.142251Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:edfeb277120e0683818b88495e9e3a1605d331e4da5f36ca00820791f167a333","observation_id":"66820ca3-7f3c-4dce-9585-fba23ab4730d","resolution":{"observed_at":"2026-08-08T01:01:44.142251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.04061","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.279208Z","title":"URL https://doi.org/10","venue":null,"work_id":"0d6f9e39-0a50-4368-b6bd-884e31789ee4","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.145383Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:ab86f2c2085af5eeea4ac3c22fa9f5ea9d6e12fc13fa30d75ebc9a08f21ee9a2","observation_id":"6d897209-cf3b-4e60-a0cb-24de3d6d59ec","resolution":{"observed_at":"2026-08-08T01:01:44.284230Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.148650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.148650Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:6cef6943fe5e5ef020b44f9805f774ef8b93288d3372e83fd0789db9c0b94abe","observation_id":"5d2a6ede-04cb-4506-b734-b0bf1f0fd6a4","resolution":{"observed_at":"2026-08-08T01:01:44.148650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.091348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.091348Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:45a874af8842f7564f585436f6d8f83c33479d52d931541fb513d49000fb2f02","observation_id":"85208fef-0207-490f-8633-3851c3c81abe","resolution":{"observed_at":"2026-08-08T01:01:44.091348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13679","last_updated":"2025-06-16T16:34:20Z","snapshot_observed_at":"2026-08-07T13:45:40.850146Z","submitted_at":"2025-06-16T16:34:20Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","version":1},"cited_work":{"arxiv_id":"2506.13679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13679","snapshot_observed_at":"2026-08-08T01:01:44.731686Z","title":"ROSA: Harnessing Robot States for Vision-Language and Action Alignment","venue":"cs.RO","work_id":"21caf7c2-7bc2-40f2-ae6d-3b8ce6cff6cf","year":2025},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.128884Z"},"links":{"cited_paper":"/paper/2506.13679","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:a86ab7c7ab438b5aad8d3f17e917259caaa1178260545484e3463550305844ca","observation_id":"87fdd124-616f-4096-9bdc-3ba1d7801856","resolution":{"observed_at":"2026-08-08T01:01:44.735748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:44.104786Z","title":"Whenwouldvision- proprioception policies fail in robotic manipulation? CoRR, abs/2602.12032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.104786Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:8215762147fc7918c85927c455c4bdd413d16b43be91280137849786e0ced64c","observation_id":"b93173d7-4de2-45eb-9873-d8c5239c2712","resolution":{"observed_at":"2026-08-08T01:01:44.104786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-08T01:01:44.101602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.101602Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:ee5511f4e5fe53b62be2094f6fe6785dc33b6f777c1120f3dd1e753ba4edc698","observation_id":"c42ebbaa-e9d2-4ae7-919b-8806c2da7a10","resolution":{"observed_at":"2026-08-08T01:01:44.101602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-08T01:01:44.080292Z","title":"Fusai, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.080292Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:7dc38fe6d8e3a054a365741770f028d58952e64c91a79dae422220255a6baab8","observation_id":"854015ee-14eb-4e0b-8f34-60d21ed41dfd","resolution":{"observed_at":"2026-08-08T01:01:44.080292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07993","last_updated":"2026-05-19T11:30:49Z","snapshot_observed_at":"2026-08-02T02:27:22.352995Z","submitted_at":"2026-04-09T09:01:43Z","title":"HEX: Humanoid-Aligned Experts for Cross-Embodiment Whole-Body Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07993","snapshot_observed_at":"2026-08-08T01:01:44.076699Z","title":"2604.07993","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.076699Z"},"links":{"cited_paper":"/paper/2604.07993","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:7d74bd1519440402a8f0fa035c6071622d7fb6674328b3c617e08bbc651008b7","observation_id":"e72c9459-5697-4a3c-a778-220795f9843f","resolution":{"observed_at":"2026-08-08T01:01:44.076699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T01:01:45.022754Z","title":null,"venue":null,"work_id":"45782ee4-93e3-4200-b71f-264259c1ffc7","year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":4096,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.151987Z"},"links":{"citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:d99b810601063c246f17607293d6c36c4f4361909211b78bc0263ca30cd38a1c","observation_id":"808705d3-d049-4661-9671-42e1387f8e10","resolution":{"observed_at":"2026-08-08T01:01:45.026043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.03052."}