{"as_of":"2026-08-10T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6364f8d3646b73cf611d6b69f75d2810ece02ec68bbdf87ae917a9df268b95af","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:56:05.890768Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:01:44.122151Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T23:07:27.134549Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":"2602.06575","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-07-07T03:18:53.217702Z","title":null,"venue":null,"work_id":"7d186f49-6c71-4ce7-9a04-8c3f3289a75c","year":2026},"citing_paper":{"arxiv_id":"2606.08542","last_updated":"2026-06-07T09:49:40Z","snapshot_observed_at":"2026-08-06T08:30:27.988052Z","submitted_at":"2026-06-07T09:49:40Z","title":"When Video Misreads: Closed-Loop Distillation of Reading Heuristics for Exploratory Manipulation Trace QA","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:26:47.393632Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2606.08542"},"observation_digest":"sha256:49500875822d889aad5bca2020ac8afb6c9392c9850bf69bf35783868d73bca3","observation_id":"bc31dfb5-636f-475a-9eb3-7fda664f660e","resolution":{"observed_at":"2026-07-07T03:18:53.217702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-08-08T01:01:44.118690Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.118690Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:538696daadd3bb716cfe5fd5ca71d43ab791bc1b3fcf7cdc2274c31f5956ca0c","observation_id":"e54940ea-f858-4887-9295-6bd8d2cf92cc","resolution":{"observed_at":"2026-08-08T01:01:44.118690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.06575","snapshot_observed_at":"2026-08-08T01:01:44.122151Z","title":"URL https: //doi.org/10.48550/arXiv.2602.06575","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03052","last_updated":"2026-08-04T03:05:47Z","snapshot_observed_at":"2026-08-08T15:01:57.505057Z","submitted_at":"2026-08-04T03:05:47Z","title":"How Should Vision-Language-Action Models Use Proprioceptive State?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T01:01:44.122151Z"},"links":{"cited_paper":"/paper/2602.06575","citing_paper":"/paper/2608.03052"},"observation_digest":"sha256:095f216acf54d3f14160cc4f77533b8ce4565aaa898f3e3b66760fc28c0b877d","observation_id":"8c5ad290-f9e0-4386-bc10-c1d1fc7b6ee2","resolution":{"observed_at":"2026-08-08T01:01:44.122151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.06575/citation-record","integrity":"/paper/2602.06575/integrity","json":"/paper/2602.06575/citation-record.json","paper":"/paper/2602.06575"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:03.390527Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:03.390527Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:8744f49ed9d82412864877521c11ffafa6b891420c4b501be0b07b9e7ea1c525","observation_id":"e79c0e1f-5ab5-4967-bf62-3c2d1efe2343","resolution":{"observed_at":"2026-08-03T03:56:03.390527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-03T03:56:03.534148Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:03.534148Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:d5a50e4b3f95d218c741e5432d1444f5e1ae88ac9da92fc19672b312d15f60ed","observation_id":"ca558d04-ed66-414f-9d4e-36c09a6f5fe3","resolution":{"observed_at":"2026-08-03T03:56:03.534148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T03:56:03.641804Z","title":"X., Tanner, J., Vuong, Q., Walling, A., Wang, H., and Zhilinsky, U","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:03.641804Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:56b32071a69130650e6ac2e827597875446f53fdaf641bb8e23bdb48d5d73f0b","observation_id":"866479ce-3577-489f-b0ec-00297cb223a3","resolution":{"observed_at":"2026-08-03T03:56:03.641804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:03.742124Z","title":"R., Finn, C., Kumar, A., and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:03.742124Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:c7fdd772f040152523d2cdaeccce19c20c9931ddd2327e3a9734f377588adeb2","observation_id":"ce5024b7-fe2a-47fe-90ea-ebddaf07717a","resolution":{"observed_at":"2026-08-03T03:56:03.742124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:03.850627Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:03.850627Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:eb7818f1f27cb65ab8266a46375d8b95284f913e6fe84329871e0c718a4b8f44","observation_id":"5a02d83f-7c01-4b53-8c32-d1abd795b7eb","resolution":{"observed_at":"2026-08-03T03:56:03.850627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10088","last_updated":"2024-10-14T02:02:54Z","snapshot_observed_at":"2026-08-04T09:34:09.818156Z","submitted_at":"2024-10-14T02:02:54Z","title":"The Ingredients for Robotic Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10088","snapshot_observed_at":"2026-08-03T03:56:03.958826Z","title":"K., and Levine, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:03.958826Z"},"links":{"cited_paper":"/paper/2410.10088","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:8e59ea207f0096eae3d3ea1616476caba8f24f7a1efca6550de3e61eb8a4775f","observation_id":"df2cc7c7-9f52-487f-90cd-13cfab484e06","resolution":{"observed_at":"2026-08-03T03:56:03.958826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:04.064798Z","title":"U., Akram, W., Saoud, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.064798Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:1ca62bc93ec8fa827f13cd70f1a8ebdfb78ea7256fb47e2b58bd54c05117da69","observation_id":"2eacf72c-5def-46fe-b13f-20757e186e7d","resolution":{"observed_at":"2026-08-03T03:56:04.064798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09144","last_updated":"2025-05-14T05:03:09Z","snapshot_observed_at":"2026-08-07T15:45:32.864744Z","submitted_at":"2025-05-14T05:03:09Z","title":"Latent Theory of Mind: A Decentralized Diffusion Architecture for Cooperative Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09144","snapshot_observed_at":"2026-08-03T03:56:04.120185Z","title":"S., Liu, X., Schwager, M., and Sartoretti, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.120185Z"},"links":{"cited_paper":"/paper/2505.09144","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:80e444892d908f50e200f2716d87d5f024ed947667f24b55967be43e2cefb2b9","observation_id":"fea78ca6-3221-45b2-8b6f-f2d5b3c5c48a","resolution":{"observed_at":"2026-08-03T03:56:04.120185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05787","last_updated":"2025-05-09T05:11:19Z","snapshot_observed_at":"2026-08-07T15:48:33.844762Z","submitted_at":"2025-05-09T05:11:19Z","title":"Demystifying Diffusion Policies: Action Memorization and Simple Lookup Table Alternatives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05787","snapshot_observed_at":"2026-08-03T03:56:04.228948Z","title":"S., Sartoretti, G., and Schwager, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.228948Z"},"links":{"cited_paper":"/paper/2505.05787","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:96be4e9f2776fc19831ae58b5f23583b6e18513edd16835f32ff99c9186262d3","observation_id":"85b205a8-ea66-405b-94bf-339714a66c7e","resolution":{"observed_at":"2026-08-03T03:56:04.228948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19757","last_updated":"2025-09-06T18:16:04Z","snapshot_observed_at":"2026-08-07T16:38:03.790732Z","submitted_at":"2025-03-25T15:19:56Z","title":"Dita: Scaling Diffusion Transformer for Generalist Vision-Language-Action Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19757","snapshot_observed_at":"2026-08-03T03:56:04.338230Z","title":"Dita: Scaling diffusion transformer for generalist vision-language-action policy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.338230Z"},"links":{"cited_paper":"/paper/2503.19757","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:4ddd4f6e58370ad8bcb4b5aec4c7559e5a0e0a9aad04886f00e04444ef3d8bb5","observation_id":"c4026ade-74dc-4276-8eaf-1bf3f6496f0c","resolution":{"observed_at":"2026-08-03T03:56:04.338230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:04.397799Z","title":"Video prediction policy: A generalist robot policy with predictive visual representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.397799Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:dbcc5a648a0fb3b3aba2259114c1253fa60bdd3f3611d71e8374dbc73192d145","observation_id":"cfd835a7-5f16-4087-a785-e8ed73593688","resolution":{"observed_at":"2026-08-03T03:56:04.397799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:04.501586Z","title":"Otter: A vision-language-action model with text-aware visual feature extraction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.501586Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:dbf3b26a2bec060015a57dde613e749f1653370425469efa37715848baa66536","observation_id":"90fb4eaf-421f-4151-95a3-dd0dd3999e1c","resolution":{"observed_at":"2026-08-03T03:56:04.501586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-03T03:56:04.604747Z","title":"Y., Ghosh, D., Groom, L., Hausman, K., Ichter, B., Jakubczak, S., Jones, T., Ke, L., LeBlanc, D., Levine, S., Li-Bell, A., Mothukuri, M., Nair, S., Pertsch, K., Ren, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.604747Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:57e0e1985366181c85e7904d603cc987250e5a3dda5632f8cf964b4be379ab5b","observation_id":"822fa9cc-27c0-42aa-804c-b12f3cc2c5b0","resolution":{"observed_at":"2026-08-03T03:56:04.604747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:04.715989Z","title":"The better you learn, the smarter you prune: Towards efficient vision-language-action models via differentiable token pruning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.715989Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:2dc1e0d04605195e4a802c7cb4ddf90b8ae34a101bb4f7c00ddb41cd11f461ac","observation_id":"68cc964f-af0e-415a-acf5-9449d98324b9","resolution":{"observed_at":"2026-08-03T03:56:04.715989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-03T03:56:04.772125Z","title":"J., Finn, C., and Liang, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.772125Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:47415a8acaa7c7746c65f39ff830fc573e6b590ca78ee67fbfca9ba94a016835","observation_id":"0b503360-8bb5-4e77-bb98-2bb75e829740","resolution":{"observed_at":"2026-08-03T03:56:04.772125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:04.879074Z","title":"J., Pertsch, K., Karamcheti, S., Xiao, T., Balakrishna, A., Nair, S., Rafailov, R., Foster, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.879074Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:23bc0d50d97426e1616a861b7dfa65080264ffd5585f989851e9ddbcced4a22f","observation_id":"ad7a0ac2-e012-4c8d-a8dd-4998de472333","resolution":{"observed_at":"2026-08-03T03:56:04.879074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-08-03T03:56:04.939069Z","title":"Coa-vla: Improving vision-language-action models via visual-textual chain-of-affordance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.939069Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:cc2ed101a95aa80f270cfcb91ef52780d118cea484f2ed0ae3c4bee763c5e41d","observation_id":"2cb37b32-e59c-4e28-904d-aa6761045a37","resolution":{"observed_at":"2026-08-03T03:56:04.939069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-03T03:56:04.993667Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.993667Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:d7fc38f888bf8e46d1f73509b10e97bddbd154bcf807059ae6ed48eba2bed663","observation_id":"6214642d-950d-46ac-a6d1-7c53307f2485","resolution":{"observed_at":"2026-08-03T03:56:04.993667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-03T03:56:05.024414Z","title":"Vision-language foundation models as effective robot imitators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.024414Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:86d13f80f0e250b920d5498d4cf9614cdae4da360c4ab8566ba8363943e708f7","observation_id":"2fca8ba7-75e2-492c-90b4-926308054eb2","resolution":{"observed_at":"2026-08-03T03:56:05.024414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T03:56:05.083076Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.083076Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:efaf6dd87dd74f2434de897601232cc81f43502b2ea8e28be5a6e0cbe484c22e","observation_id":"5c5d9faa-2b20-47fd-883d-0ef0312d7808","resolution":{"observed_at":"2026-08-03T03:56:05.083076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.142388Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.142388Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:1c10df5c79b4615fe1c38f6b805c564ade0f13f5d2066c321676dbdecb59eb55","observation_id":"6547da2f-54b9-4ce2-a21a-70f92dbd2a79","resolution":{"observed_at":"2026-08-03T03:56:05.142388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.199824Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.199824Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:324e7aa441e4701b29459710320b8bcdd92e7aff6a08ab45b5a7caeb133f9e68","observation_id":"cc3bae6d-825b-4b3f-a816-02c0e955849d","resolution":{"observed_at":"2026-08-03T03:56:05.199824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.315533Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.315533Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:810600d7c946a36e6e7607d77bf03c9b4f69cccc5c1b3105a8c1428ccb3aa469","observation_id":"6a4daf34-bf94-4cfc-9186-dee12cc36bda","resolution":{"observed_at":"2026-08-03T03:56:05.315533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.379652Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.379652Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:efe689000baf69d08848891741a343b3b35d796c4a2260e357e43aadfeecedce","observation_id":"82f5e85d-e02a-40d5-a581-3a169114d44e","resolution":{"observed_at":"2026-08-03T03:56:05.379652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05996","last_updated":"2024-07-08T14:46:44Z","snapshot_observed_at":"2026-07-06T18:43:05.700263Z","submitted_at":"2024-07-08T14:46:44Z","title":"Multimodal Diffusion Transformer: Learning Versatile Behavior from Multimodal Goals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05996","snapshot_observed_at":"2026-08-03T03:56:05.396182Z","title":"E., Wenzel, F., and Lioutikov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.396182Z"},"links":{"cited_paper":"/paper/2407.05996","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:f6baf61ba8717b7a917779c99911a38f30689073148a6bb6ffea30a289df4be1","observation_id":"15fbe715-5e6c-4768-9716-468af86a2bc5","resolution":{"observed_at":"2026-08-03T03:56:05.396182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.459011Z","title":"E., Otto, F., and Lioutikov, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.459011Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:51f21eff4a233f0274af755db0bdd598d8a8d0cdc2345c496fc962984977210e","observation_id":"e99d5310-da24-401b-bfe8-fdbc90974028","resolution":{"observed_at":"2026-08-03T03:56:05.459011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-08-03T03:56:05.496346Z","title":"S., Piergiovanni, A., Arnab, A., Dehghani, M., and Angelova, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.496346Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:55c73f7f9a84bf0eb6a354e29d0c4e8932075184ab07a1a7ae6748843fb822f6","observation_id":"a4b86630-081a-4e87-b794-675d41d62a52","resolution":{"observed_at":"2026-08-03T03:56:05.496346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-03T03:56:05.558783Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.558783Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:8af99e56c7d3e2685d5451002323355fe56dc3b9b58c8ac0b43539fad2a15f67","observation_id":"54748125-b756-47b8-9bf5-fe9c211be117","resolution":{"observed_at":"2026-08-03T03:56:05.558783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15109","last_updated":"2024-12-19T17:52:50Z","snapshot_observed_at":"2026-07-06T20:10:19.704368Z","submitted_at":"2024-12-19T17:52:50Z","title":"Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15109","snapshot_observed_at":"2026-08-03T03:56:05.618437Z","title":"Predictive inverse dynamics models are scalable learners for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.618437Z"},"links":{"cited_paper":"/paper/2412.15109","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:6d1b4185a8fdc777c53269c2e14752380f676d59418c5ffc3241163912f1a996","observation_id":"87a6f7a6-44de-44f9-8bce-769e41b39213","resolution":{"observed_at":"2026-08-03T03:56:05.618437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.689402Z","title":"Unleashing large-scale video generative pre-training for visual robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.689402Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:ec220eaf41af1923b8165037ce143b0d00e316eb89e4e6cf1b04bfe059e95d9a","observation_id":"537af961-80dc-4af7-90f5-d7c32efc8a9b","resolution":{"observed_at":"2026-08-03T03:56:05.689402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.729625Z","title":"Deer-vla: Dynamic inference of multimodal large language models for efficient robot execution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.729625Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:7b6ff27e5938696f898bde3fabfa330af7b06384ebef2b7dcc7770f226d2621f","observation_id":"ddf23d8c-a1e1-482a-8f98-b654a88a821d","resolution":{"observed_at":"2026-08-03T03:56:05.729625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:56:05.890768Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:05.890768Z"},"links":{"citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:b616c75b87a786771170108f38c019a736fdea8975340c2b36e97d60baee9ab2","observation_id":"31281768-7a8c-4a6f-8d55-0dd8cdc96c43","resolution":{"observed_at":"2026-08-03T03:56:05.890768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:2602.06575."}