{"as_of":"2026-08-07T22:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e161d5d82f4832d98bbe26a89731c7785dd31a65d98c4ef867908d4505c15859","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:57:40.870137Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02197/citation-record","integrity":"/paper/2608.02197/integrity","json":"/paper/2608.02197/citation-record.json","paper":"/paper/2608.02197"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.689174Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.689174Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:a22f65359c27eb4ca1a84bf32964a641c49abba28e20e083cd8ca843b2c41806","observation_id":"3ab1be2c-cd79-483a-91d3-f9bb8504dd95","resolution":{"observed_at":"2026-08-04T11:57:40.689174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.694039Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.694039Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:8dfdd3b2bf6b57b78c8530b5bcc4c034e05f88e2a3285060935bb98c74669842","observation_id":"4fe066ca-2b8f-4ae4-b95a-3f65aad88066","resolution":{"observed_at":"2026-08-04T11:57:40.694039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.697519Z","title":"AAAI Conference on Artificial Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.697519Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:a30a8d1dc018de91a3d1613717ca36279732a7157833819e4d71f65dbe2303ed","observation_id":"5805bee0-890a-462f-9798-ac30c8781e44","resolution":{"observed_at":"2026-08-04T11:57:40.697519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.700483Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.700483Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:e20f67a916b3b00a8c024c8dead613352dbb0868a63faaa7d1db32a00d6438ed","observation_id":"30de7cf8-ed26-4e8c-ac34-27595c947fb1","resolution":{"observed_at":"2026-08-04T11:57:40.700483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.703298Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.703298Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:307e28f552897be9149535220bebefa210306f81c20ad5d7f26c509cdef4086a","observation_id":"2507c561-7a95-473f-a2fe-8ff0d29cc462","resolution":{"observed_at":"2026-08-04T11:57:40.703298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.706639Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.706639Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:82fb2dd080aa33310710de886aa9ceb430cade411910ce7398641bcc40564a0b","observation_id":"88c2854d-376e-400a-ae16-95fd975b3dbd","resolution":{"observed_at":"2026-08-04T11:57:40.706639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.709550Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.709550Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:9bc294d35418eda92e447e034be304cd40fa6b7f065d0d343929564a8564d39f","observation_id":"2717589e-0931-4fb7-b91c-646170a32397","resolution":{"observed_at":"2026-08-04T11:57:40.709550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.712625Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.712625Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:a8fe269c06e3765bd8927bf061899167766c92687a2027c11abe2dda25038775","observation_id":"4ff15f73-5f29-4fe9-aca2-22e132ff9a35","resolution":{"observed_at":"2026-08-04T11:57:40.712625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.715883Z","title":"Proceedings of The 9th Conference on Robot Learning , pages =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.715883Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:5596ef379d69c6db3647bbbb82ff5bf8d8e3965f0c13e6d42011150e8e7bc5e1","observation_id":"866ea810-160a-4a2e-8f33-ce8dcdb215b2","resolution":{"observed_at":"2026-08-04T11:57:40.715883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.718769Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.718769Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:e296df91aa5501f201dd0cd98345ad2efcd6102ca664c74a1ea175f7a95bc766","observation_id":"255a1815-1fbf-4a6f-83e5-fc9295b8d346","resolution":{"observed_at":"2026-08-04T11:57:40.718769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.721475Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.721475Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:21abb08978b99193a748e5aac74c20ab7d3df4e20c5592cf6b4bf347846e8f66","observation_id":"581d0b33-eae5-428a-ad83-9ab2c3004cb8","resolution":{"observed_at":"2026-08-04T11:57:40.721475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.724285Z","title":"Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.724285Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:fa567eb63f84e976ae5f4b797db734d2edf070537f6e2636424552fb650be7ea","observation_id":"374f0fa4-f483-4b19-8433-8cab600aa0bd","resolution":{"observed_at":"2026-08-04T11:57:40.724285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.726856Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.726856Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:492c52f7af320f2de817d98ddb6efc1a6f7d8e129bc3b22d12b203c388e17fb8","observation_id":"27903a81-128f-49a2-bf0b-a8025d141597","resolution":{"observed_at":"2026-08-04T11:57:40.726856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.729288Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.729288Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:cd1d704aed1d1d5c1512855d693c8d0c5c73a138e27bab72dcee2db9104fa4f3","observation_id":"b078b554-02f4-44d4-94b7-4c491869dae2","resolution":{"observed_at":"2026-08-04T11:57:40.729288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.731816Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.731816Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:d468084fcbc7a0cb1016a229965e04528beeb5b885aeb536b1e90285e34efec2","observation_id":"084ba25a-67c4-4e45-9ce0-962cc7dbf93c","resolution":{"observed_at":"2026-08-04T11:57:40.731816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.734882Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.734882Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:0e778d87d3bb698bd64f1a0d71adf6531125a4a8c802bc2ec4e3f731dde704a7","observation_id":"b0e48609-837a-4fcd-a0fa-a14a2f12fb47","resolution":{"observed_at":"2026-08-04T11:57:40.734882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.738103Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.738103Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:59087644a12f45c97ff9c4e2854ac5fe5943ce511dcbfc1dacaa48ff91009d00","observation_id":"0b735300-60f4-4a61-ab68-fafa9a99904b","resolution":{"observed_at":"2026-08-04T11:57:40.738103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.741422Z","title":"Conference on Robot Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.741422Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:7e0ed721f40abd1e2778465653c0b0722bcf053c06d5fa3399b1c2ed260f8656","observation_id":"92ef1562-f681-40ee-bac2-6210b4908096","resolution":{"observed_at":"2026-08-04T11:57:40.741422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.744239Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.744239Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:007fe23cc99adde4fff1f9e57870ae2aafffe0a4740b10ee001970d971d94432","observation_id":"e6678af5-d7b7-42d2-8623-42c577c440e7","resolution":{"observed_at":"2026-08-04T11:57:40.744239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.747693Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.747693Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:293023567d9ff749a28eb7e37af6fcafe36755d81f644ffad75874135cf1e645","observation_id":"37aa1a86-1b50-47d7-882e-25649b8ad648","resolution":{"observed_at":"2026-08-04T11:57:40.747693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.751079Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.751079Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:3b814edb58f4dc49b6f3ca202f8b40979ebc4ecf6dd3979ac14d4c0dc6e7ec98","observation_id":"b68d45c1-03e4-4570-b42b-cbde06f42852","resolution":{"observed_at":"2026-08-04T11:57:40.751079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.754155Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.754155Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:39edb950b99e633b038f8c98d7a27da84c14820df30671a039f8336070bb45a8","observation_id":"1f050c24-a7ef-41d7-8c7f-79ddcfaab3e7","resolution":{"observed_at":"2026-08-04T11:57:40.754155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.756778Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.756778Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:eee816096699aebed60b3eed18d555e5f65c86d3734774291c1b06f24b7c7e66","observation_id":"bdc3bcbb-391d-43da-82d5-ab93209d195e","resolution":{"observed_at":"2026-08-04T11:57:40.756778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.759385Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.759385Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:4d03e5bd8604ed9947cbe7154add32830ba446caab8a17e22779e2c8679de293","observation_id":"2e57f597-462f-4df3-8ece-19ae4e1cc5c4","resolution":{"observed_at":"2026-08-04T11:57:40.759385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.762276Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.762276Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:c386c5b02dd7b8b1ede61c853f628fb9bdcda8cdc9189c52b1c98e2fc0451154","observation_id":"768c7528-7671-4a50-9adc-94e87fd033fc","resolution":{"observed_at":"2026-08-04T11:57:40.762276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.765237Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.765237Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:9d6dc35c8b36e420fea11970fbee86efaa8d28688ac27715f307559694a2fa23","observation_id":"f9a6f5d7-a80b-4ae9-8af6-28a95f7343b2","resolution":{"observed_at":"2026-08-04T11:57:40.765237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.767922Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.767922Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:afd4db9457293ad5cd8fe0368a1ecdccb1cd5d9200255752efa11f820e597cdc","observation_id":"02721ad6-9c6d-483b-ad73-c6104078a2e1","resolution":{"observed_at":"2026-08-04T11:57:40.767922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.770348Z","title":"Nature Machine Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.770348Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:40a5c32231c5611a3d18b8a8f330818d765662729134c32aed6e9f24f60107e8","observation_id":"c60642a5-185b-494a-8359-5ebd894b26e2","resolution":{"observed_at":"2026-08-04T11:57:40.770348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.773148Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.773148Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:7ed86664a238f6cfbef73183862e9df2cf2f16609c111e2132650cfd9818eb5b","observation_id":"f66a8724-c043-4a7f-bb80-8149b8fca07d","resolution":{"observed_at":"2026-08-04T11:57:40.773148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.775685Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.775685Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:6553187ca644b7903c56a5bf84a32fa77c87d993ef5b4bb899261b3c74394bc4","observation_id":"ade07406-9ac6-4c63-89a1-d0c7a5fa2612","resolution":{"observed_at":"2026-08-04T11:57:40.775685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.778473Z","title":"ArXiv , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.778473Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:61ecb4c743d9ed42522360b4a81b1aff3c93ffd34ce558107907fb281d40fc2f","observation_id":"0137c711-66bf-4c63-9b7b-c94fbc4b3353","resolution":{"observed_at":"2026-08-04T11:57:40.778473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.781005Z","title":"Conference on Robot Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.781005Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:e274affd0b36196a0e17ddf644af7cc2a5d155c194485081d358a113643448fc","observation_id":"3e72db6d-bf3e-41c4-93b4-423dec735f44","resolution":{"observed_at":"2026-08-04T11:57:40.781005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.784142Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.784142Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:8f7a8e6f4abff40c432966eeb722bae9a65986b457d9bce2b1c52af8b6f42dd4","observation_id":"35543a8b-f4f0-4511-8f86-f75b66d7d1e7","resolution":{"observed_at":"2026-08-04T11:57:40.784142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T11:57:40.786692Z","title":"X.; Tanner, J.; Vuong, Q.; Walling, A.; Wang, H.; and Zhilinsky, U","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.786692Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:ed0646ebd580b6cfe20a0ab041e063055c328980478f7b2267fd67ea1473dd50","observation_id":"3af9e1b6-5df7-4817-aa25-eaa11ba2d3b0","resolution":{"observed_at":"2026-08-04T11:57:40.786692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-04T11:57:40.789668Z","title":"G.; Gopalakrishnan, K.; Han, K.; Hausman, K.; Herzog, A.; Hsu, J.; Ichter, B.; Irpan, A.; Joshi, N.; Julian, R.; Kalashnikov, D.; Kuang, Y.; Leal, I.; Lee, L.; Lee, T.-W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.789668Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:65231fdf71cbd749803d979a974777233fb73f1c35351d4e484ef071919c26db","observation_id":"9b565bce-0e98-4b76-b7d9-d789a85a2ff7","resolution":{"observed_at":"2026-08-04T11:57:40.789668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19820","last_updated":"2026-04-13T18:49:58Z","snapshot_observed_at":"2026-08-02T22:55:59.243931Z","submitted_at":"2025-11-25T01:21:26Z","title":"CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19820","snapshot_observed_at":"2026-08-04T11:57:40.792418Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.792418Z"},"links":{"cited_paper":"/paper/2511.19820","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:4c35c5a5001578c0e73d3d05eb0730cc2f194b38664fc3f45408c77c930edfd4","observation_id":"aab439bf-3d7f-4eaf-8bcd-c1c15c9fb142","resolution":{"observed_at":"2026-08-04T11:57:40.792418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-04T11:57:40.795888Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.795888Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:f90e79c19f3972eed374cf9e8b23f21c3733538fdf7cf024a9d75d9053c814a9","observation_id":"042860c8-07ce-4426-953b-2fdaf8438876","resolution":{"observed_at":"2026-08-04T11:57:40.795888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-08-07T00:53:01.614001Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03233","snapshot_observed_at":"2026-08-04T11:57:40.798816Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.798816Z"},"links":{"cited_paper":"/paper/2505.03233","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:1748af30efe99cdd3d72cc45b1fc4270eb735f2891158d432e8d2b6fa9f04727","observation_id":"d68759b8-9061-47a7-9452-aa4e2fafab7e","resolution":{"observed_at":"2026-08-04T11:57:40.798816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.06754","last_updated":"2026-05-06T07:00:01Z","snapshot_observed_at":"2026-07-29T01:21:11.279990Z","submitted_at":"2025-11-10T06:33:44Z","title":"SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.06754","snapshot_observed_at":"2026-08-04T11:57:40.802406Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.802406Z"},"links":{"cited_paper":"/paper/2511.06754","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:720586856b388c23e31a417f67979537904d95e83862f74ad803a352d5b587ff","observation_id":"7e8b6d5d-f9c6-4618-b353-6e6bd8cadc5c","resolution":{"observed_at":"2026-08-04T11:57:40.802406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T11:57:40.805359Z","title":"Y.; Ghosh, D.; Groom, L.; Hausman, K.; Ichter, B.; Jakubczak, S.; Jones, T.; Ke, L.; LeBlanc, D.; Levine, S.; Li-Bell, A.; Mothukuri, M.; Nair, S.; Pertsch, K.; Ren, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.805359Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:50b2c2ff0375ee8a5f02c9f196742fec8232dfe4d24002e6c87e6e3155218edb","observation_id":"7fde7fcd-0580-4755-abfd-b35902c57c5c","resolution":{"observed_at":"2026-08-04T11:57:40.805359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.808907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.808907Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:53a13a78e7231743d50a6e65e15dd43bb4080bfd71c82848e66183087429d359","observation_id":"3e4d4107-1c0f-4075-9c47-3ff034baeaa3","resolution":{"observed_at":"2026-08-04T11:57:40.808907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.811540Z","title":"K.; and Panov, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.811540Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:fce7bd95b23ca62eaf3ec89a0c4712ef11db319a1d1462e640f949f7d111a5c7","observation_id":"35eeda9f-01e8-40be-b2f7-bc412d9ef95a","resolution":{"observed_at":"2026-08-04T11:57:40.811540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.813969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.813969Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:77ae1ad837c6932a69c1bd4c14aa3cfbb9a9aa6ecd3deebf533aa9eafef1a1df","observation_id":"1f067dcc-ead8-4fcc-9df7-e7e40125fd61","resolution":{"observed_at":"2026-08-04T11:57:40.813969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-04T11:57:40.816402Z","title":"J.; Finn, C.; and Liang, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.816402Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:d984e1f8e1cfd7020a3a2321b44ee107d99e662f830453aed93c09eb45eea538","observation_id":"72df7c2d-feb4-4843-a9de-af139903f0ba","resolution":{"observed_at":"2026-08-04T11:57:40.816402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T11:57:40.819560Z","title":"J.; Pertsch, K.; Karamcheti, S.; Xiao, T.; Balakrishna, A.; Nair, S.; Rafailov, R.; Foster, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.819560Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:789c78451ece1988be8ec465ed04b32cb2f222983af4bb3b59ed8a971221b469","observation_id":"c90fcc36-a54f-4fe0-83fc-782de7589e73","resolution":{"observed_at":"2026-08-04T11:57:40.819560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07511","last_updated":"2025-03-10T16:32:41Z","snapshot_observed_at":"2026-08-07T17:16:11.057743Z","submitted_at":"2025-03-10T16:32:41Z","title":"PointVLA: Injecting the 3D World into Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07511","snapshot_observed_at":"2026-08-04T11:57:40.822184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.822184Z"},"links":{"cited_paper":"/paper/2503.07511","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:2c0b7cc7c9344115e3565555892b5ef97d424e8a7aa4f9d29a63d9e37999d3b9","observation_id":"866f949d-1f4b-448d-9bf3-77f4d8a5c3ea","resolution":{"observed_at":"2026-08-04T11:57:40.822184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.825212Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.825212Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:fb5ffdfc2d09036c0c7180faa9b31c9b34107e86e96cba626d60c66499ed499c","observation_id":"f07a0489-153d-4201-9b12-c8a3337bb571","resolution":{"observed_at":"2026-08-04T11:57:40.825212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.828202Z","title":"R.; Fu, C.; Lunawat, I.; Sieh, I.; Kirmani, S.; Levine, S.; Wu, J.; Finn, C.; Su, H.; Vuong, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.828202Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:5d997b144378bd9ef88a1eae4eccc41891191ef93aa9e6673c669efa656beb91","observation_id":"2c3aed0a-44ba-44b7-a45e-eebad6d181e5","resolution":{"observed_at":"2026-08-04T11:57:40.828202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.830995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.830995Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:3fab781e87eeea398b28ec13704da7f5881b4a23f5a6f8048d531b0958d98fa1","observation_id":"512359e9-af7f-4560-87a0-aa7bb75e3abf","resolution":{"observed_at":"2026-08-04T11:57:40.830995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.833537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.833537Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:bfe6ed5e58cf175336ecbee1207160084430a828c2ec4996c06e8f507a3a3ec8","observation_id":"47eb7604-1d83-4922-b15c-94dbf7b68e9d","resolution":{"observed_at":"2026-08-04T11:57:40.833537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03310","last_updated":"2023-10-14T15:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-05T23:32:26Z","title":"LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03310","snapshot_observed_at":"2026-08-04T11:57:40.836041Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.836041Z"},"links":{"cited_paper":"/paper/2306.03310","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:51f678d7834d2b0669d73ce08de7fa9bd786713c758640147d94db1b9a16d23a","observation_id":"e1a76801-a6a3-45a8-8d7f-fc2b135b2b13","resolution":{"observed_at":"2026-08-04T11:57:40.836041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12966","last_updated":"2024-03-21T16:26:44Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:59:52Z","title":"Chain-of-Spot: Interactive Reasoning Improves Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12966","snapshot_observed_at":"2026-08-04T11:57:40.838682Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.838682Z"},"links":{"cited_paper":"/paper/2403.12966","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:47f6bd5d2e957c7aab0a82adb8a86c4b4e4632dfa5372ef7dda15aec6f6a1149","observation_id":"43170df6-d614-4c33-94f2-bfce8ce52198","resolution":{"observed_at":"2026-08-04T11:57:40.838682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-04T11:57:40.841228Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.841228Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:fc19936b62fe8505fae51c59bbbba6af8a1665eede9a0c88b7677b344c781ee2","observation_id":"b3be2380-7ad6-4c35-a6ef-c977b09ebb8f","resolution":{"observed_at":"2026-08-04T11:57:40.841228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.844058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.844058Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:62b55e53dcfe2e1b742e78f76894822cd61012b50d922b1d0ff5dae80c6f7776","observation_id":"59473aee-1b0d-41e1-9ffd-fb11c1a168d4","resolution":{"observed_at":"2026-08-04T11:57:40.844058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.847244Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.847244Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:06236fb3491b20fac69f2ed05b0acac4f67989442a107996a37203588970e27c","observation_id":"2a658a44-9ef1-4a9b-a27d-6ff5db8fe674","resolution":{"observed_at":"2026-08-04T11:57:40.847244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-04T11:57:40.849735Z","title":"M.; Ghosh, D.; Walke, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.849735Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:ba9a585f26a24c4d309ce02f80f9947ab1515af911141482e550383d915c0582","observation_id":"7b54e302-5223-4fbf-b14d-d5e40bd80eb2","resolution":{"observed_at":"2026-08-04T11:57:40.849735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18532","last_updated":"2026-05-20T07:29:11Z","snapshot_observed_at":"2026-08-02T03:49:48.311375Z","submitted_at":"2026-02-20T09:26:17Z","title":"VLANeXt: Recipes for Building Strong VLA Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18532","snapshot_observed_at":"2026-08-04T11:57:40.853069Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.853069Z"},"links":{"cited_paper":"/paper/2602.18532","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:49c6e93668285d47eb508b8958a6cf363561a284de0ef7cf38a55cf701acc6c1","observation_id":"f0f812ab-e057-4896-a429-b6a98d1b7a4c","resolution":{"observed_at":"2026-08-04T11:57:40.853069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.856209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.856209Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:d2dab8fd61d495746ac3127017cbef72c9399e3c5aa096975283bb033143ef46","observation_id":"62fd6580-26e2-4760-ad5a-8f06427f3bf9","resolution":{"observed_at":"2026-08-04T11:57:40.856209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16033","last_updated":"2024-02-12T05:00:09Z","snapshot_observed_at":"2026-07-06T16:37:58.121261Z","submitted_at":"2023-10-24T17:48:04Z","title":"Towards Perceiving Small Visual Details in Zero-shot Visual Question Answering with Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16033","snapshot_observed_at":"2026-08-04T11:57:40.858753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.858753Z"},"links":{"cited_paper":"/paper/2310.16033","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:7e7a212d31c90df6aaf9d1505a2dbd3983077ac78f22fa64efdec33a8fc8cdda","observation_id":"deb79fa8-4ee0-4c21-b1bf-5230b348c4dd","resolution":{"observed_at":"2026-08-04T11:57:40.858753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-04T11:57:40.861348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.861348Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:831b5ea99aae289c0731a73259e785dc9a1dbb2023dbcb45a1e1199719294e9f","observation_id":"6658d97c-8203-4d30-ae54-8f84c085a47f","resolution":{"observed_at":"2026-08-04T11:57:40.861348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.864011Z","title":"J.; Fu, Z.; Zhang, Z.; Wu, Y.; Li, Z.; Ma, Q.; Han, S.; Finn, C.; Handa, A.; Liu, M.-Y.; Xiang, D.; Wetzstein, G.; and Lin, T.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.864011Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:fb9ca5499ecbbc8f44f3056df9a1e3e94bf273348b941ce30dc5708cc6751ada","observation_id":"344253a1-31c9-4b33-baf3-fa0c6e6fd0d0","resolution":{"observed_at":"2026-08-04T11:57:40.864011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-04T11:57:40.867391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.867391Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:cc56e4946a472bc40cad641276e1a9257cf7c39b20167dedc3006bf9be19605f","observation_id":"b8e99a9f-0024-44ea-a67a-91feec2e19a4","resolution":{"observed_at":"2026-08-04T11:57:40.867391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:57:40.870137Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T11:57:40.870137Z"},"links":{"citing_paper":"/paper/2608.02197"},"observation_digest":"sha256:7688b834b1a48924a6e8352d0ca32e3a2ab0714964fd23fe19ff818e92c0a5c7","observation_id":"71a6628d-66ee-4752-8587-d1e5f167dcd2","resolution":{"observed_at":"2026-08-04T11:57:40.870137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02197","last_updated":"2026-08-03T13:18:36Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T21:56:51.098009Z","submitted_at":"2026-08-03T13:18:36Z","title":"Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2608.02197."}