{"as_of":"2026-08-10T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:214b09a8a2a452d11f3502eafca3fd708da8a51187d532a2918dc3961e5a952a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:26:03.787816Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:16:59.192241Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-08-07T13:26:03.787816Z","title":"Improving vision-language-action models via chain-of-affordance.arXiv preprint arXiv:2412.20451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21906","last_updated":"2025-05-29T23:34:24Z","snapshot_observed_at":"2026-08-07T13:17:24.769477Z","submitted_at":"2025-05-28T02:48:42Z","title":"ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:26:03.787816Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2505.21906"},"observation_digest":"sha256:13e08707cd9ad6288e924944b939bde79f9ca0630fe2d5d5e287b9b8241ddf7c","observation_id":"e40c096e-f28b-4109-bf45-bfaee6bd7b19","resolution":{"observed_at":"2026-08-07T13:26:03.787816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-08-05T05:48:48.013404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.04996","last_updated":"2025-09-05T10:43:12Z","snapshot_observed_at":"2026-08-05T05:48:44.865688Z","submitted_at":"2025-09-05T10:43:12Z","title":"FLOWER: Democratizing Generalist Robot Policies with Efficient Vision-Language-Action Flow Policies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T05:48:48.013404Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2509.04996"},"observation_digest":"sha256:1fcfe415cd9ed9bf2ef9bdf923d545e26eac1b938df8cf5691eb9e643facb8fd","observation_id":"1e4cf007-3d7a-4a75-b37c-c233baff2257","resolution":{"observed_at":"2026-08-05T05:48:48.013404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-08-03T03:56:04.939069Z","title":"Coa-vla: Improving vision-language-action models via visual-textual chain-of-affordance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.06575","last_updated":"2026-07-06T12:11:10Z","snapshot_observed_at":"2026-08-03T03:56:00.008362Z","submitted_at":"2026-02-06T10:16:22Z","title":"Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:04.939069Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2602.06575"},"observation_digest":"sha256:cc2ed101a95aa80f270cfcb91ef52780d118cea484f2ed0ae3c4bee763c5e41d","observation_id":"2cb37b32-e59c-4e28-904d-aa6761045a37","resolution":{"observed_at":"2026-08-03T03:56:04.939069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":"2412.20451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-07-02T13:16:59.192241Z","title":"arXiv preprint arXiv:2412.20451 (2024)","venue":null,"work_id":"56a3c5e2-1a77-4ed3-8e7c-c726208f9df8","year":2025},"citing_paper":{"arxiv_id":"2603.22003","last_updated":"2026-05-09T06:59:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-23T14:08:58Z","title":"VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T00:54:36.125258Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2603.22003"},"observation_digest":"sha256:452560b1ff83a3d260e460167031c4922431e12c4d27d1dfd85f80766b977960","observation_id":"46fd2d0a-a3d7-4d3c-8c44-198cfb7a3dba","resolution":{"observed_at":"2026-05-15T00:58:26.715669Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":"2412.20451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-07-02T13:16:59.192241Z","title":"arXiv preprint arXiv:2412.20451 (2024)","venue":null,"work_id":"56a3c5e2-1a77-4ed3-8e7c-c726208f9df8","year":2025},"citing_paper":{"arxiv_id":"2605.05714","last_updated":"2026-05-07T05:57:49Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T05:57:49Z","title":"TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T14:54:48.058400Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2605.05714"},"observation_digest":"sha256:887fcfcba09b79fc060ffe89d43c8d4065d4794cb30c413d3d9d8680b6e011b7","observation_id":"e0ea0d9d-76c4-4400-9481-c83e3acaa1d2","resolution":{"observed_at":"2026-05-11T18:36:09.184585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":"2412.20451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-07-02T13:16:59.192241Z","title":"arXiv preprint arXiv:2412.20451 (2024)","venue":null,"work_id":"56a3c5e2-1a77-4ed3-8e7c-c726208f9df8","year":2025},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-06T22:19:24.528783Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:63b264603ba9cc500a5a75fc6e51270813cb017e388ae5dc085bd4b7b64803ca","observation_id":"97c78094-a882-4347-91c7-b03004757dd9","resolution":{"observed_at":"2026-06-29T13:33:27.807771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":"2412.20451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-07-02T13:16:59.192241Z","title":"arXiv preprint arXiv:2412.20451 (2024)","venue":null,"work_id":"56a3c5e2-1a77-4ed3-8e7c-c726208f9df8","year":2025},"citing_paper":{"arxiv_id":"2606.00998","last_updated":"2026-05-31T04:28:18Z","snapshot_observed_at":"2026-08-10T02:15:52.866586Z","submitted_at":"2026-05-31T04:28:18Z","title":"GraspGen-X: Cross-Embodiment 6-DOF Diffusion-based Grasping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:26:12.044711Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2606.00998"},"observation_digest":"sha256:fa54f821126d55ee5d80b265f2d46711d6b38be18c3ef9c15881f06d541e3d01","observation_id":"9aaf89e3-443e-4bd7-882d-8f4c0dd255ae","resolution":{"observed_at":"2026-07-01T21:16:13.226599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":"2412.20451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-07-02T13:16:59.192241Z","title":"arXiv preprint arXiv:2412.20451 (2024)","venue":null,"work_id":"56a3c5e2-1a77-4ed3-8e7c-c726208f9df8","year":2025},"citing_paper":{"arxiv_id":"2606.06155","last_updated":"2026-06-04T13:28:51Z","snapshot_observed_at":"2026-07-29T15:22:02.359291Z","submitted_at":"2026-06-04T13:28:51Z","title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T01:23:02.576098Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2606.06155"},"observation_digest":"sha256:eb791f55160a56a158767562f6e55cc1ff9af4a789b820c2ca258c414eb216de","observation_id":"af54694b-a523-42e1-8949-d905413d30aa","resolution":{"observed_at":"2026-07-02T13:16:59.193734Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20451","snapshot_observed_at":"2026-07-31T06:18:55.737801Z","title":"Coa-VLA: improving vision-language-action models via visual-text chain-of-affordance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":195,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.737801Z"},"links":{"cited_paper":"/paper/2412.20451","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:eb475fe3b4130a827822233315cf65a646988f5f56f7552344f398b679949cc9","observation_id":"3b8c218e-6a88-40b9-90ab-70045d15195f","resolution":{"observed_at":"2026-07-31T06:18:55.737801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.20451/citation-record","integrity":"/paper/2412.20451/integrity","json":"/paper/2412.20451/citation-record.json","paper":"/paper/2412.20451"},"outbound":[],"paper":{"arxiv_id":"2412.20451","last_updated":"2025-07-31T14:36:30Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T10:58:24.266918Z","submitted_at":"2024-12-29T12:24:31Z","title":"CoA-VLA: Improving Vision-Language-Action Models via Visual-Textual Chain-of-Affordance"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2412.20451."}