{"as_of":"2026-08-09T12:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a188a70f8c89884e518d729473e61051cd05b5f1251a160c5731b34a5f20cab","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:54:48.841652Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00502/citation-record","integrity":"/paper/2608.00502/integrity","json":"/paper/2608.00502/citation-record.json","paper":"/paper/2608.00502"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T00:54:48.786424Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.786424Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:bb7fb5fbcca513c0ded1c8831738f57a4ef0462dae4530a9edf1e2eaa2df32c8","observation_id":"4c5d8d37-3172-49eb-a030-76bbe9e0695d","resolution":{"observed_at":"2026-08-05T00:54:48.786424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-05T00:54:48.790316Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.790316Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:04058e3c4b07c061d21ed3f185490344a01da981514645f7b2763fa132e96932","observation_id":"fe9811cd-c017-4fd8-bc46-6ae4eec4e4b8","resolution":{"observed_at":"2026-08-05T00:54:48.790316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14747","last_updated":"2021-06-28T14:22:52Z","snapshot_observed_at":"2026-08-08T16:37:52.847631Z","submitted_at":"2021-06-28T14:22:52Z","title":"One-Shot Affordance Detection","version":1},"cited_work":{"arxiv_id":"2106.14747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.14747","snapshot_observed_at":"2026-08-05T00:54:49.125085Z","title":"One-Shot Affordance Detection","venue":"cs.CV","work_id":"befb7698-88cb-4e50-bd02-412e7f439a79","year":2021},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.811578Z"},"links":{"cited_paper":"/paper/2106.14747","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:645a5b172a85272f364ee1a527840245dd0088e1da74802f69c013391b3febe0","observation_id":"1d74063a-18b6-467c-9346-ec035d883fc5","resolution":{"observed_at":"2026-08-05T00:54:49.129302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T00:54:48.817378Z","title":"Qwen2.5-VL technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.817378Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:748f6179d88b244be760abba4a41b0f9fd5d464ade41d1381734d89966e858d0","observation_id":"aa4483fb-ef56-478a-89eb-4ce8a5f5083c","resolution":{"observed_at":"2026-08-05T00:54:48.817378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T00:54:48.823565Z","title":"VLM-R1: A stable and generalizable R1-style large vision-language model.arXiv preprint arXiv:2504.07615,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.823565Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:54685fd1c5efff5fda3dc3a7e262dca46bfdf41a57382a63dfc47552fbe33db8","observation_id":"8ceeb62a-a73c-4ed5-9df3-906602311fc8","resolution":{"observed_at":"2026-08-05T00:54:48.823565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:54:49.195436Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"55c935be-837d-4cec-a331-8ad6eb9f73b7","year":2024},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.826852Z"},"links":{"citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:d618678d368512183f0ddf1d5912a007a0be658a68dfb7c173c0db3f286eba22","observation_id":"b4127c37-5561-4372-bae1-2f28034ef8cf","resolution":{"observed_at":"2026-08-05T00:54:49.198559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:54:48.829656Z","title":"RoboBrain 2.5: Depth in sight, time in mind.arXiv preprint arXiv:2601.14352,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.829656Z"},"links":{"citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:bdb310462b389caf798502c0e7c8cc9eef0ef4063919e7ffe7925172ec623fb4","observation_id":"a08943d3-b8cf-46ad-87ba-8b807a0a6bdb","resolution":{"observed_at":"2026-08-05T00:54:48.829656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T00:54:48.835533Z","title":"Qwen2-VL: Enhanc- ing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.835533Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:ec5e5dc20297ba17729fbefb5c971258bb78d0d394439b4e14fd7d9d63c7e183","observation_id":"ce239547-b0fe-49b5-8120-2637e6fedde0","resolution":{"observed_at":"2026-08-05T00:54:48.835533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13519","last_updated":"2022-02-28T02:58:36Z","snapshot_observed_at":"2026-08-08T14:50:58.317346Z","submitted_at":"2022-02-28T02:58:36Z","title":"PartAfford: Part-level Affordance Discovery from 3D Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13519","snapshot_observed_at":"2026-08-05T00:54:48.838732Z","title":"PartAfford: Part- level affordance discovery from 3D objects.arXiv preprint arXiv:2202.13519,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.838732Z"},"links":{"cited_paper":"/paper/2202.13519","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:1cde27257840305bd6c39cbdf1b9f1f4e449f8d2c95ac8d3a1a28c31b31bec5f","observation_id":"47da41f5-3b1f-4c2d-bce4-0c8231d80e48","resolution":{"observed_at":"2026-08-05T00:54:48.838732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03577","last_updated":"2025-05-08T05:49:30Z","snapshot_observed_at":"2026-08-06T09:14:02.055269Z","submitted_at":"2024-10-04T16:30:54Z","title":"Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03577","snapshot_observed_at":"2026-08-05T00:54:48.841652Z","title":"Look twice before you answer: Memory-space visual retracing for hallucination mitigation in multimodal large language models.arXiv preprint arXiv:2410.03577, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.841652Z"},"links":{"cited_paper":"/paper/2410.03577","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:70241244efd8d32300a86d51bf72a3cc0747a9d41ce1a8f717278a0191249508","observation_id":"603f4ed2-4932-46af-8a9f-68303b365f65","resolution":{"observed_at":"2026-08-05T00:54:48.841652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:54:49.214938Z","title":"Mgpo: Thinking with images via multi- turn grounding-based reinforcement learning","venue":null,"work_id":"68027d8e-a7cc-46b6-9a8b-04587d88570b","year":2026},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":1979,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.797363Z"},"links":{"citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:9714fc4b45e1ac3cf739eef2beaeea70c972012af7c6703e73e45610ef9c953d","observation_id":"c4d9ff90-75a3-45c6-b2d8-b90ff19a7653","resolution":{"observed_at":"2026-08-05T00:54:49.218206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08241","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:54:49.108519Z","title":"Do MLLMs really see it: Reinforcing visual attention in multimodal LLMs.arXiv preprint arXiv:2602.08241,","venue":null,"work_id":"92315f19-3b31-43d7-b462-fea5a6e99445","year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.814582Z"},"links":{"citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:b52872d32be72c4efb0b38e6e0a9d397d9a2a20ab9b2ebeb1e476e1f1571b3ac","observation_id":"34304f19-c3d3-4887-9ef7-3aadb0dfa4fd","resolution":{"observed_at":"2026-08-05T00:54:49.115128Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T00:54:48.820591Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.820591Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:884e388df1f3e0b7597376e778640e942b61e875624eb94b166e144c26cdb888","observation_id":"9d870beb-a6c7-4cc2-947e-3c64e26ccd69","resolution":{"observed_at":"2026-08-05T00:54:48.820591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-05T00:54:48.793928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.793928Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:ec9f1b57a3facc6c48a061e667ff549b13ac80838086d4d29592d08a54636681","observation_id":"bfc3d2c6-72be-4554-a5b9-3b0d19f72fe9","resolution":{"observed_at":"2026-08-05T00:54:48.793928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T00:54:48.800997Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.800997Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:a21c58c36fb29050db34db238baa3cc2e857ca7913c9fe42b8665d5b9f8a9ce4","observation_id":"97d9db3f-cfeb-4faf-b572-984c4dfa35f4","resolution":{"observed_at":"2026-08-05T00:54:48.800997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:54:49.205361Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"2e5fb424-c8fb-459b-838c-4e205989f26b","year":2034},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.808322Z"},"links":{"citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:b292aa1262f722686a5642c799cbbfe5f974ada65977e44bedad9085e0ef1015","observation_id":"08652df0-1ecb-4470-b233-cf5c238f4dd9","resolution":{"observed_at":"2026-08-05T00:54:49.208446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03595","last_updated":"2026-07-03T20:34:42Z","snapshot_observed_at":"2026-08-06T04:42:02.069334Z","submitted_at":"2026-07-03T20:34:42Z","title":"Token-Based Affordance Grounding with Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2607.03595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03595","snapshot_observed_at":"2026-08-05T00:54:49.139224Z","title":"Token-Based Affordance Grounding with Large Vision-Language Models","venue":"cs.CV","work_id":"c5445edf-ea06-46ba-8214-05cc8a4cad55","year":2026},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.804739Z"},"links":{"cited_paper":"/paper/2607.03595","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:b5b38723228c2f9c367ab907521d667f1a52a65ff3df8582f33420b8a69a3e0d","observation_id":"7f743f60-859f-4db7-a84e-11729fbe09f1","resolution":{"observed_at":"2026-08-05T00:54:49.142536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-08T02:43:34.071635Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-08-05T00:54:48.781637Z","title":"Robo- Brain 2.0 technical report.arXiv preprint arXiv:2507.02029,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.781637Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:956468f377fa8019e5a2110c16358d40b548729799fb44014ab04fdd821284e5","observation_id":"29606749-d338-4124-8d6e-841411590730","resolution":{"observed_at":"2026-08-05T00:54:48.781637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27373","last_updated":"2026-06-25T17:59:55Z","snapshot_observed_at":"2026-08-08T23:29:13.406265Z","submitted_at":"2026-06-25T17:59:55Z","title":"Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27373","snapshot_observed_at":"2026-08-05T00:54:48.832527Z","title":"Paying more attention to visual tokens in self-evolving large multimodal models.arXiv preprint arXiv:2606.27373,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:48.832527Z"},"links":{"cited_paper":"/paper/2606.27373","citing_paper":"/paper/2608.00502"},"observation_digest":"sha256:0a3b568063e8c4f5526822f4598e79fb4a5817850f7c4c3e6c15f4b35e93910d","observation_id":"9323f021-c714-4397-a258-cbc5f52e805d","resolution":{"observed_at":"2026-08-05T00:54:48.832527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00502","last_updated":"2026-08-01T07:53:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T18:16:49.822942Z","submitted_at":"2026-08-01T07:53:09Z","title":"SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":3},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2608.00502."}