{"as_of":"2026-08-07T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6260a129bdaa3d20ec421b221284a89ea23fb7890f07e1a48e2f87bcad6131e4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:50:32.315784Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T16:44:56.123044Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-08-07T13:50:32.315784Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.315784Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:accf3c535f2b12c41405cc78f678a798def9bee21bc27fdeced25220e68c29ff","observation_id":"0f972e68-e574-42ee-a6ed-21d647e6ff52","resolution":{"observed_at":"2026-08-07T13:50:32.315784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-08-07T00:57:27.167072Z","title":"Capture: Evaluating spatial reasoning in vision language models via occluded object counting.arXiv preprint arXiv:2504.15485, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12374","last_updated":"2025-06-24T10:01:18Z","snapshot_observed_at":"2026-08-07T07:38:26.007252Z","submitted_at":"2025-06-14T07:11:44Z","title":"AntiGrounding: Lifting Robotic Actions into VLM Representation Space for Decision Making","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:27.167072Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2506.12374"},"observation_digest":"sha256:208e83863820961d5472d365809b1f2131dbec5a6aebbdeb54615f62135fd976","observation_id":"89ed4db9-1ac1-465e-9632-203f668c3226","resolution":{"observed_at":"2026-08-07T00:57:27.167072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-08-03T17:17:07.618065Z","title":"Capture: Evaluating spatial reasoning in vision lan- guage models via occluded object counting.arXiv preprint arXiv:2504.15485, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10342","last_updated":"2026-06-26T22:35:57Z","snapshot_observed_at":"2026-08-07T19:41:07.793806Z","submitted_at":"2025-12-11T06:46:51Z","title":"CoSPlan: Corrective Sequential Planning via Scene Graph Incremental Updates","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:17:07.618065Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2512.10342"},"observation_digest":"sha256:d78b366fa92c19b499d6b07a64a43c91cafaf620b4e908b87d56671dfe7e39f7","observation_id":"b1d2c762-7cdd-4a35-a45b-60977dcf6494","resolution":{"observed_at":"2026-08-03T17:17:07.618065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-08-03T14:53:02.245247Z","title":"& Bansal, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06056","last_updated":"2026-06-03T15:57:06Z","snapshot_observed_at":"2026-08-03T14:52:55.605377Z","submitted_at":"2025-12-22T07:30:42Z","title":"Using street view images and visual LLMs to predict heritage values for governance support: Risks, ethics, and policy implications","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T14:53:02.245247Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2601.06056"},"observation_digest":"sha256:ca07ea7c99daf2e3e7eb01be9112a158a1ef8b57a1e13761192fae5cb90fcfdd","observation_id":"64a2ad40-79a8-4e5a-b180-c7fa679bd364","resolution":{"observed_at":"2026-08-03T14:53:02.245247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-07-13T23:42:44.515158Z","title":"arXiv preprint arXiv:2504.15485 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16506","last_updated":"2026-03-18T04:22:15Z","snapshot_observed_at":"2026-08-02T06:47:16.352514Z","submitted_at":"2026-03-17T13:36:30Z","title":"VIEW2SPACE: Studying Multi-View Visual Reasoning from Sparse Observations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T23:42:44.515158Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2603.16506"},"observation_digest":"sha256:318ca6389b63fbb25ab6be3aa74d906edea60691f2442e9f6a9854ba9b38f2ff","observation_id":"818d1e8a-e5a3-4816-b936-dd8ead34c7a9","resolution":{"observed_at":"2026-07-13T23:42:44.515158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":"2504.15485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-06-30T16:44:56.123044Z","title":"Capture: Evaluating spatial reasoning in vision language models via occluded object counting","venue":null,"work_id":"3ab36349-797a-4437-9dd1-15c00a6826d2","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-07-30T02:30:56.837847Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-25T05:10:32.522453Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:453107ec88c31aa5dfb164c461ed656e2492cd8a73d2b71433e8c80b23bf72be","observation_id":"20a09eda-3925-4e68-8f68-0ab48bdece20","resolution":{"observed_at":"2026-05-25T05:15:22.749650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":"2504.15485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-06-30T16:44:56.123044Z","title":"Capture: Evaluating spatial reasoning in vision language models via occluded object counting","venue":null,"work_id":"3ab36349-797a-4437-9dd1-15c00a6826d2","year":2025},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-07-30T02:30:56.837847Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:7ef2d7a7dbce15803d759a4fafd1c2b365070f03c5d9ac07e945ac5238ef81ee","observation_id":"e513a6c6-598c-42cc-946a-022c513cc61d","resolution":{"observed_at":"2026-06-30T16:44:56.124516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15485/citation-record","integrity":"/paper/2504.15485/integrity","json":"/paper/2504.15485/citation-record.json","paper":"/paper/2504.15485"},"outbound":[],"paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2504.15485."}