{"as_of":"2026-08-17T03:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e03e4aff250f84e9dbe21d16aae1150b76fef3b8499991632885a28efd535a4b","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:17:06.512196Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T16:18:15.917659Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T16:26:20.752416Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"cited_work":{"arxiv_id":"2504.16061","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.16061","snapshot_observed_at":"2026-07-09T16:26:20.752416Z","title":"Vision language models are unreliable at trivial spatial cognition","venue":"cs.CV","work_id":"1f505b8e-0b2b-49a9-8fa2-007bf9ec8451","year":2025},"citing_paper":{"arxiv_id":"2607.07251","last_updated":"2026-07-08T10:34:54Z","snapshot_observed_at":"2026-08-15T17:58:27.858781Z","submitted_at":"2026-07-08T10:34:54Z","title":"Evaluation of Multilingual Ability to Use Spatial Deictic Expressions in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-09T16:18:15.917659Z"},"links":{"cited_paper":"/paper/2504.16061","citing_paper":"/paper/2607.07251"},"observation_digest":"sha256:97f506c94ee8ef6f79b06ebaa70bcecd275aaf5a77685b1a79e7c99f8d58b15a","observation_id":"400f398f-56c9-4e8a-b2d4-a96bd4f7b03c","resolution":{"observed_at":"2026-07-09T16:26:20.757332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.16061/citation-record","integrity":"/paper/2504.16061/integrity","json":"/paper/2504.16061/citation-record.json","paper":"/paper/2504.16061"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:07.004137Z","title":"Amant, J Gregory Trafton, et al","venue":null,"work_id":"63906c71-da3c-485f-9cbb-430fc1e7b80c","year":2022},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.408369Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:a95c83e2bfd441b3231699411b0db5e3e6296757ff11502f1b92824703bd41b5","observation_id":"a357382b-e330-4dd0-9785-b4ffd30cc74d","resolution":{"observed_at":"2026-08-16T11:17:07.007823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.992036Z","title":"Spatial reasoning","venue":null,"work_id":"ce4402ce-8293-4066-b6b8-378f859212f7","year":1989},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.412890Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:42d00fa2ad62a2a29e22d547a0673a40c327d567a0d4663f5843b44104396b58","observation_id":"f3212152-2377-407c-8f96-e4782da0eaae","resolution":{"observed_at":"2026-08-16T11:17:06.995868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-16T13:41:24.654042Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-16T11:17:06.417789Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.417789Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:1819841573325660b90c480923e02133adfce0fdbcc007a359bdfc40ca9b017f","observation_id":"c13173e1-e7ea-4349-b5ab-7b82556d935e","resolution":{"observed_at":"2026-08-16T11:17:06.417789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.981133Z","title":"Spa- tialvlm: Endowing vision-language models with spa- tial reasoning capabilities","venue":null,"work_id":"1dd91b8e-5714-4aba-9d09-d1c277125bc4","year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.422254Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:edaa5652ec2fd7fd17a14dc005086190e34ea99628ad2848563fcf5efd615c79","observation_id":"86d68f78-f7db-4f96-bc6c-fa2f127ea92b","resolution":{"observed_at":"2026-08-16T11:17:06.985035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.969634Z","title":"Large language models are visual reasoning coor- dinators","venue":null,"work_id":"e86179c3-5415-4202-8447-95a972b1f3d8","year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.425782Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:5599cad115540ebe86abe9cc95992ee3a65511cd3833f2d12f38c304fbe70554","observation_id":"3c787524-bae6-48bb-a611-bfe85bd05b99","resolution":{"observed_at":"2026-08-16T11:17:06.973691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-16T11:17:06.429836Z","title":"Spatialrgpt: Grounded spatial rea- soning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.429836Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:c3f00ea9e8bfef911bbb7b016bf2ce482932914b447944ae24f6d0b8d6f125d0","observation_id":"279db72f-026a-4e35-a91b-dd96ba8541ec","resolution":{"observed_at":"2026-08-16T11:17:06.429836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.959086Z","title":"What makes mental modeling difficult? normative data for the mul- tidimensional relational reasoning task","venue":null,"work_id":"fcc6dfb1-cd81-49c5-95b8-09a706231c6e","year":2021},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.433824Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:bee72bc29615a5133195ff1d12f55dc567bf65297cc4a47181e6790a52ef76c1","observation_id":"b77c39ae-db78-44ce-b606-f7e7a0d9daa2","resolution":{"observed_at":"2026-08-16T11:17:06.962533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.948551Z","title":"Spatial com- munication systems across languages reflect universal action constraints","venue":null,"work_id":"f1e83a33-bd5d-42ba-bc7d-f85e61cc7005","year":2023},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.437677Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:69c41cf87cfdce72868e2b1b40af2af50bc249edf21de8264c7a7f521f9d41d8","observation_id":"45e848a0-3ba5-4b6a-b9f9-4984f3f8d969","resolution":{"observed_at":"2026-08-16T11:17:06.952223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.937103Z","title":"Objaverse: A universe of annotated 3d ob- jects","venue":null,"work_id":"eff7f25e-6814-49ff-875f-bcff8243cdef","year":2023},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.441113Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:79f3e90f21de9be290b7d26fe3523579c14f0f2467d3638dac7420778c386b19","observation_id":"365d2330-92f4-4e46-944b-402a5fa80f1f","resolution":{"observed_at":"2026-08-16T11:17:06.941305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-16T14:08:59.197349Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-16T11:17:06.445081Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.445081Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:e17f1841ebd06c3ca896b29cc687d010a7a58e103309fa9ccd37102cd83fb846","observation_id":"59f2b213-f65a-4d5a-8dfe-bb83c2465e25","resolution":{"observed_at":"2026-08-16T11:17:06.445081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.448839Z","title":"Exploring the fron- tier of vision-language models: A survey of current methodologies and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.448839Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:e9b463cf1d9bfa3cec47228a3152edb1deea6107433d95e75d52166fdc0323cd","observation_id":"d78ec83f-5de6-4d97-b4f2-ed4ad02f7744","resolution":{"observed_at":"2026-08-16T11:17:06.448839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.925476Z","title":"Spatial lan- guage and spatial representation.Cognition, 55(1):39– 84, 1995","venue":null,"work_id":"2bd21b8e-54dc-4d1f-9217-6b9496a102b4","year":1995},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.452384Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:97805cde3608555fe55904ff71eaeffcb7e3aedad7b3fe38ae8f0f0f2c77d2e6","observation_id":"1dc2dd4f-ed37-4fcf-9e9a-fd5fedb816d8","resolution":{"observed_at":"2026-08-16T11:17:06.929509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.913287Z","title":"Correctness comparison of chatgpt-4, gemini, claude-3, and copilot for spatial tasks","venue":null,"work_id":"cf98434f-4336-4e94-bd55-549b75d0dff9","year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.455942Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:6ca41af09ceebeebbd7d037737695562ed2db0857f92423a500ba9c80d6559ba","observation_id":"9bdba29e-97ae-425e-9e6c-b11b6cc2df26","resolution":{"observed_at":"2026-08-16T11:17:06.917474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19785","last_updated":"2023-10-30T17:50:15Z","snapshot_observed_at":"2026-08-16T14:47:31.796733Z","submitted_at":"2023-10-30T17:50:15Z","title":"What's \"up\" with vision-language models? Investigating their struggle with spatial reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19785","snapshot_observed_at":"2026-08-16T11:17:06.459331Z","title":"What’s” up” with vision-language models? investi- gating their struggle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.459331Z"},"links":{"cited_paper":"/paper/2310.19785","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:b6bb499a54160da47610c1ef5765bbbce4a48e36d3d08b311a49469ca93f43c3","observation_id":"6a3bac8e-e1a5-4b5a-b989-233a96832039","resolution":{"observed_at":"2026-08-16T11:17:06.459331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.901811Z","title":"Space to reason: A spatial theory of human thought","venue":null,"work_id":"5442bfdf-4d4d-47da-b8d9-cfc709b6e04f","year":2013},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.462976Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:416e4022260972dfc98d82dc30570f29be0ad7f5c0654b70747b00047f7a4ad3","observation_id":"fb4dba2f-a4ca-4658-a531-6c77f33fa41b","resolution":{"observed_at":"2026-08-16T11:17:06.905447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.890381Z","title":"Whence and whither in spatial language and spatial cognition? Be- havioral and brain sciences, 16(2):255–265, 1993","venue":null,"work_id":"1832bf92-ce75-4e5d-a0af-7bdc776d64ca","year":1993},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.466324Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:1d9c418cc4fca6a8b172922ad7793fc5bd02ecba3389d166e387d9ac1f66a99a","observation_id":"43d752fc-0c63-4975-a338-8b112bdd0a31","resolution":{"observed_at":"2026-08-16T11:17:06.894674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-16T13:55:33.670920Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-16T11:17:06.469788Z","title":"What matters when building vision- language models? arXiv preprint arXiv:2405.02246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.469788Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:55b4ed3bd7781f6b0d0b5ccf8c3fcf549d055a1dc3c30696e9c50a9976e52f7e","observation_id":"a02cbd10-c82a-47ab-a211-84f641d0a0b4","resolution":{"observed_at":"2026-08-16T11:17:06.469788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.877895Z","title":"BLIP: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"201d1342-c5ad-48c8-b9a5-f5aac8babc2f","year":2022},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.473387Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:1b0637e112b1d0c53fea6c1b2d2c4ed032a2ae1077bdd7c446b03893feca5b80","observation_id":"fe77a344-09ca-4285-b9bf-69d7366a100f","resolution":{"observed_at":"2026-08-16T11:17:06.881789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07403","last_updated":"2024-07-12T03:58:05Z","snapshot_observed_at":"2026-08-16T13:35:33.098200Z","submitted_at":"2024-07-10T06:57:58Z","title":"A Survey of Attacks on Large Vision-Language Models: Resources, Advances, and Future Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07403","snapshot_observed_at":"2026-08-16T11:17:06.477196Z","title":"A survey of attacks on large vision-language models: Resources, advances, and fu- ture trends","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.477196Z"},"links":{"cited_paper":"/paper/2407.07403","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:a86d09d37e4ebfaaf28dbcce60cabb325261a343de6ed3cb482043eb69cff9f4","observation_id":"ef0e08f4-99df-4b9b-afe0-1d96547d1f23","resolution":{"observed_at":"2026-08-16T11:17:06.477196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.865767Z","title":"Visual spatial reasoning","venue":null,"work_id":"56ce63da-ce7e-448d-85e0-f86e83630d41","year":2023},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.481010Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:af2b217a1684cd2615f3082c0053661d51cd87764b32f67883b0c12ed214133e","observation_id":"c035cd08-07a2-450e-b9aa-ff4bc77294d7","resolution":{"observed_at":"2026-08-16T11:17:06.869517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-13T12:48:26.884823Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-16T11:17:06.484550Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.484550Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:e45e116d912464db423aa881c6c7a9eaec824873b7d5e96986ede59f109f5b05","observation_id":"a825e976-011b-4371-983f-452a91303b21","resolution":{"observed_at":"2026-08-16T11:17:06.484550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.853977Z","title":"Zero-shot visual reasoning by vision-language mod- els: Benchmarking and analysis","venue":null,"work_id":"11866674-fb57-4dd4-890b-d456633dabde","year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.488056Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:64ef628172df9cbc3e7b0b45180868fe10e538b095ae47f624759cd9f1d148a5","observation_id":"2e236229-42f0-4454-9cca-8f285cd87247","resolution":{"observed_at":"2026-08-16T11:17:06.857728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.842149Z","title":"A theory and a computational model of spatial reasoning with pre- ferred mental models","venue":null,"work_id":"7ec0f569-d037-46ef-9826-ec2e313aef99","year":2013},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.491502Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:39305a3e1765a3c534157c38bc2d0287b36a49b1762146e7e2669df38d363771","observation_id":"1ecb8195-7411-402b-9ec5-44089044ae8a","resolution":{"observed_at":"2026-08-16T11:17:06.846222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.494988Z","title":"Sparkle: Master- ing basic spatial capabilities in vision language mod- els elicits generalization to composite spatial reason- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.494988Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:e8faec663f3061c92dede020e55a7997be1940c3969eef1d914ebd0f44ae54a4","observation_id":"da906f70-248b-4cbf-8bd5-825a4d8b1813","resolution":{"observed_at":"2026-08-16T11:17:06.494988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:17:06.498562Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.498562Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:0abdff740cea4f0d3a78d8091d9f7df0798cbe791faf63aed51f73c571a3961f","observation_id":"bfe9250d-697b-4c28-bdd9-53055b172d26","resolution":{"observed_at":"2026-08-16T11:17:06.498562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.830959Z","title":"Learning phys- ical parameters from dynamic scenes","venue":null,"work_id":"5d57c919-69f7-492e-9b85-b256ad6ffa7b","year":2018},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.501992Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:b5e3c2fb0b666fd3f419fa6af460cacf77207dda9f1a59bb6fa4988907291a38","observation_id":"73f7707a-ccb3-4450-af0a-1d2dc1b946ca","resolution":{"observed_at":"2026-08-16T11:17:06.834817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.819164Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?, 2023","venue":null,"work_id":"08e5f5c0-9966-41fc-ae1f-1dc1075f970b","year":2023},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.505609Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:ed6f5910f195f55305e1e748f2e8c1df0c58389e7ec93ae9219f243bb2657f31","observation_id":"c69e8c64-5800-4136-bf54-54f998527666","resolution":{"observed_at":"2026-08-16T11:17:06.823137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:17:06.804058Z","title":"Vision-language models for vision tasks: A sur- vey","venue":null,"work_id":"55daa1c4-1248-47e6-bdb0-1593e5a1aad9","year":2024},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.508700Z"},"links":{"citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:0bb820a291e0862ecc9d73f157b7cebfb85911de2afaaccef79a85e25fba7d88","observation_id":"ca3535d1-a0d7-43fe-a784-cfca6ba4d0dd","resolution":{"observed_at":"2026-08-16T11:17:06.809897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17385","last_updated":"2025-04-17T17:59:27Z","snapshot_observed_at":"2026-08-16T13:06:51.567111Z","submitted_at":"2024-10-22T19:39:15Z","title":"Do Vision-Language Models Represent Space and How? Evaluating Spatial Frame of Reference Under Ambiguities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17385","snapshot_observed_at":"2026-08-16T11:17:06.512196Z","title":"the [blank] is to the left of the [blank]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:17:06.512196Z"},"links":{"cited_paper":"/paper/2410.17385","citing_paper":"/paper/2504.16061"},"observation_digest":"sha256:db128653c3359c46590c7f2ed26c553932ad19024e53b04bd7e590056ff32477","observation_id":"ec4b1981-974c-4b0c-896d-d2fb7111b640","resolution":{"observed_at":"2026-08-16T11:17:06.512196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.16061","last_updated":"2025-04-22T17:38:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:50:07.812950Z","submitted_at":"2025-04-22T17:38:01Z","title":"Vision language models are unreliable at trivial spatial cognition"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2504.16061."}