{"as_of":"2026-08-10T15:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:283a6703b19c162acfaedb7fae082effdbe6763abcd9dc72fa515f1da006dc6d","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:31:17.461916Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.26535/citation-record","integrity":"/paper/2606.26535/integrity","json":"/paper/2606.26535/citation-record.json","paper":"/paper/2606.26535"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:256e3380b46cc4431ad61cbe1035dd32d9fe4248fc93857c43caf067b70a48e0","observation_id":"d5d0d744-97d9-4ced-831d-bf813336622c","resolution":{"observed_at":"2026-07-04T13:09:50.241764Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:03e37c0b5ab11d80b729df5321264b6d9b5aaef5bd72efed1f2f8c2429ab8a7e","observation_id":"00c60199-c9eb-4423-808b-4bc8cff4f204","resolution":{"observed_at":"2026-07-04T13:09:50.247909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:7e1ad28f3ee6303161e94aca551cbce3587da39f7cc329d4a89d741b2ca9218f","observation_id":"1a1779e2-c1e0-4fd4-ae3e-09ef5234f6ee","resolution":{"observed_at":"2026-07-04T13:09:50.229185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:31:17.461916Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:fb9363489c96e10083815fca74a6203b6932e9b2662acb891073199d3288f4c4","observation_id":"83c946b8-c033-48d8-acb3-1d4beb3f441c","resolution":{"observed_at":"2026-06-26T05:31:17.461916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:6eb9d09f550f19c01e51ffeb057430be4489e3fe5b5a232f2856bd426b0494ec","observation_id":"833a873c-693f-46bd-8890-ccd010bb8025","resolution":{"observed_at":"2026-07-04T13:09:50.250608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:31:17.461916Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:df6b035ea2076d3981bbf246167c2111f497b4552ba859fbcd77aee359a5116f","observation_id":"81e5ab5f-8e76-4c62-a060-bc47dc6e5a5a","resolution":{"observed_at":"2026-06-26T05:31:17.461916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":"2501.05444","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-04T13:09:50.233935Z","title":"W., Li, L., Yang, Z., Wang, L., and Cheng, Y","venue":null,"work_id":"3684bdb2-838f-4727-be6b-797dcc466fdf","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:6a84434446150536c15d8d06f0b10ed33b6cb11b876866e8e41d68f0f263f2b6","observation_id":"01469653-fd64-47f6-bc32-e6f8c0ffde20","resolution":{"observed_at":"2026-07-04T13:09:50.235779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03135","doi":"10.48550/arxiv.2506.03135","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omnispatial: Towards comprehensive spatial reasoning benchmark for vision language models","venue":"Open MIND","work_id":"f971b57a-47ff-414d-80f9-50ccac0c8e78","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:487bf76667e18cc5f48859b242225b0237a18d91b69c96fbd7e0f4680a215c1d","observation_id":"ccafd9dc-74d1-4d7e-a53f-23e3a632f9a9","resolution":{"observed_at":"2026-07-04T13:09:50.244898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:24b28c53cf70c932d562bc1fcae6d713630bc3fcea8f92fffe458a13cd1c5992","observation_id":"22096ffd-1387-47fc-a43e-05e21824912b","resolution":{"observed_at":"2026-07-04T13:09:50.259228Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:2a31d7e597d03f00c571aa81f9f855c14026bf5975f8ebeaa15a62e5d466f108","observation_id":"f5aa600a-80eb-48c8-ab3b-23a25521e6bd","resolution":{"observed_at":"2026-07-04T13:09:50.232626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:31:17.461916Z","title":"Advances in neural information processing systems35, 24824–24837 (2022) 30 Z","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:8b4eda7aa7c63fa1bcf6f5a1664589038fdbb94fae5282c0e6b73ccf435f8c1a","observation_id":"0a00fa9a-1f7f-44d1-acaa-d6f3ced63d87","resolution":{"observed_at":"2026-06-26T05:31:17.461916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:31:17.461916Z","title":"In: Pro- ceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:068921b87e702842c7ce9f5567693832ab069d1d25c9474de22acf3459742436","observation_id":"7f09df85-b641-47e3-928b-7ce30b575576","resolution":{"observed_at":"2026-06-26T05:31:17.461916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":"2511.04670","doi":"10.48550/arxiv.2511.04670","metadata_source":"pith","pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","venue":"cs.CV","work_id":"f715ecad-ad1d-4060-9a4c-bdb41257ef61","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:6435dcd8c47064ecf62fa66198d8a85681181598b29f41d01cfc3ba2f99c3fec","observation_id":"4928d0d7-7c39-44f7-86ea-0843df5c6cd8","resolution":{"observed_at":"2026-07-04T13:09:50.253799Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-08-07T12:36:19.326245Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":"2505.23764","doi":"10.48550/arxiv.2505.23764","metadata_source":"pith","pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence","venue":"cs.CV","work_id":"3c86b01a-2b7e-4a70-94c5-92bf4d05ad52","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:5350adb180cb5982652eb23e9febd5e8f3f13ce1ebea9028126743c132003392","observation_id":"7e10ce79-1938-4d77-a9e0-0639533f8f69","resolution":{"observed_at":"2026-07-04T13:09:50.238739Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T05:31:17.461916Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:38e57d1e42ba826da9d7b198a8f8479fbbd3317fcce9efb9068921d4968132d2","observation_id":"ac3f3fc5-c4c5-4ca9-8737-f4f99e85825c","resolution":{"observed_at":"2026-06-26T05:31:17.461916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.24625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:16:29.422789Z","title":"Learning from videos for 3d world: Enhancing mllms with 3d vision geometry priors.arXiv preprint arXiv:2505.24625","venue":null,"work_id":"dd7bade9-d1d4-4597-8176-7cf017bedbd8","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:15cd6f468a0314fdb762ba7bdb9ce549f8457b2ea1e16af78d045a5092e3b20e","observation_id":"f59c9272-3614-4f48-a34c-532ae77ff0de","resolution":{"observed_at":"2026-07-04T13:09:50.256764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":5,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2606.26535."}