{"as_of":"2026-07-25T10:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfb86b0a1545fc22a096143c771bce01b44e1864789783ca1d62f2a24e5c1af4","coverage":[{"denominator":11,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T09:01:35.425918Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-25T06:30:59.84592+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T07:43:50.633779Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-13T07:47:33.319161Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"cited_work":{"arxiv_id":"2604.16256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16256","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","venue":"cs.CV","work_id":"90b19a9f-5a97-43a7-89e9-9f063f4cf7c5","year":2026},"citing_paper":{"arxiv_id":"2605.09266","last_updated":"2026-05-12T14:15:36Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:23:58Z","title":"SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:39.571227Z"},"links":{"cited_paper":"/paper/2604.16256","citing_paper":"/paper/2605.09266"},"observation_digest":"sha256:b6f4c42fbcb5bd982b129775a7164b2b6cb355d912219e1f52a0fd2d6d42209a","observation_id":"bb1354e6-797d-4137-88e5-ff5f2f9e9713","resolution":{"observed_at":"2026-05-12T05:36:26.064995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"cited_work":{"arxiv_id":"2604.16256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16256","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","venue":"cs.CV","work_id":"90b19a9f-5a97-43a7-89e9-9f063f4cf7c5","year":2026},"citing_paper":{"arxiv_id":"2605.09266","last_updated":"2026-05-12T14:15:36Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:23:58Z","title":"SeePhys Pro: Diagnosing Modality Transfer and Blind-Training Effects in Multimodal RLVR for Physics Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:43:50.633779Z"},"links":{"cited_paper":"/paper/2604.16256","citing_paper":"/paper/2605.09266"},"observation_digest":"sha256:0d87ac103fd6e96999c5a3a86dfa5b24ecc367c44835e19d6c9ae1abf6a2f1f6","observation_id":"a8d8672a-8a01-4291-b1b9-c2915943612b","resolution":{"observed_at":"2026-05-13T07:47:33.322107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16256/citation-record","integrity":"/paper/2604.16256/integrity","json":"/paper/2604.16256/citation-record.json","paper":"/paper/2604.16256"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-11T02:17:46.480513Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:b06d49978fa6a1eee5e149cb53eee59be9cbaac7e72635360657216918922040","observation_id":"e9d5d633-9a7c-456d-9a8e-76e60b701bc8","resolution":{"observed_at":"2026-05-10T09:03:25.041433Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:25.151918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:25.151918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11595","last_updated":"2025-06-13T09:03:33Z","snapshot_observed_at":"2026-07-06T21:41:38.400347Z","submitted_at":"2025-06-13T09:03:33Z","title":"EasyARC: Evaluating Vision Language Models on True Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.11595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11595","snapshot_observed_at":"2026-07-03T16:58:42.461788Z","title":"Mert Unsal and Aylin Akkus","venue":null,"work_id":"2f0ebe21-a557-41c0-b1ce-5d711cbbeee4","year":2025},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"cited_paper":"/paper/2506.11595","citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:fb50f8481def9ad2c6862eaf20c85cf604a4060c975d3e1db3ad629599454773","observation_id":"4f39df01-7084-46e2-8517-4267c377a059","resolution":{"observed_at":"2026-05-10T09:03:25.045165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2733.2024","doi":"10.1109/cvpr52733.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Emogen: Emotional image content generation with text-to-image diffusion models","venue":null,"work_id":"7efbc2dd-b0f2-4f71-bb1c-d2fcf110d805","year":2024},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:332566bfb83d6f2359df4a55f8db348c187e5219e0ec2eeb2b67d2dfa5bb2abc","observation_id":"86b2b7ce-77b7-49d2-80a1-a10ee83e03a1","resolution":{"observed_at":"2026-05-10T09:03:24.517640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73242-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T02:30:40.858424Z","title":"URLhttps://doi.org/10.1007/978-3-031-73242-3 10","venue":null,"work_id":"05c42c21-3af1-4a16-aa23-2791f1f3b254","year":2024},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:e128bbcacde53a58bd152fe634c6524b17b299ee328fd9b497d10327e5b05f49","observation_id":"c8299b56-70f6-4268-af4e-2416ece439b4","resolution":{"observed_at":"2026-05-10T09:03:24.510527Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are given a **cross math puzzle** in a **textual markdown grid format**","venue":null,"work_id":"3f4f0e95-026f-42d6-8214-a3efa85be07a","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:54b94c58141ea06534e7860ff5260963e8da0f80c96ae62cc46fa9cf5e8fa5dd","observation_id":"03aa5c2d-3571-4e31-b762-40cedb41e5df","resolution":{"observed_at":"2026-05-20T18:23:38.173700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are given a **cross math puzzle** in a **image format**","venue":null,"work_id":"86635b66-b7a1-4ef5-8282-197ddadf6d10","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:c4ec493a5cb501157e0e3ee5a9c0d520e49cf84e9bb2fb8e1b0ffddcc3414b70","observation_id":"c43f78a9-55c5-4b25-84e4-7c2adf8cc0d8","resolution":{"observed_at":"2026-05-20T18:23:38.161128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are given a **cross math puzzle** in **both image format and textual markdown format**","venue":null,"work_id":"6e68acfd-9d0f-4813-b4b5-42e5169f93b5","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:de1e8e638e1e73926f7ac01403c8d40bd4e92c3e4bdc35aa73d122ae6316ac2e","observation_id":"b6a6c397-ee48-4675-9520-29d59af3fc58","resolution":{"observed_at":"2026-05-20T18:23:38.169302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"766277d1-0e99-4f0f-b1f2-aa7e5afccc62","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:fcf00e712cdef1ed8806e5afc351a655a1e7f9ef98776f711eda64ecedcd9dd7","observation_id":"56fad0d0-b3f6-4e86-bb69-4f921626dc61","resolution":{"observed_at":"2026-05-20T18:23:38.175408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e83d906f-ed48-4065-8fcc-f485a8f1a75e","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:b90d1bab5bc85bc71faa56aa9a6690a494fd1808bd995df368589c80ee605877","observation_id":"86efefc3-01d1-40c7-ac84-e50071f55c7d","resolution":{"observed_at":"2026-05-20T18:23:38.171322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"98b4d4f7-03c1-4dc9-b003-112bbd7453aa","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:52eed5101e29b64b5841bae7d060ebadb750ed1aace77feed94ee45861264acf","observation_id":"1b155ff9-751c-4abf-b921-151e36394255","resolution":{"observed_at":"2026-05-20T18:23:38.163408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You are given a **cross math puzzle** in a **textual markdown grid format**","venue":null,"work_id":"73fb269f-d487-4bec-91bf-a72f13db598c","year":null},"citing_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T09:01:35.425918Z"},"links":{"citing_paper":"/paper/2604.16256"},"observation_digest":"sha256:bed24b78181d53c13683d42ccb3385e031c4aee1c5aa633a745caa98343fd0e0","observation_id":"ac2646c3-2185-4d7c-8750-61950c38d326","resolution":{"observed_at":"2026-05-20T18:23:38.166227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-25T06:30:59.84592+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap"},"reference_resolution":{"displayed":11,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":11},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-25T06:30:59.84592+00:00","source":"crossref"},{"observed_at":"2026-07-25T06:30:55.222588+00:00","source":"retraction_watch"}],"thesis":"As of 25 July 2026, this Paper Citation Record lists 11 of 11 outbound references and 2 inbound Pith citation observations for arXiv:2604.16256."}