{"as_of":"2026-08-08T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fbe856c7482ba3372c58e533ee216a9147490f176502de16ad7ff87afac8055","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:50:34.081389Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T06:34:56.032634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T21:11:15.085382Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2505.20728","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20728","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ahmed Masry, Xuan Do, Joty Tan, Shafiq Joty, and Enamul Hoque","venue":null,"work_id":"d4e78e9a-411c-4479-80f1-11dfc17851ad","year":null},"citing_paper":{"arxiv_id":"2604.23813","last_updated":"2026-04-26T17:26:06Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T17:26:06Z","title":"ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T06:34:56.032634Z"},"links":{"cited_paper":"/paper/2505.20728","citing_paper":"/paper/2604.23813"},"observation_digest":"sha256:27b7f83a69d893bdcecae9d366c098a6733b472295e5c7298375ec6760e603f8","observation_id":"af191167-4ede-47cd-87e2-f3dc88dfe650","resolution":{"observed_at":"2026-05-11T21:11:15.133893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20728/citation-record","integrity":"/paper/2505.20728/integrity","json":"/paper/2505.20728/citation-record.json","paper":"/paper/2505.20728"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:30.566175Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.566175Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:f0a63567e42eef5d9312e2a57fc1f1533f05f5779abe20d56178da1b3f6b53ae","observation_id":"5c399578-31b0-470e-9f41-1b4bc570dda5","resolution":{"observed_at":"2026-08-07T13:50:30.566175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:30.634571Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.634571Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:17ef67c690a30fd3e8665523747d5f3792a1b26884622f5dfab1ff50506eb68f","observation_id":"9d151fad-124c-448c-802b-279daa1da518","resolution":{"observed_at":"2026-08-07T13:50:30.634571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-07T13:50:30.732806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.732806Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:f93144fb9e8ec81c3e2117acbea8ae520e1e34208d7bd12508228b3c6aac5bb3","observation_id":"b7040f26-b49f-46db-9f98-0ba1569ab0bb","resolution":{"observed_at":"2026-08-07T13:50:30.732806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:50:30.813020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.813020Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:48c9cfc86a1bf4475df26eda84408b34d758d069fff0f6c26bc713bcf8cf40c1","observation_id":"752de2f1-8c9d-4fd0-b9d1-e72e290aab7a","resolution":{"observed_at":"2026-08-07T13:50:30.813020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:50:30.868504Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.868504Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:d11ce5ee8a5a413df37424c6c1451e8c662a7c9900d258b1e87b333ceb718036","observation_id":"915d26d0-19a8-4d7f-8af0-09413637133e","resolution":{"observed_at":"2026-08-07T13:50:30.868504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:30.952646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:30.952646Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:c0e75af0ea02c9c276fbbfef7f8a37cb7c0cba57b3cfd5bdfb4685bf6573437e","observation_id":"a998c525-c809-401b-a93c-920b0ea44347","resolution":{"observed_at":"2026-08-07T13:50:30.952646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:50:31.034463Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.034463Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:bf5f21f810ab62d6da91d5b3bca09a022af9d13005eaf5c9552b581c4526b166","observation_id":"5d9339a7-f16c-43db-b718-064548533b5c","resolution":{"observed_at":"2026-08-07T13:50:31.034463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:36.230078Z","title":null,"venue":null,"work_id":"c998ffea-b1d9-4baf-80f6-8e85f38e5842","year":2023},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.115810Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:abf94ab40f480d1cd046f9c4d0da24c407740feb96935bade07f85e3445b7464","observation_id":"18f9b066-a05a-4a05-8efe-ba769070c060","resolution":{"observed_at":"2026-08-07T13:50:36.299628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:36.073947Z","title":null,"venue":null,"work_id":"3ba6b303-884e-46db-a279-37f4bf4c0ba0","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.165621Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:0a8a66a5b94ab7ef201f6e280eaa1ae7a72008b4fd5ca84d44088a8715da1211","observation_id":"83229649-630f-4331-9b98-ad31b15475fc","resolution":{"observed_at":"2026-08-07T13:50:36.156624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08751","last_updated":"2025-05-13T17:03:48Z","snapshot_observed_at":"2026-08-07T15:45:41.524843Z","submitted_at":"2025-05-13T17:03:48Z","title":"Aya Vision: Advancing the Frontier of Multilingual Multimodality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08751","snapshot_observed_at":"2026-08-07T13:50:31.236941Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.236941Z"},"links":{"cited_paper":"/paper/2505.08751","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:02f28d046313d6ff7ec47fe2fafb8fe69d27ba7505e817e53b1b97bc224a46f2","observation_id":"0b6d4f18-972e-4d8c-b198-074d5dd7cb52","resolution":{"observed_at":"2026-08-07T13:50:31.236941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T13:50:31.301410Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.301410Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:b48f19b545218e8960fa60910b87cfac2e7e61ef69f02e266ab3b67c949c5f34","observation_id":"88c75eb4-923e-4bb7-bbb5-8cb2c3f30022","resolution":{"observed_at":"2026-08-07T13:50:31.301410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.877390Z","title":null,"venue":null,"work_id":"30288e1f-08fb-47fb-9593-95f2c8c0853d","year":2018},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.377792Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:ff934e78167e823eef203dbf7f57a12deb2e88afba338c2da89c12081d0a0595","observation_id":"d67f9f9f-cb3a-43ab-87b8-be3144fcc46f","resolution":{"observed_at":"2026-08-07T13:50:35.970655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T13:50:31.444781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.444781Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:f5ed707861818382f778ae3263651ec12119c49f253043be7d5f6efe9e828325","observation_id":"4b860dae-a052-4a8b-bf93-b134355876e7","resolution":{"observed_at":"2026-08-07T13:50:31.444781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.692687Z","title":null,"venue":null,"work_id":"633dafdd-53c6-4114-8cdb-c54fcf811f87","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.516823Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:ecb8b253b05caaacb20941bbcf84acdb64b47e748801abe0fad8c0ce56f72989","observation_id":"1e2bdc44-4582-4ee6-866a-cbbed726afb1","resolution":{"observed_at":"2026-08-07T13:50:35.779086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.488255Z","title":null,"venue":null,"work_id":"885d7f23-7c63-4f2c-9736-c81e98751136","year":2021},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.595020Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:18fb5ce53e8443ff5f28636eca63ed33514533e6629957617803412ee32341d5","observation_id":"56b1f494-4cca-4dd8-8989-6add8b57b1e8","resolution":{"observed_at":"2026-08-07T13:50:35.590650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.686596Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.686596Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:ac9ad90a4f68c16214838224316fdd6c74eed62a6514abd2aa41f890d54a71e4","observation_id":"06300119-8468-4e4b-b66c-f7cbd0fe8a1f","resolution":{"observed_at":"2026-08-07T13:50:31.686596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.769097Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.769097Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:6e87dfb8c48d7cbf3d402399f155e61ab73136a6de630b390a3b11c157d50c38","observation_id":"8d8cc75a-6a49-4d13-b764-86b738695d19","resolution":{"observed_at":"2026-08-07T13:50:31.769097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.864485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.864485Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:9eb2b613fb380ba97ad7d092a5306eeb2613e9983954dc53042be24766d96087","observation_id":"1751a488-47f6-463a-95ee-3434fdd5a170","resolution":{"observed_at":"2026-08-07T13:50:31.864485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.905490Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.905490Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:46050db8261df6c04a312a105cd150b8f683fad2a0ed94fcab0fe182a8b946e4","observation_id":"98096c57-9bd8-444f-a72b-8ac62487f656","resolution":{"observed_at":"2026-08-07T13:50:31.905490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:31.978776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:31.978776Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:16e167132bf207498cbdcd5818a73503a16f3a84baa6f4ad6f4ce08eb1c94a64","observation_id":"8835969b-b7aa-46d7-ab34-527f0d1550ba","resolution":{"observed_at":"2026-08-07T13:50:31.978776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.068720Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.068720Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:e3d8e006a32be26e900ad40d2c38f461502907bb3fc1f9c023f89b94b4e81ec3","observation_id":"e95c8114-bbb1-485f-a17f-6ce584870e4e","resolution":{"observed_at":"2026-08-07T13:50:32.068720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.240284Z","title":null,"venue":null,"work_id":"b90d1d79-c6ec-4d44-9e2f-f52dbfab665e","year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.171204Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:b5ba9c9bc44863dcb889343d8579fb8bfeb19bd91dfe2539bcdf4a5a2a44efe2","observation_id":"001d6cb3-83f1-49ba-98c9-d03602fda910","resolution":{"observed_at":"2026-08-07T13:50:35.334929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:35.091615Z","title":null,"venue":null,"work_id":"6d237d31-56b2-479c-a84c-ab8ccf324f00","year":2016},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.242418Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:bb0ee9985dd16bff4011389a094be0ee3c3fd55e7cfa4bd4a805a09c4959bd7d","observation_id":"601b543a-3e8e-40a9-ba87-49474f2fca34","resolution":{"observed_at":"2026-08-07T13:50:35.138981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-07T16:00:25.965211Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15485","snapshot_observed_at":"2026-08-07T13:50:32.315784Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.315784Z"},"links":{"cited_paper":"/paper/2504.15485","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:accf3c535f2b12c41405cc78f678a798def9bee21bc27fdeced25220e68c29ff","observation_id":"0f972e68-e574-42ee-a6ed-21d647e6ff52","resolution":{"observed_at":"2026-08-07T13:50:32.315784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:34.985153Z","title":null,"venue":null,"work_id":"d2b43e61-d906-434a-9a28-af8f892d1662","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.389330Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:bd3951bb5b446569ae9a470d506f68c31c70556a7c83498ac4d028dfc2b9b7b2","observation_id":"ead65715-e649-4dca-b20c-e1f20b6c4f0f","resolution":{"observed_at":"2026-08-07T13:50:35.032708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.470962Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.470962Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:275026cd9bfaccb5963bc8172c5b7b43f5d0d839a672fe5d5c1077b6c82bb7ad","observation_id":"5c97cc13-0618-4740-880f-af2c42d94a96","resolution":{"observed_at":"2026-08-07T13:50:32.470962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23064","last_updated":"2025-04-02T07:10:05Z","snapshot_observed_at":"2026-08-07T16:28:36.257219Z","submitted_at":"2025-03-29T12:50:38Z","title":"VGRP-Bench: Visual Grid Reasoning Puzzle Benchmark for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23064","snapshot_observed_at":"2026-08-07T13:50:32.535373Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.535373Z"},"links":{"cited_paper":"/paper/2503.23064","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:0d4fc5933a166999c6b8064bb09761af0320e89ecef50792b5d7d63a194fd6fe","observation_id":"ffbe223e-d9c3-4ae9-9117-c5fa30c22be1","resolution":{"observed_at":"2026-08-07T13:50:32.535373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T13:50:32.608633Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.608633Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:3c5b4859147e56752769c3dada3e1f380db63e6be8ed8b98f2eaac8e4218171a","observation_id":"dfb006dd-2a19-4373-a98d-e6b997626f22","resolution":{"observed_at":"2026-08-07T13:50:32.608633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.676073Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.676073Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:f5ee8e78aa20d4cc825c82216f4d3b6e8e18d4f8ab6660ce9f19a2e28ff414aa","observation_id":"874f6b88-88ce-4ec7-a840-424a733f8385","resolution":{"observed_at":"2026-08-07T13:50:32.676073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:34.837257Z","title":null,"venue":null,"work_id":"dbd5191e-29ed-421a-bac5-76ae9af078a7","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.758845Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:49ae137d093ce0a37b3ab812887749b9bf2827ec8c25cf928f01e36c47c188be","observation_id":"4eae3f36-1e9a-4657-b9a4-c3b516b3d359","resolution":{"observed_at":"2026-08-07T13:50:34.893955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:32.851572Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.851572Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:1c86fa52a1984d9c97efe83bd07f467e5a7e1db2807c324b2e6b46f9c7450993","observation_id":"62794210-eb1e-45bc-b7fd-b271d7ac7dc9","resolution":{"observed_at":"2026-08-07T13:50:32.851572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-07T16:05:50.340309Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-08-07T13:50:32.927998Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:32.927998Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:c480cdd9b9a84c7cac6f84dd4d41b88418b0b2a385a2fb528c2ef08574e325ca","observation_id":"dc85e25c-5131-46e0-a594-a8fb0bacfe77","resolution":{"observed_at":"2026-08-07T13:50:32.927998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-07T16:38:11.702011Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-08-07T13:50:33.010530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.010530Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:2645841dc24a46497a2ff37c8efa43cc5c6811720ec7c9d8ad59bc90928eb8b1","observation_id":"fc5d705f-b0e8-4de9-a506-d73312103c29","resolution":{"observed_at":"2026-08-07T13:50:33.010530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19990","last_updated":"2025-06-20T05:50:00Z","snapshot_observed_at":"2026-08-07T16:37:24.241241Z","submitted_at":"2025-03-25T18:21:07Z","title":"LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19990","snapshot_observed_at":"2026-08-07T13:50:33.120737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.120737Z"},"links":{"cited_paper":"/paper/2503.19990","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:928dcd54e45734045da29bc1b774c5496c8cb09454f55e631032067e2a7ef0ee","observation_id":"f462880d-35a6-456c-a477-9290ac0be834","resolution":{"observed_at":"2026-08-07T13:50:33.120737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12522","last_updated":"2022-10-10T10:39:10Z","snapshot_observed_at":"2026-08-02T04:06:04.677348Z","submitted_at":"2022-05-25T06:30:19Z","title":"Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12522","snapshot_observed_at":"2026-08-07T13:50:33.214128Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.214128Z"},"links":{"cited_paper":"/paper/2205.12522","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:89e486e8d79beca219c45581afb2941d60ef64a6482f4f04ab2535d3e2029ff2","observation_id":"d5a87d20-629c-4fed-a2ca-1aa7cc8a503d","resolution":{"observed_at":"2026-08-07T13:50:33.214128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:34.684844Z","title":null,"venue":null,"work_id":"240d5320-bb9b-48c9-960f-4046c5f2daac","year":2022},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.357115Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:39e44fe3122111ecc0241127ffc9bb48bb5e5c917410d376822f30c6eaa3f1e0","observation_id":"cf46d1fe-c7ad-4a60-ae0d-05f05bc2541a","resolution":{"observed_at":"2026-08-07T13:50:34.743151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:50:33.477473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.477473Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:2347e651970893e9e95029f3c6d48b93e8e2ea7704bfb5aab81531d02f4f263f","observation_id":"5594654b-632a-47ac-b866-0c18d131b687","resolution":{"observed_at":"2026-08-07T13:50:33.477473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09150","last_updated":"2025-02-12T03:00:20Z","snapshot_observed_at":"2026-07-06T19:01:49.900679Z","submitted_at":"2024-08-17T09:49:40Z","title":"CogLM: Tracking Cognitive Development of Large Language Models","version":3},"cited_work":{"arxiv_id":"2408.09150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.09150","snapshot_observed_at":"2026-08-07T13:50:34.238328Z","title":"CogLM: Tracking Cognitive Development of Large Language Models","venue":"cs.CL","work_id":"15ab9af6-3b82-469d-8c1e-f46612e72ea0","year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.577929Z"},"links":{"cited_paper":"/paper/2408.09150","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:7a6ce07ac46c8045b4daacafa87bf3e2ae2c8722af596904a3cbdb8b2d268121","observation_id":"537d74e7-7f34-4249-9156-1de218b34bdc","resolution":{"observed_at":"2026-08-07T13:50:34.334219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:33.703965Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.703965Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:2f7adedc2f4f003f18c8d3a75550d125deda4f0ec7b50a8c9f83ad3eef9b816a","observation_id":"1633c790-48b4-4a8f-ad8c-b011cab5840c","resolution":{"observed_at":"2026-08-07T13:50:33.703965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:50:33.819280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.819280Z"},"links":{"citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:f592a31800d2319ac3265c6ce0e86b4b7d4cee8a3b535b85dfbc3f7898b5e2ef","observation_id":"ae6ea074-f45a-4264-af88-2e2f6d623eb0","resolution":{"observed_at":"2026-08-07T13:50:33.819280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13953","last_updated":"2025-05-28T08:41:02Z","snapshot_observed_at":"2026-07-06T20:25:12.962104Z","submitted_at":"2025-01-20T08:09:42Z","title":"Redundancy Principles for MLLMs Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13953","snapshot_observed_at":"2026-08-07T13:50:33.938748Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:33.938748Z"},"links":{"cited_paper":"/paper/2501.13953","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:b5db51da4d72bb053dff8edce8b80a517c4074c21e0b5c8352fa937b67c9c9b5","observation_id":"01d53ced-5ee7-4b5e-b343-a35ca024c4f8","resolution":{"observed_at":"2026-08-07T13:50:33.938748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:50:34.081389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:34.081389Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:e0744bfd82d0d0d80e28161040d6b0ee7e518b659152cb9465139ed53c7cd53a","observation_id":"d9652d4f-5803-404f-bfbe-04cbc5d6017a","resolution":{"observed_at":"2026-08-07T13:50:34.081389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","latest_version":4,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T13:45:31.054843Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2505.20728."}