{"as_of":"2026-08-07T22:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd6481d060829fb1b09234f21a5b27d3ae7f4cbd4cf99e560f0f27562be2fac6","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:51:06.202263Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07297/citation-record","integrity":"/paper/2507.07297/integrity","json":"/paper/2507.07297/citation-record.json","paper":"/paper/2507.07297"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:03.420164Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.420164Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:149ac05b85ff4daf5c531a8f693583a000bf082d2cbb6bbfbc56271a55207adb","observation_id":"01079c24-8587-41b4-9ee6-5a8b73321352","resolution":{"observed_at":"2026-08-06T18:51:03.420164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.810101Z","title":"Introducing the next generation of claude","venue":null,"work_id":"aca2e51e-eed9-488a-8bfe-ce223c24d103","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.478021Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:98be3954e30b61fa773133a7af5a02ef4aeabe18c1f89b3c3a3135b39d8e0ebb","observation_id":"4adc7ce3-70be-4142-8439-c3db538f8671","resolution":{"observed_at":"2026-08-06T18:51:08.910433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T18:51:03.544169Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.544169Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:3b678e8789b31d0e0b2192a61d2d693ac7486a3748e9158e1b303e028421863e","observation_id":"a287fb6c-90de-4f06-9964-f737307741be","resolution":{"observed_at":"2026-08-06T18:51:03.544169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T18:51:03.629099Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.629099Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:ae552fcb8550f6241d863f985b2218562bdcd640133e99ce16625d26a71c6889","observation_id":"e5658769-623e-418d-8a07-f020d37f21a0","resolution":{"observed_at":"2026-08-06T18:51:03.629099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.659267Z","title":"AiR : Attention with reasoning capability","venue":null,"work_id":"9a0ca0f2-0b68-48dd-9ab5-33edc63dc458","year":2020},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.686648Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:3cf50db903308e2050cd0ad5d0ab9b0e16eedebf202716c14d221c8210bae020","observation_id":"847a7c53-0ffc-4be9-b655-69daa69edf73","resolution":{"observed_at":"2026-08-06T18:51:08.713385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:03.766806Z","title":"Measuring and improving chain-of-thought reasoning in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.766806Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:fc6daa90ae35f0c3b70092c17bba845a332febfbcfec7ff7399815d43d35b3f7","observation_id":"26524540-6843-4f25-8d64-d6d90b3161f9","resolution":{"observed_at":"2026-08-06T18:51:03.766806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-07-06T14:40:50.270024Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-08-06T18:51:03.841863Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.841863Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:4596fe8a9e23496b59614cbb7f94422e39d321ce275ba67d3addf8585c3462a2","observation_id":"f50ac4c8-1124-4a79-b6c8-e32f1c9947e9","resolution":{"observed_at":"2026-08-06T18:51:03.841863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.489665Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"1d18c4a2-7e37-46d0-b2fc-b2523677a310","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.907226Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:eb0a1383614ac500df1f7bde52462f2a9f9e753fe9814209186089c9a7618e4d","observation_id":"f08cb58b-885c-473a-b805-4942db340f1d","resolution":{"observed_at":"2026-08-06T18:51:08.565046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.337884Z","title":"Aya-vision model card","venue":null,"work_id":"ddf36199-b851-4518-adac-08f21a8f75a3","year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:03.976013Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:b8deb9c759d65961ae8e9fe7f6e96fd4d827c511cf235806b63557ab1690de6e","observation_id":"4de4e951-11d1-4b5b-8837-207ab0b1cd12","resolution":{"observed_at":"2026-08-06T18:51:08.411182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T18:51:04.037683Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.037683Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:bb4c8c80f235abad1c173248b396a8eda11631628805bffa5abf7996c0f55b0a","observation_id":"9428915f-571b-493d-8bd4-4e9c9f3684c4","resolution":{"observed_at":"2026-08-06T18:51:04.037683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04554","last_updated":"2023-12-07T18:59:22Z","snapshot_observed_at":"2026-07-06T16:58:32.099526Z","submitted_at":"2023-12-07T18:59:22Z","title":"Improved Visual Grounding through Self-Consistent Explanations","version":1},"cited_work":{"arxiv_id":"2312.04554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04554","snapshot_observed_at":"2026-08-06T18:51:06.923632Z","title":"Improved Visual Grounding through Self-Consistent Explanations","venue":"cs.CV","work_id":"7d4dec86-3c3c-41ec-b99b-f84ec36e2e03","year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.109878Z"},"links":{"cited_paper":"/paper/2312.04554","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:ec9317c7576660a2934e46e8bb8917c2f2e9a73731bbd2f5d2d10e62d8285475","observation_id":"803f8c99-c8b1-4ea9-aa9e-dd8cd31a484e","resolution":{"observed_at":"2026-08-06T18:51:07.033159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.168260Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"ad75e6ef-7b72-4393-adc7-9501f9e64959","year":2019},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.201246Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:9e84194df70944091d8a31b0a06f63afd4ef156eb724278bb39c0e70ca375917","observation_id":"a94447db-402c-4f07-9daf-f7be8ed79e9b","resolution":{"observed_at":"2026-08-06T18:51:08.229609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T18:51:04.289982Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.289982Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cc2ac86bb260f3f8dcd1e4fc31f36c5e6c4f759342523abf7f9edb30e6958d99","observation_id":"4bfa830a-d607-4b6d-a050-a712d764dd7a","resolution":{"observed_at":"2026-08-06T18:51:04.289982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-19833-5_38","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:06.470937Z","title":"Weakly supervised grounding for vqa in vision-language transformers","venue":null,"work_id":"42b3b64a-8c3f-4ba6-812d-039070d726ec","year":2022},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.365691Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:6721ab4ad38c95e320c3bbb17b36f255e3ce581fe3d8d057c3fa05fc56e32192","observation_id":"c891e4df-803f-47e8-89ec-cdb9b2b70354","resolution":{"observed_at":"2026-08-06T18:51:06.522495Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-06T18:51:04.420426Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.420426Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:d949eac0acd4075599871fab911767b4124682dabcd2336d0a3f2c492554797f","observation_id":"89a1cba5-0ab5-4c6a-8fa0-fe426fcdecb7","resolution":{"observed_at":"2026-08-06T18:51:04.420426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T18:51:04.468078Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.468078Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:0f66567142bef31aadeaa1138cd37b6013ab6e6087a7a6cd705b2b32a214f01c","observation_id":"2cc45b3f-a014-47a5-9625-f7b95e3a6b91","resolution":{"observed_at":"2026-08-06T18:51:04.468078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:08.023176Z","title":"Visual instruction tuning","venue":null,"work_id":"ff7dea8e-6382-439b-88d1-4bbd66bcb7fd","year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.531795Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cdf5e1201aee342185c1b43ae00e445275572f1238cb0261c3ae61a9335c67a8","observation_id":"bc1c45f8-a047-46a9-a055-0e97c45ce61a","resolution":{"observed_at":"2026-08-06T18:51:08.068541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:04.586706Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.586706Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:885fc82a9d82cb44c14466dd2bf9508053741bc4f338875c24c23b03862dbd80","observation_id":"6de4a6e7-42da-4ea2-888b-26422013531a","resolution":{"observed_at":"2026-08-06T18:51:04.586706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:04.654427Z","title":"Deepseek-vl: Towards real-world vision-language understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.654427Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:88afb6b6a0de3934ccb3fc821887f4579f1b159eb424f7baaa5e0000ca26cdc6","observation_id":"7d3d5810-42b4-4185-abcb-0427d493b7b5","resolution":{"observed_at":"2026-08-06T18:51:04.654427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14562","last_updated":"2024-06-20T17:59:45Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:59:45Z","title":"Whiteboard-of-Thought: Thinking Step-by-Step Across Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14562","snapshot_observed_at":"2026-08-06T18:51:04.723812Z","title":"Whiteboard-of-thought: Thinking step-by-step across modalities, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.723812Z"},"links":{"cited_paper":"/paper/2406.14562","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:02eab6620be182b322e387c7e2a0589c19b559da4a211c5837a818acbce8ce7b","observation_id":"3326c16b-02c8-4888-a0f1-2431d76235b4","resolution":{"observed_at":"2026-08-06T18:51:04.723812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:04.807420Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.807420Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cb5014e031c4e8d6206b04b43030c28c889ccc1e1db3b64f78e03bbe8034c603","observation_id":"de87c41c-c010-4906-bd35-c2f9d1377340","resolution":{"observed_at":"2026-08-06T18:51:04.807420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.853332Z","title":"Introducing gpt-4.1 in the api","venue":null,"work_id":"86e19a18-8d8d-4dda-b490-fb4e07eb66f4","year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.872081Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cb72fe38e44479ab15fb7e4c7dd90e6ec420ff800832bfa436ef03b1bf9c1a3a","observation_id":"ced51df7-21a3-40f8-bc0b-9a2d7e1cd7f0","resolution":{"observed_at":"2026-08-06T18:51:07.933231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.702533Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":"ad526af0-d150-4bc1-8692-315752cca9e8","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.903213Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:3d0ba0beecc11b6b6fb57149f795c7e0a1d3d8ead5ba9e06b38775040ef1a6e0","observation_id":"73f51922-0f6a-4e14-b238-55e7ff329eb9","resolution":{"observed_at":"2026-08-06T18:51:07.766881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.241","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:06.294068Z","title":"Uncovering the full potential of visual grounding methods in VQA","venue":null,"work_id":"1171e198-60b1-445c-b8ee-fb5a151978c9","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:04.962971Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:f9346596a3bab25cf9b5552eebf7d250d8052292db194c4bc19ec4fa9d7e9e42","observation_id":"52598951-ae8e-4590-9c5c-23e5980ed9d9","resolution":{"observed_at":"2026-08-06T18:51:06.383863Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-06T18:51:05.057773Z","title":"Visual chain of thought: Bridging logical gaps with multimodal infillings, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.057773Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:cbaad11cf903c2773992adbf0c8b599db82b9f6d96127aa25f25911f010e95b5","observation_id":"e1e41564-69ac-402c-b641-dd779435f174","resolution":{"observed_at":"2026-08-06T18:51:05.057773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-06T18:51:05.113854Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.113854Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:edf7847825b3802641837196ae9966f8c032f5e217e031b725d07c839345237a","observation_id":"7264deb3-fdc8-413f-8112-00ef15330c3f","resolution":{"observed_at":"2026-08-06T18:51:05.113854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T18:51:05.213221Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.213221Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:782a7791f5f6d217418c75bb74a3877a4854c0c86fab09d81adcc7e9eb4133f2","observation_id":"3e314ea3-e67d-44e2-9326-95c0ef7349ea","resolution":{"observed_at":"2026-08-06T18:51:05.213221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-06T18:51:05.257142Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.257142Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:489b31c6a070272499256191d734d8eafb55db3d443f1ce0e59240f71c735315","observation_id":"391d53de-c277-45ab-848a-cf4e971f8c19","resolution":{"observed_at":"2026-08-06T18:51:05.257142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:05.326894Z","title":"Contrastive region guidance: Improving grounding in vision-language models without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.326894Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:a4bb855f864dc06d6b29bcf6c97c31af9beef8fed412c13a83daf627d657c693","observation_id":"51ec8827-b6fb-4c75-a226-2429fe40ba5e","resolution":{"observed_at":"2026-08-06T18:51:05.326894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T18:51:05.402887Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.402887Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:2541a1f3fbc9430abb4c84e869b5fadddd1fc4a2eba4a006573f048fd6d916c0","observation_id":"2fa00a24-98fb-41ab-a6ca-c0a1990eabe7","resolution":{"observed_at":"2026-08-06T18:51:05.402887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02172","last_updated":"2025-03-18T08:02:22Z","snapshot_observed_at":"2026-07-06T20:00:41.813099Z","submitted_at":"2024-12-03T05:04:49Z","title":"VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2412.02172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02172","snapshot_observed_at":"2026-08-06T18:51:06.705524Z","title":"VISCO: Benchmarking Fine-Grained Critique and Correction Towards Self-Improvement in Visual Reasoning","venue":"cs.CV","work_id":"3094a2a1-fdd2-43fc-8da0-753665a9488e","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.455071Z"},"links":{"cited_paper":"/paper/2412.02172","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:7b6c6d8653b1374352441e42ee3f2a0d0177b47c99fd4de97047f52c89f3cf01","observation_id":"2430184c-629d-4eec-8bc3-f9736569496e","resolution":{"observed_at":"2026-08-06T18:51:06.738821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.535669Z","title":"Llava-onevision-chat: Improving chat with preference learning, September 2024","venue":null,"work_id":"53deac1e-bd26-4c65-875f-793d8aa4a562","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.525846Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:7a11e94ee0f30db8bf67b3e79310d5f6f51a5a076af1ae87082bc83db890aee8","observation_id":"62e285fa-da03-4007-b4f9-e48be3f54dcf","resolution":{"observed_at":"2026-08-06T18:51:07.629867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-06T18:51:05.654601Z","title":"Llava-cot: Let vision language models reason step-by-step, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.654601Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:d2ad9dc90906c0efcbc9e65d76bf02965652989ec7b5a9c962667bd598306977","observation_id":"b0d75234-27f1-4d5f-b1e7-762272879e96","resolution":{"observed_at":"2026-08-06T18:51:05.654601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15462","last_updated":"2024-01-07T00:24:21Z","snapshot_observed_at":"2026-07-06T13:26:33.250328Z","submitted_at":"2022-06-30T17:55:12Z","title":"Improving Visual Grounding by Encouraging Consistent Gradient-based Explanations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15462","snapshot_observed_at":"2026-08-06T18:51:05.755348Z","title":"Improving visual grounding by encouraging consistent gradient-based explanations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.755348Z"},"links":{"cited_paper":"/paper/2206.15462","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:5290110e0bd756b243b21a780cfb39456d1624bf4597b9782202196295ee3651","observation_id":"08cec980-e5df-487c-a7a2-2e261c508c7b","resolution":{"observed_at":"2026-08-06T18:51:05.755348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.408176Z","title":"Mm-vet: evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"4a22a0f4-f0a7-4475-9a68-429f82495a16","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.824802Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:1a66dda675084e0c1e0c2f6df84115fb595d606ad7e4d4d2adddd0831333b630","observation_id":"a99c0d05-b26f-4792-a42a-7dc8685f882a","resolution":{"observed_at":"2026-08-06T18:51:07.478808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.254801Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"c0f0d80f-ce10-4735-9063-2277c768d796","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:05.946191Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:41f6366654879e0c17d2dff741e17dce56210e1d1840d82d77292b433f04d729","observation_id":"3d4c7102-8b8d-4b1d-b41b-10db977a64f9","resolution":{"observed_at":"2026-08-06T18:51:07.321052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-06T18:51:06.064596Z","title":"Improve vision language model chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:06.064596Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:aca6daa404d66a141dca1889dca1bbb36310d58c0f719a96bf79a369114ab78f","observation_id":"ca938052-b05d-4806-b200-a1166d0a1387","resolution":{"observed_at":"2026-08-06T18:51:06.064596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:07.150286Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":"a4c96cf3-0711-494c-89ab-7a99114a9f61","year":2024},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:06.133863Z"},"links":{"citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:69be80cbcd14771775ab48a5a04b30a37e9ed974194a8ac0df337fb2e10e24b0","observation_id":"5cc0ad3c-9096-45f9-bb46-c620dd382045","resolution":{"observed_at":"2026-08-06T18:51:07.198965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-06T18:51:06.202263Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:51:06.202263Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2507.07297"},"observation_digest":"sha256:20ea4b5bc8f0eac46c307b9461bf223473945af22be8e81fd171cf11c0d09043","observation_id":"6a330a3f-c247-42d8-9270-a560a91fd405","resolution":{"observed_at":"2026-08-06T18:51:06.202263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07297","last_updated":"2025-07-09T21:44:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:42:08.310263Z","submitted_at":"2025-07-09T21:44:12Z","title":"MagiC: Evaluating Multimodal Cognition Toward Grounded Visual Reasoning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":4,"verified_fuzzy":12},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.07297."}