{"as_of":"2026-08-08T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79963c9dd90918a36d2c8726acafdf0d3f21fde7cbc83995ec5693a962be7b1c","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:33.769358Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:17:40.198357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.004072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2505.20753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20753","snapshot_observed_at":"2026-07-04T15:09:55.004072Z","title":null,"venue":null,"work_id":"586a68cf-341b-4352-b4cc-929dd74ae2de","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.20753","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:5e59bb8c5d3b3d5297a963a7a665dbda3a22b798b15f202905c70f51dc643b58","observation_id":"5d8824a4-823a-4543-b995-e55d68069cfd","resolution":{"observed_at":"2026-07-04T15:09:55.006201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20753","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2505.20753 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":267,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2505.20753","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:f9b81ffd440d7e8f399343d513d8016a4980ca82a49992816fe00e0079aff8fa","observation_id":"5b38d76a-528f-4b16-b509-d2292a23dc31","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20753/citation-record","integrity":"/paper/2505.20753/integrity","json":"/paper/2505.20753/citation-record.json","paper":"/paper/2505.20753"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.496274Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.496274Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:428a87a443a2017cb0e83e0a7f6ea143b0c603431cc4012fca414a5083e1a343","observation_id":"f0c5ce36-7756-4d7f-99c4-076090780625","resolution":{"observed_at":"2026-08-07T13:53:19.496274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.548421Z","title":"Macmillan, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.548421Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c3ff9ebd1c4b5532a0934eecb874ad0a2c1f8c42db031d0dc1e3e9b254fa06c9","observation_id":"378366f4-92e8-4dfe-8de8-9cc157e94372","resolution":{"observed_at":"2026-08-07T13:53:19.548421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:53:19.693636Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.693636Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:2c225d25b5084ee7168c867425c735da11ef7dd8fa23de1ab96c6298a150ea36","observation_id":"fdf90947-2c0e-48fd-b9a6-444821b05537","resolution":{"observed_at":"2026-08-07T13:53:19.693636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.758407Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.758407Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:8646310852f103f0fb5d5eae046b4fac96976e7b2e61f6dbc4a2f50768aa95d4","observation_id":"31ab5a2e-056d-4f9d-ab3c-b2824f777881","resolution":{"observed_at":"2026-08-07T13:53:19.758407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.844787Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.844787Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d23d031952a498ff161ba67a44cb641b084b30845caf807410f012215d5c95d6","observation_id":"c7367a42-a8d2-4aba-b715-d790901e698b","resolution":{"observed_at":"2026-08-07T13:53:19.844787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.894399Z","title":"Due: End-to-end document understanding benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.894399Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:66f4a55e59ba9f80d35daaae237b4bc65c1b561935b97c4408e999f10bea593c","observation_id":"27d52929-5863-4763-8f58-0d862d6a24ce","resolution":{"observed_at":"2026-08-07T13:53:19.894399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:19.976064Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:19.976064Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:ef8bc179a21942a8fca9cc02975fe5960182a09e555d2f1fa5279961efc8438e","observation_id":"a14884bd-d4e2-49a5-babe-6df5e63e82e7","resolution":{"observed_at":"2026-08-07T13:53:19.976064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T13:53:20.043444Z","title":"Shikra:unleashing multimodal llm’s referential dialogue magic.arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.043444Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:213990460c02989f940d301581c005f48e819fd040f9facfd593a958e760aadd","observation_id":"6f9a441d-3597-404b-865a-d2b17460588e","resolution":{"observed_at":"2026-08-07T13:53:20.043444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T13:53:20.114407Z","title":"Sharegpt4v: Improving large multi-modal models with better captions.arXiv preprint arXiv:2311.12793, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.114407Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:2c5b0d6084639ae75ecc15fbb8026d2223113654881333e6bd577a796be8b40a","observation_id":"bda90484-709f-472d-b9fa-185e123158c1","resolution":{"observed_at":"2026-08-07T13:53:20.114407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T13:53:20.174756Z","title":"Microsoft coco captions: Data collection and evaluation server.arXiv preprint arXiv:1504.00325, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.174756Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3927b5185ecac34f398b1b8a7c8b0011411dda2d0a56a58ecc50f8a15914301b","observation_id":"65924100-3232-4961-af83-da8e2ddea302","resolution":{"observed_at":"2026-08-07T13:53:20.174756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.255910Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.255910Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:7a156e0b686e04e1378ece54a740d0602241cbd6743934f38691da88123787ee","observation_id":"4db8759c-387c-4251-be4e-56fc6039b0cb","resolution":{"observed_at":"2026-08-07T13:53:20.255910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.325250Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.325250Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:41397f53e234dec0f24d6d55725763b9979e172b537266e05509ed12f5ff931e","observation_id":"52b4758f-07a6-4826-a16b-2257cfbfeaff","resolution":{"observed_at":"2026-08-07T13:53:20.325250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T13:53:20.400173Z","title":"Enhancing chat language models by scaling high-quality instructional conversations.arXiv preprint arXiv:2305.14233, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.400173Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:7c7cd3206978110300e26bdad82112de4321a5487f7aec8dbf06a9ad8c25e588","observation_id":"7a573766-a33e-4c3b-a218-901eee60fb5d","resolution":{"observed_at":"2026-08-07T13:53:20.400173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-07T13:53:20.469521Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model.arXiv preprint arXiv:2304.15010, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.469521Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c4cf20a201cd2c971a99969cb9b803a7131dcec06564cc1af161a220d1eb45ba","observation_id":"417f4e4c-8ac4-44a4-ab4c-d8069a1cf6ed","resolution":{"observed_at":"2026-08-07T13:53:20.469521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.529695Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2(11):665–673, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.529695Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d5772ad9e0a6cf2143d9370eb953f6852c8528fc35613464c3298eb5d41f2476","observation_id":"955f3862-cd6d-425b-9487-cacf88b4967d","resolution":{"observed_at":"2026-08-07T13:53:20.529695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.586311Z","title":"Flacuna: Unleashing the problem solving power of vicuna using flan fine-tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.586311Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b1451cd73d722f50a80526ff5bf9f9ec4702fd882c01be4290922e69c87991c5","observation_id":"df4562eb-e1eb-4298-ab9d-ce26fb8d5219","resolution":{"observed_at":"2026-08-07T13:53:20.586311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-07T13:53:20.636978Z","title":"Accurate, large minibatch sgd: Training imagenet in 1 hour.arXiv preprint arXiv:1706.02677, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.636978Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c42a5fffcf9078524e317935ac576adfa6dcbee2b96d73a8e6b867bd558c8061","observation_id":"580d697d-f7a0-417f-9820-53c92980fb3e","resolution":{"observed_at":"2026-08-07T13:53:20.636978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.701415Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.701415Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b3951fe744860b0142ba8c5b1f249028cbdc8752095874c86b0cd48b90e6e77e","observation_id":"9d33b65c-aaa8-43f7-ac12-8c5fefa27395","resolution":{"observed_at":"2026-08-07T13:53:20.701415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.754461Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.754461Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4dc64c4efec549cea7daf199bb76306e001c2651a0bd752bed786b407845f8b3","observation_id":"92a0534e-ba85-4e6b-94bb-03596443725c","resolution":{"observed_at":"2026-08-07T13:53:20.754461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16182","last_updated":"2023-12-24T15:13:10Z","snapshot_observed_at":"2026-07-06T16:12:22.303188Z","submitted_at":"2023-08-30T17:58:50Z","title":"GREC: Generalized Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16182","snapshot_observed_at":"2026-08-07T13:53:20.818723Z","title":"GREC: Generalized referring expression comprehension.arXiv preprint arXiv:2308.16182, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.818723Z"},"links":{"cited_paper":"/paper/2308.16182","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:de189a0749dad31e46af0547498773f1dbd3047b3c4c423fc7e4889b08cb66eb","observation_id":"64bfc413-9da2-4864-9bc9-332813dd0d7f","resolution":{"observed_at":"2026-08-07T13:53:20.818723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:20.893626Z","title":"spaCy: Industrial-strength Natural Language Processing in Python","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:20.893626Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:ab13c110b9f3160f6a97a2e5ccd6b78447a311f088d09f67054a43cb4fea6cfe","observation_id":"608935c6-b7d3-4b0e-9d73-7fb1f6999ddf","resolution":{"observed_at":"2026-08-07T13:53:20.893626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.001252Z","title":"Visual program distillation: Distilling tools and programmatic reasoning into vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.001252Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:29e068fd86bfd94f66adc3f389bb534837a3b0f60bddbf3776f281fc2bb03e0b","observation_id":"adcf352b-ff59-4a77-a590-39a1900d31a6","resolution":{"observed_at":"2026-08-07T13:53:21.001252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.112689Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.112689Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e9b2ecf4b3124c242fcbde3c15bb20117f9ac3837349da103e2b7fc2d2628be6","observation_id":"5ca6894f-45a7-4e25-b8b5-4e6c8779bbe1","resolution":{"observed_at":"2026-08-07T13:53:21.112689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.187118Z","title":"Vcoder: Versatile vision encoders for multimodal large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.187118Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1d98bd0412c3cf3d692f49dd53f7f06b672e34348b021ca2720f89e7311ca253","observation_id":"e40686fc-98d3-4eb9-b2aa-989e442e7940","resolution":{"observed_at":"2026-08-07T13:53:21.187118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.232788Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.232788Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:171b7119cf50be4094dc18d351ecbc1e542924b0001203c78dc20a11eefdb0fa","observation_id":"5a3bc90a-502a-4109-a130-f4f4218e71e7","resolution":{"observed_at":"2026-08-07T13:53:21.232788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.291645Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.291645Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d8808bb237487009bb203b934e79166888db46770720899cd4ef0dbb96586d07","observation_id":"fc28b69b-2bdd-4f01-92cb-1e75ae9a1463","resolution":{"observed_at":"2026-08-07T13:53:21.291645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.375712Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.375712Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:03832efd4227c29b22eb85dd93b5e5711aed7f58906a21e316074423931a8d7b","observation_id":"7e8d1255-7b28-40ec-9aeb-c7560ea16bc5","resolution":{"observed_at":"2026-08-07T13:53:21.375712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.469500Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.469500Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3d6f477eb8d5f8808edc9b6ae9d9d42c954823ba2280cfe317b4a6d6c5c2e486","observation_id":"6c46aa50-7e9e-497d-8cdd-58f9336c2bdf","resolution":{"observed_at":"2026-08-07T13:53:21.469500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.575290Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.575290Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d500678c1e2ce7aaba12ef966eab329be571f1b565caa682980c9d6976c62624","observation_id":"b88d2eda-89bf-441f-a912-3f178702cb78","resolution":{"observed_at":"2026-08-07T13:53:21.575290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.660540Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.660540Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:7364279888f176a4236e633560ac66dec0cdaed659dfcadfa8138b035cb4360f","observation_id":"fde02abc-151c-4d07-8be9-3d5787e222d9","resolution":{"observed_at":"2026-08-07T13:53:21.660540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:21.781128Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.781128Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:18541c823796740055a2e2035cbda651fd5cfbe4cf28ccb7dfed34b8d3f34c95","observation_id":"8733d8a4-d5f7-4e6d-8edb-c83824827eb1","resolution":{"observed_at":"2026-08-07T13:53:21.781128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12058","last_updated":"2024-02-19T11:23:53Z","snapshot_observed_at":"2026-07-06T17:32:10.828230Z","submitted_at":"2024-02-19T11:23:53Z","title":"Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12058","snapshot_observed_at":"2026-08-07T13:53:21.886226Z","title":"Scaffolding coordinates to promote vision-language coordination in large multi-modal models.arXiv preprint arXiv:2402.12058, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.886226Z"},"links":{"cited_paper":"/paper/2402.12058","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c60ac348bd8151c136a2e3c732d7e894471051682048326c65bfd7693b6172a4","observation_id":"d264e598-dba1-4a0c-8182-39169e1c6db4","resolution":{"observed_at":"2026-08-07T13:53:21.886226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T13:53:21.997699Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:21.997699Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:dda777ae0279c788e68c408332fa55b574807f6c30335f5462be70c401b0667b","observation_id":"435ca4ef-4f62-4aeb-99fb-5769e0e1ef27","resolution":{"observed_at":"2026-08-07T13:53:21.997699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.107442Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.107442Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:af96ceaf795801bb0ea87fd1268f5e86b5f5bce47509e19c147cd83663c220ab","observation_id":"aaa4e6ba-fc9f-48f5-9b0b-facb283dbcf0","resolution":{"observed_at":"2026-08-07T13:53:22.107442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T13:53:22.204884Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.204884Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:adef5cbee123780e25b5a48862393d916752611fcaf86870dc62c8504ec2151a","observation_id":"a55e395e-5397-4627-8430-f5d8ea9f42d7","resolution":{"observed_at":"2026-08-07T13:53:22.204884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16919","last_updated":"2025-03-08T17:16:09Z","snapshot_observed_at":"2026-08-07T21:32:18.022012Z","submitted_at":"2024-05-27T08:12:00Z","title":"VoCoT: Unleashing Visually Grounded Multi-Step Reasoning in Large Multi-Modal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16919","snapshot_observed_at":"2026-08-07T13:53:22.323235Z","title":"V ocot: Unleashing visually grounded multi-step reasoning in large multi-modal models.arXiv preprint arXiv:2405.16919, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.323235Z"},"links":{"cited_paper":"/paper/2405.16919","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b02f508d38f8d21a273a9f1f8b650388785f8b335dda9db92537a34ceff9eae9","observation_id":"4f1502bd-9178-44d1-928a-fb4d474499b0","resolution":{"observed_at":"2026-08-07T13:53:22.323235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.987854Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"c4ca792f-c4b7-4b5d-bd57-30125278f79d","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.424312Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:48273b7b9abc9d3ffd22bcd0fc7e186df1adafd31735fa561063d571fe078502","observation_id":"8473446e-f3dc-4a6b-9da8-71901626e012","resolution":{"observed_at":"2026-08-07T13:53:42.125743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.731926Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces","venue":null,"work_id":"5acae410-9f22-4325-8e4f-7f0024a717a4","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.545417Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1fff68e3eaaa9ac72de721631d91ab0dce1265efd1a4f2478bdb1e06d4a4da50","observation_id":"c11fef41-281f-476d-8165-e17a14aa3f49","resolution":{"observed_at":"2026-08-07T13:53:41.848288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.675306Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.675306Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:ea92664a7b23baf0a0f7e67b022995cd48ba723eb91f5f5dd309dbb7b7cf25d5","observation_id":"a2e8eb45-df10-44a8-8d88-9f589bc5a246","resolution":{"observed_at":"2026-08-07T13:53:22.675306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.458391Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":"41defb1e-733b-4ca1-abf2-bd041d749259","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.820414Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e7b8e5dc083a32ed2b40fabf998c4ff9ecf860b236660ab1f5f5781891af142b","observation_id":"32adae86-aba9-41c4-98a9-81111160a3a0","resolution":{"observed_at":"2026-08-07T13:53:41.608715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:22.964209Z","title":"Visual spatial reasoning.Transactions of the Association for Computational Linguistics, 11:635–651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:22.964209Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d00ec1f9a115cf8d97134c5b43dbdb1309f1b2ae0050cd64c702983bb393f376","observation_id":"82437ce4-a71e-489f-8774-159e3913f8a1","resolution":{"observed_at":"2026-08-07T13:53:22.964209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.130259Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.130259Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:0a13dadf028d10c59920abb7b78d9feb0f599ccd79a1c80de21389dc01b80f4c","observation_id":"2e9833d0-f52b-4065-8c01-1211b45fa3a0","resolution":{"observed_at":"2026-08-07T13:53:23.130259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.373071Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.373071Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b57c72667ea50221b1da795ce37378a79120b1c0ef0827dcfcfa82aa65b33256","observation_id":"63cea63f-afb5-4efd-bb9f-2b4d68737187","resolution":{"observed_at":"2026-08-07T13:53:23.373071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:23.500464Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.500464Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:43eaa73a1bf62bab08ae2784b7efb6d0d87e11cc755594d8ad9cc7e197dd2281","observation_id":"9b47bb85-f4b1-4233-ab38-4ddb71c2176b","resolution":{"observed_at":"2026-08-07T13:53:23.500464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T13:53:23.608745Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.608745Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e6ef54b831c133da0c453332fdb5f9d70170e17cb70d0db8076713c06ea21ad3","observation_id":"05240b21-1ac2-4421-a709-8474e902b52d","resolution":{"observed_at":"2026-08-07T13:53:23.608745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T13:53:23.686995Z","title":"Mmbench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.686995Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d0406829949acf6fa265c0d6711f2c3888fbe6e01e1d6c66462d8d266e8ad0b9","observation_id":"ea90225d-36a0-4628-b4d1-b53b74070a7d","resolution":{"observed_at":"2026-08-07T13:53:23.686995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T13:53:23.781434Z","title":"Sgdr: Stochastic gradient descent with warm restarts.arXiv preprint arXiv:1608.03983, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.781434Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:0d3e540ec3b7813cd52ab1c6d33446b1b746fe8ef1335bd3f7bba3aa1a48e443","observation_id":"e2adaeff-cf3f-4379-9212-7a1a5c377f61","resolution":{"observed_at":"2026-08-07T13:53:23.781434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:53:23.884963Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.884963Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:13535e7222394b617a7d413410187cf9b39010aff96d60e0e4a7aef7d83a0a81","observation_id":"1c56508f-e269-44b5-96d9-07a2bec943ec","resolution":{"observed_at":"2026-08-07T13:53:23.884963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T13:53:23.995606Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:23.995606Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:11f9168c1533b50cab9da972c0857eeafa6d22a9092ea8f98c395b997c9d3371","observation_id":"2d5289b8-a2f0-4180-8ac6-af8bf1b6a8b7","resolution":{"observed_at":"2026-08-07T13:53:23.995606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:41.189081Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"31e1bced-69b6-491f-9d50-beec010631c6","year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.139378Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:9170d96a827bbd6e056e28a7fef4d18d7daa085a7bf5cdff5073eab9af75ed0e","observation_id":"a68b5598-0cb6-4120-bbc7-4155901aeac1","resolution":{"observed_at":"2026-08-07T13:53:41.328177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08568","last_updated":"2025-05-27T07:40:36Z","snapshot_observed_at":"2026-08-04T15:08:40.203853Z","submitted_at":"2023-06-14T15:18:48Z","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08568","snapshot_observed_at":"2026-08-07T13:53:24.296339Z","title":"Wizardcoder: Empowering code large language models with evol-instruct","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.296339Z"},"links":{"cited_paper":"/paper/2306.08568","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:27460fe5f38366dba3a4c3526e54b70b1bf66cc8f8af85d249c5bc7799c3bcbd","observation_id":"93c279a6-7aaf-40bb-99c5-b7769f486fd0","resolution":{"observed_at":"2026-08-07T13:53:24.296339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.447099Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.447099Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:9b535d073b253d86e08317547063e0cdf98982e41c68404ed8907204bfe4a7c9","observation_id":"cb7fc0a8-3ee4-45b7-ba58-37f468155d54","resolution":{"observed_at":"2026-08-07T13:53:24.447099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.910269Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"2507ee16-1c17-40f0-aa7e-e70315971a01","year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.628303Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e102695f1bf7a51fc648f4982e166a49a9b572e0f0ce3211967c0ed8dc69c37a","observation_id":"f18f105c-723e-4f69-bc5d-835bcd223f7d","resolution":{"observed_at":"2026-08-07T13:53:41.064270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-07-06T09:34:24.643148Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-07T13:53:24.790502Z","title":"Docvqa: a dataset for vqa on document images","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.790502Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:11d91f15cac71b867247b7bc4c63718301aae4d97462784fe0af87c0d0b2131e","observation_id":"99fdb9fa-25a6-4dd7-960c-7f37b6558ffc","resolution":{"observed_at":"2026-08-07T13:53:24.790502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:24.879645Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.879645Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:604906979f19a44b03b19666d85d8351194662518c18cabc5f1439f45596372d","observation_id":"c7fb0e1e-04da-47cc-bf80-2bb65dc0b676","resolution":{"observed_at":"2026-08-07T13:53:24.879645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.694793Z","title":"Schema theory revisited.Review of educational research, 75(4):531–566, 2005","venue":null,"work_id":"a9aeb6d2-165d-4f77-a7b2-fecc9c5629a8","year":2005},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:24.937787Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:fefa5ced2d51a3dbe0291b3afee2dc3c279add49ad9384be12125477350ae56c","observation_id":"d5a71263-a21a-4380-abef-d0154ff3ec05","resolution":{"observed_at":"2026-08-07T13:53:40.764860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.481037Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"a9be489f-065f-45e9-997e-b1e8a39faa07","year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.026922Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:60fcd30d4e8570e117017d5ca6e8b30769917b814575dc9d0b63ab48742ce40f","observation_id":"f8731295-39b9-4461-a89c-a346ff2d16ed","resolution":{"observed_at":"2026-08-07T13:53:40.564102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:40.240621Z","title":"Compositional chain of thought prompting for large multimodal models","venue":null,"work_id":"16d6dcd7-1265-4863-af53-eabc1e8f2d93","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.120302Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:b7bae0104faa8f98f31bfb324b577c4f182f83667b757d0882e7246ee0ff559b","observation_id":"50c017f3-90c0-4df5-a43d-a94f52ab6a77","resolution":{"observed_at":"2026-08-07T13:53:40.342412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.230063Z","title":"Modeling context between objects for referring expression understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.230063Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:f28aba0e1e30aff510882c73db71bcf96c745ffaa5042b89a151d8f607aebe7b","observation_id":"c4c16501-60db-4847-a6c4-4a5b7eb6b375","resolution":{"observed_at":"2026-08-07T13:53:25.230063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.330170Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.330170Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d7fdc0f5d343670684f7897f49ed73a2d206a913b85f637792731870cd7662a8","observation_id":"04158600-31a1-4870-a91c-ace12a753643","resolution":{"observed_at":"2026-08-07T13:53:25.330170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.980653Z","title":"Chatgpt: A large language model for natural language processing, 2024","venue":null,"work_id":"87bcb782-7d4e-4e1c-8b73-3ad9bef1115a","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.475870Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e95709595d640f15fad0572934f6b48341b884d5d57e0a5bd7723e9ba8b9a742","observation_id":"644297db-8b94-4964-ad8d-d9d0c68fa519","resolution":{"observed_at":"2026-08-07T13:53:40.097424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.665361Z","title":"Learning to predict visual attributes in the wild","venue":null,"work_id":"70ee987a-9fe1-4998-b420-a41b7f4d4dc0","year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.551507Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:51707dfa8e175a1bba091bfdea1d223a30ed988051b57fc80f28a900ada4eede","observation_id":"8742e0ac-8199-418e-b456-4aa0f5a1a862","resolution":{"observed_at":"2026-08-07T13:53:39.829599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.431287Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"c41c2ef8-0fc1-4216-952e-8faf84c3a3d4","year":2017},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.619246Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:32b1a2396429f08873895a8dffd966dd95b6c8370ad43529d21dec7e3618dff8","observation_id":"e55e88bc-d4d8-4cd2-9c50-ea5b04d010a0","resolution":{"observed_at":"2026-08-07T13:53:39.502500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:39.200960Z","title":"Jack of all tasks master of many: Designing general-purpose coarse-to-fine vision-language model","venue":null,"work_id":"7ab3ae94-f4fd-407d-b375-df2ccb885cd1","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.770648Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4d6c24073ba63a78efa3915860b9e14b7dcebe2520757ab039a6aeeac1f75ada","observation_id":"43f3024b-f2bc-4c52-91c7-2f7eddfb5c10","resolution":{"observed_at":"2026-08-07T13:53:39.286746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-07T13:53:25.907620Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations.arXiv preprint arXiv:2402.04236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.907620Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:ec8847140a07a2fc1032775cbb955be8b3053ba30aff32e61c89b7d58092c19f","observation_id":"efde47e4-f32c-43f0-8ffa-cd59057f1d59","resolution":{"observed_at":"2026-08-07T13:53:25.907620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:25.963697Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:25.963697Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:eaa7605ab560209019b434e35be9bf90dcd2541a4626436ee0b83aab8e65ee2b","observation_id":"444391bf-6e3d-43a6-988c-750be1226fc7","resolution":{"observed_at":"2026-08-07T13:53:25.963697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.136393Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.136393Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d9b3a120f4632d650caf57fcb382ccf21eed6f476ec422cf6a9f79166b39829b","observation_id":"fc710403-a39d-40f4-a2ec-e273c051da41","resolution":{"observed_at":"2026-08-07T13:53:26.136393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.914454Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":"ce126065-6f11-4e29-a81e-eb2672466c3b","year":2015},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.325068Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:82d543b09e88a150843f6cd0899905795acacf287c375a152f30f8decdb3ece5","observation_id":"2d14563a-fa7f-4563-b0d4-e07d0bba71c7","resolution":{"observed_at":"2026-08-07T13:53:39.065652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.569338Z","title":"A- okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"e5faa042-d140-441e-aff3-e5da46a99d39","year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.448121Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:f04a24dcfa8513116ea5fca66376488e579f1cc343f8ecdc226a4834057676bd","observation_id":"40e0e4a3-f065-4fdc-94c8-bfc9dde9bf10","resolution":{"observed_at":"2026-08-07T13:53:38.744111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T13:53:26.608996Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.608996Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:6d41b4b1c8d4f27d4dc5f9a07a0b9228979340f60707926990c195b7c7a56a33","observation_id":"f446b261-ed47-44a9-b1e3-e3c89900bad2","resolution":{"observed_at":"2026-08-07T13:53:26.608996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.721908Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.721908Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:3b6cd657e3f18939d4e2cfc678ba85e225e10d82c232c6b4ac8304d318dbe687","observation_id":"a79b54ec-36a7-41a4-9f59-194a176e5c8c","resolution":{"observed_at":"2026-08-07T13:53:26.721908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-08T00:11:31.801569Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-07T13:53:26.829722Z","title":"Woodpecker: Hallucination correction for multimodal large language models.arXiv preprint arXiv:2310.16045, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.829722Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:560be81494aa57732bab8282f97dcee11aa2624d3bbaa9eff0d410fcfc006906","observation_id":"d96e4623-5ba0-4a39-a2e4-78bb8261499a","resolution":{"observed_at":"2026-08-07T13:53:26.829722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:26.964879Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:26.964879Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:e0ede9742f66e17c1f896309aacc2ba5485e75b9fa0d078c7f8750a6c2247b96","observation_id":"33b36a20-3f15-494b-9b7e-85c21bb343e3","resolution":{"observed_at":"2026-08-07T13:53:26.964879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.138590Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.138590Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:46bc99c4a7585618eac198fc4be0b1281334d89bb6da740808c5ab66c06c5a10","observation_id":"85c83ac2-07e3-4182-ac75-6bc7c05496cb","resolution":{"observed_at":"2026-08-07T13:53:27.138590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:27.298358Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.298358Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:cf179c2e7c181f17502f3c2ca3453e4a9ce3b9e84489b3b2e5f366b1a7a99bc6","observation_id":"63324793-9ecd-451d-83e5-20c423547bf7","resolution":{"observed_at":"2026-08-07T13:53:27.298358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:53:27.425640Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.425640Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:f1c366a0860b0f9e0854812fe4d57b4319d640bf145aad17865a011dd26476c8","observation_id":"b6a94df1-76aa-44e5-b482-72557d258da4","resolution":{"observed_at":"2026-08-07T13:53:27.425640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T13:53:27.674640Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.674640Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:7b16fd48a898c880004097ca3a961aeb23092fbba6ac5374163e7e7a926130ea","observation_id":"f4576e48-1534-43e1-841f-2936f52b26de","resolution":{"observed_at":"2026-08-07T13:53:27.674640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:38.272595Z","title":"Qwen2.5: A party of foundation models, 2024","venue":null,"work_id":"0dc82627-bce1-4a36-954f-d3fd519d3baf","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:27.845136Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d54e62871ca876d89dce83d5c5844141a771d364d1519ad2aa4c0658333654ba","observation_id":"a8556a4e-68e7-4b55-b6a2-e46ddf9619c1","resolution":{"observed_at":"2026-08-07T13:53:38.385503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-06T03:52:00.226360Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-07T13:53:28.020503Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning.arXiv preprint arXiv:2311.07574, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.020503Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:8771b138659fb9b7ed942cbe1abc65dbf13b751d53a737b280ed0019ffcddd20","observation_id":"00b24c17-26cc-4e54-9912-f809d9449f77","resolution":{"observed_at":"2026-08-07T13:53:28.020503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.989817Z","title":"V3det: Vast vocabulary visual detection dataset","venue":null,"work_id":"8f741df1-dc5e-4e41-be40-3e2d70b9de89","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.235980Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:2f937a3ac70259da357509a2357d01ef551bf8f9b056a6d1f4d10a53e645433b","observation_id":"a7227ddf-c6ae-4f25-a30b-dc91397c878b","resolution":{"observed_at":"2026-08-07T13:53:38.108520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:53:28.436180Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.436180Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:1a5a18c8e898c79817f6f3ba217baaf7e7748c2a009c49ac5fb27256a2e8ee73","observation_id":"7ea5dd24-af13-40fd-b158-c0121e0842bd","resolution":{"observed_at":"2026-08-07T13:53:28.436180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.654535Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.654535Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4e9e359730bbf613b7953f45e56993d4231fd76e4580f37a86330812a318e2ea","observation_id":"6664e084-8326-4525-88ac-8aa5900c3b19","resolution":{"observed_at":"2026-08-07T13:53:28.654535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:28.800849Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.800849Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:34cced1c85b7c308d41a2cb8fc2159649b94fee0363b227ddb96c04a58ecf98e","observation_id":"99fb6267-65f7-4ac8-bcbe-8a35e9da365b","resolution":{"observed_at":"2026-08-07T13:53:28.800849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.718733Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":"b43f848c-9e7f-4f76-9485-48784f869545","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:28.943646Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:c73921ff47b4920501aa95dba945de93dc40caa75540aadc471edcc9789661de","observation_id":"64d076da-b523-4ae9-95ed-dfada6d68c35","resolution":{"observed_at":"2026-08-07T13:53:37.854933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T13:53:29.090452Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:29.090452Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:239541458c509b01e06e0f23001960bccd37d37c28f719f81229647380e87a7e","observation_id":"ceb3ff64-846a-4a98-bd96-1e607ffe50f1","resolution":{"observed_at":"2026-08-07T13:53:29.090452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:29.715909Z","title":"Tree of thoughts: Deliberate problem solving with large language models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:29.715909Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:cf01fcc5f3b2970f39532ed0072df84d8a990f8adeeba566c052eb20de73c33f","observation_id":"3bce61a9-aea9-4e95-9caf-c3fdd31c82ca","resolution":{"observed_at":"2026-08-07T13:53:29.715909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.436810Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":"20611d39-57c7-49b8-a2b3-47058ccaff05","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:31.986056Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:815a4c674130dbb13a66e7ced92c55869f18c733a1daa635e468b69c6e6d40c6","observation_id":"47d9c578-d58f-4748-af17-7ea6ee6efd43","resolution":{"observed_at":"2026-08-07T13:53:37.509787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-07T13:53:32.111913Z","title":"Ferret-ui: Grounded mobile ui understanding with multimodal llms.arXiv preprint arXiv:2404.05719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.111913Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:491eddc090d503be25c6867dd609a14272691a5d393115c5678a5bc8086a8236","observation_id":"81556e13-6f8a-4852-8d99-066d8bf27378","resolution":{"observed_at":"2026-08-07T13:53:32.111913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.216567Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.216567Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:4f15a3b67255a67805b89ac0b275aa88046aadc9b2cc20be4654854b9427057b","observation_id":"c74538d7-e8a4-4a2b-b73e-4170ddac37f4","resolution":{"observed_at":"2026-08-07T13:53:32.216567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T13:53:32.326619Z","title":"Metamath: Bootstrap your own mathematical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.326619Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:16b710dc8475fb8355945bcc17bbe5ad829978bb4a3702501d87289003d9e1b0","observation_id":"88ee7ea1-47a9-43a7-870b-bd16d1a7f6d9","resolution":{"observed_at":"2026-08-07T13:53:32.326619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:32.463254Z","title":"Osprey: Pixel understanding with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.463254Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:9b8281978594de76f4edc9ef99b019da91d3b412f879e0a70bf076e3086f1252","observation_id":"aad44938-ec86-46b1-9972-491612c46e4b","resolution":{"observed_at":"2026-08-07T13:53:32.463254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-07T13:53:32.600372Z","title":"Mam- moth: Building math generalist models through hybrid instruction tuning.arXiv preprint arXiv:2309.05653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.600372Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:552f965b97164c1974f5fbdd2bb9ea83f2e332085c7e3a87a54305effc58a549","observation_id":"1db65240-c2c3-444a-a8f7-6bbfac99a870","resolution":{"observed_at":"2026-08-07T13:53:32.600372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:37.180491Z","title":"Griffon: Spelling out all object locations at any granularity with large language models","venue":null,"work_id":"bb44ed7f-d3fb-4ae2-a0aa-e3a427ad9155","year":2024},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.713818Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:a17c9c4ea5907b02283bad400ea58353558253df903a61b86b5159c05a12e5d9","observation_id":"60d458aa-0cd3-4836-96de-c49499754562","resolution":{"observed_at":"2026-08-07T13:53:37.294153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T13:53:32.834055Z","title":"Automatic chain of thought prompting in large language models.arXiv preprint arXiv:2210.03493, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.834055Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:ad54072c9789f5a9442f1c60def5627a6ecabd9ef18d237205dbfb027fb5e9f8","observation_id":"250fc1e9-7210-495a-9cb2-b8a494f739d5","resolution":{"observed_at":"2026-08-07T13:53:32.834055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.860192Z","title":"yes” or “no","venue":null,"work_id":"a328b780-1f7c-49e9-b334-dccebfa4de83","year":2023},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:32.967018Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:af1a8bc20eba19786707c50f2add342f361f6e0118bceffc013a56fe69e1dc67","observation_id":"43994f56-3434-4817-80de-4d69d73512ac","resolution":{"observed_at":"2026-08-07T13:53:37.033887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.516463Z","title":null,"venue":null,"work_id":"69a6d824-43c6-44c6-9830-db24980ff2f8","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.117627Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:db834cc84aa62e523425f084b0bddb9fe980669f8d5456ecdbb3f4bbe4ea9043","observation_id":"420e162c-67b3-4f6f-9d11-b5510053330e","resolution":{"observed_at":"2026-08-07T13:53:36.655327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.101881Z","title":null,"venue":null,"work_id":"6b96233a-cfe1-443b-8325-73e171abf455","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.381162Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:51a054ba69333661f2cc08c357442fa143ed4322fb3608fe49eac31e53be0bab","observation_id":"f776522e-df36-4c05-9dbb-8041809823c6","resolution":{"observed_at":"2026-08-07T13:53:36.188645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.642377Z","title":null,"venue":null,"work_id":"b7c612cc-6de7-49a2-8ff0-865677e328a3","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.586439Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:d7e2c651be028631328b3080cec0495b28f60b2c1c0be8ec872ba31628a10b19","observation_id":"8fa7385a-6ddc-471a-ab2d-f46df1dbc8bb","resolution":{"observed_at":"2026-08-07T13:53:35.804909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:35.213184Z","title":null,"venue":null,"work_id":"de18ce1b-39df-4c17-8a8f-be787450a16a","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.665448Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:8692e54a62fcf262aa55718b14254c90cf6cf0993859831d4f5396d0fc891d49","observation_id":"af56e164-1237-4768-94ab-da81c32ec363","resolution":{"observed_at":"2026-08-07T13:53:35.445068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:53:36.294410Z","title":null,"venue":null,"work_id":"2542bfe8-6053-415e-b840-4e0dc4bacee4","year":null},"citing_paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:33.769358Z"},"links":{"citing_paper":"/paper/2505.20753"},"observation_digest":"sha256:55b15d9e175703100d8b1f43b16401cf59414ecdfc4875e93355f23c8318c0fd","observation_id":"1d7846c4-193e-4223-9e09-2d8cbd0b1552","resolution":{"observed_at":"2026-08-07T13:53:36.375321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20753","last_updated":"2025-05-27T05:50:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:45:07.459562Z","submitted_at":"2025-05-27T05:50:25Z","title":"Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 2 inbound Pith citation observations for arXiv:2505.20753."}