{"as_of":"2026-08-12T03:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ec4a8a718f9910fc0ea693c2843888ac659b5d1775e76c46c03be15d71e435a","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:38:14.155401Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:18:59.500206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:15:46.368932Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-08-10T21:18:59.500206Z","title":"Comt: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-10T21:11:43.711209Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:59.500206Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2501.05444"},"observation_digest":"sha256:daf0710aab799586a0b8b48d5dc3f94bea42dfb6ed3c4b13d0f740ee24ab6b2f","observation_id":"ee5f873c-6dee-4731-8241-a898d9499189","resolution":{"observed_at":"2026-08-10T21:18:59.500206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.12932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoMT: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":"c1b3ad58-0579-4ca6-9622-993e0f2ccffb","year":2024},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:d1af31ca38ed23f65f7345eb09b508b27b60393726e17d7cdb24cf24713ff5c4","observation_id":"257a7895-bdaa-4beb-a86b-a8c099750e61","resolution":{"observed_at":"2026-05-16T15:15:46.371485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.12932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoMT: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":"c1b3ad58-0579-4ca6-9622-993e0f2ccffb","year":2024},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:04856ce43ad732817577b0f282f45d2154a092bfd6f15526a306107aed8d3907","observation_id":"c92d0997-0214-4ac9-a7fc-d42ffd2e7a7c","resolution":{"observed_at":"2026-05-12T08:40:42.000176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2412.12932","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12932","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoMT: A novel benchmark for chain of multi-modal thought on large vision- language models","venue":null,"work_id":"c1b3ad58-0579-4ca6-9622-993e0f2ccffb","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.12932","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:1490b0b3588b5546b11417287357d754dd7721645a6e416ddea2ac4cdb5473a4","observation_id":"da70c93b-f4ae-4780-8e09-a7717b5f7a75","resolution":{"observed_at":"2026-05-15T17:18:53.293580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12932/citation-record","integrity":"/paper/2412.12932/integrity","json":"/paper/2412.12932/citation-record.json","paper":"/paper/2412.12932"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:13.965366Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.965366Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:d02d2a6555cd0a676ed566540742adbe4ad42271fa93d16143e8c4733cc81217","observation_id":"8034891e-c37d-4063-98cf-2afe3b79d316","resolution":{"observed_at":"2026-08-11T13:38:13.965366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:13.969608Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.969608Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:44f93d182cd34f9e67a6299689120f7aa4b8d8791b687ab866140f7c24016335","observation_id":"fbd2b36c-273f-44ff-aa61-02a06070f876","resolution":{"observed_at":"2026-08-11T13:38:13.969608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T13:38:13.973903Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.973903Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4b8761ab4757388a622560f7a21fae166762e2ad3ce57b63fa391f74710abccf","observation_id":"57a2ac40-063c-4295-8be9-01a130c220f7","resolution":{"observed_at":"2026-08-11T13:38:13.973903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.665749Z","title":null,"venue":null,"work_id":"7665fd35-f85f-4004-ba66-bff4cc178bfc","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.978345Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:05b70cce82f6c755b63b691b01c8d0e64c737a1e345e1f08cc984ff0b01a3952","observation_id":"dcd8b321-e3f2-449b-8783-839897f77078","resolution":{"observed_at":"2026-08-11T13:38:14.669899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.655078Z","title":null,"venue":null,"work_id":"a507ca2b-065f-447a-9301-f05123fd0ed2","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.981961Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:5ca7d9cd24f5aaba105c9a749dd62251a34f71779b3af000b7ebda6016835626","observation_id":"8abbe37d-f615-4282-abd2-c305ace76b5f","resolution":{"observed_at":"2026-08-11T13:38:14.658652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-11T03:35:32.869778Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-11T13:38:13.986574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.986574Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:7ef5586db91bed8ff6df7f050b7838b5193655b581236331ee2aff3ff9f7df40","observation_id":"90671c1b-3e88-46b1-8aa8-74d8d62ec4d3","resolution":{"observed_at":"2026-08-11T13:38:13.986574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:13.990476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.990476Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:6627c50d8ba78b9db7e21cf27bbb0fd9c9b556c3532e6bb9c700159761d66960","observation_id":"dfd098ce-faa8-454d-bc96-4272b74bfba3","resolution":{"observed_at":"2026-08-11T13:38:13.990476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T13:38:13.994300Z","title":"H.; Zhao, J.; Wang, W.; Li, B.; Fung, P.; and Hoi, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.994300Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c83d22f654f5ece113a8c29370283a1e46dc8407b36e149c250424662d1c23c6","observation_id":"383e9cdc-f93f-4999-8613-e7e20e7c666c","resolution":{"observed_at":"2026-08-11T13:38:13.994300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.637845Z","title":null,"venue":null,"work_id":"3fc93fd7-6d0d-468c-b327-b2a7ac5f3006","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:13.998232Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:5a163e565f7d70de1b92301cdeb5f16b046950b7294aae9e8bcfa77e26c41eed","observation_id":"68a5ee27-1ea6-4fdb-87c3-c7093dfd2bf8","resolution":{"observed_at":"2026-08-11T13:38:14.641535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.627080Z","title":null,"venue":null,"work_id":"204d2b3d-36df-4e69-a045-fbb7a0d1529b","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.001637Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:21af64e268be7f8befef2da0199300a042e3a4ccb40d64af65b163c8c7b02cab","observation_id":"69a46e92-6351-43c6-bd9d-ef0b65308156","resolution":{"observed_at":"2026-08-11T13:38:14.630603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.616961Z","title":null,"venue":null,"work_id":"1f5b07ab-9a74-4c20-8900-abf454c3cbda","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.005393Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:360f0bf66ff8d9631391b5d754ea08b5428cb3de4176fe90e0324c40c5c71313","observation_id":"273f5760-434e-4911-b0ce-05243ef18e73","resolution":{"observed_at":"2026-08-11T13:38:14.620403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.606969Z","title":null,"venue":null,"work_id":"7aa1e966-30c7-4ca9-9e6b-734b9f35a93d","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.009044Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:ef26b3f5debfbcdd77500020d6f548f3be2da0f47b6eb083e14996ef7014a5b4","observation_id":"40d85930-82fa-496e-a1e3-df2c1e391c52","resolution":{"observed_at":"2026-08-11T13:38:14.610455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.594757Z","title":"P.; Poff, S.; Corredor, M.; Zettlemoyer, L.; Fazel-Zarandi, M.; and Celikyilmaz, A","venue":null,"work_id":"4339b09c-c8f1-4954-8ed0-ba421868713a","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.012557Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:14e45a97f47c92cf9efc65c20d04cdd3926b746c5c5829ef38ed52db9bbed515","observation_id":"c21bbc0c-d03a-441e-8f59-77fc46303491","resolution":{"observed_at":"2026-08-11T13:38:14.599885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.583948Z","title":null,"venue":null,"work_id":"6a85f0b7-2be2-425f-963e-690dd44b5101","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.015834Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:94d61c7aa1d2e10195bbfae19239e2a64936bae4a16775734fdd99e6c5c1cde5","observation_id":"4f74b3fe-4c7a-4170-b8ba-e743f1333127","resolution":{"observed_at":"2026-08-11T13:38:14.587672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.019407Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.019407Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:753a86d94effd1a6c9650dc5768a2fb01e344ca83cb07827f905a1c21f604323","observation_id":"ed6278f1-1757-48ac-ada2-5f1a4a9b2a37","resolution":{"observed_at":"2026-08-11T13:38:14.019407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.16492","last_updated":"2022-11-29T18:57:06Z","snapshot_observed_at":"2026-08-10T11:22:53.498057Z","submitted_at":"2022-11-29T18:57:06Z","title":"Abstract Visual Reasoning with Tangram Shapes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.16492","snapshot_observed_at":"2026-08-11T13:38:14.022709Z","title":"K.; Hawkins, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.022709Z"},"links":{"cited_paper":"/paper/2211.16492","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:5a47701d83e370a8b4f06ac3d1d4413c961b281108fe4c1a6aa1bee69a9daa25","observation_id":"19065e72-0b5d-4304-be0a-d6fc575e3cf3","resolution":{"observed_at":"2026-08-11T13:38:14.022709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.567723Z","title":"Y.; Fried, D.; and Salakhutdinov, R","venue":null,"work_id":"8bb4c4b1-20ae-415d-939f-95cbe06477ae","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.026376Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:5fc90914e28e817dbedc38f23ef4df04c4de078b626b7c84d13958a7df3aa534","observation_id":"1be8d884-cf09-49e4-a3bc-98a9b2254814","resolution":{"observed_at":"2026-08-11T13:38:14.571413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.555403Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":"ca814002-bd41-4cf1-a981-59739e150367","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.029751Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:84571faa7db1408a938c6dba88fc3633b7be703d8982af68f8573a716a910a61","observation_id":"c617cfbf-052b-43b6-a360-efd0e7859984","resolution":{"observed_at":"2026-08-11T13:38:14.559972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.545015Z","title":"R.; and Koch, G","venue":null,"work_id":"dfe78f3e-d1d8-433a-8f2e-c3a9164b8a38","year":1977},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.032918Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c5b2cb7c95d85f948d5b91966fbd4cf77f431af282dc39f016480764b9585041","observation_id":"babae6f3-b5e2-4c33-8fee-c83d9131dda4","resolution":{"observed_at":"2026-08-11T13:38:14.548776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T13:38:14.036134Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.036134Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:39c3b498d7c51082c0f5ca9ef235320882bf45d6cace24af986c04dcde71e641","observation_id":"2019cda5-9f63-43af-b405-3caa3415cba3","resolution":{"observed_at":"2026-08-11T13:38:14.036134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02030","last_updated":"2024-06-05T03:28:01Z","snapshot_observed_at":"2026-08-06T04:48:58.920073Z","submitted_at":"2024-06-04T07:13:23Z","title":"Multimodal Reasoning with Multimodal Knowledge Graph","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02030","snapshot_observed_at":"2026-08-11T13:38:14.039890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.039890Z"},"links":{"cited_paper":"/paper/2406.02030","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:851c83cb311c9b6ddb488f8a7c7b824b2f7a048885575b6ab4ff0970fc7cd6f3","observation_id":"d9be3fae-36ec-4b96-906a-d84ef5d741da","resolution":{"observed_at":"2026-08-11T13:38:14.039890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.533632Z","title":"D.; Strik, W","venue":null,"work_id":"4fdc12ce-a319-47ba-83c7-52f4963b2d08","year":2010},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.043346Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4b2019f146db410f48254e90b3b8ecf6ea9c1a78f0ea9a7e770ae1e1984cf3b2","observation_id":"6564c27f-cbaa-4ede-97b2-007aef125d7c","resolution":{"observed_at":"2026-08-11T13:38:14.537450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04320","last_updated":"2023-05-16T05:59:25Z","snapshot_observed_at":"2026-08-10T12:59:14.021514Z","submitted_at":"2023-05-07T16:07:11Z","title":"Unified Demonstration Retriever for In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04320","snapshot_observed_at":"2026-08-11T13:38:14.046278Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.046278Z"},"links":{"cited_paper":"/paper/2305.04320","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4ddd34362207f7158ad1e77bfd7130a3db1a4c1346c0d49c6925b7d8bdef30b3","observation_id":"4544a36e-345b-454c-810b-ad01f34d769f","resolution":{"observed_at":"2026-08-11T13:38:14.046278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07536","last_updated":"2024-08-24T09:59:31Z","snapshot_observed_at":"2026-08-11T12:44:36.120047Z","submitted_at":"2023-11-13T18:22:32Z","title":"A Comprehensive Evaluation of GPT-4V on Knowledge-Intensive Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07536","snapshot_observed_at":"2026-08-11T13:38:14.049627Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.049627Z"},"links":{"cited_paper":"/paper/2311.07536","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:9d6aa3e207b06fc0df8ba469487bcd9def14c32da7b1ab943f35cf86292f1d51","observation_id":"810e78d5-86a4-4ec6-8860-1ba54137ca5b","resolution":{"observed_at":"2026-08-11T13:38:14.049627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-09T18:37:19.036481Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-11T13:38:14.053159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.053159Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:064e5eb14013c66d8233310cdb699844aec8dc4b132d9351e727ea9a7d4fb9ca","observation_id":"4f169db1-9c86-4ed5-9749-71ed3d63aa53","resolution":{"observed_at":"2026-08-11T13:38:14.053159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01714","last_updated":"2024-03-03T06:12:44Z","snapshot_observed_at":"2026-08-01T10:11:20.453560Z","submitted_at":"2023-12-04T08:07:21Z","title":"Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01714","snapshot_observed_at":"2026-08-11T13:38:14.056640Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.056640Z"},"links":{"cited_paper":"/paper/2312.01714","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:78c06fa5ba90ae7f3fad6d1feaf0e796eed4db8d371eda277edcacd246340fda","observation_id":"a6208ccc-ec4d-430c-a07c-063dfc4d6b4c","resolution":{"observed_at":"2026-08-11T13:38:14.056640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.522569Z","title":null,"venue":null,"work_id":"487288a6-8537-4bc8-942b-0b822c2bc073","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.060266Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:b55ccdb4b84d09dc70a3c06e59b1af790472a9f03d319443da4220c7918c4840","observation_id":"ec511551-9895-48b9-bd86-8286a527f007","resolution":{"observed_at":"2026-08-11T13:38:14.525994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.512044Z","title":null,"venue":null,"work_id":"9e079a89-3d2f-4977-8a0f-646665825d8c","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.063317Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:901c8216fbca2f656f658b63a011b664fb5be51b5adb37d49fdac8ea9527e223","observation_id":"8a417068-b26c-4d4f-925d-5dbbcd1b084b","resolution":{"observed_at":"2026-08-11T13:38:14.515788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T13:38:14.066249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.066249Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:27fae9e39a1b8ec21c62f743b2595a58d0059e17c2015a6585961f71cfd4ad93","observation_id":"2339f6bd-5f08-4f8e-85f2-f7fdbddac1a9","resolution":{"observed_at":"2026-08-11T13:38:14.066249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.501464Z","title":null,"venue":null,"work_id":"7c734057-daa7-4737-903a-555e3a9d5d76","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.069654Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:2334c2839574eaaecc006b10eb19b65496f5bbae2d51a9e0c474f0487877c176","observation_id":"b2655f6e-31a8-403b-9d7c-e5ca4003f63c","resolution":{"observed_at":"2026-08-11T13:38:14.504841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09241","last_updated":"2023-11-09T11:14:51Z","snapshot_observed_at":"2026-08-10T21:09:39.221660Z","submitted_at":"2023-11-09T11:14:51Z","title":"Chain of Images for Intuitively Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09241","snapshot_observed_at":"2026-08-11T13:38:14.072618Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.072618Z"},"links":{"cited_paper":"/paper/2311.09241","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:93447ed95ad363cdf07f33ba053452d06c954c8007d783bd99fb8d26cd30c6d4","observation_id":"85dd9dc4-7908-409d-9116-467825017e59","resolution":{"observed_at":"2026-08-11T13:38:14.072618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12863","last_updated":"2024-01-23T15:56:11Z","snapshot_observed_at":"2026-08-07T22:49:22.103072Z","submitted_at":"2024-01-23T15:56:11Z","title":"KAM-CoT: Knowledge Augmented Multimodal Chain-of-Thoughts Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12863","snapshot_observed_at":"2026-08-11T13:38:14.076036Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.076036Z"},"links":{"cited_paper":"/paper/2401.12863","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:738395cfea8eeeb4a4a266ab68f157e0aecef4b62efed6a446cc31c7dba24922","observation_id":"c7ca2f4b-34ea-4c76-aab7-aa5be1ba3c1c","resolution":{"observed_at":"2026-08-11T13:38:14.076036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20482","last_updated":"2024-10-27T15:37:51Z","snapshot_observed_at":"2026-07-06T19:40:21.797132Z","submitted_at":"2024-10-27T15:37:51Z","title":"What Factors Affect Multi-Modal In-Context Learning? An In-Depth Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20482","snapshot_observed_at":"2026-08-11T13:38:14.079635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.079635Z"},"links":{"cited_paper":"/paper/2410.20482","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:28e530e5568683e2338ecb277ea5446eb7f9e262866098cb8b8ad69bd7956adf","observation_id":"8807733c-7086-4704-831a-69d459326c88","resolution":{"observed_at":"2026-08-11T13:38:14.079635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12819","last_updated":"2025-08-25T02:35:43Z","snapshot_observed_at":"2026-07-06T18:17:21.217971Z","submitted_at":"2024-05-21T14:24:01Z","title":"Large Language Models Meet NLP: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12819","snapshot_observed_at":"2026-08-11T13:38:14.083304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.083304Z"},"links":{"cited_paper":"/paper/2405.12819","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:803ff7ec626b6d4ccc8b9a53ba4343e3736eacc2d3fee6d060bdc790e4c50705","observation_id":"e9324f2e-2037-44bc-8182-f6520df2b1f9","resolution":{"observed_at":"2026-08-11T13:38:14.083304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.490973Z","title":null,"venue":null,"work_id":"dd332c22-d1e0-4b17-afc4-61034585ec04","year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.087614Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:30880c268974348a41bf6c684236ac2289ac50c18e60886d2e5142b96e6a193d","observation_id":"f5421ae8-7934-4145-b23e-4498daa03afa","resolution":{"observed_at":"2026-08-11T13:38:14.494644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.090582Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.090582Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:4c5d35ca6168fced7431cb3f4a9db717744ebbdd5188de34f07de72602233998","observation_id":"713119a3-79da-4952-b398-a914aba96b10","resolution":{"observed_at":"2026-08-11T13:38:14.090582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.473875Z","title":null,"venue":null,"work_id":"b17d5192-c6ed-4643-bee6-519f8a905ef4","year":2022},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.093782Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:cbd65319b6232b2f9508e69ae1d873910350bad034db30e1395375aa2092c314","observation_id":"6d6b0eeb-931f-4be8-8f6f-59d562627b0d","resolution":{"observed_at":"2026-08-11T13:38:14.477738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.463244Z","title":"A.; Yasarla, R.; and Patel, V","venue":null,"work_id":"465d52cb-ed82-4e43-988b-787da1b949ba","year":2020},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.096997Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:9c5d2f59e3eb127f3c0c2a9a87dbe2ad3c9320ca36d45c9d999fb508efcdaf2a","observation_id":"78611544-0b79-41f8-9451-2bac1a3eb059","resolution":{"observed_at":"2026-08-11T13:38:14.466729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20834","last_updated":"2024-05-31T14:23:49Z","snapshot_observed_at":"2026-07-06T18:23:19.450809Z","submitted_at":"2024-05-31T14:23:49Z","title":"Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20834","snapshot_observed_at":"2026-08-11T13:38:14.100180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.100180Z"},"links":{"cited_paper":"/paper/2405.20834","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:299373a02b3dceb8e91ede5f430d9c9ccb82edaabfef3c6d893889072f45dd6f","observation_id":"d45efeeb-9d63-49fd-8ff4-4b6bf220565a","resolution":{"observed_at":"2026-08-11T13:38:14.100180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T13:38:14.103515Z","title":"M.; Hauth, A.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.103515Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:2b4e0527ab660783f6e4d312ec2b9870f0d166effe06511fa21086f4675ee1bb","observation_id":"7911f6a6-a7a4-4fd5-97e7-50dfb40033fd","resolution":{"observed_at":"2026-08-11T13:38:14.103515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.451675Z","title":null,"venue":null,"work_id":"298a3a87-b3cf-4b9b-928a-52cad4832aa7","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.106809Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:79a595a88dd704743c8cc2befe2824b87e2ce60c2d38dec68ae7fa7803452af1","observation_id":"ef7790aa-6b17-464f-84fc-46772035abfb","resolution":{"observed_at":"2026-08-11T13:38:14.455530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-11T13:38:14.110031Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.110031Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:48f77946b0eaf81b100a2f216529fb90e331c9de65e517b1435907e7632e3217","observation_id":"164d0c2f-6277-4f85-9c05-44ffea2f4a6f","resolution":{"observed_at":"2026-08-11T13:38:14.110031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.441336Z","title":null,"venue":null,"work_id":"74b82798-2fb4-4f20-ab27-1e6d3a800b65","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.113646Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:902c1f84965c8a14e6b7a6e8ba8cd023a39d86b20899dc299775be008d2c759c","observation_id":"4cc2f2db-edce-425b-9e87-24c260e23e27","resolution":{"observed_at":"2026-08-11T13:38:14.444870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.430699Z","title":null,"venue":null,"work_id":"c8109707-8033-4750-a8c4-3c089c257c26","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.116780Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:8ed83661c653b84e28e07fdf909d8512141028a3ac0d2646a36b4addac3d45a0","observation_id":"3211c793-d67a-4f78-a89c-563cd12de61e","resolution":{"observed_at":"2026-08-11T13:38:14.434445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03622","last_updated":"2024-10-23T07:20:26Z","snapshot_observed_at":"2026-08-01T23:41:06.358986Z","submitted_at":"2024-04-04T17:45:08Z","title":"Mind's Eye of LLMs: Visualization-of-Thought Elicits Spatial Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03622","snapshot_observed_at":"2026-08-11T13:38:14.120001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.120001Z"},"links":{"cited_paper":"/paper/2404.03622","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:1fb691f27ff932f4b161e89f2a1f5e5073a4bac1dc36f29067b6f6cf68f8fc2a","observation_id":"142c6a96-f632-490f-b4e5-d58b7d8eaf93","resolution":{"observed_at":"2026-08-11T13:38:14.120001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09193","last_updated":"2023-11-15T18:39:21Z","snapshot_observed_at":"2026-08-10T05:47:40.489627Z","submitted_at":"2023-11-15T18:39:21Z","title":"The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09193","snapshot_observed_at":"2026-08-11T13:38:14.123422Z","title":"C.; and Nie, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.123422Z"},"links":{"cited_paper":"/paper/2311.09193","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:56102419dc5bae64bd45cfab79ea887d7cc272ac0b0a414d500668e7749745a1","observation_id":"2a6769f1-860c-4fbf-a0f5-be13c7bc6c1d","resolution":{"observed_at":"2026-08-11T13:38:14.123422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18357","last_updated":"2024-06-11T07:41:03Z","snapshot_observed_at":"2026-08-11T16:58:29.445307Z","submitted_at":"2024-05-28T16:55:33Z","title":"Faithful Logical Reasoning via Symbolic Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18357","snapshot_observed_at":"2026-08-11T13:38:14.126778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.126778Z"},"links":{"cited_paper":"/paper/2405.18357","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e606d8d2bed6b885fff6428f0127ecc1ed318d9089ebe6b602d145dc56688e6c","observation_id":"47751f60-6b9c-463a-ae0d-459d1c858fb6","resolution":{"observed_at":"2026-08-11T13:38:14.126778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T13:38:14.130433Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.130433Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:8d52e112dee6014117470a37165e0a466397e4c45a9d2e7319256e146fdb6662","observation_id":"1ff5d7f2-ed6e-45dc-bfe8-47372802bdc2","resolution":{"observed_at":"2026-08-11T13:38:14.130433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.420708Z","title":null,"venue":null,"work_id":"55f06646-885f-4b9e-84f3-c33b1e52d86d","year":2019},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.134018Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:2ab50c4ef71c40a5d84df5e6fe1f8e6628e73d207c83a233dbea1d7eb2087bc0","observation_id":"6cb29fa8-a492-4297-887d-5ef4b222f7be","resolution":{"observed_at":"2026-08-11T13:38:14.424158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-11T13:38:14.137261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.137261Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:0a84d940835157441f93354a8c7492815c2b3c6834462b543d5eaadc16702db7","observation_id":"85b6cef6-180c-469e-a7e4-e54085e4c354","resolution":{"observed_at":"2026-08-11T13:38:14.137261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-10T20:10:12.438459Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-11T13:38:14.141106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.141106Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:1112d520f79aa551e2b31140ac557f6600cf535db204cb94f10b46ae379db149","observation_id":"5a18b25a-5a27-454c-825a-af4e52c2f3e2","resolution":{"observed_at":"2026-08-11T13:38:14.141106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.145181Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.145181Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e72d84b5a61b3b3a9e02e011f6b88b47426f4afc8308f435cdfa1ba9e69a66d8","observation_id":"1cd17fb7-3032-4d16-945a-305b1cbdbe31","resolution":{"observed_at":"2026-08-11T13:38:14.145181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-11T13:38:14.148756Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.148756Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:e3affeaa298397e6f2d3885416e99f9e50cd848a50bd1a5d09bb744adb18a945","observation_id":"29b5c9b8-f9f7-4945-8f4d-5cbf1548a5f1","resolution":{"observed_at":"2026-08-11T13:38:14.148756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:14.402450Z","title":null,"venue":null,"work_id":"86bc2f94-50b2-4ee2-8643-7baef2c9e5cf","year":2024},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.152223Z"},"links":{"citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:c47af05f2e71b272e54978f99672bf6f259113b1c95e947dce374a0f382214c7","observation_id":"0c7497cd-38ae-4c5e-934b-60964a4b1b1b","resolution":{"observed_at":"2026-08-11T13:38:14.407242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T13:38:14.155401Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:14.155401Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.12932"},"observation_digest":"sha256:9e344be51c4e0f217c411f968ddde8071ed979c5c7dcb72aef1c45631d7193d3","observation_id":"bd71a01f-2ac2-4f74-8caf-d03740639725","resolution":{"observed_at":"2026-08-11T13:38:14.155401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12932","last_updated":"2025-03-09T08:47:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:58:39.874168Z","submitted_at":"2024-12-17T14:10:16Z","title":"CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2412.12932."}