{"as_of":"2026-08-07T18:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9dfd9f2c8be5c1b45a80720a659dae06d5a8427fe4f7f77e423258fb4203d7ef","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T18:12:27.396607Z","state":"measured"},{"denominator":149,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":149,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":170,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:52.535108Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":98,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T22:50:24.053411Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.04671"},"observation_digest":"sha256:884b445c9f970c898bfc22c65c4d899d5a25f45fc0f4011ced4c068795e3f699","observation_id":"7c9d7d79-955e-4dd1-b16d-b5ff256b9116","resolution":{"observed_at":"2026-05-13T22:50:24.184228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T01:17:58.678036Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.11381"},"observation_digest":"sha256:5cd327ba12be8f1c8519825b1c4d789932ee82057a8a85f3190ae61a085c4cce","observation_id":"d2d319d5-695f-4e9c-8371-74f8fd7000c0","resolution":{"observed_at":"2026-05-14T01:17:58.849157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:34d893ffd094ddf33e81fa5f08e9121c4f9ac83dd760d3492b5273578a5e076f","observation_id":"1d345092-eea8-491e-9045-de78406b0d1c","resolution":{"observed_at":"2026-05-14T23:07:42.533156Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2303.17760","last_updated":"2023-11-02T17:34:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-31T01:09:00Z","title":"CAMEL: Communicative Agents for \"Mind\" Exploration of Large Language Model Society","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-14T01:40:53.351795Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2303.17760"},"observation_digest":"sha256:9dc73cb22eca8edbab70d3b354c4c4e513dc15965ba3e9d6cc1523e9318c3244","observation_id":"19f22747-9d6b-4414-8ef6-69cae187b6a5","resolution":{"observed_at":"2026-05-14T01:40:53.989447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:83228bdc2b2b1809e0c32c5a9eb4eafc85aa2debd005175e1c07889cd024d4d1","observation_id":"5256cbde-1982-4314-bc75-36f929a43ee9","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":188,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:f5937906eeeaf4ab20a4b09eea744d7ff14113778f4dcb5392224a98be1cb87f","observation_id":"f8f02aaa-3ebb-4513-9d7e-91c6c0f7cc9a","resolution":{"observed_at":"2026-05-16T02:56:42.161866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":287,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:31986b7d8c5ae32a67f66586ec1720adde25feb5c6c42ef00cdc659526830b69","observation_id":"083c4f53-0000-4c38-a929-18411a8a6b66","resolution":{"observed_at":"2026-05-19T20:28:39.267291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-05-17T22:30:44.520703Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2308.05374"},"observation_digest":"sha256:67158bcbe42a7a18972930ff575ef10ae39ef8226ecacde95756f96db3e1f846","observation_id":"a9abddba-d78d-4bfb-850b-d7883baf9c53","resolution":{"observed_at":"2026-05-17T22:30:44.981950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:d93f5f48f280b146c655518a491a3a0543410dcde054b8d81f3dfea832b24417","observation_id":"dc656a40-a271-46ae-9382-b2922349e537","resolution":{"observed_at":"2026-05-15T23:26:06.516043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2407.08101","last_updated":"2026-04-14T18:39:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-11T00:10:45Z","title":"What to Say and When to Say it: Live Fitness Coaching as a Testbed for Situated Interaction","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-23T22:51:08.753650Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2407.08101"},"observation_digest":"sha256:c5501b8fa8ca0fac1c8bedf131344b682dad74f93e101b2adbc2d53f0acdaaf4","observation_id":"8e663a4c-89fb-439e-b5ba-085ab1d1deba","resolution":{"observed_at":"2026-05-23T22:53:33.167426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:2764f56ae98e22534a5bc8f9403c931f50f1fb36f477308f983253bb0062cad9","observation_id":"c8340945-5d4a-419d-8176-910feb651aff","resolution":{"observed_at":"2026-05-15T17:18:53.639892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:fb71000dafd290d551d6c7325cc1f0ad09a49d88363ac3d4897ce3664263024f","observation_id":"f9b98dac-ae3d-4953-9575-283b2a442322","resolution":{"observed_at":"2026-05-19T06:59:03.343413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:5edc856c7f68221661ab48fdabe8fd217cc2360ae5a0c60fa545a8c6f6f8f8e6","observation_id":"4969705c-1c80-4067-9738-0eda3b0caf0a","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T13:29:47.529564Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.15879"},"observation_digest":"sha256:16fb34432a0faea25827d0fda4eed69d9e95a85179d7512ddc2e27c48f179dba","observation_id":"1637b3ad-0836-4ee4-a4e2-097fff7616fc","resolution":{"observed_at":"2026-05-22T13:31:36.128814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T15:10:14.103607Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16192","last_updated":"2025-05-30T06:35:34Z","snapshot_observed_at":"2026-08-07T15:03:33.507467Z","submitted_at":"2025-05-22T03:50:13Z","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:14.103607Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.16192"},"observation_digest":"sha256:b8669f1cfacbbe227782dbd87d3e39b57a7dd83b8bce53d9c4d813a31c3f1457","observation_id":"44fa5f25-11c6-4fad-a0ca-ef63fd42e4b0","resolution":{"observed_at":"2026-08-07T15:10:14.103607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T15:01:34.320692Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16673","last_updated":"2025-05-22T13:39:32Z","snapshot_observed_at":"2026-08-07T14:55:04.641472Z","submitted_at":"2025-05-22T13:39:32Z","title":"R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:01:34.320692Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.16673"},"observation_digest":"sha256:291b898b8d4369a5edf5db4525fbe5c6111310ba74627ee0aeebe25932118171","observation_id":"b3ebe649-9063-43bb-8bc2-49d5d0425bc8","resolution":{"observed_at":"2026-08-07T15:01:34.320692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:52:05.094450Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-07T14:46:48.101372Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.094450Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:598799f50d2724891065ed7724e886c4805bd66e890d1dfd863bd01514a73b0e","observation_id":"47117c81-1b56-4a5b-aae9-9bfb30599547","resolution":{"observed_at":"2026-08-07T14:52:05.094450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:34:40.407245Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18603","last_updated":"2026-05-26T15:30:09Z","snapshot_observed_at":"2026-08-07T14:26:48.340884Z","submitted_at":"2025-05-24T08:53:05Z","title":"Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:40.407245Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.18603"},"observation_digest":"sha256:e1f782388390edea353e463cd3f344d07d14127a74430962163a0b782c248b84","observation_id":"4015f0cd-d7cb-4dbd-a4eb-bc2c63181f95","resolution":{"observed_at":"2026-08-07T14:34:40.407245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:03:05.767363Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-07T13:56:23.519692Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.767363Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:399517d971b70c1535a97912bd91d6e9fbbe676a01d9bbba3c84732397ecb4dc","observation_id":"b0fcf885-c808-484a-984b-460da8e0881b","resolution":{"observed_at":"2026-08-07T14:03:05.767363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:02:56.990545Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-07T13:54:37.270545Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:56.990545Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:698ed12b1083f5f9a8884446dbd2b69c666df43fbed4d249f3907acff619926f","observation_id":"c8763ff9-10b6-4436-a687-abc1eb4f5234","resolution":{"observed_at":"2026-08-07T14:02:56.990545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2505.20816","last_updated":"2026-04-21T01:11:43Z","snapshot_observed_at":"2026-07-06T21:31:11.245854Z","submitted_at":"2025-05-27T07:23:38Z","title":"Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T13:52:44.096262Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.20816"},"observation_digest":"sha256:72ccd32c7273a45dbc4cbe87c83b600360dfc4cdefc8ffabfcaa8fcbc5731127","observation_id":"07e52310-e195-4dca-9353-8f18fd9fbb80","resolution":{"observed_at":"2026-05-19T13:53:05.648683Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:36:02.479679Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-07T13:27:31.159147Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:36:02.479679Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:8d22cbc029cd06fb0e9941a8f532c4105ce5bf8b1641e9799ca8d577bd461278","observation_id":"7da7d4b6-a65a-4f5f-bb94-304753048f66","resolution":{"observed_at":"2026-08-07T13:36:02.479679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:22:26.520134Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-07T13:13:59.147933Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:26.520134Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:70c841d6f63ed3016b0660bdc09a9f526ad2c4b5394f80d212fb8c7700f9d47b","observation_id":"ba02ac77-4754-4ff3-8aeb-e459fef570f7","resolution":{"observed_at":"2026-08-07T13:22:26.520134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T13:09:53.466958Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22525","last_updated":"2025-05-28T16:12:45Z","snapshot_observed_at":"2026-08-07T13:02:39.708613Z","submitted_at":"2025-05-28T16:12:45Z","title":"Thinking with Generated Images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:53.466958Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.22525"},"observation_digest":"sha256:bf6df53a4967c1f6346d1dd2379d98a1501b7e6d206951abb76cde3aab1c56a1","observation_id":"b00aa88c-d384-4217-a29a-941e95e67d16","resolution":{"observed_at":"2026-08-07T13:09:53.466958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:54:27.034519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23272","last_updated":"2025-05-30T14:14:00Z","snapshot_observed_at":"2026-08-07T12:46:34.936963Z","submitted_at":"2025-05-29T09:20:12Z","title":"Are MLMs Trapped in the Visual Room?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:27.034519Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23272"},"observation_digest":"sha256:863e52016996b6a67cb11e5bd0b984fc71d8eba03db325b03da8a63d0623248c","observation_id":"9279b93b-17e7-469f-a099-4376b71c4232","resolution":{"observed_at":"2026-08-07T12:54:27.034519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:2081d263de15d6249d94a13f1747388194cb5c844ac8d2600d0a21c108b9083a","observation_id":"a3f638c1-0a06-4065-af59-2a2ccfebf95b","resolution":{"observed_at":"2026-05-22T01:05:52.179893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:42:28.172520Z","title":"Multimodal chain-of- thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-07T12:36:01.559601Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:28.172520Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:7a6d0c1bfce9476cf70b2f46f972ecebd9f41789f9568ff937a0dc1895dbb700","observation_id":"7ad3e96f-f3ab-4080-9149-e5242db7cdc5","resolution":{"observed_at":"2026-08-07T12:42:28.172520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T12:02:10.670667Z","title":"Karypis, and Alexander J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00806","last_updated":"2025-06-01T03:15:29Z","snapshot_observed_at":"2026-08-07T11:55:15.725512Z","submitted_at":"2025-06-01T03:15:29Z","title":"Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:10.670667Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.00806"},"observation_digest":"sha256:be79ec417350a6442577dc8cd4b393c90070e40b6dd0e7c66206a5221e55869a","observation_id":"8a1b897e-7d41-43f7-8b74-ee6c45709c95","resolution":{"observed_at":"2026-08-07T12:02:10.670667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:55:14.744601Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-07T11:49:02.400828Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.744601Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:7e1316ac377bb1f611e64893035ad08648fcbb9ecaa9bac1e2a8e89638a122ff","observation_id":"5e94eb29-f3b2-481f-9344-cd4227812f63","resolution":{"observed_at":"2026-08-07T11:55:14.744601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:05:19.790349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T10:57:48.182894Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.790349Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ab185966a306fea3a3e1e8adefad4e663d786de2c555e5978787c00932374424","observation_id":"48a225fb-5b1d-4cf3-8168-4a210622fcce","resolution":{"observed_at":"2026-08-07T11:05:19.790349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:d20b7a0c0dba1339726ec0ad5def3c4b8788b8b8a3c3ee9c211e286b225b0407","observation_id":"5ebbdf54-4206-4f77-9901-8ee38e4e3326","resolution":{"observed_at":"2026-05-19T11:52:16.454085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T10:28:54.760061Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-07T10:19:01.005683Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:54.760061Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:7597412fc85e1cfbeb3450068ade39c96c7627440295af49b949bdcb18c865c3","observation_id":"36d4ec69-ae2b-41ae-99ab-a8253b6602a5","resolution":{"observed_at":"2026-08-07T10:28:54.760061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:37:02.608167Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07501","last_updated":"2025-06-09T07:26:47Z","snapshot_observed_at":"2026-08-07T05:29:44.483494Z","submitted_at":"2025-06-09T07:26:47Z","title":"Graph-of-Causal Evolution: Challenging Chain-of-Model for Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:37:02.608167Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.07501"},"observation_digest":"sha256:3e2ad2d55727a9204a9a5b20ee103910429f3125ae6de818b8aedddeba785446","observation_id":"6c408dae-9419-45a2-9711-7791ca903d3b","resolution":{"observed_at":"2026-08-07T05:37:02.608167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:27:05.050109Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-07T05:20:11.340991Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:05.050109Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.07905"},"observation_digest":"sha256:1eb3247a8558f70dc699b05c5f01e1af94276d53a9b55ad89dc8e41ee56f12a2","observation_id":"373b2e0a-d748-48a8-967e-69b399de2ec1","resolution":{"observed_at":"2026-08-07T05:27:05.050109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:09:23.620651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-07T12:16:31.533543Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:23.620651Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:7c1125ef63a772547644369fe8e2edb2a51702dba9b59cba1d979d350fbd930d","observation_id":"133a0312-fd14-48e7-a0bb-71019c467bc8","resolution":{"observed_at":"2026-08-07T05:09:23.620651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T05:05:52.403000Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08817","last_updated":"2025-06-12T15:51:33Z","snapshot_observed_at":"2026-08-07T04:59:07.065080Z","submitted_at":"2025-06-10T14:08:56Z","title":"Video-CoT: A Comprehensive Dataset for Spatiotemporal Understanding of Videos Based on Chain-of-Thought","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:52.403000Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.08817"},"observation_digest":"sha256:0f6e8cb9d593c57cf6db0d1ceaf6e143bce438a51ab9cb8c526fbc2983394252","observation_id":"13dd506a-9ce8-4054-af5f-43844a6ab1c3","resolution":{"observed_at":"2026-08-07T05:05:52.403000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T15:26:52.535108Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11040","last_updated":"2025-05-21T04:45:11Z","snapshot_observed_at":"2026-08-07T15:21:53.633879Z","submitted_at":"2025-05-21T04:45:11Z","title":"Large Language models for Time Series Analysis: Techniques, Applications, and Challenges","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.535108Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.11040"},"observation_digest":"sha256:5a1c447712ba89266f27102732ba954c554d31944b93d99085c2e002208a0278","observation_id":"3662b8f8-acfc-4c21-810b-20756e58c665","resolution":{"observed_at":"2026-08-07T15:26:52.535108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T00:57:13.795355Z","title":"doi: 10.18653/v1/2024.acl-long.773","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12430","last_updated":"2025-07-11T02:01:54Z","snapshot_observed_at":"2026-08-07T08:27:10.239745Z","submitted_at":"2025-06-14T10:03:17Z","title":"Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:57:13.795355Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.12430"},"observation_digest":"sha256:c0bc2b1a7edd941fb0df2193cbad27a2fcd08d0f2db75fb2f476e12c8e5d4d73","observation_id":"52a76e6f-afc4-4d0e-84de-11b6b2635d1d","resolution":{"observed_at":"2026-08-07T00:57:13.795355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T00:40:37.239483Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-07T00:34:58.147767Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":253,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:37.239483Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:844185fc3e404d2226c944bd4e2d95fd07f988fb39d3b39dbcad5b55582241f5","observation_id":"2dca750e-d06e-4844-9e73-de662e458a8d","resolution":{"observed_at":"2026-08-07T00:40:37.239483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T00:39:52.632806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13192","last_updated":"2025-06-16T07:59:51Z","snapshot_observed_at":"2026-08-07T00:33:30.864367Z","submitted_at":"2025-06-16T07:59:51Z","title":"Breaking Thought Patterns: A Multi-Dimensional Reasoning Framework for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:39:52.632806Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.13192"},"observation_digest":"sha256:124742fc7ba4e3bcdce9e1021048548a757d86d2c0e248ca62c5a7cfafc26aea","observation_id":"e541fac0-dd6d-4160-996c-78d7825e2d88","resolution":{"observed_at":"2026-08-07T00:39:52.632806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:19:05.501316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14805","last_updated":"2025-08-12T17:07:53Z","snapshot_observed_at":"2026-08-07T11:11:27.738711Z","submitted_at":"2025-06-03T13:44:14Z","title":"Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:19:05.501316Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.14805"},"observation_digest":"sha256:c503f73b729eb1df90551503b13be7f7cd58844c1f0e39c82caa48890c368898","observation_id":"674066e8-842b-4f03-b0c8-b0e1c546067d","resolution":{"observed_at":"2026-08-07T11:19:05.501316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T04:09:01.775920Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14827","last_updated":"2025-06-13T13:39:53Z","snapshot_observed_at":"2026-08-07T07:12:40.611388Z","submitted_at":"2025-06-13T13:39:53Z","title":"DAVID-XR1: Detecting AI-Generated Videos with Explainable Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:01.775920Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.14827"},"observation_digest":"sha256:5ab47a48aaa91d64086f8375fa463795765e98956be75bc070197df4917b1c64","observation_id":"3dcc9428-0220-4ea6-a573-9c642f348207","resolution":{"observed_at":"2026-08-07T04:09:01.775920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2506.16796","last_updated":"2026-04-13T02:17:17Z","snapshot_observed_at":"2026-07-30T08:45:44.946546Z","submitted_at":"2025-06-20T07:21:21Z","title":"RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T08:32:20.566798Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.16796"},"observation_digest":"sha256:3d9d445dc01277a550e5e6caba38748f409617d15f42d2bbdae87e5ab6e864b8","observation_id":"cef7b16d-aaeb-4dea-a7b8-18deed2c501b","resolution":{"observed_at":"2026-05-19T08:33:02.089330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:27:19.364377Z","title":"Mul- timodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.364377Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c1f2d2b5504a8f9381b7a5fac18d29d782cccd62479713364ebf25e43198fb77","observation_id":"df92342c-82be-4b17-ab21-c721e7ac7c18","resolution":{"observed_at":"2026-08-06T23:27:19.364377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:12:13.597717Z","title":"(2024, May 20).Multimodal chain-of-thought rea- soning in language models.arXiv:2302.00923v5 [cs.CL]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19599","last_updated":"2025-06-24T13:09:53Z","snapshot_observed_at":"2026-08-06T23:04:21.804814Z","submitted_at":"2025-06-24T13:09:53Z","title":"ECCoT: A Framework for Enhancing Effective Cognition via Chain of Thought in Large Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:13.597717Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.19599"},"observation_digest":"sha256:50b08ce7f396c32bab161f63256c561c172aef1781b31922d68cb5a389c2b772","observation_id":"dfcbac5d-2cfb-4fe5-93cb-f41d8aa0b5e6","resolution":{"observed_at":"2026-08-06T23:12:13.597717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:11:47.453315Z","title":"arXiv preprint arXiv:2302.00923 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19610","last_updated":"2025-06-27T08:04:32Z","snapshot_observed_at":"2026-08-06T23:04:21.674756Z","submitted_at":"2025-06-24T13:23:25Z","title":"V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:47.453315Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.19610"},"observation_digest":"sha256:62c28b53492cb3b33706faeea27c461bd2a73224d2646e087311651f6c3a289e","observation_id":"90270684-ff5a-4647-bdab-e290706fab79","resolution":{"observed_at":"2026-08-06T23:11:47.453315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T22:22:37.620896Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-07T01:10:13.747886Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:37.620896Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:b11433ec19392c599c361dc602f958c9f04c3b227e1b964b84c191d727b1ec2b","observation_id":"3b8029ff-bebd-4799-878e-2bc272449bc2","resolution":{"observed_at":"2026-08-06T22:22:37.620896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T20:25:20.890778Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02804","last_updated":"2026-06-28T12:40:31Z","snapshot_observed_at":"2026-08-07T08:25:09.971477Z","submitted_at":"2025-07-03T17:07:20Z","title":"Multimodal Mathematical Reasoning with Diverse Solving Perspective","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:20.890778Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.02804"},"observation_digest":"sha256:98cbff78b9755d762fd85f5ca8e50b5571082bdf2c1555ec37c4bd6c7ddd4a3a","observation_id":"91da92d8-23a0-41e2-947d-7e120d2fdbd1","resolution":{"observed_at":"2026-08-06T20:25:20.890778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T21:19:35.695869Z","title":"arXiv preprint arXiv:2302.00923 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02984","last_updated":"2025-07-28T05:53:50Z","snapshot_observed_at":"2026-08-07T08:32:24.456726Z","submitted_at":"2025-07-01T08:24:51Z","title":"From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:35.695869Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.02984"},"observation_digest":"sha256:0b1def0d117931fee39a4fc03c5672c419ec52c009a1aad7980a30315eb51155","observation_id":"d64192ec-5a48-479b-98c3-4c1ae57b6b90","resolution":{"observed_at":"2026-08-06T21:19:35.695869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T18:19:58.893076Z","title":"Zhang, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08664","last_updated":"2025-07-11T15:03:17Z","snapshot_observed_at":"2026-08-07T13:51:35.756452Z","submitted_at":"2025-07-11T15:03:17Z","title":"Introspection of Thought Helps AI Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.893076Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.08664"},"observation_digest":"sha256:ff394bdc62c0cc30897649a519ebb4a7df13955e4655c9ba3ba539879410ad78","observation_id":"8c8a3027-fe41-4a9e-93a3-893590608b0a","resolution":{"observed_at":"2026-08-06T18:19:58.893076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T16:42:42.893099Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12761","last_updated":"2025-07-17T03:33:46Z","snapshot_observed_at":"2026-08-06T16:36:45.445367Z","submitted_at":"2025-07-17T03:33:46Z","title":"Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:42:42.893099Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.12761"},"observation_digest":"sha256:4c2561cbb29c22d18a5f3b0bf415b8551eb7fe4d214a1d3bb494184321e9b8f8","observation_id":"e766ee2a-fc74-468b-beb6-2c0f3d296603","resolution":{"observed_at":"2026-08-06T16:42:42.893099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T13:23:35.914280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-07T01:11:37.463830Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:35.914280Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:8fc2e788c143c9847e1077243dbd09030506200cfabcd44c78ee057925f9c9b8","observation_id":"d653de49-8eae-4efb-a3c9-30ff8af79890","resolution":{"observed_at":"2026-08-06T13:23:35.914280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T12:39:42.154856Z","title":"Prompt, generate, then cache: Cascade of foundation models makes strong few-shot learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21589","last_updated":"2025-07-29T08:43:16Z","snapshot_observed_at":"2026-08-07T04:25:49.997139Z","submitted_at":"2025-07-29T08:43:16Z","title":"Exploring the Link Between Bayesian Inference and Embodied Intelligence: Toward Open Physical-World Embodied AI Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:39:42.154856Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2507.21589"},"observation_digest":"sha256:a76c5d900a31ad4792b21e6257f387a2aae9363ccf20b34a06527b04d2e38882","observation_id":"353e4f03-3de5-4d82-bf48-55b87652f79b","resolution":{"observed_at":"2026-08-06T12:39:42.154856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2508.09547","last_updated":"2026-04-29T01:36:59Z","snapshot_observed_at":"2026-07-06T22:12:12.166886Z","submitted_at":"2025-08-13T07:05:17Z","title":"GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T23:02:14.913189Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.09547"},"observation_digest":"sha256:d4d2a2ef4c1c9557d97f00c56d80d683add5a3716884bb91e274b71d06182a4a","observation_id":"d760e15b-049d-4cd4-8727-49c584108094","resolution":{"observed_at":"2026-05-18T23:02:52.657037Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T16:51:04.957340Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17718","last_updated":"2025-08-25T06:51:15Z","snapshot_observed_at":"2026-08-07T16:56:20.607417Z","submitted_at":"2025-08-25T06:51:15Z","title":"Instant Preference Alignment for Text-to-Image Diffusion Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T16:51:04.957340Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.17718"},"observation_digest":"sha256:627ce9f9d8cd46fcd27f6cb982cf25b62e8730f431433eafcc966ec4bab2a215","observation_id":"7c7ae754-a36f-4a23-8fd3-bcf7d831a020","resolution":{"observed_at":"2026-08-05T16:51:04.957340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T16:17:37.994242Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18772","last_updated":"2025-08-26T07:55:46Z","snapshot_observed_at":"2026-08-07T08:24:33.804357Z","submitted_at":"2025-08-26T07:55:46Z","title":"Beyond the Textual: Generating Coherent Visual Options for MCQs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:37.994242Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.18772"},"observation_digest":"sha256:cd1c0e96c693c46a562c02ccef2bd1b82a5cecf0608368af1857469cfd1db84d","observation_id":"49e17bd7-3278-408f-ac68-8555d4081583","resolution":{"observed_at":"2026-08-05T16:17:37.994242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2508.21720","last_updated":"2026-06-17T04:32:48Z","snapshot_observed_at":"2026-08-05T14:02:48.680783Z","submitted_at":"2025-08-29T15:36:06Z","title":"PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T20:22:03.697564Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.21720"},"observation_digest":"sha256:5258b0503329c1a4362f5a8695390cad7bf3a48417a06cfed4cda90a75bdf11b","observation_id":"f12eb1c8-495a-418e-b7ac-a83a24d06c18","resolution":{"observed_at":"2026-05-18T20:22:50.786017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T14:02:50.738468Z","title":"arXiv preprint arXiv:2302.00923","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21720","last_updated":"2026-06-17T04:32:48Z","snapshot_observed_at":"2026-08-05T14:02:48.680783Z","submitted_at":"2025-08-29T15:36:06Z","title":"PosterForest: Hierarchical Multi-Agent Collaboration for Scientific Poster Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:02:50.738468Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2508.21720"},"observation_digest":"sha256:fad752bd12341962a36cc71ac63f44a119be4bafaca05289a487a4811b42d325","observation_id":"bed337f0-7045-4cf1-812a-7404b80d7d3a","resolution":{"observed_at":"2026-08-05T14:02:50.738468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c5944fcdd8aff7f09b78655b5ed3a2b483bec8f254a83e523e214dd54441b7fd","observation_id":"b3b56c74-004b-42ff-9712-d07230ee392a","resolution":{"observed_at":"2026-05-18T19:21:48.502694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.04123","last_updated":"2026-04-11T07:57:17Z","snapshot_observed_at":"2026-07-06T22:23:59.676849Z","submitted_at":"2025-09-04T11:37:06Z","title":"TaleDiffusion: Multi-Character Story Generation with Dialogue Rendering","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-18T19:02:01.962726Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.04123"},"observation_digest":"sha256:60c9dfdcba466553970acf0ca44a789df3d641f0a1ad38684e52ec12df174fb4","observation_id":"404ae37e-9036-44d2-bbbf-d0cd38a23689","resolution":{"observed_at":"2026-05-18T19:02:48.699721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T12:06:04.601125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.04502","last_updated":"2025-09-02T04:49:51Z","snapshot_observed_at":"2026-08-05T12:05:59.668745Z","submitted_at":"2025-09-02T04:49:51Z","title":"VaccineRAG: Boosting Multimodal Large Language Models' Immunity to Harmful RAG Samples","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T12:06:04.601125Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.04502"},"observation_digest":"sha256:4448cf6d064ef57f4815fc89c3e0c521d1d49a9ad5e39f7e833d30935b504cb4","observation_id":"08d127c0-8ffe-468d-a1e3-8b43d1295ee4","resolution":{"observed_at":"2026-08-05T12:06:04.601125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T05:34:40.404905Z","title":"Zhang, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05226","last_updated":"2025-09-05T16:40:13Z","snapshot_observed_at":"2026-08-06T03:16:59.543245Z","submitted_at":"2025-09-05T16:40:13Z","title":"Less is More Tokens: Efficient Math Reasoning via Difficulty-Aware Chain-of-Thought Distillation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T05:34:40.404905Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.05226"},"observation_digest":"sha256:78ecd191d77b2329a25ef9123d25c27a29da652824122fbd6ec1979a0a19dbd6","observation_id":"b5d984ed-8311-487e-89d2-a0f09c327f24","resolution":{"observed_at":"2026-08-05T05:34:40.404905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T22:33:30.357545Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07287","last_updated":"2025-09-08T23:44:00Z","snapshot_observed_at":"2026-08-06T22:54:10.353309Z","submitted_at":"2025-09-08T23:44:00Z","title":"Paladin: Defending LLM-enabled Phishing Emails with a New Trigger-Tag Paradigm","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T22:33:30.357545Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.07287"},"observation_digest":"sha256:d9809571d248406d904edc9e67eeee41dfa6d76702dcbdb3aa954953d1b08b0f","observation_id":"fd290b6e-04a7-40ac-837a-f2d139744a8c","resolution":{"observed_at":"2026-08-04T22:33:30.357545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T19:27:21.029581Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09286","last_updated":"2025-09-11T09:22:16Z","snapshot_observed_at":"2026-08-07T15:22:39.720731Z","submitted_at":"2025-09-11T09:22:16Z","title":"Visual Programmability: A Guide for Code-as-Thought in Chart Understanding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T19:27:21.029581Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.09286"},"observation_digest":"sha256:38876d278e595d7008209b8b31764ccd2eb72f66416ebbb97e71c47cf6d489b5","observation_id":"b99f0ba0-d221-4aeb-8735-b58887b3660c","resolution":{"observed_at":"2026-08-04T19:27:21.029581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.10026","last_updated":"2026-04-14T03:34:18Z","snapshot_observed_at":"2026-07-06T22:29:06.119014Z","submitted_at":"2025-09-12T07:45:44Z","title":"LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T17:53:08.136677Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.10026"},"observation_digest":"sha256:3dc21688bb2746628d5d61163e7b761dbf2db1a2c8bfb17caf0f69b93ffdb5ce","observation_id":"10edc72e-370e-48c3-a010-ed41b3df0c99","resolution":{"observed_at":"2026-05-18T17:56:42.215334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.23322","last_updated":"2026-04-09T10:37:26Z","snapshot_observed_at":"2026-08-02T12:34:37.611019Z","submitted_at":"2025-09-27T14:13:41Z","title":"Mitigating Visual Context Degradation in Large Multimodal Models: A Training-Free Decoupled Agentic Framework","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-18T12:31:25.257879Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.23322"},"observation_digest":"sha256:9478a000bd181ca269129540393355cece0516c5024ceedaa783d3df4babf3ab","observation_id":"f569ab2b-1434-4ef7-a2e8-4cb778f39a6e","resolution":{"observed_at":"2026-05-18T12:32:36.326769Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T18:41:30.307521Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.24251"},"observation_digest":"sha256:1955a8833b5a80ab7c0ce87926b85fc11755e7b916b2da79907bb58002cb446a","observation_id":"acacc8a5-596d-4c7b-9904-daf4fc61de55","resolution":{"observed_at":"2026-05-15T18:41:30.484640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T13:30:10.620448Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:9afeab77cd032d80cadde58fab0b6da9ce485758c71a26ba68261c7aac860f47","observation_id":"a02e3b88-324c-4d34-a2a8-06494d1fc7f0","resolution":{"observed_at":"2026-05-18T13:31:24.813779Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T13:43:00.973423Z","title":"Multimodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T13:43:00.973423Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:c3a9e7e37b858e9aa930cf24a15b0061f519aacac729888774d1aed26eb1c169","observation_id":"966e5e11-9439-4d79-9afa-1a7c4ef1f8f2","resolution":{"observed_at":"2026-08-04T13:43:00.973423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T11:26:06.881567Z","title":"Multimodal Chain -of- Thought Reasoning in Language Models , May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04704","last_updated":"2026-05-28T12:47:58Z","snapshot_observed_at":"2026-08-04T11:25:51.992516Z","submitted_at":"2025-10-06T11:17:56Z","title":"AtomWorld: A Benchmark for Evaluating Spatial Reasoning in Large Language Models on Crystalline Materials","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:26:06.881567Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2510.04704"},"observation_digest":"sha256:b05e488190ba11b155b82b0a5cdabbede5eba14051f79ac7cb06f53315e06758","observation_id":"a1146530-2b00-4072-87af-e1c387abf8e9","resolution":{"observed_at":"2026-08-04T11:26:06.881567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2510.08945","last_updated":"2026-05-21T22:37:46Z","snapshot_observed_at":"2026-07-06T22:32:17.816175Z","submitted_at":"2025-10-10T02:51:47Z","title":"FATHOMS-RAG: A Framework for the Assessment of Thinking and Observation in Multimodal Systems that use Retrieval Augmented Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T08:13:05.328746Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2510.08945"},"observation_digest":"sha256:600adf8c5594d45cd97e4e5e517281eb4f476ce7f86842f6722328aec00ce644","observation_id":"fbb8b3e7-44e2-463f-b63b-96bff2c815aa","resolution":{"observed_at":"2026-05-25T08:15:33.896676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-04T07:54:08.862155Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.23509","last_updated":"2026-07-18T06:00:54Z","snapshot_observed_at":"2026-08-04T07:54:06.302346Z","submitted_at":"2025-10-27T16:47:15Z","title":"Logic-Guided Socially-aware Robot Navigation World Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T07:54:08.862155Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2510.23509"},"observation_digest":"sha256:bf7c217e568290acd905f527af9dcc82be73f545190bf98dfed0d2487e92b193","observation_id":"7fa3ef87-aebe-42b7-9771-3b3e10d9fd4d","resolution":{"observed_at":"2026-08-04T07:54:08.862155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2511.04570","last_updated":"2026-04-07T09:55:11Z","snapshot_observed_at":"2026-07-30T01:17:08.732833Z","submitted_at":"2025-11-06T17:25:23Z","title":"Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T00:54:24.641649Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2511.04570"},"observation_digest":"sha256:5005946a043623a875bc4d2dda52e9e2a6a25f6e4e482973cfe2dc274eda5c0f","observation_id":"95dbf2cf-d48c-4ec7-bdbc-ebde4de5fcc8","resolution":{"observed_at":"2026-05-18T00:55:35.066474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-03T19:04:29.050993Z","title":"Multimodal chain-of-thought rea- soning in language models.arXiv preprint arXiv:2302.00923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.02456","last_updated":"2026-06-29T04:23:52Z","snapshot_observed_at":"2026-08-06T23:32:01.589684Z","submitted_at":"2025-12-02T06:30:10Z","title":"See, Think, Learn: A Self-Taught Multimodal Reasoner","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T19:04:29.050993Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.02456"},"observation_digest":"sha256:8187ba6341a3e4e88801bab209fd664625f34f14695ddf7d47d092b872997863","observation_id":"896da98d-637d-49c1-963f-0bdd2193e065","resolution":{"observed_at":"2026-08-03T19:04:29.050993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-02T09:59:18.546374Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:95afb048223352e5bea8127a0147a4b27bc7484546d30ec58a655c324c104d0b","observation_id":"f9d79ef7-388b-474a-8279-1dbab18537fe","resolution":{"observed_at":"2026-05-17T02:11:26.653988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:7ac59fe111c30b8690581d066f8d79c84cad44362c2032366e43d73c9346a3c5","observation_id":"28a8e559-bec1-457c-8adf-692dc8754528","resolution":{"observed_at":"2026-05-17T03:11:29.850303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-03T18:51:49.421484Z","title":"Multimodal chain-of- thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:49.421484Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:a76e81a4975925bd9f09447afa02c6fd4f1566ffeb632af963f4821e06ffac87","observation_id":"ad87133e-003b-4ec7-921c-3fec66bddc16","resolution":{"observed_at":"2026-08-03T18:51:49.421484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:26d0f2b372cf846daab5b8399b225354d1e6f3c27c771eed8fa332fd6d81990a","observation_id":"52cad193-c475-4773-909f-2c9223e7d384","resolution":{"observed_at":"2026-05-16T23:03:38.874678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2602.11731","last_updated":"2026-04-29T01:08:35Z","snapshot_observed_at":"2026-08-07T03:47:17.716581Z","submitted_at":"2026-02-12T08:54:02Z","title":"Thinking with Drafting: Optical Decompression via Logical Reconstruction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T03:28:32.264246Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2602.11731"},"observation_digest":"sha256:03c8e724a1e29499c28c70d9a8ce2b7f7ed3b24622df090e7d30541b7234d573","observation_id":"875f1f99-90de-4a37-a7fe-5b2f3508d4f9","resolution":{"observed_at":"2026-05-16T03:30:32.904559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T19:58:29.065846Z","title":"Multimodal chain-of- thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:29.065846Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:7ebd38b7cdfa2c773300e01b1f2e001c5ccfa25f0407c128001fbbce3741d859","observation_id":"cf8729e9-749d-462b-b1be-58fc8eed83dd","resolution":{"observed_at":"2026-08-02T19:58:29.065846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T17:26:40.248532Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-05T15:21:17.681677Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.248532Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:601c304722a85dacfa5f7d85d3cc02e83f089ff41e1167d757d0367f76123cd7","observation_id":"dcc206f7-9f28-4832-923d-3791a8b20e3d","resolution":{"observed_at":"2026-08-02T17:26:40.248532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.00013","last_updated":"2026-04-12T03:30:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T12:48:41Z","title":"C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T13:51:40.334057Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.00013"},"observation_digest":"sha256:71597978de208b3ad2244335329b3aaa8bddaed819b1941b4949114e9cbaae27","observation_id":"444c27a7-b7a1-4af7-bbf6-1f567d200795","resolution":{"observed_at":"2026-05-15T13:55:53.312853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.04017","last_updated":"2026-04-05T08:29:52Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T08:29:52Z","title":"GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T17:31:08.575993Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.04017"},"observation_digest":"sha256:78034d4b96e39bd1d02f47e52689945b7b149d9f904fd5870649c98943963093","observation_id":"8f0119c2-76f2-4f07-8b49-f3d5c788ac6d","resolution":{"observed_at":"2026-05-13T17:33:02.326459Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:b524a31c6b96a607d0de44faa43789edd6b85edd5c18f026cf4f60f93c258d0a","observation_id":"0113667c-c002-43ba-bb8e-7fee2dcf4db3","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-06T14:41:06.876472Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:264cbccb7bb6d992abd055d4c5663372433ca314a6b37b2247cb5c4b6f74df27","observation_id":"d3cff9b5-13fd-4e3f-a775-4f383422ced1","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.07518","last_updated":"2026-04-08T18:52:27Z","snapshot_observed_at":"2026-07-06T22:55:46.307881Z","submitted_at":"2026-04-08T18:52:27Z","title":"Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:33.231488Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.07518"},"observation_digest":"sha256:d8c3e4284aef285045f52db4b449f46cd9ce483794e488f573f05bbc99059901","observation_id":"008179b4-bddc-4f19-8315-2888e22e7dcb","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.09757","last_updated":"2026-07-19T04:58:08Z","snapshot_observed_at":"2026-08-05T07:49:47.069678Z","submitted_at":"2026-04-10T16:03:03Z","title":"MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:03:14.408704Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.09757"},"observation_digest":"sha256:2a32084b0dbf5332231724bdd0c87259e74ac273df078c7ec1ed12091c240520","observation_id":"e53bfd75-6068-4707-8f14-54508e3e4c6d","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-02T16:33:55.007487Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.09757","last_updated":"2026-07-19T04:58:08Z","snapshot_observed_at":"2026-08-05T07:49:47.069678Z","submitted_at":"2026-04-10T16:03:03Z","title":"MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T16:33:55.007487Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.09757"},"observation_digest":"sha256:9c00ae7a09390d69310ad953c0d64eb674a402cbd44ff04148c53a6541a08843","observation_id":"f911754d-c845-4c89-95e1-b2499f7c68c8","resolution":{"observed_at":"2026-08-02T16:33:55.007487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:725063c41ef09c6caf1df3dfc870342eec81bd7804422a0a0bb8cc882a4bfdef","observation_id":"448c12b8-1bcb-426a-9ce3-913217c88572","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:a6ad8386c83d77b035a3f9e29e3b874678513cf2f75b1b1a5f9a44fe33a702c6","observation_id":"6f5664c5-b3a7-497f-b10c-d2c473c6d21e","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:40f01e26f546cacc4318341096a675e47662ac383852d7aec25fdf40f995cceb","observation_id":"51135fcb-62cc-4db5-ac2e-48761b49e915","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10517","last_updated":"2026-04-12T08:14:49Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:14:49Z","title":"From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:36.083682Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10517"},"observation_digest":"sha256:128ccb4e750de0644737f0dc34c080628d1ab96636d527b13bebb00b5936ac6f","observation_id":"5c0298ad-2e73-42c0-9622-f8d8f9f2c175","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.15301","last_updated":"2026-04-17T07:02:15Z","snapshot_observed_at":"2026-08-02T19:53:21.062944Z","submitted_at":"2026-04-16T17:57:24Z","title":"Think in Latent Thoughts: A New Paradigm for Gloss-Free Sign Language Translation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-10T11:44:13.158397Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.15301"},"observation_digest":"sha256:1dd38e537d45b3e7b046473fc929df5767e3abbfe9c648ac75727abb72b1b721","observation_id":"ea6e9f77-d437-4e91-8bd0-85051ddd1c56","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.15705","last_updated":"2026-04-17T05:24:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T05:24:04Z","title":"Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:07.531338Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.15705"},"observation_digest":"sha256:7ac4902c9fcfcc53364bbc55c18a471c2d73d25e101655438a63d9d30a9480f0","observation_id":"11e719fb-f938-4b88-8698-ce05a887291d","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-02T11:12:35.059224Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:33.668451Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:5f5367741498058dfd1004895c947fe87feb071f56bbb8ab580f3bb2259c19ce","observation_id":"632feb4d-d129-48f4-8894-9904f46c762c","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-02T11:12:35.059224Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-05T04:29:52.480873Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:4d40b0a32e0597e2f7b24cc30fce56e8007beb8ac9b3d4a4377bb248d2368514","observation_id":"08694fb4-b97b-4ec9-8c88-7477b0e84e8f","resolution":{"observed_at":"2026-07-05T04:30:40.726775Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20755","last_updated":"2026-04-22T16:44:33Z","snapshot_observed_at":"2026-08-01T03:59:28.787636Z","submitted_at":"2026-04-22T16:44:33Z","title":"V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:32.613988Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20755"},"observation_digest":"sha256:c7b104939f358d6165bcc1b341be1adfa5a6b50493eb81b289c13ef89f5678e4","observation_id":"57a14436-1756-4103-b0de-8b5e7cd5e0a8","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.20878","last_updated":"2026-04-11T09:38:45Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-11T09:38:45Z","title":"AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:10:32.154619Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.20878"},"observation_digest":"sha256:ac7d47081cce93d46b199ee7d38c7f8714901b0b9b96f466e4a2d27de0e0c5b9","observation_id":"6a9a443f-a542-4e16-a1c1-70402f1e6416","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.21079","last_updated":"2026-04-22T20:44:24Z","snapshot_observed_at":"2026-07-06T23:07:41.856444Z","submitted_at":"2026-04-22T20:44:24Z","title":"Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T00:16:34.362000Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.21079"},"observation_digest":"sha256:cca41e3200c81e778710d6f6b9c9fd08707f7b6679f32ad59f062f7342305c57","observation_id":"34e1e90d-c6a2-4288-a084-d4d338a30b6b","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:0423080a2c9f00249d6732b44c260682a743d560b665b7347e195ab6d10b3ced","observation_id":"ac698ec7-2f60-4fe5-bcd7-7bfee93b7393","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2302.00923/citation-record","integrity":"/paper/2302.00923/integrity","json":"/paper/2302.00923/citation-record.json","paper":"/paper/2302.00923"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"37f0c9e5-2cd0-4ce1-9bd1-ed73296c8f48","year":2018},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8d7b0913b7dbba8ff46dd94cb91f316e4f00edb152df39aac31576e90b102cee","observation_id":"7ad35ea1-2a60-458b-b4ef-201ffec9a45b","resolution":{"observed_at":"2026-05-12T18:12:27.663644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.00636","doi":"10.1109/cvpr.2018.00636","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anas Awadalla, Irena Gao, Josh Gardner, Jack Hessel, Yusuf Hanafy, Wanrong Zhu, Kalyani Marathe, Yonatan Bitton, Samir Gadre, Shiori Sagawa, et al","venue":null,"work_id":"a4282939-a23d-4958-819e-2b9e560e7236","year":2018},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:7fd891dac8deaf41870fcf6ab529a0b2c14fa7dadeef61c9b3d0ca01fb1148f5","observation_id":"f8ba0729-c688-4567-a7bc-d91945d5185d","resolution":{"observed_at":"2026-05-12T18:12:27.452441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b2f1c95c-096f-4f84-9bca-89f670ad3c12","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:58e4412f730c625dd871e280c10394328d92fbf77778f50d221fca4c5f2f91e5","observation_id":"e4e8e4e3-9895-415e-b56d-399c80cac386","resolution":{"observed_at":"2026-05-12T18:12:27.578573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"57cfd5d0-061a-4a1c-a98f-d421937f34a6","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8d3e4a39a11a97683b29b9fcb23a544352e3368032d57b0e97d175431f3b8d9b","observation_id":"bf3623b3-4212-4668-aad6-c56d7d99d596","resolution":{"observed_at":"2026-05-12T18:12:27.583463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"002ecb5e-c3d3-418a-9b3d-4b800ed2e6bd","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:5b530acbc0a460f6164f7c45dd1d3a643eec60c17adcdd21dab0ef71a3c50585","observation_id":"821d6c3a-3805-4fef-8cd1-693e7d52fd03","resolution":{"observed_at":"2026-05-12T18:12:27.587969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":"2211.12588","doi":"10.48550/arxiv.2211.12588","metadata_source":"pith","pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","venue":"cs.CL","work_id":"618aa44c-a6c6-425c-abce-8aa8aa842921","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:50f1097790c8fac9754f85ed1f0f9d7b12545c13da1bec86f0d1c08b03ff9d1b","observation_id":"1527499e-f4fe-4435-9f89-748255a9274c","resolution":{"observed_at":"2026-05-12T18:12:27.499329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05226","last_updated":"2023-01-12T18:59:50Z","snapshot_observed_at":"2026-07-06T14:40:50.270024Z","submitted_at":"2023-01-12T18:59:50Z","title":"See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2301.05226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.05226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"See, think, confirm: Interactive prompting between vision and language models for knowledge-based visual reasoning","venue":null,"work_id":"ea2e7413-2359-4efb-b9e8-5b449f6eb566","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2301.05226","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8d409f1ba5b4ee2b967e18e72fcf3b90edf21faa69d135c8a34a55da17f4bb16","observation_id":"f804bb78-8fa3-4b9b-918e-eff6e51e1459","resolution":{"observed_at":"2026-05-12T18:12:27.534776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:352684b1593fc2121c81bdecf8ea4557c46aa99d7e2e21c1f9bedab2dd966e4e","observation_id":"9af814b1-823f-48f3-8120-6ede79c5558f","resolution":{"observed_at":"2026-05-12T18:12:27.549367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:3df6d9592a3c20dba6b097b4dcc2a10fbf9166229c0a9ce0fc423cef98050905","observation_id":"2c0d5a16-c27b-4b8b-9306-1d1badee10fd","resolution":{"observed_at":"2026-05-12T18:12:27.494483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"9f1d35ab-285a-4596-b6d6-0e3ba9598a41","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8934da6df10dcf972149c81caccfa78fba81914835b8448ad117b4879deaec9b","observation_id":"63675545-d366-4a2b-b33f-9d263b3ea93c","resolution":{"observed_at":"2026-05-12T18:12:27.592340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7de93f0f-8430-446a-bc5e-982e0fa266c6","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8fe27a9efd04d69a2f953f75df6f1b994bad0718a20c82ca50ff569ea9516730","observation_id":"f721fb64-450b-433f-a967-8dbdcee5b4d6","resolution":{"observed_at":"2026-05-12T18:12:27.596429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00720","last_updated":"2023-01-30T09:15:49Z","snapshot_observed_at":"2026-08-07T05:39:17.046417Z","submitted_at":"2022-10-03T05:33:27Z","title":"Complexity-Based Prompting for Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2210.00720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.00720","snapshot_observed_at":"2026-07-05T10:20:57.247384Z","title":"Complexity-based prompting for multi-step reasoning","venue":"cs.CL","work_id":"346e5048-02d1-410f-b165-2e5ffdafc2a5","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2210.00720","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:9dfb891f44922fee31f6f3d5638bcecae31a4962053e2c7e379d22e95f8bffbd","observation_id":"57f5e2e1-7ed5-46d9-bc64-78f66b55bdae","resolution":{"observed_at":"2026-05-12T18:12:27.528925Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51e010b9-f4ab-4c90-93cb-7e858efdf274","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:5117c30162a9a950ac5873525dca04535b497d4053d9804906980f7c6e5ac469","observation_id":"7c749774-e285-4b05-a420-07d68890ab93","resolution":{"observed_at":"2026-05-12T18:12:27.600330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00680","doi":"10.1109/cvpr.2019.00680","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yaru Hao, Haoyu Song, Li Dong, Shaohan Huang, Zewen Chi, Wenhui Wang, Shuming Ma, and Furu Wei","venue":null,"work_id":"27e8a78a-7373-49eb-8bad-f76570432e3b","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:0b70dc835960b5d738143fb90dcd03674c1775380ff8a9ef478c53cca5b83149","observation_id":"bf5eb678-d7db-4c56-892c-3a45cce3149c","resolution":{"observed_at":"2026-05-12T18:12:27.437051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"a9f655e5-44c6-4592-be26-8516ccae64a8","year":2016},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:48edb0c546fabc93da02b375cfcbe74d43cbd5287f3ac5f4a0512303084f0cee","observation_id":"b9404238-ea89-4c8a-a7a9-fc0f89a477d4","resolution":{"observed_at":"2026-05-12T18:12:27.604691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.90","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:16:59.350888Z","title":"Deep residual learning for image recognition","venue":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","work_id":"b353bda2-591d-479a-9c8b-22dfcba12431","year":2016},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:d63fb39d2f8a3c86667ca3a84d075ec228526d1bb3357b82db4ee6193fe19a90","observation_id":"f6b26b5f-fd45-4736-93ee-998c0b7fd531","resolution":{"observed_at":"2026-05-12T18:12:27.471413Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-03T17:08:01.374485+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T17:08:01.374485+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2212.10403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-07-02T19:27:18.690866Z","title":"Towards Reasoning in Large Language Models: A Survey","venue":"cs.CL","work_id":"d920638f-5831-406f-9ceb-41c99337b692","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:1deb771cea941bddd6432e30cd5b746c9e8b5dcf8bf10099d107cd6b067f37e0","observation_id":"be82e526-8f40-47a9-b560-0438bdaef110","resolution":{"observed_at":"2026-05-18T13:22:30.236738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UNIFIEDQA: Crossing format boundaries with a single QA system","venue":null,"work_id":"10157b4f-9aea-4ee4-8ea2-a07a818e32e8","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:304a4fe9f352bf72a5abc96a4a3961fe51828e675beaba5c9482decc2570dbe7","observation_id":"81b9afc3-05d3-4bed-ad07-0dffd1416a68","resolution":{"observed_at":"2026-05-12T18:12:27.608549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.findings-emnlp.171","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In Findings of the Association for Com- putational Linguistics: EMNLP 2020 , Trevor Cohn, Yulan He, and Yang Liu (Eds.)","venue":null,"work_id":"50e0e9a5-ff26-4eaf-8c82-4d5305b3f419","year":2020},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:f259bf37dfec0f15fb9bfe59e56e478451885407aa31f1400bdda7c37ad518c2","observation_id":"10537ba7-d59b-4eaa-b875-d2f3a9c9f277","resolution":{"observed_at":"2026-05-12T18:12:27.446265Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bilinear attention networks","venue":null,"work_id":"9ff258ed-1bb1-49d7-998e-d0c8249e3b32","year":2018},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:20303f0ab2c46d7f83f26ca2b8baa8a815240fd95681a0e59e988f7fb8f811b1","observation_id":"b2e7e6eb-0e9c-45d5-a9cb-79dd1201040f","resolution":{"observed_at":"2026-05-12T18:12:27.612252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision","venue":null,"work_id":"8d665133-648e-4875-9b39-a6836771066f","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:93c27b4cbd79b6a2d7eacc1e0bea4fd5a7357fc5b40b4e55b6b29ae36925a135","observation_id":"af4c2ac4-1ded-41fb-b907-1ea5fa78eee4","resolution":{"observed_at":"2026-05-12T18:12:27.616303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-07T04:02:08.445660Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":"2205.11916","doi":"10.48550/arxiv.2205.11916","metadata_source":"pith","pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models are Zero-Shot Reasoners","venue":"cs.CL","work_id":"d9b7eb1a-7165-46ff-9f06-d2f0b9d6f95d","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:61349ca0d7514fdc985579c1ad23034bb4c25d5c1d5e4730a23da098839148bb","observation_id":"469e3a72-906e-4e29-aeb6-58ae000298d2","resolution":{"observed_at":"2026-05-12T19:04:13.904485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.438","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On vision features in multimodal machine translation","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"51bc5112-3603-4009-a01d-a8828f99c486","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:4c02fad7f9dec3a81a298af49903b0fda10f86e04bd39a76120f80d516994f2a","observation_id":"9e995384-b5ff-45ab-971a-788f8649b6b8","resolution":{"observed_at":"2026-05-12T18:12:27.466782Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02336","last_updated":"2023-05-24T04:08:08Z","snapshot_observed_at":"2026-07-06T13:17:41.206878Z","submitted_at":"2022-06-06T03:38:36Z","title":"Making Large Language Models Better Reasoners with Step-Aware Verifier","version":3},"cited_work":{"arxiv_id":"2206.02336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.02336","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yifei Li, Zeqi Lin, Shizhuo Zhang, Qiang Fu, Bei Chen, Jian-Guang Lou, and Weizhu Chen","venue":null,"work_id":"43823128-e3c9-4d2e-8e37-8e23c025e9d0","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2206.02336","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:d15a8be2cf77448f95f1dea67a4c70dbd669a81d1f38383c0e72e0f9a79fe2ea","observation_id":"0fb9d7f0-8e94-4370-a83c-3715e78ae4a6","resolution":{"observed_at":"2026-05-12T18:12:27.511336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-07T02:52:46.435647Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":"2209.14610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-07-05T17:41:17.457873Z","title":"arXiv preprint arXiv:2209.14610 , year =","venue":"cs.LG","work_id":"b02aa44e-3fa1-4e2f-a1d4-adc73c214fdc","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:6335acc7cb1c3e19d257bf0a7147102e5845d7c8b6621506c1b1884e9dff94f8","observation_id":"78cad326-9ff8-4673-99e7-855a21908352","resolution":{"observed_at":"2026-05-12T18:12:27.523797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-07-06T14:31:38.001143Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":"2212.08410","doi":"10.48550/arxiv.2212.08410","metadata_source":"arxiv_reference","pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Mallinson, J., Adamek, J., Malmi, E., and Severyn, A","venue":"arXiv (Cornell University)","work_id":"cde44144-7045-4c56-a99a-f8c35fd5de98","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:129ce317ab9406c2ac040d049a91166ea751329a2ca756ffbf58f98b6e65a3d3","observation_id":"656bbdf0-841d-4e84-98e4-efd34d95cc44","resolution":{"observed_at":"2026-05-12T18:12:27.517396Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"0f608e16-b3d1-4329-b24f-66532f223033","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:5ec792d3dffaba992dca02d0dacd5928ccd1e6b2a2a35dd2ebf3297f21003b58","observation_id":"a19888a4-dac2-4fbd-baa1-90ca8d1c3b4f","resolution":{"observed_at":"2026-05-12T18:12:27.619807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f40a9a0-ba36-49bf-9a11-69cc4ba67a8f","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:682765f272beb170c37549b9871b809fa5b8df122f01d87ed91cd25dd8732e51","observation_id":"4ef36915-1e9e-4c8a-afe9-9b6ffccbdbb3","resolution":{"observed_at":"2026-05-12T18:12:27.623055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8dd86c81d2ec9351451bbf2421eec9ac4e8d2d85cb0d8dd228771a0fb6854354","observation_id":"ee7709c8-bc65-4e82-a76c-a6167080d958","resolution":{"observed_at":"2026-05-12T18:12:27.539613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:8bff1c9d767ea2dc14e16c512b66ef1f00f069e0d717a9b83a8232596b96186a","observation_id":"cda73128-84cc-44a0-a79f-d665ea0a59e4","resolution":{"observed_at":"2026-05-12T18:12:27.544680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to retrieve prompts for in-context learning","venue":null,"work_id":"f37dfbd6-b61c-4258-ade6-8e4ce4b1edce","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a00ba6ce43a079719c87835006ecf9fecfd8c92705067ea24c7c04f61ee6868b","observation_id":"e0393ae7-7a86-4e00-8d6f-cbad4c222670","resolution":{"observed_at":"2026-05-12T18:12:27.626501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.naacl-main.191","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://aclanthology.org/2022.naacl-main.191","venue":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","work_id":"296fa0b3-6893-4f3b-91ed-fdc7880ae1ab","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:6da7a38e80505aa7ecd13d11c15aeba94f789c34a0ad7fd778c59d8d7d67cdae","observation_id":"b00368f9-1202-4afe-97c0-d849b4eff5f2","resolution":{"observed_at":"2026-05-12T18:12:27.457467Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alpaca: A strong, replicable instruction-following model.Stanford Center for Research on Foundation Models","venue":null,"work_id":"afd33db5-1cd1-4978-bece-1569f236446d","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:e3cf42e17a18471b8e21dd4f0e0011d6aa5b57e14ee7add5f4abd28b8b5635bd","observation_id":"aeff0bf7-c854-42ec-9812-2e265e51ffe8","resolution":{"observed_at":"2026-05-12T18:12:27.630240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":"2201.08239","doi":"10.48550/arxiv.2201.08239","metadata_source":"pith","pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LaMDA: Language Models for Dialog Applications","venue":"cs.CL","work_id":"1b66d0a5-f6ae-4332-8025-c662dc64b238","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:939ef6f25dcab65732e9181625a01f27033ef91d329ecab23c81199187267081","observation_id":"273863e7-76eb-4d25-aac4-9bb6dbc8f215","resolution":{"observed_at":"2026-05-12T18:12:27.555158Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"ac4ed9ac-e750-4fb9-b3f7-668b6d9bbd15","year":2017},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:275b5c17cc19cf7c7b8c59e9e4b381212f8fb68ebfc58224eced5b40cdfbd9c7","observation_id":"71bcf958-0f7f-439a-b194-fcb8e5285cb6","resolution":{"observed_at":"2026-05-12T18:12:27.633657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:6f394be5ee6d7848777243df7fb53f87baff557558d43f904bbecca502a4e43c","observation_id":"af839bf3-d430-4853-9a5c-36811a6a1d97","resolution":{"observed_at":"2026-05-12T18:12:27.560610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.480","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2021.acl-long.480","venue":null,"work_id":"21704fd4-0d57-4bd2-a10a-56c555c64a9a","year":2021},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:4960473d05bf3c77080bfe2b1a60bed45c75e9cf9371ddbb6f12c259816bc043","observation_id":"cae2e0b5-7529-438c-9b59-aaaf43daedd2","resolution":{"observed_at":"2026-05-12T18:12:27.441860Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep modular co-attention networks for visual question answering","venue":null,"work_id":"2dabfe30-af03-49b5-97b4-7aaabb9917d7","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:0409fbe21f8eaa65221de6c68b1ee927bd333aaf38b2fc9fc87559089f168fee","observation_id":"d7d72da8-8c0d-471a-9b48-539049a53ba9","resolution":{"observed_at":"2026-05-12T18:12:27.637169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00644","doi":"10.1109/cvpr.2019.00644","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"78752402-24b7-46fa-bf8c-57dc84aa463f","year":2019},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a1e809b0be1504b9450b3c036f826d80a6f578b57eb45dd326f77417098d1163","observation_id":"396c4dd5-6a7c-4251-84da-6fe672dfbd37","resolution":{"observed_at":"2026-05-12T18:12:27.463247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":"2303.16199","doi":"10.48550/arxiv.2303.16199","metadata_source":"pith","pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","venue":"cs.CV","work_id":"5c44e6f5-82ca-4461-9fc1-d630f3bfa3e1","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:e356a7684361b12b82e5ff5b7629232adad29a7c85a47a9bfd0b8a13f6761db4","observation_id":"80262818-848b-4c79-82ef-eaeef4822ba2","resolution":{"observed_at":"2026-05-12T18:12:27.485002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.323417","doi":"10.1109/tpami.2023.3234170","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal multimodal representation for language understanding.IEEE Transactions on Pattern Analysis and Machine Intelligence, pp","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"b7e9dc40-5ec6-42e2-88b9-5c88560e31ff","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:deb15ea4271e2dbd154f20310a90f3a7d4250959523cfd4a70ca6c0b8a0857ff","observation_id":"1a39ba30-2706-4a79-bdf0-a3b42487b1f1","resolution":{"observed_at":"2026-05-12T18:12:27.478103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":"2205.10625","doi":"10.48550/arxiv.2205.10625","metadata_source":"pith","pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","venue":"cs.AI","work_id":"7e58c111-4666-4996-b5ad-1c8efd433083","year":2022},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:43e6fd7c30d5cdf12b3cd92ae7201c9b5268051afaccc82e0c10ee9ad860dc7c","observation_id":"21b84276-9bbd-43bf-a97c-fbbef837aa08","resolution":{"observed_at":"2026-05-12T18:12:27.489391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Here, we present additional examples to illustrate this phenomenon, as depicted in Figure","venue":null,"work_id":"0817c5c1-42f9-4d18-86c9-d287a4242621","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:2789e08532c5f4b8302282d0a7b88ed223cb51c715080ce71e77cd910f2d24ba","observation_id":"90430afc-f885-4437-9d04-036b3cfa34bb","resolution":{"observed_at":"2026-05-12T18:12:27.641184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"844e209d-c684-4ca2-a336-59421b9c0ea5","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:be2efc72fef664779f270087aa90a07d182ff86092bea9695f2452353fbbfa5f","observation_id":"ca4ea2f9-54b9-4cff-a55e-aaccb5841a74","resolution":{"observed_at":"2026-05-12T18:12:27.644559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"•ScienceQA is a large-scale multimodal science question dataset with annotated lectures and explanations","venue":null,"work_id":"527e2729-7626-4bdc-bfdb-3a66f5b40f81","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:d51bc6e0d30c08d9baa82e81111e9eeabf9fc5abfffc8d5fc07b99ccab1efbbf","observation_id":"7ee6d94f-c59a-42ad-aa4d-28f4b8023501","resolution":{"observed_at":"2026-05-12T18:12:27.648925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The vision features are obtained by the frozen ViT-large encoder (Dosovitskiy et al., 2021b)","venue":null,"work_id":"caccd600-8372-49d6-b4c6-f50d962230b7","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:befb1532394d6b07ed5ade1f14fe47c99026bc36cfee727012ab0779f15a2341","observation_id":"2b33669f-bd67-4d6d-9e45-37dc5d96a707","resolution":{"observed_at":"2026-05-12T18:12:27.652669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14278dde-1563-4b52-be37-bcfe301509c9","year":2023},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:a271673ed13ecc942c16779f805c6c4aa3ab470424e3f6a9e42a3c835fd79a48","observation_id":"44f98b01-008f-43c5-8e58-15f468486cd6","resolution":{"observed_at":"2026-05-12T18:12:27.655991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Then, we use the generated pseudo-rationales as the target rationales for training instead of relying on the human annotation of reasoning chains","venue":null,"work_id":"564688ae-d065-464e-b2a1-56c4004c7b63","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:ff6d1287b0e4b1080fc5a5a9ffbf5e9aec66c71e81e231738f61f5f31ee2d70a","observation_id":"469e8305-0116-4b5b-9414-e3f70d359b4c","resolution":{"observed_at":"2026-05-12T18:12:27.659950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"80% 14%6% CommonsenseLogicalOthers Figure 11: Categorization analysis","venue":null,"work_id":"24491a1c-8683-480e-8d40-016fdd05cd9c","year":2024},"citing_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T18:12:27.396607Z"},"links":{"citing_paper":"/paper/2302.00923"},"observation_digest":"sha256:484a42377e8a5be76aecd377330d7596bc223d63ebd830d8dfea7543a214a942","observation_id":"80dbcc96-326f-47e6-8a24-73ef138993b1","resolution":{"observed_at":"2026-05-12T18:12:27.570799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":7,"verified_exact":19,"verified_fuzzy":17},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 100 inbound Pith citation observations for arXiv:2302.00923."}