{"as_of":"2026-08-08T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7301e3616a7ced245cb9ca6aee28789c38e2f7ab375254e41d1979fcf0c74779","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:02:24.955656Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:31:24.804270Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:d15b2ca04c58ab53f23673bfa0e6b8d012a0ce782c5362a310866cfa6e373952","observation_id":"fa2db9a7-bd56-4ed2-8723-7abfc7ee438b","resolution":{"observed_at":"2026-05-16T09:16:17.430760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:dae462854322bff15f86502fe23d45f3fcde83c490112e92a2c5cd8a42e172b3","observation_id":"3b253375-e068-4098-b7f3-71a665c88a01","resolution":{"observed_at":"2026-05-10T13:41:08.233339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T15:02:24.955656Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-08T00:05:11.317658Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:24.955656Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:90f43eadb8cfb4834a454b63054f86f80f80d5e5e7e25109427914cfcab1432f","observation_id":"a768fc52-f4a4-45e4-8ead-41ade8a9bbb9","resolution":{"observed_at":"2026-08-07T15:02:24.955656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T14:02:52.740516Z","title":"M 3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of- thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20223","last_updated":"2025-05-26T17:06:00Z","snapshot_observed_at":"2026-08-08T00:05:56.709460Z","submitted_at":"2025-05-26T17:06:00Z","title":"Chain-of-Thought for Autonomous Driving: A Comprehensive Survey and Future Prospects","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:52.740516Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.20223"},"observation_digest":"sha256:2ab041f6f3a815371f3ff83d1c20b5e2e33d511d602f5cda3f102bdf7ccaea0f","observation_id":"63d556ef-4e20-4813-b7d4-3824b8e545b1","resolution":{"observed_at":"2026-08-07T14:02:52.740516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T13:19:32.456049Z","title":"M ˆ3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of- thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22112","last_updated":"2025-05-28T08:40:55Z","snapshot_observed_at":"2026-08-08T00:05:28.641555Z","submitted_at":"2025-05-28T08:40:55Z","title":"Visual Large Language Models Exhibit Human-Level Cognitive Flexibility in the Wisconsin Card Sorting Test","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:32.456049Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.22112"},"observation_digest":"sha256:f5ca80665943239a7daeab6fecb62927989de0929e57b64e4bfcf4b49a7be6fd","observation_id":"5ef36ba9-0092-47a9-846d-f92be3f14d16","resolution":{"observed_at":"2026-08-07T13:19:32.456049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T13:12:53.142788Z","title":"M3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-07T21:24:45.521322Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.142788Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:140b565287fb3ceb0604e7596e458508018f77ed84bb15f1419f7d078d39a86d","observation_id":"d6e6e4a9-3d92-4866-95c0-a526d30c03aa","resolution":{"observed_at":"2026-08-07T13:12:53.142788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:55:12.014182Z","title":"M3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:12.014182Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:f91829a95919e7d3e8e067f70dd48a134cacb1f8fe724d87030b9563e2ce5907","observation_id":"c9ff8af9-fef5-462a-8545-4a856cbd90e8","resolution":{"observed_at":"2026-08-07T11:55:12.014182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:05:19.193447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.193447Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:204d3c8e237dff4b4d517cf6d312509eeb71f0259b2f935c5639a570fb72b65d","observation_id":"2760d9a4-0362-4c1d-a434-7a40e9ef31e0","resolution":{"observed_at":"2026-08-07T11:05:19.193447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T05:25:30.344139Z","title":"M 3cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.344139Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:466e63bc087494010e28415eae0e99640fe38001a584d986153cfd7c79aeb34e","observation_id":"5cfa213e-4e85-4600-8e5a-d68347522cd7","resolution":{"observed_at":"2026-08-07T05:25:30.344139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T05:09:18.196208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-08T00:05:08.877544Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:18.196208Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:52a3a0e8df7be952d3cf064ff62d3310c4ab83461da46a3d9464c9b930931740","observation_id":"23ace000-230b-4d70-a2f6-a22c80d74a04","resolution":{"observed_at":"2026-08-07T05:09:18.196208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T04:07:31.820419Z","title":"M ˆ3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:31.820419Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:566443f7644e2fe63e27b204599a8c137124f07ed42f7ece09292448d3d05b86","observation_id":"de2f71a6-6d3e-42c6-bc3f-951120f45647","resolution":{"observed_at":"2026-08-07T04:07:31.820419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-06T12:18:32.202517Z","title":"M 3 cot: A novel benchmark for multi- domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21924","last_updated":"2025-07-29T15:39:14Z","snapshot_observed_at":"2026-08-07T11:15:49.597365Z","submitted_at":"2025-07-29T15:39:14Z","title":"MMAT-1M: A Large Reasoning Dataset for Multimodal Agent Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.202517Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2507.21924"},"observation_digest":"sha256:dc712c41413cbbdc1c68b7c666b44fe5b86d0b6a0224bc8e2b618baa0dc65206","observation_id":"c5d95906-1dc0-47af-9f83-a6d76b8c75b1","resolution":{"observed_at":"2026-08-06T12:18:32.202517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:56:23.817544Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2508.05748"},"observation_digest":"sha256:2798a01fd8a698476757eb7cef55bab50b88d7d8ae9a7770a55be8c85f0ecea8","observation_id":"499edf28-5844-4674-ab3d-bcb80ccd7474","resolution":{"observed_at":"2026-05-15T18:56:23.872966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-05T19:03:06.028911Z","title":"M3 cot: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13692","last_updated":"2025-08-19T09:52:04Z","snapshot_observed_at":"2026-08-08T00:06:34.475015Z","submitted_at":"2025-08-19T09:52:04Z","title":"HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:06.028911Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2508.13692"},"observation_digest":"sha256:d17c963c54973bd90952c9bf1dc908879062adf6d571cbf5be51993a4db153c9","observation_id":"0fb856ae-46bb-4b18-8f01-dd3c23c85fdf","resolution":{"observed_at":"2026-08-05T19:03:06.028911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-04T18:17:16.302417Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10059","last_updated":"2025-09-12T08:46:49Z","snapshot_observed_at":"2026-08-07T01:10:15.108476Z","submitted_at":"2025-09-12T08:46:49Z","title":"Multimodal Mathematical Reasoning Embedded in Aerial Vehicle Imagery: Benchmarking, Analysis, and Exploration","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T18:17:16.302417Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2509.10059"},"observation_digest":"sha256:ec5ba1d12b9eb79e526999adbacc0dfb837102552913ef496551d8dcee288d25","observation_id":"93e0c80a-7cef-40ce-a675-08f108ee77f4","resolution":{"observed_at":"2026-08-04T18:17:16.302417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T13:30:10.620448Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:00725f442d7f132ba77a252c0449e63b267bf8deebfa919c26a1c30b1fe07ad3","observation_id":"c59e1cb9-f502-49ef-a836-ce4960afb37d","resolution":{"observed_at":"2026-05-18T13:31:24.806625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-04T13:42:59.320438Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-04T13:42:58.327870Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":4},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-04T13:42:59.320438Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2509.25699"},"observation_digest":"sha256:051bbe562870443a42c4b8a3f82cdbc71e97bb87896bb12e8b109f53ec2af388","observation_id":"c33ecb02-7b77-4bc5-b8eb-9a0400c2620f","resolution":{"observed_at":"2026-08-04T13:42:59.320438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-03T18:25:01.437413Z","title":"1, 3, 5, 12","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05530","last_updated":"2026-06-02T03:33:30Z","snapshot_observed_at":"2026-08-07T14:28:27.717799Z","submitted_at":"2025-12-05T08:41:44Z","title":"MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:25:01.437413Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2512.05530"},"observation_digest":"sha256:7a38b6d35cdf0f314561220a96ee8194f07e5ea94bba7881611f9643c23bb0ce","observation_id":"bcdf53d7-3650-4256-8c03-e7f7d95c5f10","resolution":{"observed_at":"2026-08-03T18:25:01.437413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2604.05497","last_updated":"2026-04-07T06:41:05Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T06:41:05Z","title":"Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:06:45.417233Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2604.05497"},"observation_digest":"sha256:14d43e48913dcc9b152dcc42d3dcfd182616c9abb4c894da0e72df69dba7d9ae","observation_id":"3098d1d8-c620-4482-bc2d-d54d5d21c7de","resolution":{"observed_at":"2026-05-10T23:30:50.458940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2604.14646","last_updated":"2026-04-17T11:31:53Z","snapshot_observed_at":"2026-08-02T15:11:58.102043Z","submitted_at":"2026-04-16T05:52:18Z","title":"Targeted Exploration via Unified Entropy Control for Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T10:48:27.733823Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2604.14646"},"observation_digest":"sha256:c7a3edca5a1607468d460fd82b94a44c04640299d728f35297a3cc0daa9b4ce6","observation_id":"ce225f1b-afe4-473d-8aa3-b0b5418455d2","resolution":{"observed_at":"2026-05-10T10:49:56.104547Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2604.15705","last_updated":"2026-04-17T05:24:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-17T05:24:04Z","title":"Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:07.531338Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2604.15705"},"observation_digest":"sha256:0fcb6d5eadc75b9a6f73cb6b063293571b727f0e073add390fb536b5924dd5b0","observation_id":"d1e68568-458f-4b72-a105-3d1bd065df69","resolution":{"observed_at":"2026-05-10T09:03:26.437698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2405.16473 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":255,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:be4e9877e68b633146672660c49dd5dc685551f1898f415e3d31c5790d80a50f","observation_id":"73f1b7c1-46c2-4eed-bd86-6c79507e911a","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-01T16:48:35.633314Z","title":"M 3 CoT: A novel benchmark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-07T08:03:33.617792Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:35.633314Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:8976cc8b79500e5adce7af24f488e441fc24d0e60e8e34434a1f0c885593ab01","observation_id":"ddfb857f-9aa0-4d81-9deb-23b1d1ad7ce0","resolution":{"observed_at":"2026-08-01T16:48:35.633314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.16473/citation-record","integrity":"/paper/2405.16473/integrity","json":"/paper/2405.16473/citation-record.json","paper":"/paper/2405.16473"},"outbound":[],"paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2405.16473."}