{"as_of":"2026-08-05T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2206de326692c594434595ed56657fc77ceca39151d7122bb50e42c8adcd943","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T20:10:59.264484Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T04:30:38.804702Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-23T04:32:32.712337Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"cited_work":{"arxiv_id":"2410.04509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04509","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","venue":"cs.CL","work_id":"f8fbe6d1-f696-4bb2-be1b-8f1e271bec25","year":2024},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":224,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2410.04509","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:e8f0f8002f329a9e0bac7160e2c0ad520d8f23d38408767f7136fbb39afc2cc1","observation_id":"0eabe05b-56f9-4448-8a95-946e31910d21","resolution":{"observed_at":"2026-05-23T04:32:32.716530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.04509/citation-record","integrity":"/paper/2410.04509/integrity","json":"/paper/2410.04509/citation-record.json","paper":"/paper/2410.04509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Complexity in declarative process models: Metrics and multi-modal assessment of cognitive load","venue":null,"work_id":"1ee02293-2053-435d-8aee-889440561a7e","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ed09528c7916af147f92fc1132d470b431ea5ebd5e8debb2b1769ba5c497de6a","observation_id":"391c2e3d-8ab0-4bb8-a7e8-0f1680031792","resolution":{"observed_at":"2026-05-23T20:13:25.675921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:eedea7789f069df956d60d7f7a2b512a7aee1e24baeccc93fa36482823d3a851","observation_id":"055423cd-2fb1-4a5f-a3ed-bdbab039e4d1","resolution":{"observed_at":"2026-05-23T20:13:24.713023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling laws for generative mixed-modal language models","venue":null,"work_id":"3de8cfa1-6169-4a38-bd8e-2964eaa14519","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8098e958764e92de647de0ae0006e52be19a73f87cfdc01224e445fb2fd679da","observation_id":"081df14e-80ae-4bb1-ab08-30c62b6666a9","resolution":{"observed_at":"2026-05-23T20:13:25.680024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-03T23:38:38.676420Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":"2402.00157","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-07-04T11:39:46.423009Z","title":"Large language models for mathematical reasoning: Progresses and challenges","venue":null,"work_id":"d8278850-469f-40f1-8af5-cf634483852f","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:70b718adb0041866d4bb283b5a0e996a1c7ab1e4f57faaf60252a124cc27a2c1","observation_id":"13237bbd-396e-47ce-8b20-4238944258aa","resolution":{"observed_at":"2026-05-23T20:13:24.615341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3, 2024 a","venue":null,"work_id":"5d5c93d1-bc4b-49c7-8a95-2af693520c72","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b9c15bb58248adc88feaac0a36978a75006953e652381d0648a72c33ebf2776c","observation_id":"ccb84f09-1457-4698-b7fa-8999f8a525ca","resolution":{"observed_at":"2026-05-23T20:13:25.683997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5, 2024 b","venue":null,"work_id":"d756d008-f7a3-462c-aac6-524cba9d7504","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2bbbc254b2f1b75a7628c478c303ab96a3a8379642a7388b00b72e7e05e7d5e0","observation_id":"5e6cf1ad-5f67-473c-bd17-555a775c03ce","resolution":{"observed_at":"2026-05-23T20:13:25.804632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:065569bb178f0affa079089debeeb830c6ef5e238efecae6891dc7e4153c1ebb","observation_id":"df8fda6c-3f85-440e-8684-a2f46e46d525","resolution":{"observed_at":"2026-05-23T20:13:25.026755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03917","last_updated":"2023-06-06T18:00:01Z","snapshot_observed_at":"2026-07-06T15:39:22.864048Z","submitted_at":"2023-06-06T18:00:01Z","title":"Turning large language models into cognitive models","version":1},"cited_work":{"arxiv_id":"2306.03917","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.03917","snapshot_observed_at":"2026-07-03T20:58:57.612100Z","title":"Turning large language models into cognitive models","venue":null,"work_id":"8158d1c7-7bf2-4fad-bf95-c9c2ac68f07b","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2306.03917","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:807f9b684b7029f0d0f3108e390d79d2c0c64deb4c9405b387b5caaed98653a4","observation_id":"8d8b027e-93cc-4830-a1cc-f388a5eda008","resolution":{"observed_at":"2026-05-23T20:13:25.022104Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":"6c737b23-3d39-4fd2-a682-b8081300522a","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d491d99a942fee5398bdcce6910b7a9b6197b84f3e1594879fa0aad68e7509f7","observation_id":"4ca4f385-91cd-4b24-95d3-a76458269871","resolution":{"observed_at":"2026-05-23T20:13:25.808080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4d7c699c020da981a6d6b49b087cd13e4399db420999145d7faee638b59389d6","observation_id":"3be8ded9-a037-42a7-97eb-24e30023ecc7","resolution":{"observed_at":"2026-05-23T20:13:24.993510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:94ace674267f0f687e7210d4e9211f61893ac6562a74a4aa0c2d07b26bc75739","observation_id":"ce162e8b-2af0-4b96-8ef1-f74d6e85f1d2","resolution":{"observed_at":"2026-05-23T20:13:24.981889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multimodal large language models for autonomous driving","venue":null,"work_id":"5aa45d1f-8937-4bb3-aad3-f1aefbdd3222","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c304ca2a71596a4fdd114e459ee9dd3e13811bdfddabb28d3a1ec63dd99f7d05","observation_id":"9dc97bf6-0f72-4722-8dcd-ec1e2a400ba1","resolution":{"observed_at":"2026-05-23T20:13:25.793952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advancing mathematics by guiding human intuition with ai","venue":null,"work_id":"e345c1fe-48eb-4d3d-b3d7-8a8c00d7dbfa","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b755da18814b29f50147757ec7dfbae4e0b4da65e2ff00ba7e3ba43c4685fc7b","observation_id":"16026aa9-6449-4604-a689-020543105388","resolution":{"observed_at":"2026-05-23T20:13:25.801048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11737","last_updated":"2024-07-06T05:26:33Z","snapshot_observed_at":"2026-07-06T13:55:41.552052Z","submitted_at":"2022-09-23T17:34:33Z","title":"Visual representations in the human brain are aligned with large language models","version":2},"cited_work":{"arxiv_id":"2209.11737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.11737","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual representations in the human brain are aligned with large language models","venue":null,"work_id":"142db49b-70fe-4519-ac35-4e0b61bfbcc3","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2209.11737","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d1b2aee92aa314027187e65aeb87a0ac6a9c125a8693aaab4fb9fac377e83041","observation_id":"21518bc5-3b88-484c-822b-15c1805cd1d6","resolution":{"observed_at":"2026-05-23T20:13:25.031867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Muffin or chihuahua? challenging multimodal large language models with multipanel vqa","venue":null,"work_id":"3f293718-4c26-40d2-8901-96927a8e268d","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6a02eacbbabe1f827d76fef4ff9f2577039d4dc4da0a1f2f1eae47862b49ff68","observation_id":"52922b22-c1d3-45ca-bf92-467dfa39452a","resolution":{"observed_at":"2026-05-23T20:13:25.790354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05876","last_updated":"2024-10-23T14:48:20Z","snapshot_observed_at":"2026-08-05T14:42:13.473991Z","submitted_at":"2023-11-10T05:24:04Z","title":"Trends in Integration of Knowledge and Large Language Models: A Survey and Taxonomy of Methods, Benchmarks, and Applications","version":3},"cited_work":{"arxiv_id":"2311.05876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05876","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trends in integration of knowledge and large language models: A survey and taxonomy of methods, benchmarks, and applications","venue":null,"work_id":"fe71bea2-99e2-46f5-ae9f-d2dbbac937d6","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.05876","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:873a9494b610cda3a8bbb4f5f5c4ccc3f211cbae093850175e8a4ee805ce3c4a","observation_id":"c17fe3b3-ce1f-488e-ab6a-d6b5706b8563","resolution":{"observed_at":"2026-05-23T20:13:24.742490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":"2404.01266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Isobench: Benchmarking multimodal foundation models on isomorphic representations","venue":null,"work_id":"4ee4a08a-ffd0-4312-b562-0bfb90e419c9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2b55a8230ffda980f233e7d520bac9013dd65ed847306ea88deade07c1afb4ea","observation_id":"e53d8485-5e44-4821-8c36-a047c854cde0","resolution":{"observed_at":"2026-05-23T20:13:24.891338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":"2406.12793","doi":"10.48550/arxiv.2406.12793","metadata_source":"pith","pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","venue":"cs.CL","work_id":"de9ce5af-0d8d-4b94-9793-64968d9bc06d","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2c48dee2c05ef17927cbcc3aaff4bd14e9e7b529f58184753471dbacb4a8f16b","observation_id":"33cedaae-dab5-4308-868d-eabed4c4ea68","resolution":{"observed_at":"2026-05-23T20:13:24.896437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-07-06T17:50:13.914184Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":"2403.16831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbanvlp: A multi-granularity vision-language pre-trained foundation model for urban indicator prediction","venue":null,"work_id":"6feff56a-4407-41e0-b645-b5465d08efa4","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:e78a13687c842f2ed70f7a9132df70495c57a60a398fcb2daba969e6ae7ee0d2","observation_id":"61b1e7d4-020b-45a2-a222-07c3f5485eaf","resolution":{"observed_at":"2026-05-23T20:13:24.871280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02797","last_updated":"2025-01-16T02:31:20Z","snapshot_observed_at":"2026-07-06T17:11:58.725249Z","submitted_at":"2024-01-05T13:22:12Z","title":"PeFoMed: Parameter Efficient Fine-tuning of Multimodal Large Language Models for Medical Imaging","version":3},"cited_work":{"arxiv_id":"2401.02797","doi":"10.48550/arxiv.2401.02797","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.02797","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pefomed: Parameter efficient fine-tuning on multimodal large language models for medical visual question answering","venue":"arXiv (Cornell University)","work_id":"0855448c-e4c2-4773-9a60-85a34b3344a9","year":2025},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.02797","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5f181251a9f6b8ee505798f24965d6414905d3867c4bf6b4e39de6d8c0e305a8","observation_id":"868a8b7a-3584-45a6-9cac-c12faeedf4c6","resolution":{"observed_at":"2026-05-23T20:13:24.825358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14011","last_updated":"2024-05-08T07:34:06Z","snapshot_observed_at":"2026-07-06T17:20:17.051503Z","submitted_at":"2024-01-25T08:22:10Z","title":"CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":"2401.14011","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.14011","snapshot_observed_at":"2026-06-29T08:03:13.744710Z","title":"Cmmu: A benchmark for chinese multi-modal multi-type question understanding and reasoning","venue":null,"work_id":"f45bcb08-502d-40a7-895c-7f252c90f29b","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.14011","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6408131b3450852dce9be7fed38a934f5632fba916b2ed143057f0139b55980f","observation_id":"afc6ffdf-2f90-4c99-9de8-680fd9e1e13c","resolution":{"observed_at":"2026-05-23T20:13:25.003350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8b7851701e265c3fea62cc28dea7fd20fa7d8ca56c3e12ba11a6537190205cac","observation_id":"61c2cfe1-22c8-449d-b678-ebbc4c2dbc27","resolution":{"observed_at":"2026-05-23T20:13:24.728474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":"2406.09403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-07-04T19:30:06.763408Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"6df227a2-7a70-47c8-ae06-b2d6eee27a57","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:38acf185c25f9e034d4db45ab3206dd5cd788f85fc08ac548fd85661b1940861","observation_id":"8900b923-fec1-4134-bf1e-df2e0167bfa0","resolution":{"observed_at":"2026-05-23T20:13:24.850060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11193","last_updated":"2024-10-01T17:04:22Z","snapshot_observed_at":"2026-07-06T18:31:57.866202Z","submitted_at":"2024-06-17T03:59:44Z","title":"MMNeuron: Discovering Neuron-Level Domain-Specific Interpretation in Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2406.11193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmneuron: Discovering neuron-level domain-specific interpretation in multimodal large language model","venue":null,"work_id":"f4e4a2bf-b895-4921-b285-f05ced042360","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.11193","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:3814616dd9ff4e14902c84960664f4aeeebe5b12cee41984dbc15980c2f00631","observation_id":"ec757e1c-078f-417a-9525-dc588045b480","resolution":{"observed_at":"2026-05-23T20:13:24.854814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14604","last_updated":"2024-04-26T02:34:29Z","snapshot_observed_at":"2026-07-06T18:04:04.541434Z","submitted_at":"2024-04-22T21:59:35Z","title":"Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training","version":3},"cited_work":{"arxiv_id":"2404.14604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Describe-then-reason: Improving multimodal mathematical reasoning through visual comprehension training","venue":null,"work_id":"29b530c1-80b0-4313-9e08-444e596aad3a","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.14604","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:6b7dd0e22b826040862a817f91018ce3ca6add523192339c2050db866ec55e6d","observation_id":"ccc2ac53-320e-476b-a810-444d8c4da6bf","resolution":{"observed_at":"2026-05-23T20:13:24.883048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"New generation deep learning for video object detection: A survey","venue":null,"work_id":"5a620f91-2fa0-4f60-b779-4d2a3afbe039","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:98bf9d94091d1470aeba14ac3e893aa1c2f32f32b2bda90199f3e3db22d24f52","observation_id":"1817a52e-bc03-4163-845e-e23b32334315","resolution":{"observed_at":"2026-05-23T20:13:25.797268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning instance-level representation for large-scale multi-modal pretraining in e-commerce","venue":null,"work_id":"8c12407e-598a-4ba7-9156-5e8a5529a103","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:35bd043c0efbaaa0853a709ee4902fb238d442c41ff2cdbf299f98350fc9046f","observation_id":"1e079590-4b40-45db-8bf9-78b8a447502e","resolution":{"observed_at":"2026-05-23T20:13:25.823018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models struggle to learn long-tail knowledge","venue":null,"work_id":"bad51c47-d5bd-4135-a9f7-bfae61b6c993","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:98622e69cd3b6ed40beb76b4d8998000710e0c0c60662710de9c2a3eab6f5490","observation_id":"fd89f66e-3a2a-42cd-9720-86d0ad964e32","resolution":{"observed_at":"2026-05-23T20:13:25.778712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b8f32241a296e02b85c0f11bdaf700231039606df29073ed72f45eee3600629c","observation_id":"10420b75-8e73-4209-bad3-e386591f6652","resolution":{"observed_at":"2026-05-23T20:13:24.699095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive load theory: An applied reintroduction for special and general educators","venue":null,"work_id":"146e0c8e-e393-4171-a091-31455b0bcdf9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:e9a596717ef23300c5cd3d13edcfbf6b23206144db15586f0078c19e5aa9b191","observation_id":"73b4a142-6d39-40c3-9099-df106ddfdfb6","resolution":{"observed_at":"2026-05-23T20:13:25.710619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.313381Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"d4bd155e-4771-4421-89e1-851500eaaea7","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5ccd398246db17c0b32b7f0bb53deb9426bc1e42865c668852ec06ac00314e55","observation_id":"d3ceb4ea-2a12-403f-92e2-70ad657c6bfc","resolution":{"observed_at":"2026-05-23T20:13:25.770497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"48f21f4d-a21b-4e9b-9bde-4aeb438dde54","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fb734f5fa9bf90d7110eb2d9d6c41a58040a8cd12ec697d12a9b09c9df139880","observation_id":"bc925469-d196-4f80-a92e-8f719e36071c","resolution":{"observed_at":"2026-05-23T20:13:25.766527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14601","last_updated":"2024-06-28T23:43:07Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-02T23:54:51Z","title":"Bringing Generative AI to Adaptive Learning in Education","version":3},"cited_work":{"arxiv_id":"2402.14601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14601","snapshot_observed_at":"2026-07-02T03:26:29.643289Z","title":"Bringing generative ai to adaptive learning in education","venue":null,"work_id":"c7494bd8-0942-4588-bbfa-869595bfed8e","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.14601","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:f295a43f8769ed26e3f199bbed3f26bb7ef9d2b11eb9a0ee1907fa5fe999abe8","observation_id":"ca615388-f73a-4a0b-9df3-4df1a512c422","resolution":{"observed_at":"2026-05-23T20:13:25.068959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00755","last_updated":"2024-06-02T14:16:24Z","snapshot_observed_at":"2026-07-06T18:24:01.251445Z","submitted_at":"2024-06-02T14:16:24Z","title":"Evaluating Mathematical Reasoning of Large Language Models: A Focus on Error Identification and Correction","version":1},"cited_work":{"arxiv_id":"2406.00755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00755","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating mathematical reasoning of large language models: A focus on error identification and correction","venue":null,"work_id":"db385252-3b8b-4ef3-bb00-fbbdadd75a74","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.00755","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ecd1778ecb3c7a3f0fd87d411d8878a13c260aa2f54534db94c57315d8c97b09","observation_id":"14d40029-233f-43c0-99e7-30d1188c3bdf","resolution":{"observed_at":"2026-05-23T20:13:24.840001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12023","last_updated":"2024-06-28T02:35:51Z","snapshot_observed_at":"2026-07-06T18:47:25.751118Z","submitted_at":"2024-06-28T02:35:51Z","title":"CMMaTH: A Chinese Multi-modal Math Skill Evaluation Benchmark for Foundation Models","version":1},"cited_work":{"arxiv_id":"2407.12023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.12023","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cmmath: A chinese multi-modal math skill evaluation benchmark for foundation models","venue":null,"work_id":"26b490ed-f728-417e-8ab7-491bcea182c9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2407.12023","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5cbc05ad029ab08004ea1d22cf4bc7fbcec1d5f4d431d6b532a4d32911bb8097","observation_id":"e4a372f3-2979-437e-8640-101eb7831d61","resolution":{"observed_at":"2026-05-23T20:13:24.901744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024 a","venue":null,"work_id":"e35e61af-4d6f-449c-b8db-68e023455da6","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:eddce2023efc23233cd0e655efffdcded52c614f18a9f329c07bf8ee1633dec1","observation_id":"981eb948-3025-48ee-83e2-0d6677026d28","resolution":{"observed_at":"2026-05-23T20:13:25.758496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12209","last_updated":"2024-05-20T17:52:29Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:52:29Z","title":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","version":1},"cited_work":{"arxiv_id":"2405.12209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.12209","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathbench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark","venue":null,"work_id":"871a28f2-26b4-44f2-867a-a46d44601ff7","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2405.12209","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5778b7a895610ab61f77c9d366ab4fd38c54f6a4bf9c6dff2381dbadfe30d222","observation_id":"a4fb8dfe-28f1-432b-9c51-6b8ead269c3b","resolution":{"observed_at":"2026-05-23T20:13:24.804839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17644","last_updated":"2024-06-09T13:54:09Z","snapshot_observed_at":"2026-08-05T13:54:32.157291Z","submitted_at":"2024-02-27T16:15:03Z","title":"Are LLMs Capable of Data-based Statistical and Causal Reasoning? Benchmarking Advanced Quantitative Reasoning with Data","version":2},"cited_work":{"arxiv_id":"2402.17644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.17644","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are llms capable of data-based statistical and causal reasoning? benchmarking advanced quantitative reasoning with data","venue":null,"work_id":"6379dfdb-8b2c-4827-9ae8-7e2610b15d6b","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.17644","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5aacebdfd58411bee28c307e3e3fbef0689854c1d1ade072afb163416cd150c5","observation_id":"213f5ab0-6c1f-454d-809c-372f739c275f","resolution":{"observed_at":"2026-05-23T20:13:25.074552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d7f7711708b2d3509757cfd69fc203f8909e6a2f9f77709789012849c31ce37f","observation_id":"bb2f1cd8-6e24-43f5-8ac0-7e500414bbac","resolution":{"observed_at":"2026-05-23T20:13:24.784013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10535","last_updated":"2023-06-22T01:37:02Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:46:16Z","title":"A Survey of Deep Learning for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2212.10535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10535","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of deep learning for mathematical reasoning","venue":null,"work_id":"cce57d28-ad56-4c02-b935-44cc1fff91d8","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2212.10535","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8df42c5d5264e766bb7dffd400a1b22628acf1928519300317c9167c626ab426","observation_id":"4add98e9-d240-4094-9622-d47fb5d22cda","resolution":{"observed_at":"2026-05-23T20:13:24.737121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c4cdab85599b93a36b29b119a82046e14179b93547a6f16d85bf79b5de5e1c61","observation_id":"740ff5f3-23ef-4f57-877e-1a072ddbc86d","resolution":{"observed_at":"2026-05-23T20:13:24.722988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":"85f4c65a-ee81-40ab-8782-a0b430bd8d53","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:f25d112b84264b4a69ad92db492daa69a43e00364544758265a303170123edb7","observation_id":"5ae4255b-12a5-483b-a923-2ccbaea78250","resolution":{"observed_at":"2026-05-23T20:13:25.762166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":"2402.06196","doi":"10.48550/arxiv.2402.06196","metadata_source":"pith","pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models: A Survey","venue":"cs.CL","work_id":"54e385fe-1786-48c3-8aa0-d727210eb50e","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7ee084f23c624661e42509d67dab303329636155e1f31805d59cadb9b6b00a5c","observation_id":"a4d2500f-7082-4485-a0e7-69bbf93779de","resolution":{"observed_at":"2026-05-23T20:13:24.844854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling data-constrained language models","venue":null,"work_id":"db311da2-d4e4-42b2-b6b3-48d75e75329d","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:82a44c270cd252acfc2032b3add16d4358daa24954bfcc7bebb59c363adbba02","observation_id":"1d180948-b687-4322-b825-7e8fb872c1e7","resolution":{"observed_at":"2026-05-23T20:13:25.750446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8d5c3db19b794a350b8d8af299d63a332ac4f70611ef2c0492c986fa375e1cb6","observation_id":"91aa87ec-9310-4dcc-a70c-71666846f229","resolution":{"observed_at":"2026-05-23T20:13:24.757361Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4V(ision) system card, 2024 a","venue":null,"work_id":"6132b934-6018-412b-b1be-2e020ad5be2b","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4882de03830a672ddabca26001f2e14de9e14734274936d2ea6fed2b8db2a17f","observation_id":"bc700717-d009-44ea-9e7b-272d59800955","resolution":{"observed_at":"2026-05-23T20:13:25.743969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o mini: advancing cost-efficient intelligence, 2024 b","venue":null,"work_id":"7b27c831-78fb-4afc-94ed-39c365b911bd","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8b22f6e66a1c4f3d9f2eabd7b401dc2c0490160916129155c6374a2ec70833a9","observation_id":"bfbc8825-449e-4ddc-9c43-9c4e997b51e8","resolution":{"observed_at":"2026-05-23T20:13:25.738654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive load theory and instructional design: Recent developments","venue":null,"work_id":"337bcf90-d0a4-4347-882a-40f8e2dc57d4","year":2010},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d5f43d5896863d8885e6ef99d4077204edaa5e11fbd0697d3268501767d2dbba","observation_id":"5d29731a-20f6-4213-8362-89fdc2eb83b0","resolution":{"observed_at":"2026-05-23T20:13:25.786625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07023","last_updated":"2024-02-10T19:08:28Z","snapshot_observed_at":"2026-07-06T17:28:27.220300Z","submitted_at":"2024-02-10T19:08:28Z","title":"Gemini Goes to Med School: Exploring the Capabilities of Multimodal Large Language Models on Medical Challenge Problems & Hallucinations","version":1},"cited_work":{"arxiv_id":"2402.07023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.07023","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini goes to med school: exploring the capabilities of multimodal large language models on medical challenge problems & hallucinations","venue":null,"work_id":"146ed706-5884-4ee7-b012-522574c22e20","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.07023","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7cbb4105cbd0e977f280edb6bb566f5c5ec3379e55cfda9423d042e5a8e34f66","observation_id":"a1e38f9c-de1a-42cd-9fb2-0d325458eb1a","resolution":{"observed_at":"2026-05-23T20:13:24.747536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-07-06T19:08:26.637143Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":"2409.00147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-07-03T21:28:58.438612Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models","venue":null,"work_id":"c82f0a48-7a00-4aa4-94dd-e64c35c6d5f2","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:e787f8af93ec8c1dc637d3cb76af14c2a3014ac31eb8832072ce38e88166f296","observation_id":"0f08144f-7f53-4bce-967b-e99f9d347ae5","resolution":{"observed_at":"2026-05-23T20:13:24.789526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:a8fc5af0916cbe66b6cde4b1bbcf12b073829e9bbb352cab900dda9092e26422","observation_id":"b92f1d45-4b97-46a8-b689-3c3579cf5d2b","resolution":{"observed_at":"2026-05-23T20:13:24.631903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elementary math learning through piaget's cognitive development stages","venue":null,"work_id":"320f05e6-a2fa-4969-b3a2-53399398013c","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5ee045432623e5c793a39b945a9f14d6f0cabf44c96b975be5265c11244322b0","observation_id":"6109d41c-3620-4bfd-bf38-7ec138d14b65","resolution":{"observed_at":"2026-05-23T20:13:25.730301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:75cb8b5a2cdcd44c0458634d8ccc7e0ab0fc1948080750b01178218852d42ac4","observation_id":"c5183aab-f5a4-4d10-ac62-c2ca24b4d04e","resolution":{"observed_at":"2026-05-23T20:13:24.597040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.16789","doi":"10.48550/arxiv.2310.16789","metadata_source":"pith","pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Detecting Pretraining Data from Large Language Models","venue":"cs.CL","work_id":"1ff0530f-0b29-487b-ba43-d22a740293b1","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4335ac5fe1d643a1b995b44abf7b22e3c46dffd338d35d7926446cf1484ee734","observation_id":"1cdd9210-316a-4bb2-a8c4-de08309256d0","resolution":{"observed_at":"2026-05-23T20:13:24.831510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-04T00:41:59.024387Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.17294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-07-03T20:18:57.684839Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":"0eaf9e93-7c20-4692-bd9a-2257336131c0","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d323593e95d7d9c0a33655b8aff43f2c135eedd07d357da155ce698231c1bae9","observation_id":"dd81da68-afc6-487a-b30d-16383dfef233","resolution":{"observed_at":"2026-05-23T20:13:24.675026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":"2311.07594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-07-03T01:07:30.855621Z","title":"How to bridge the gap between modalities: A comprehensive survey on multimodal large language model","venue":null,"work_id":"fe13fa6b-5be3-4d29-9164-8b538d73ae53","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:f7b27c00ceeb7f428cf81d08e4d24b80d292d70264cc4bf8aceb765be4f1bed1","observation_id":"89ecd939-1a04-4291-8044-b49b18e9cc38","resolution":{"observed_at":"2026-05-23T20:13:25.058416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific research","venue":null,"work_id":"9935bfbe-6df5-4564-953c-090a95182c28","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:0b5cef3b59ebb54b59311c49765019c279fec3c5d85657e4c816c731487b4783","observation_id":"81b3a9e7-e85a-4bea-b552-7cf98bfc58c5","resolution":{"observed_at":"2026-05-23T20:13:25.722923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":"2309.14525","doi":"10.48550/arxiv.2309.14525","metadata_source":"pith","pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","venue":"cs.CV","work_id":"85bf563b-4790-4f8d-92e3-0ed210813c10","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:0606423e296d5f00c0c17e34d70969786446eefef10f00f87f7fa5b0544d493d","observation_id":"6696d416-a815-4cb5-bea7-38f0a3071df7","resolution":{"observed_at":"2026-05-23T20:13:24.796726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memorization without overfitting: Analyzing the training dynamics of large language models","venue":null,"work_id":"3a5deb73-d2f8-4474-8536-eb5e14462f60","year":2022},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:7e37eeae77492c9edbc65fe12fa9183983669fcf28d3d8ced43139c68dfcbc78","observation_id":"d0ae4849-dc13-4b84-8d16-27965b2d6f13","resolution":{"observed_at":"2026-05-23T20:13:25.734523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":"2402.14804","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-07-03T20:48:56.151594Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","venue":"cs.CV","work_id":"c59c0707-68e6-4ab4-9b9f-293004398dc7","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:674e6cc83243b6b30c22b131a6fdc2a100d10e7be7dbeac7ce9b55e8b7060e1d","observation_id":"d7ddc412-30ba-4a2d-acbc-506790c88a42","resolution":{"observed_at":"2026-05-23T20:13:24.769190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18105","last_updated":"2024-04-01T18:47:45Z","snapshot_observed_at":"2026-08-05T22:34:48.476134Z","submitted_at":"2024-03-26T21:04:29Z","title":"Large Language Models for Education: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":"2403.18105","doi":"10.48550/arxiv.2403.18105","metadata_source":"arxiv_reference","pith_arxiv_id":"2403.18105","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models for education: A survey and outlook","venue":"arXiv (Cornell University)","work_id":"1a20cafc-6664-446c-a1e3-a3e36ef762e5","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.18105","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2f37647de4306b45a23b492a5264bc76dc5575d10bcecf1f392ec40a08608228","observation_id":"6d1ba5fa-f238-4a5e-aa60-3ad5e5606653","resolution":{"observed_at":"2026-05-23T20:13:24.812679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":"2311.03079","doi":"10.48550/arxiv.2311.03079","metadata_source":"pith","pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":"cs.CV","work_id":"0d81fb99-dae6-46d2-8bed-c01dcbd7d7cf","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:8e1d0bb426d3b718bf1d2c5afa14ee84013f29ceb25dbf09d576a2cbc71d09a0","observation_id":"dedad807-91d7-4d41-ad1f-0185068474a2","resolution":{"observed_at":"2026-05-23T20:13:24.656773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale multi-modal pre-trained models: A comprehensive survey","venue":null,"work_id":"b682f7d3-cbd4-4f7e-a4db-c978a56ae9a7","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fd75b7d9e5e0c96f43d66648c003f667a76b2bb8aebc2c6d06f516bd98ee591b","observation_id":"2841365e-1eb1-47e2-818b-53502139cdcc","resolution":{"observed_at":"2026-05-23T20:13:25.706479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":"2307.10635","doi":"10.48550/arxiv.2307.10635","metadata_source":"pith","pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","venue":"cs.CL","work_id":"88ae39fd-4d53-4184-9d82-03e8ac44d797","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:23a300b8638ab19889f2c54c7acd06e35630ca06e8685de53daebd7bceeff8c1","observation_id":"e1bbde25-40b2-4a34-b348-a6b4424acfbe","resolution":{"observed_at":"2026-05-23T20:13:24.665670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:35.354385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:35.354385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":"2401.06805","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-07-04T09:59:44.777709Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning","venue":null,"work_id":"f8488283-5738-4b2a-9d3e-86913e913cdb","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:0aa791bb9c7c91cac82aba1f846426f75cdd3fbebdfc6382ba38cda60289ef3e","observation_id":"0b2da07f-e806-4b7e-a552-f13f425ffe47","resolution":{"observed_at":"2026-05-23T20:13:24.651777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are deep neural networks adequate behavioral models of human visual perception? Annual Review of Vision Science, 9 0 (1): 0 501--524","venue":null,"work_id":"4a823728-664b-4b04-aa36-e24e1c7bc31e","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:84492dae1875c292c40d241744a298892a6bb5d670c7340507fbefa87e5e080f","observation_id":"2e8d19e2-7d15-4fb1-98f4-a5faad70e5bf","resolution":{"observed_at":"2026-05-23T20:13:25.718670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08603","last_updated":"2024-12-30T15:08:23Z","snapshot_observed_at":"2026-08-01T22:27:02.699643Z","submitted_at":"2024-05-14T13:42:05Z","title":"A Comprehensive Survey of Large Language Models and Multimodal Large Language Models in Medicine","version":3},"cited_work":{"arxiv_id":"2405.08603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08603","snapshot_observed_at":"2026-07-03T09:47:59.509868Z","title":"A comprehensive survey of large language models and multimodal large language models in medicine","venue":null,"work_id":"a2f21b07-5d22-4c01-a2f1-62f35f5ebd50","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2405.08603","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:bdf819b05ef649d12371462c5fae1571e5005b8b24ab06fec12fe860708e9a78","observation_id":"b7bf2295-098e-429e-bd4b-71e3631f542d","resolution":{"observed_at":"2026-05-23T20:13:24.643282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10701","last_updated":"2024-10-12T05:08:54Z","snapshot_observed_at":"2026-07-06T18:31:32.118399Z","submitted_at":"2024-06-15T17:56:09Z","title":"MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding","version":3},"cited_work":{"arxiv_id":"2406.10701","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10701","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind: Multimodal shopping intention distillation from large vision-language models for e-commerce purchase understanding","venue":null,"work_id":"02ad8569-b279-4188-b23b-b26e1592dfeb","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.10701","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:aafcab2761b0dbfd3c212bd40ec5ef3d34e117ecc7156f2b2eeea9f2862028b8","observation_id":"ad01e102-61e5-4ae0-be2e-9cc1545c302f","resolution":{"observed_at":"2026-05-23T20:13:24.637635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11819","last_updated":"2024-02-02T02:35:13Z","snapshot_observed_at":"2026-07-06T17:18:40.469815Z","submitted_at":"2024-01-22T10:30:11Z","title":"SuperCLUE-Math6: Graded Multi-Step Math Reasoning Benchmark for LLMs in Chinese","version":2},"cited_work":{"arxiv_id":"2401.11819","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.11819","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superclue-math6: Graded multi-step math reasoning benchmark for llms in chinese","venue":null,"work_id":"b301703a-ea1d-46a7-baf4-e8e74db4b42b","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2401.11819","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:04d7de0f5e9c2e9aff95d0ae512fe81a380102106c8fdc57b7a59dfe68c907f1","observation_id":"752b09f9-3757-4f31-99a5-b587d6533ca1","resolution":{"observed_at":"2026-05-23T20:13:24.609009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.05687","last_updated":"2021-09-13T03:39:52Z","snapshot_observed_at":"2026-08-05T01:06:28.807438Z","submitted_at":"2021-09-13T03:39:52Z","title":"Raise a Child in Large Language Model: Towards Effective and Generalizable Fine-tuning","version":1},"cited_work":{"arxiv_id":"2109.05687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.05687","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raise a child in large language model: Towards effective and generalizable fine-tuning","venue":null,"work_id":"53431710-3885-483e-959b-029da246e022","year":2021},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2109.05687","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:c1a7d96d732f59abbd19d4eb770afe2cdc7825e8480463521e8cdc6bcdda4924","observation_id":"6ed7585e-c8b0-45b2-b324-b47400a2c4e1","resolution":{"observed_at":"2026-05-23T20:13:24.590916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02760","last_updated":"2024-03-12T11:29:07Z","snapshot_observed_at":"2026-07-06T17:39:41.498480Z","submitted_at":"2024-03-05T08:31:00Z","title":"Emerging Synergies Between Large Language Models and Machine Learning in Ecommerce Recommendations","version":2},"cited_work":{"arxiv_id":"2403.02760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.02760","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerging synergies between large language models and machine learning in ecommerce recommendations","venue":null,"work_id":"62c34cef-2b8d-41c6-81d2-394fe0f382c4","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.02760","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:4226a75bed42cd7df53d603c0fa48152241d4d7c82d767f65a0af2f83d5ab6dc","observation_id":"eeb102f7-ccbe-4efe-9ff6-0a01b33774c4","resolution":{"observed_at":"2026-05-23T20:13:25.049022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11366","last_updated":"2024-08-21T06:35:21Z","snapshot_observed_at":"2026-08-04T23:07:28.431911Z","submitted_at":"2024-08-21T06:35:21Z","title":"GeoReasoner: Reasoning On Geospatially Grounded Context For Natural Language Understanding","version":1},"cited_work":{"arxiv_id":"2408.11366","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11366","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Georeasoner: Reasoning on geospatially grounded context for natural language understanding","venue":null,"work_id":"05ac767d-7b78-4620-8b3c-60ddfc740d89","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.11366","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:b062e680ccec21d2c402b862a501aeac7723138406cef5e6c16debfca41e9f2a","observation_id":"c1a9acb3-51a9-4a54-8acc-a199d0c57ce1","resolution":{"observed_at":"2026-05-23T20:13:24.693768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbanclip: Learning text-enhanced urban region profiling with contrastive language-image pretraining from the web","venue":null,"work_id":"ea355d71-cfd9-4a3e-bf32-ba8db85ced0c","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:f1bfd2dc7192c833147ef84f337e342c3f714859684c4026803602eabd667b95","observation_id":"ae8143ff-b337-457f-ac72-5a7d537990fe","resolution":{"observed_at":"2026-05-23T20:13:25.689996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring diverse in-context configurations for image captioning","venue":null,"work_id":"1cc58931-c1f1-4d86-a399-3e06414362a9","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fd2ae8e4ff6160009f18ce2a7758040bec9c5701a4c56c6824c5a275fe4b84d1","observation_id":"0372a539-9a1d-41d3-9673-a0093cb903f5","resolution":{"observed_at":"2026-05-23T20:13:25.694605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:2e64b02e0ba9becf26425e1e6e9a952f48ec79f34003b164d4194e1d3e4e8e84","observation_id":"17c4ad5f-dc70-4c37-ad5e-3797dcbb1393","resolution":{"observed_at":"2026-05-23T20:13:24.906671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":"2403.04652","doi":"10.48550/arxiv.2403.04652","metadata_source":"pith","pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yi: Open Foundation Models by 01.AI","venue":"cs.CL","work_id":"8efee8a1-5e3c-4851-9c65-18e3d1d9e769","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ddda5d1a1254698bf81a3a790974fa2c2a60cea639f7ea4e4f5cc726ea8719ed","observation_id":"2bab7c3f-75c0-4163-9282-e0ca44687f23","resolution":{"observed_at":"2026-05-23T20:13:24.686872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language model as attributed training data generator: A tale of diversity and bias","venue":null,"work_id":"a57d0254-a3e8-4dd1-97cf-2b735e867921","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5dda274a5cdfdb9226cbd7943487cdaafa521732c86b78e378bf660ee6698bcd","observation_id":"7dd62501-1f2d-42ad-929b-c34c289c1fb3","resolution":{"observed_at":"2026-05-23T20:13:25.699491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13975","last_updated":"2024-12-20T12:52:00Z","snapshot_observed_at":"2026-08-01T01:55:59.679795Z","submitted_at":"2024-06-20T03:50:23Z","title":"MR-Ben: A Meta-Reasoning Benchmark for Evaluating System-2 Thinking in LLMs","version":3},"cited_work":{"arxiv_id":"2406.13975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.13975","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mr-ben: A comprehensive meta-reasoning benchmark for large language models","venue":null,"work_id":"8a982295-072e-4d4e-a562-f3dc58a39633","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2406.13975","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:3c506e5330e98170b3e8a2daf6069502216489eb595705a4677991b668b16506","observation_id":"fdf4f964-e45d-4c93-ad69-829831adaa9a","resolution":{"observed_at":"2026-05-23T20:13:24.818351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:ec959a161ff46ffaf1b2e330ef44924c177b654f5e5d8439fe6c59a9fca7c630","observation_id":"1fd7739d-d3c1-447c-9fb2-ef9a29d4363c","resolution":{"observed_at":"2026-05-23T20:13:24.708257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-05T22:17:49.177780Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:def3c680b119c27b5fc2836797897efacaf24a7eed8e3f20aa4c709d6abc540d","observation_id":"60de8a06-b8b0-4a34-a59e-75de3c30507a","resolution":{"observed_at":"2026-05-23T20:13:24.620935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09429","last_updated":"2025-05-30T07:27:55Z","snapshot_observed_at":"2026-07-06T19:02:03.017798Z","submitted_at":"2024-08-18T10:07:02Z","title":"Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":"2408.09429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.09429","snapshot_observed_at":"2026-06-30T06:14:19.277132Z","title":"Reefknot: A comprehensive benchmark for relation hallucination evaluation, analysis and mitigation in multimodal large language models","venue":null,"work_id":"c0edd888-0d87-4c8c-b6df-bf7783b979dd","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.09429","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:5f1e9d80e12770637128d16522c114073163336c29aab92052f18505ca2d0afc","observation_id":"26e69ea4-d823-4e60-88c0-5da7588b24d4","resolution":{"observed_at":"2026-05-23T20:13:24.681459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14241","last_updated":"2024-04-22T14:53:27Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:53:27Z","title":"UrbanCross: Enhancing Satellite Image-Text Retrieval with Cross-Domain Adaptation","version":1},"cited_work":{"arxiv_id":"2404.14241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14241","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbancross: Enhancing satellite image-text retrieval with cross-domain adaptation","venue":null,"work_id":"51e61a06-77b1-4c54-b35d-b001d87d01d7","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2404.14241","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:a4b0c498e348090c82593981509255c52b6fb45b35b70aacc2d86efafd2718ca","observation_id":"d7ccc97d-03ac-4148-a9a0-67fb8b57f831","resolution":{"observed_at":"2026-05-23T20:13:24.703873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.07543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathscape: Evaluating mllms in multimodal math scenarios through a hierarchical benchmark","venue":null,"work_id":"8f7aed8a-6052-4010-a3b9-bb13d1d7a863","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:191f0d085194912f464a3fa766d2104f495629e0dddf63b74c95fc28278a43ad","observation_id":"6a4c28c4-ad13-4c28-8dfe-f0bb8de28cef","resolution":{"observed_at":"2026-05-23T20:13:24.864286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17161","last_updated":"2024-02-27T02:47:50Z","snapshot_observed_at":"2026-07-06T17:35:57.887470Z","submitted_at":"2024-02-27T02:47:50Z","title":"Large Language Model for Participatory Urban Planning","version":1},"cited_work":{"arxiv_id":"2402.17161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17161","snapshot_observed_at":"2026-07-10T20:57:34.643826Z","title":"Large language model for participatory urban planning","venue":"cs.AI","work_id":"f2f4782b-7239-4f8b-a03c-bd1ced17bce8","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2402.17161","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d258992e2586c3776611051eb71c3701c649ca6cd7a286b4c862b7530253acfc","observation_id":"774c5a7e-bd97-4aff-a820-5a3e8933d4cc","resolution":{"observed_at":"2026-05-23T20:13:24.777188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2308.07107","doi":"10.48550/arxiv.2308.07107","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models for information retrieval: A survey","venue":"arXiv (Cornell University)","work_id":"ff471f2d-dc3e-459c-81a9-9a40d29e96f8","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:47ea86ee38b812e46c5c028d3b9606f5e7870e42258a63da787227b7e5f5e0b0","observation_id":"6be2948c-6684-4b74-9e22-fbe581ffa754","resolution":{"observed_at":"2026-05-23T20:13:25.037969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:15.875295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08640","last_updated":"2024-09-25T09:53:13Z","snapshot_observed_at":"2026-08-05T13:30:19.839955Z","submitted_at":"2024-08-16T10:11:05Z","title":"Math-PUMA: Progressive Upward Multimodal Alignment to Enhance Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2408.08640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.08640","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Math-puma: Progressive upward multimodal alignment to enhance mathematical reasoning","venue":null,"work_id":"1dcf5bb9-930d-4a6d-80a2-3202fe67e703","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2408.08640","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d5ce1ed82156eeeaed57ce169b5ff91510b583124b1c1e665944b7fc16d62375","observation_id":"882d7d89-01da-45cb-8219-31bb3569df79","resolution":{"observed_at":"2026-05-23T20:13:25.043471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning for cross-domain data fusion in urban computing: Taxonomy, advances, and outlook","venue":null,"work_id":"62d5743f-eeac-4c01-88ef-fd5a14f843f4","year":2025},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:bc62106d46ceaef9652818b0982bbff3bbea72ff890d51b8a325dbef87eb8540","observation_id":"eb14ca03-8ff0-4d6f-988c-96131b7302d4","resolution":{"observed_at":"2026-05-23T20:13:25.817974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object detection in 20 years: A survey","venue":null,"work_id":"3c5ed1b7-0c40-4dd2-993b-e865869f48ba","year":2023},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:aa709f1a05219ab0276d502920ac2ca5544891090daefe81f236dfa41bc90c39","observation_id":"0ce46bd0-3a45-4866-b6a3-476d24ef4787","resolution":{"observed_at":"2026-05-23T20:13:25.829449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.311803Z","title":"write newline","venue":null,"work_id":"8e5fda61-e601-4df4-8204-015bee341570","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:98d12d8b00511b7d7cc1b53988af256d2bcce998320f0ac0d814dd390c54f668","observation_id":"6892dd8d-ae52-453f-bd0a-45fa91b59f44","resolution":{"observed_at":"2026-05-23T20:13:25.774675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:44.012295Z","title":"@esa (Ref","venue":null,"work_id":"b058608d-98d0-4821-a4ae-403d2b7cd411","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:04be08052d322d566ea222b1aa14fe05a418424ca4d98f8e95c57626e17c4c04","observation_id":"2229d2cb-fbcf-4124-8669-856d25a312ec","resolution":{"observed_at":"2026-05-23T20:13:25.754450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T00:05:48.337191Z","title":null,"venue":null,"work_id":"ea79bfb8-d434-45e9-8607-416d3839ec5c","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:fe2a53fb06ca8453c48fd6829c678d13f5898632762f130d278f54520f74b84c","observation_id":"b4822c65-1ae0-4888-937b-1572a7a59bd0","resolution":{"observed_at":"2026-05-23T20:13:25.783042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d051d6aa-efca-49eb-a66d-8ea01bf21294","year":null},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:d2d492e8f9ff9551d9cfb56772ca6f684377dd0a3d26a51b764fc3e60e6905c2","observation_id":"0393e8f1-3007-41c8-a9e9-5de496b1dab9","resolution":{"observed_at":"2026-05-23T20:13:25.814025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":58,"verified_fuzzy":32},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 1 inbound Pith citation observation for arXiv:2410.04509."}