{"as_of":"2026-08-08T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4c753cda8cebd8c8c2c1648bad6cb1675389b979fa8bba05abc70b501ad11d0","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:44.008852Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:36:21.863358Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:43:15.762081Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"cited_work":{"arxiv_id":"2506.07202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07202","snapshot_observed_at":"2026-06-29T08:43:15.762081Z","title":"InProceedings of the IEEE/CVF international conference on computer vision, pages 11963–11974","venue":null,"work_id":"9189ef28-3be4-41c9-bfa5-924456b50cf7","year":2025},"citing_paper":{"arxiv_id":"2605.29339","last_updated":"2026-05-28T04:20:41Z","snapshot_observed_at":"2026-08-02T12:43:45.453036Z","submitted_at":"2026-05-28T04:20:41Z","title":"DMC-CF: Dynamic Multimodal CounterFactual QA benchmark for Causal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:36:21.863358Z"},"links":{"cited_paper":"/paper/2506.07202","citing_paper":"/paper/2605.29339"},"observation_digest":"sha256:c872df0211be970deee0735dc023fc158b4ce5ae52b78c43c1e82dc429ae6d37","observation_id":"87a9aca1-b6d3-44d1-a386-294b3273e171","resolution":{"observed_at":"2026-06-29T08:43:15.763580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07202/citation-record","integrity":"/paper/2506.07202/integrity","json":"/paper/2506.07202/citation-record.json","paper":"/paper/2506.07202"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:49.103129Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":null,"work_id":"5355f61a-ea1c-4d95-9eeb-47170f16e7f4","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.190734Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:ef003ba79a4d39a5c66332e1cb4e2260a306411bc71008cb98b7be9a29aaf8bb","observation_id":"ca4abf32-e965-4329-8ddb-2d501f7288dd","resolution":{"observed_at":"2026-08-07T05:43:49.228008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T05:43:38.257889Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.257889Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:055523f73ad07547cb6507e727820141aa1092d4248d49f40922f499f3785aa3","observation_id":"461a6f64-d357-4671-838d-54ffc7894c6f","resolution":{"observed_at":"2026-08-07T05:43:38.257889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T05:43:38.419260Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.419260Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:3846f377a5bb198c22e20a4daadb66b5312a1ac95915c01846a3a6aa5298e8d2","observation_id":"ff8bb995-86a5-47ab-a9af-6e3f4a808755","resolution":{"observed_at":"2026-08-07T05:43:38.419260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T05:43:38.541820Z","title":"Closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.541820Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:61b206ce70750e72dbd982f62916b83015e5851fb0c5bb312e77e5e2b22649c8","observation_id":"c7bd01bc-355d-4378-8430-4d52309701ae","resolution":{"observed_at":"2026-08-07T05:43:38.541820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:38.711427Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.711427Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:e261dd7037bd01d7af15b6b4c4e19a261660e873860e5c8f94113dfb70b7d42a","observation_id":"6e3b7325-fb3c-403b-9538-584a770ebc6b","resolution":{"observed_at":"2026-08-07T05:43:38.711427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-03T11:31:09.198404Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-07T05:43:38.885301Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:38.885301Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:fc54b8c5046eb983abeb3e48d68fc8db7d35462751371b0c3b864bab38bd1f21","observation_id":"a5dce37d-d9c2-4d0b-888a-cbfc4ac61195","resolution":{"observed_at":"2026-08-07T05:43:38.885301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.754363Z","title":"Complex Video Reasoning and Robustness Evaluation Suite (CVRR-ES)","venue":null,"work_id":"a6b1469a-b931-479e-ac7a-4b7744f49674","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.042400Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:f2d74f920a619566965c3d2a34a9194314625a39c83f2006fbabdbdc28597798","observation_id":"b6d79c24-7fe5-41ca-af19-30b895ee88de","resolution":{"observed_at":"2026-08-07T05:43:48.912141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14890","last_updated":"2024-02-12T17:30:25Z","snapshot_observed_at":"2026-07-06T17:07:19.721701Z","submitted_at":"2023-12-22T18:07:44Z","title":"NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14890","snapshot_observed_at":"2026-08-07T05:43:39.255176Z","title":"Nphardeval: Dynamic benchmark on reasoning ability of large language models via complexity classes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.255176Z"},"links":{"cited_paper":"/paper/2312.14890","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:dc417cb8cc260f23c2092e54a4b64df9ef9430955f4acf2ab96588102210f0b7","observation_id":"145fe6b8-60a8-4bd3-a933-6aa0a5eaad46","resolution":{"observed_at":"2026-08-07T05:43:39.255176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T05:43:39.375817Z","title":"Video-R1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.375817Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:5bbd48309cb30d709954e39f704e64ceb33ba1f97fdb4362a3cb7837fea7faf3","observation_id":"18484495-cf17-4f71-b15a-4214b86012b5","resolution":{"observed_at":"2026-08-07T05:43:39.375817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T05:43:39.449895Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.449895Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:caa27ae8ef5193f45c5c08d8de92d1d23a81c2651c2c501e92a0df2c5d7ef306","observation_id":"7f864f67-399d-4d94-8d52-7712ddc73784","resolution":{"observed_at":"2026-08-07T05:43:39.449895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-06T11:32:00.537531Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-07T05:43:39.543588Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.543588Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:d6fb117a3c353d2c6ad9548ce56133a8ea4551de9873383c4aac01397dc39202","observation_id":"dc258f49-a426-4b23-bc29-558dde71b26f","resolution":{"observed_at":"2026-08-07T05:43:39.543588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.476976Z","title":"Time travel in LLMs: Tracing data contamination in large language models","venue":null,"work_id":"bb56dafa-fba6-4eb0-8b93-378889b9af3a","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.598573Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:9f0bb2d779991a4a97e0eab65f0d82e45503cf0cd5ab68590efae8bd7d67a112","observation_id":"373f9932-70b9-42e9-8684-9ed355346882","resolution":{"observed_at":"2026-08-07T05:43:48.603675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:48.217588Z","title":"Goodfellow, Jonathon Shlens, and Christian Szegedy","venue":null,"work_id":"6e03a7d9-6622-43ce-bca5-19a2997a5de6","year":2015},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.737219Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:54b8be96b1a2d9c27adc313ef49808bf7c74a9043a3ae64addf81e5543e9e2f0","observation_id":"6dad6892-dcbe-4f3c-8327-94cc60b97c7b","resolution":{"observed_at":"2026-08-07T05:43:48.325245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.954242Z","title":"Flat minima","venue":null,"work_id":"75ba55d3-862f-4a8d-8099-7fd071e199ec","year":1997},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:39.855755Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:61f77628ca7c927c5ba4b81da82b85ac4bda386682b090aca942127fa47270c3","observation_id":"03daa9c5-f96a-43e8-944a-775293501894","resolution":{"observed_at":"2026-08-07T05:43:48.054042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:40.028594Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.028594Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:033d6e11ea91351e599983e50ec42a95c6262449ea482738ecf6273b8599390e","observation_id":"296a0b41-3fd2-40f9-ba56-9bbb5d0eb0b1","resolution":{"observed_at":"2026-08-07T05:43:40.028594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-07T05:43:40.205852Z","title":"On large-batch training for deep learning: Generalization gap and sharp minima","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.205852Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:0fb0f027b380c3081ae17f2b2c8a138f537c5125095ece1934d076cf46b92522","observation_id":"16b0f9da-ef7e-455e-a53e-c4a85c7e0b23","resolution":{"observed_at":"2026-08-07T05:43:40.205852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.624024Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":"ad6fe1c9-3e09-41fc-9f50-50783542beb0","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.352290Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:5972ec57078f803bb961193534e87259d5d6a221e57114818623902807a0cab3","observation_id":"d940628d-e01b-4cad-acd2-5bf23370c18f","resolution":{"observed_at":"2026-08-07T05:43:47.780360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T05:43:40.501360Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.501360Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:65ee6611d90a218cc636f54450fd2471bc96052466e0d3a336a2f1ff006e08ca","observation_id":"c7cc41dc-b9de-4638-aa37-b8f895cd19a0","resolution":{"observed_at":"2026-08-07T05:43:40.501360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T05:43:40.648654Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.648654Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:9cc8cba95158e5a803823d54edef66a912ab14ac2b1cf9f68c35f3ec29121706","observation_id":"56be8d9d-0980-44d9-8a08-da5276953aa3","resolution":{"observed_at":"2026-08-07T05:43:40.648654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T05:43:40.744698Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.744698Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:319a2bc88b769962cf9d3c7ea979805fdc968bd82434cabe4ff86ec538304239","observation_id":"954ca561-503e-4eec-9ed3-dd3d1fe530e5","resolution":{"observed_at":"2026-08-07T05:43:40.744698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:40.944687Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:40.944687Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:b54f13c501c4e1f7794098f230b909632ffbcb8ac96e5119b5183e7d5904826a","observation_id":"a1214211-d31e-42b3-811c-b63afed3d312","resolution":{"observed_at":"2026-08-07T05:43:40.944687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.372096Z","title":"On the robustness of multimodal language model towards distractions, 2025","venue":null,"work_id":"54f41a16-7f8c-413f-a001-d14e0536d8d2","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.115259Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:7810f6b202f4a7ae50c775a2247c866cace07e41325d16d2b5823c009850089a","observation_id":"655f1235-d44d-4cb3-89c3-0231e9e6d2cd","resolution":{"observed_at":"2026-08-07T05:43:47.469322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:47.053176Z","title":"Is your video language model a reliable judge? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"bcaaafea-0d5a-4119-9cfc-03fb987b9ed3","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.231453Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:7c282c0f7a22c6d4e0658c6c3a922df76e4bb51de3789210b9a37b8770f29479","observation_id":"9bc5acdd-12dc-415d-97c4-5eeadbcac686","resolution":{"observed_at":"2026-08-07T05:43:47.201742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T05:43:41.387231Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.387231Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:d55afc35272c9a45296c75babb4c78994847c27110670b39931d57a1ab15ac81","observation_id":"786f99bd-9ae8-4afc-a830-939e58122de1","resolution":{"observed_at":"2026-08-07T05:43:41.387231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:46.765671Z","title":"The Llama 3 herd of models","venue":null,"work_id":"0b3ac397-7aa0-49a8-9f91-1089826e9947","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.529067Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:fb7170bf5c740e59f7a30763848176dd694e569c6b90fdd52b941a4f9a6dccee","observation_id":"3002a829-5539-413f-8145-f53522016021","resolution":{"observed_at":"2026-08-07T05:43:46.871877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:41.682613Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.682613Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:2f07ef00de870ee67c1d46d5bbf8d71759930d64c38334a2dd205313a056684d","observation_id":"719807d8-f564-4bf8-84ec-85ffd002dfec","resolution":{"observed_at":"2026-08-07T05:43:41.682613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-07T05:43:41.824761Z","title":"MM-EUREKA: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:41.824761Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:dfd0c4f12fa4c1fc526d85d4ab1f78351dafb5cf934b5685c97b87c2b7eaa2ff","observation_id":"7c71a775-0782-4af8-98a8-9bb109f52d3c","resolution":{"observed_at":"2026-08-07T05:43:41.824761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:46.501102Z","title":"Introducing GPT-4.1","venue":null,"work_id":"742ea241-1b18-4915-baca-1945f7f855b0","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.007117Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:c0e5e5a72e0e39c1c636ccc7c467bf4443716e0b6dc98013a2d1841a982249b2","observation_id":"5588a6fb-1bff-444c-affa-7cb2e6634c9a","resolution":{"observed_at":"2026-08-07T05:43:46.605726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:46.173756Z","title":"Introducing o3 and o4-mini: Our smartest models yet","venue":null,"work_id":"62c8b5f5-33dc-4f23-bd2f-20cde3c26b22","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.126854Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:badd898c23bed9c372007d1a8f08203cf1569d9e20f97e80ceaf1296ae40141e","observation_id":"e6db3cb7-00f5-467c-a8e7-ea121436aac4","resolution":{"observed_at":"2026-08-07T05:43:46.340798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:45.811532Z","title":"Chatterji, Faisal Ladhak, and Tatsunori Hashimoto","venue":null,"work_id":"554471ca-704f-4b2b-99a8-a9733430aeb6","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.312172Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:efc77ce815f2e310fd13ade2cfb0af899923ccfc2aa5371fe9290fb1fa45995a","observation_id":"b7293655-e8c3-47b1-beba-d9e66f85cc81","resolution":{"observed_at":"2026-08-07T05:43:45.997943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:45.555938Z","title":"Qwen2.5-VL Technical Report","venue":null,"work_id":"71c642b3-6952-4151-9d33-e379c4fccb0a","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.449448Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:1cb0f2771bc467aed19578b5c6c539e94b31f1ad4b223a636bc7b6b55ff48eba","observation_id":"e33612d5-bdef-4b89-8fd5-1966ba17a24f","resolution":{"observed_at":"2026-08-07T05:43:45.644329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T05:43:42.595992Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.595992Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:00e63ea4273060c0414aaea29c2118dc074ddc3f2ffb36dc5da60676c35578ac","observation_id":"7fdd844e-eb3c-416b-9c9b-7bf7065b460d","resolution":{"observed_at":"2026-08-07T05:43:42.595992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-07T05:43:42.737932Z","title":"VL- Rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.737932Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:72eb257762808ee39682e8100e35ff4298116fccc47d32f1db50c9e7916ecb8e","observation_id":"5d741959-b5bc-45b1-a7a8-54dbea542666","resolution":{"observed_at":"2026-08-07T05:43:42.737932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:43:42.884189Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:42.884189Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:0f7529963637e137ea3412524db42e4a98eb6caeda8560b79ccbc5767a78d57b","observation_id":"83b791cf-4563-4bac-b69b-e823938961cd","resolution":{"observed_at":"2026-08-07T05:43:42.884189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T05:43:43.067246Z","title":"InternVideo2.5: Empowering video mllms with long and rich context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.067246Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:ca7d3922f163b6439671d21ad4aed4603be99d26f158a157f42155f7d38b8662","observation_id":"fc628e12-ea92-4ca2-8b7b-a2916806fa5f","resolution":{"observed_at":"2026-08-07T05:43:43.067246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:45.294113Z","title":"Realworldqa","venue":null,"work_id":"ce6f73ef-0928-45ac-8ff7-13d54bd00912","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.206948Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:8b244228cd27368acaa9ddbc9ee16c962154e4d504a494674a40191dae6cdd39","observation_id":"49db2cd3-1be6-43e4-9ca3-4059d3f4df2b","resolution":{"observed_at":"2026-08-07T05:43:45.404107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:44.975973Z","title":"Dynamic multimodal evaluation with flexible complexity by vision-language bootstrapping","venue":null,"work_id":"ed76f0df-c3ff-4dc8-9627-6c0b03faef5c","year":2025},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.306522Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:21ae92fc1c6ea6c5ddc5b70ee89d5b49f360de2562ca8174df527b433ddabb9a","observation_id":"f5299504-2ffd-4225-86e8-3561e2128509","resolution":{"observed_at":"2026-08-07T05:43:45.090141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-07T05:43:43.489140Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.489140Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:3dd9393f85b2e0b70fde80b617fa6398b56cd1620fdffdaf9062432437fe4a97","observation_id":"170e434f-ad70-4ad2-8b5b-37a9c533797f","resolution":{"observed_at":"2026-08-07T05:43:43.489140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T05:43:43.659170Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.659170Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:7b23758d8a341f157e2a0bc96d89f636224ca966f5adb3db9086b28550af0e36","observation_id":"e027e542-f702-40f6-9e38-0c9c8015b887","resolution":{"observed_at":"2026-08-07T05:43:43.659170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:43.761515Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.761515Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:6752de04b9c9270459f514a86b3e1b9f5b4a4e66d550bbd268c38e3e209730d0","observation_id":"5879e056-8321-4c4d-9c80-1ed495a4e8ba","resolution":{"observed_at":"2026-08-07T05:43:43.761515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-07T05:43:43.859281Z","title":"Dyval: Graph-informed dynamic evaluation of large language models.arXiv preprint arXiv:2309.17167, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:43.859281Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:6599ed2252f7156831425003b146ed6c2a5af373e1684f05fb5d3a17b48fc98f","observation_id":"bcc4f788-8ab4-443c-b4bf-217c5acd20de","resolution":{"observed_at":"2026-08-07T05:43:43.859281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:44.593087Z","title":"reasoning MLLMs,","venue":null,"work_id":"7599b829-ebc0-4639-8b43-b19b5a830f57","year":2024},"citing_paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:44.008852Z"},"links":{"citing_paper":"/paper/2506.07202"},"observation_digest":"sha256:fc5bd7e0c568f9ece30e2da182a0843591a856d2e81cd01db8c7818eaf51690f","observation_id":"678d5dee-677b-490a-9f62-21926e94ddac","resolution":{"observed_at":"2026-08-07T05:43:44.803931Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07202","last_updated":"2025-06-08T15:52:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T05:37:12.085602Z","submitted_at":"2025-06-08T15:52:38Z","title":"Reasoning Multimodal Large Language Model: Data Contamination and Dynamic Evaluation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.07202."}