{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b98c484ec9297cac7135df1fe825297de1b1cb12ad10fb28133ff8d85b6ae51","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:05:20.044416Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:54:43.474266Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T00:12:50.323154Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-08-04T09:54:43.474266Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.12953","last_updated":"2026-08-03T22:42:44Z","snapshot_observed_at":"2026-08-07T23:09:08.076264Z","submitted_at":"2025-10-14T19:57:03Z","title":"Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:43.474266Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2510.12953"},"observation_digest":"sha256:6616d4dedb87935aadd489d2ff0580a2f6d6cc8b3610c185e539836d57dad52c","observation_id":"5c6864df-b047-4bee-bf80-fedc21632611","resolution":{"observed_at":"2026-08-04T09:54:43.474266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2604.00799","last_updated":"2026-04-02T21:20:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-01T12:06:54Z","title":"Multimodal Language Models Cannot Spot Spatial Inconsistencies","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T23:12:27.333405Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2604.00799"},"observation_digest":"sha256:e6df194a838b691393ebcc2358565f712dd0f41015bb63ef179527647baefa0a","observation_id":"d334f9d5-9cff-48f6-91d2-3fba26525cc2","resolution":{"observed_at":"2026-05-13T23:13:24.779717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:c2ccb160c2014b02659e2176b83f29924a41f0d9d32bbd246663fea57bc1bf8d","observation_id":"92fa0042-066d-4efb-aa58-7d57f2915315","resolution":{"observed_at":"2026-05-11T13:26:03.830119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:610f01e902134276f68362ef00c4bd8307744211d3c0a7a62d5c715b98744c6f","observation_id":"8425e803-0d62-4c85-bd60-4fbd56364dac","resolution":{"observed_at":"2026-05-11T13:46:02.750336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":"2506.04280","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04280","snapshot_observed_at":"2026-06-29T00:12:50.323154Z","title":"Evaluating mllms with multimodal multi-image reasoning benchmark","venue":null,"work_id":"91488ac0-e55e-404d-b2cd-0e78aa28a2a0","year":2025},"citing_paper":{"arxiv_id":"2606.00148","last_updated":"2026-05-29T03:20:05Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-29T03:20:05Z","title":"StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:15:56.598968Z"},"links":{"cited_paper":"/paper/2506.04280","citing_paper":"/paper/2606.00148"},"observation_digest":"sha256:09d518546b7c8863437e52cd7bffca64c10222bc7c77098b6b733d31dae7d74d","observation_id":"a1c2534f-54a4-4485-8371-831cfd49b2d7","resolution":{"observed_at":"2026-06-29T00:12:50.324575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04280/citation-record","integrity":"/paper/2506.04280/integrity","json":"/paper/2506.04280/citation-record.json","paper":"/paper/2506.04280"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.093166Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.093166Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5f2caf4597a7dcafde279e8872c814f2f2be8a6e6980706da06dc1af4b1e2193","observation_id":"5391bfd9-4e4c-4283-b50a-84b1f44de3e1","resolution":{"observed_at":"2026-08-07T11:05:19.093166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:05:19.125992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.125992Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:80676d64c3a57ed126351692cc2930344b572734632ee54cc5464adeedc3a7ae","observation_id":"c72cb348-886c-46ff-9438-363f60a1b434","resolution":{"observed_at":"2026-08-07T11:05:19.125992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:05:19.149385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.149385Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:26fde2e33d41350a5bba7fd12d24149dfaf954d0058fb05bc4510be44025e101","observation_id":"c92bdff2-402b-46bf-92af-c5ffe95e425b","resolution":{"observed_at":"2026-08-07T11:05:19.149385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.168229Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.168229Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:d60b134e3af6f64d2c0a619c3348ec9002ef4edf0678e8e41b6eaed09e2deb0b","observation_id":"c657ea92-7c09-48a2-9414-40d49c3df2a0","resolution":{"observed_at":"2026-08-07T11:05:19.168229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:05:19.206037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.206037Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:2f455a6a5f5ed0997d01919f98a4791fd1af9c243ee3d8d6340d3364373abb61","observation_id":"449cf1fb-3f45-442d-9e5a-69ee1fe9b17a","resolution":{"observed_at":"2026-08-07T11:05:19.206037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.285840Z","title":null,"venue":null,"work_id":"43c4ff08-43c2-4ebc-8ba4-1e0ef8f0ade4","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.221144Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5eafc21fd4bfac39a43a97059050c9845e9b1221a3784727552301f8f0fff430","observation_id":"b2332d1c-679a-49e9-9264-e55557eb3bbf","resolution":{"observed_at":"2026-08-07T11:05:23.314570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.232426Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.232426Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f27568249133d6d9fe2be16c433161bc9393d527a5bffbd7bd6398b8f4390251","observation_id":"aee44f84-b50e-4f52-8e75-f1d730020eeb","resolution":{"observed_at":"2026-08-07T11:05:19.232426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.246975Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.246975Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:77fafa4f5f6ee8af8a06ee18fca887c4746037a6202577acb4f5e82dac0b54ad","observation_id":"4f0b9bfc-e67f-4693-b269-3faff3a84983","resolution":{"observed_at":"2026-08-07T11:05:19.246975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.06364","last_updated":"2018-09-17T17:59:13Z","snapshot_observed_at":"2026-08-02T01:51:56.235582Z","submitted_at":"2018-09-17T17:59:13Z","title":"Generalizing Across Multi-Objective Reward Functions in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1809.06364","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.06364","snapshot_observed_at":"2026-08-07T11:05:21.649291Z","title":"Generalizing Across Multi-Objective Reward Functions in Deep Reinforcement Learning","venue":"cs.LG","work_id":"c3e70b02-72e3-40cd-bd5c-7bfb83fb5b33","year":2018},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.279701Z"},"links":{"cited_paper":"/paper/1809.06364","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:2d78cb20cb54e24170d8a1738718af8f47d6637a056c76a3a5a4b79ea05f69e5","observation_id":"3769c6c6-8602-491c-8a98-64c15c0dde53","resolution":{"observed_at":"2026-08-07T11:05:21.666096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.286471Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.286471Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:cefea4983756b46c9208d9adc9139601da1354198564a08a676491ed29546273","observation_id":"b83ffd3f-dd39-4fec-9365-ec175c24b1c8","resolution":{"observed_at":"2026-08-07T11:05:19.286471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06606","last_updated":"2025-04-09T06:09:40Z","snapshot_observed_at":"2026-08-07T16:07:18.452869Z","submitted_at":"2025-04-09T06:09:40Z","title":"Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06606","snapshot_observed_at":"2026-08-07T11:05:19.291846Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.291846Z"},"links":{"cited_paper":"/paper/2504.06606","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:40944f8d8052e7602009a4458a173d445986fdab259531e5a420a67c762eb027","observation_id":"87f573ed-96f7-49dc-b444-396ddc047ac6","resolution":{"observed_at":"2026-08-07T11:05:19.291846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.058761Z","title":null,"venue":null,"work_id":"1ed54350-229d-4247-b9ff-21a3cc143bf7","year":2009},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.302473Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:8bd50b8e857370235b3bdcaeacb606dbe4ad8f6c97fe8fa4d93e8bcb08ba20a1","observation_id":"2a463a9b-c158-4504-b449-7030e94417d5","resolution":{"observed_at":"2026-08-07T11:05:23.067313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:05:19.318506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.318506Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:d41fbed7f844ad0a834334ef9cd16fc33784f264fe08f4419dc94e4ae417e4fb","observation_id":"b7a365eb-80de-45f2-8806-193219db6b68","resolution":{"observed_at":"2026-08-07T11:05:19.318506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T11:05:19.352234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.352234Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:89ba878e56857ee3d81eb5dc8c8ce1bb83f1b2a95287e835cec9e5553066c2c8","observation_id":"3783139e-c5f8-4251-832e-b1894c57c50b","resolution":{"observed_at":"2026-08-07T11:05:19.352234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09621","last_updated":"2025-02-13T18:59:46Z","snapshot_observed_at":"2026-08-07T20:46:02.743961Z","submitted_at":"2025-02-13T18:59:46Z","title":"MME-CoT: Benchmarking Chain-of-Thought in Large Multimodal Models for Reasoning Quality, Robustness, and Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09621","snapshot_observed_at":"2026-08-07T11:05:19.357259Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.357259Z"},"links":{"cited_paper":"/paper/2502.09621","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:8592147a7ec89b77b67316ae1580b0a0b499b20d8d1805970833b6e91bb7928a","observation_id":"110bcaec-d601-4d7f-807d-775cf6756cf5","resolution":{"observed_at":"2026-08-07T11:05:19.357259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.028218Z","title":null,"venue":null,"work_id":"a5ef7591-4808-4350-b1b6-dec80f94cbcc","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.373052Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:3701f9415179fbe2a7fbd3f6ca8eeaa4dc023a348ca379ad8bb7dba497aed3d5","observation_id":"7a7f698c-e082-4f45-9278-6ee28fb1844e","resolution":{"observed_at":"2026-08-07T11:05:23.033572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T11:05:19.396582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.396582Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:4fd43aa48d0dc56b9c6de6fac3091f87c34aac045314e539d4c4b7cf0fdce40b","observation_id":"b7622b24-9377-4fb8-bc24-f16a898b13f7","resolution":{"observed_at":"2026-08-07T11:05:19.396582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-08-07T11:39:49.685292Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-08-07T11:05:19.405502Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.405502Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f8c6cf711133476cbc6aba71f04ac334a5d063b75c25a0c7c8b38bbbe3ba54f2","observation_id":"e7821c05-6750-4e3b-91b5-d3fde00a313e","resolution":{"observed_at":"2026-08-07T11:05:19.405502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.423016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.423016Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:bc87dd0b66cbf960cfdefc40f1582a663c9829a79f75ff7ebdaa939b6c226fd8","observation_id":"e2f30b36-44ac-44b6-a637-bb39ff2dd03a","resolution":{"observed_at":"2026-08-07T11:05:19.423016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.980695Z","title":null,"venue":null,"work_id":"a1f37d49-3dca-4417-808d-f4efb1691f04","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.386373Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ad298656aa22f10fa584a3b0e9ddc4fd3a440765a60583a8a38383412234d7af","observation_id":"d1523ac9-2457-485e-81b5-2463cdc7d8fe","resolution":{"observed_at":"2026-08-07T11:05:22.986394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.875426Z","title":null,"venue":null,"work_id":"00a47e11-4f9c-4867-bcb4-4e7633467810","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.445145Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:25a29ea395227ba1e8e128a001ab60060e582f589ecf63ad9b314e98436e6663","observation_id":"813a2978-95cb-40c9-b6a3-adacfaeb7e29","resolution":{"observed_at":"2026-08-07T11:05:22.889599Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T11:05:19.462282Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.462282Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:90e94c9e1162817fe484a23f4960065e98ea6fa87c6e2e795ef8eefd78342c6f","observation_id":"55e9a714-8997-4266-9b20-f54251a95a86","resolution":{"observed_at":"2026-08-07T11:05:19.462282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-07T11:05:19.472918Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.472918Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:a9f374ab897d62465824199e7b515856c496b2f989a3e8dbdec7329e776fbb46","observation_id":"57dc166e-b0ca-4809-8d63-1189cd44c09b","resolution":{"observed_at":"2026-08-07T11:05:19.472918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.913147Z","title":null,"venue":null,"work_id":"8e8b88dc-e60c-4419-9014-314961614370","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.432019Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:bfdc4a54eef53ac6a24ec6f8130b1ae4343f8b29d464ac3a5368ba3b87af84af","observation_id":"934bdc89-a9a3-4304-b26a-b210f382595f","resolution":{"observed_at":"2026-08-07T11:05:22.927157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.791730Z","title":null,"venue":null,"work_id":"a924e94f-f300-4326-8527-a000944dd8b0","year":2022},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.491198Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:da2c33623f97ac146d1a0ab09c867ab9540a9a949c353ad154860ccee9196785","observation_id":"383301d0-48b3-47a5-a9fa-aff5a789d17f","resolution":{"observed_at":"2026-08-07T11:05:22.810498Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.499218Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.499218Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:40ff57a46e5d130ffcbe42b4b099d323304adcf40ebca4e37ee522395c4041ab","observation_id":"28d0fb4b-8fb2-40ad-906b-aae4f0d84da1","resolution":{"observed_at":"2026-08-07T11:05:19.499218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-04T01:28:52.686106Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-08-07T11:05:19.523326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.523326Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:188590c3a0704d3aff1bde7af0410318c137380366073b34140b0bf6f78c3f9f","observation_id":"0d9ba4f4-81b9-478f-84f5-54dd0f3419fd","resolution":{"observed_at":"2026-08-07T11:05:19.523326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.483720Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.483720Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:86635fe51ec0769c7b604900881c70f7e84adea5fe889dd1350bedf46ad5dbd9","observation_id":"7ac23c4c-fbae-43fb-bea4-f92333afc950","resolution":{"observed_at":"2026-08-07T11:05:19.483720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.734152Z","title":null,"venue":null,"work_id":"ea309cbd-5c5a-4bd3-9635-343c8f686d3f","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.546625Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:360c33fb96c14ca960d0669defa82c816e310248c74a3af7c0e1bdee2842ef95","observation_id":"bed07209-e2ff-4850-9771-6ba94f4008fc","resolution":{"observed_at":"2026-08-07T11:05:22.744082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-07T11:05:19.555184Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.555184Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:3df2ed2787effa36f325c18228911a4a1aecbcd30e3a20b761ffe68a35c73f47","observation_id":"2a7da2ce-8183-4bf8-b05e-358ed8c1ce6e","resolution":{"observed_at":"2026-08-07T11:05:19.555184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-06T10:53:26.005728Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-07T11:05:19.565467Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.565467Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:6c8e28e22aeabd945ad95976a08d675846d2e948902fcdda4e2561bb8fed76ad","observation_id":"2c0f76dd-9160-4dd7-8fd6-571bc8943ae7","resolution":{"observed_at":"2026-08-07T11:05:19.565467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.580744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.580744Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:e2a1f8ad6e3c01e6506d34572b09f122b02ac274d9f63a3f7f755f93d06e73bb","observation_id":"991b90ed-dccd-416d-b568-5e449d05da9f","resolution":{"observed_at":"2026-08-07T11:05:19.580744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.10411","last_updated":"2019-09-23T15:10:41Z","snapshot_observed_at":"2026-07-06T08:23:53.657345Z","submitted_at":"2019-09-23T15:10:41Z","title":"NLVR2 Visual Bias Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.10411","snapshot_observed_at":"2026-08-07T11:05:19.537088Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.537088Z"},"links":{"cited_paper":"/paper/1909.10411","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:323106a7dbe63552a4008dda6da8448d620e227f0d688d3bf6c5e6dfcbaf1dff","observation_id":"072f0cd2-45ba-4135-88d6-0ead62ec9e8c","resolution":{"observed_at":"2026-08-07T11:05:19.537088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-07T21:25:47.268391Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-07T11:05:19.613480Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.613480Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:03e149ffbd55ee1b480d0b20a91feac383d5b1372b53d7febcabe318c2672f11","observation_id":"6290e526-21b7-4b54-ad8e-4f63cb734c17","resolution":{"observed_at":"2026-08-07T11:05:19.613480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.653398Z","title":null,"venue":null,"work_id":"f1f41708-cbde-48fc-9532-36dd11514932","year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.622195Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:170a05bf01e613dcb5a8158c38881a25492635d29835c006ab5c1fad3e417349","observation_id":"0c55dbbe-cfdc-41e9-8a47-d5c02a572196","resolution":{"observed_at":"2026-08-07T11:05:22.676752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.643578Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.643578Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1b69522aa6e7f2374f810d6127292e090804c80a147bac40df0c75f30750635b","observation_id":"4a5f715c-91b1-4750-bea6-34f1d1fa0f3d","resolution":{"observed_at":"2026-08-07T11:05:19.643578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T11:05:19.654435Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.654435Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:365a04cafdfd6325c47644ba3dd71848c90057a1ca37a0ff02f80837a46e46a4","observation_id":"c7c041f0-6fd7-491e-b307-15c86595814e","resolution":{"observed_at":"2026-08-07T11:05:19.654435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T11:05:19.601376Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.601376Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:8882e170da765cc8f1c588f65d3d614af737059705d159a1862fec1e3abf1ea6","observation_id":"daac543d-7b2b-4ab2-a972-1effe3b51c83","resolution":{"observed_at":"2026-08-07T11:05:19.601376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-07T11:05:19.683399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.683399Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:618e7619a9a0c7bd460eb57ede0d5c93a3bffb5cec7628bc0daa995f58456bae","observation_id":"0921162d-cacd-4676-966b-647ed987a204","resolution":{"observed_at":"2026-08-07T11:05:19.683399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-07T16:00:29.784743Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-07T11:05:19.704763Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.704763Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:49a76cbbc21193aadf4ba1d72ae452a05a40ac9d9e8fd53510e996779f101981","observation_id":"7278bfc9-b506-4303-a6a8-b0c457cedc3d","resolution":{"observed_at":"2026-08-07T11:05:19.704763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T11:05:19.713959Z","title":"Yichang Zhang, Yinger Zhang, Yu Wan, Yuqiong Liu, Zekun Wang, Zeyu Cui, Zhenru Zhang, Zhipeng Zhou, and Zihan Qiu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.713959Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:090676aa4a78b111067d91a94c6273939b3d9ce333b941ff56c4863b9dcfe43e","observation_id":"7e2399a7-c682-4cf5-9248-a7ad6c9ad0bf","resolution":{"observed_at":"2026-08-07T11:05:19.713959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-08-07T18:03:15.507750Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-07T11:05:19.719944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.719944Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1e85b18e15615323df727528f1af8b9a53858039aaae0a223dc3a51d907ed7d7","observation_id":"4f95da42-0fbe-49f0-b7a7-b9d955e24ffa","resolution":{"observed_at":"2026-08-07T11:05:19.719944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-07T11:05:19.667340Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.667340Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1db5dc778436e38c3f878fd01e00e94eec617e60d85aedde4ac16b9e61d6cc5f","observation_id":"406e5081-45d4-448a-93c0-300a95aa87e7","resolution":{"observed_at":"2026-08-07T11:05:19.667340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-06T01:46:05.964793Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12368","snapshot_observed_at":"2026-08-07T11:05:19.748441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.748441Z"},"links":{"cited_paper":"/paper/2501.12368","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:9bb31676aca53f2925d486b9456bc10926059ffc81ce95dabebe29d66213e4d5","observation_id":"869ae997-430e-4c73-89a3-0a3e0ab35c59","resolution":{"observed_at":"2026-08-07T11:05:19.748441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-07T11:05:19.759069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.759069Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c69f505d019def4cce8173b9060cf65a7f3625048c65d94f022d203d4b7ce77c","observation_id":"b207ca52-e644-403c-a340-c47554341d74","resolution":{"observed_at":"2026-08-07T11:05:19.759069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03272","last_updated":"2024-05-06T08:42:34Z","snapshot_observed_at":"2026-07-06T18:10:16.760984Z","submitted_at":"2024-05-06T08:42:34Z","title":"WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03272","snapshot_observed_at":"2026-08-07T11:05:19.768115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.768115Z"},"links":{"cited_paper":"/paper/2405.03272","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ea3299f71c0d5db8c75177aa7eefd2d7c60464731b4bf4687abae1c2ad7aa2ba","observation_id":"04bcbfa7-9314-4b0c-83ac-9331cbf40313","resolution":{"observed_at":"2026-08-07T11:05:19.768115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-07T15:56:17.654117Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-07T11:05:19.779262Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.779262Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ac434a0ec8612d77ee879a21e11731ba7ece3bb6a3bae67ca77da315fc154605","observation_id":"5c512187-0b0e-4e92-b81e-804a018e0106","resolution":{"observed_at":"2026-08-07T11:05:19.779262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.737053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.737053Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:4de89a17f50daf72a59a6b470d5c5c70e204d40c8a2f1310c11a7ce205c9a4fe","observation_id":"674a23ef-a859-4fa0-abfb-8c3dd55cf2d9","resolution":{"observed_at":"2026-08-07T11:05:19.737053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14668","last_updated":"2025-02-28T12:57:03Z","snapshot_observed_at":"2026-07-06T19:36:05.879892Z","submitted_at":"2024-10-18T17:57:40Z","title":"MiCEval: Unveiling Multimodal Chain of Thought's Quality via Image Description and Reasoning Steps","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14668","snapshot_observed_at":"2026-08-07T11:05:19.808950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.808950Z"},"links":{"cited_paper":"/paper/2410.14668","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5a3ece1eee4f369e19709a63be2b71006f07f15915709c9c50e8777121c86a20","observation_id":"374273db-e653-4a63-945d-d745994c824d","resolution":{"observed_at":"2026-08-07T11:05:19.808950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:05:19.821194Z","title":"Do not in- clude any explanation. Only output your final answer in the ex- act format: Answer[<letter> or <your_answer_here>]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.821194Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5e0ad159c8cabf8ef9001139c45a7ba2db40f7eef0e1d25cb56181eb7382ccc7","observation_id":"242fbcc3-9161-4688-add2-97f2000fa578","resolution":{"observed_at":"2026-08-07T11:05:19.821194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T11:05:19.790349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.790349Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:1b71d961b2b7895092294212aff69035b3731c4e0c25baa7a3c5df6735407a71","observation_id":"48a225fb-5b1d-4cf3-8168-4a210622fcce","resolution":{"observed_at":"2026-08-07T11:05:19.790349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.533818Z","title":null,"venue":null,"work_id":"e8940912-82ae-4c66-9cfc-e76d082656bd","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.834814Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:ac0b34f882d4cc507bc80ab702dd2fb7e5fd1599a1e9eec4717310395a6636e0","observation_id":"1e7286e3-27d0-49ca-b3d0-4040e9b2d71e","resolution":{"observed_at":"2026-08-07T11:05:22.541576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.495397Z","title":"reasoning step","venue":null,"work_id":"441e3101-dbe6-4ffe-a854-ce838e615e4f","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.856925Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:feb31495a95d02cdcdeae4cf9976bcdcaf353e7e97be75f0aa356ef8cc4d71d8","observation_id":"9afa9931-c062-408b-a212-7cdd30230c4c","resolution":{"observed_at":"2026-08-07T11:05:22.504739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.298342Z","title":"equally good","venue":null,"work_id":"e157a222-054c-49d2-99c1-d561e68c8028","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.900673Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:6584ffb4ab8091d2c4b1650ab43e202567d30019c585224c0312e68a5e3a037c","observation_id":"c25669a8-8996-44f7-be32-3c9ab4488f32","resolution":{"observed_at":"2026-08-07T11:05:22.311098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.244458Z","title":"equally good","venue":null,"work_id":"77152c00-d164-4da7-b6b7-c9d49465bd45","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.946132Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:f9d70fac86f79b2104d2fceb81760a04220111cbb1c597fee7c2fb66936828c3","observation_id":"09ab0e9d-67e1-47e7-9269-464b8458d6a1","resolution":{"observed_at":"2026-08-07T11:05:22.259112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.439555Z","title":null,"venue":null,"work_id":"68d7c516-7790-4447-ba53-809e836678b1","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.961296Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:cd9d0aa45ed89664f6e64df04cdcc76087cbd647dcf54745aae1289730c3a680","observation_id":"2cb14538-63db-429e-98ba-48aa6e23b6e2","resolution":{"observed_at":"2026-08-07T11:05:22.465449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.389292Z","title":null,"venue":null,"work_id":"8caf7115-818e-4bf9-83c0-aedf37f53763","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.971376Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:c8d1922710379b32e64166f5a77cc23abe4a8e375b02dffc06b932ef74966526","observation_id":"c130aa28-c9d8-4f8c-93ac-78e6f1e19275","resolution":{"observed_at":"2026-08-07T11:05:22.395288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.344981Z","title":null,"venue":null,"work_id":"48eda53f-49e9-4336-bf28-27cfff2bb034","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.980113Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:bf3d6644687ec13b37c0428fbd8f0a2ddc0187cfe94df8dfdd205d3f78076aef","observation_id":"b7038d16-669d-460c-a5e0-4ef8f49abba8","resolution":{"observed_at":"2026-08-07T11:05:22.363949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.182553Z","title":"equally good","venue":null,"work_id":"490a0081-6a79-4c1e-a54c-6c5971e8881a","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.988591Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:372ed5b68a7b5497f87bde81645686436554713124f365b2a87143538531f2df","observation_id":"56aba37e-d952-4cb6-ad57-00930f296933","resolution":{"observed_at":"2026-08-07T11:05:22.199841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.104031Z","title":"Responses should minimize the mention of objects not present in the ground truth answer, and inaccuracies in the description of existing objects","venue":null,"work_id":"c6715844-43f4-4194-acbd-7a36957fda7c","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.013797Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:be67962f9e5b392b0943ea5d90ea411ad3a46fd5d3fb0026dd4f08d38813224f","observation_id":"d4e85cc4-f8a5-487e-b582-eee8aea80311","resolution":{"observed_at":"2026-08-07T11:05:22.116840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.056553Z","title":"Rank higher the responses that least misrepresent these relationships","venue":null,"work_id":"d8f50db1-43c0-4017-9454-f2e30be7e62c","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.026221Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:e62ade3a9da7f3597567df7f0cca11b0ea8020add0c97fe9fb140200a9cfe62d","observation_id":"78a0e081-f8d1-4af4-bf4f-192fa85a8888","resolution":{"observed_at":"2026-08-07T11:05:22.066928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:22.004244Z","title":"Responses should avoid inaccuracies in describing the characteristics of the objects present","venue":null,"work_id":"33251c6e-90c9-49f4-86ab-bfe7436ea327","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.034083Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:09d9dc1ddaafd93d50e54a742d08b2c6fd0363dbf96d36076a20681a0956c55f","observation_id":"88f71158-6ef9-430c-88b4-7f57a2d86032","resolution":{"observed_at":"2026-08-07T11:05:22.020746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:21.949565Z","title":"Equally good","venue":null,"work_id":"36e63bde-2861-488c-92a7-865e6def5290","year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:20.044416Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:5d9d158d34ce9396bbe2ec49a0edff4b9beee32062b59f5864d4839908df233b","observation_id":"edc4972b-8872-4d0a-b8bc-92ad31259023","resolution":{"observed_at":"2026-08-07T11:05:21.962642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:05:19.509807Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.509807Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:868650b1a5ec0a053902baac01e4086096c97c522557a6287931481e3526a23a","observation_id":"7994fa18-e622-4d8b-b9ee-64d433200258","resolution":{"observed_at":"2026-08-07T11:05:19.509807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:19.114146Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.114146Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:473aca545f6ce803b91a2051ab198bd0c7faac8ba849a992a154c61415b01978","observation_id":"3823083d-0afc-468d-bd06-d4c92fc52bff","resolution":{"observed_at":"2026-08-07T11:05:19.114146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:05:23.143159Z","title":"InProceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"2c4e0838-11dc-4b4d-b126-1b2cd79f6f1b","year":null},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.262204Z"},"links":{"citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:24a16c0ae9f179e2c2b462ed87fba067466c467ce1e0f03f32a5ef47cf4a44ea","observation_id":"c013ae08-676f-4166-8fbe-e7b9fac4652c","resolution":{"observed_at":"2026-08-07T11:05:23.155612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-08T00:04:38.380220Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-08-07T11:05:19.193447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.193447Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:204d3c8e237dff4b4d517cf6d312509eeb71f0259b2f935c5639a570fb72b65d","observation_id":"2760d9a4-0362-4c1d-a434-7a40e9ef31e0","resolution":{"observed_at":"2026-08-07T11:05:19.193447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:26:08.023036Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 5 inbound Pith citation observations for arXiv:2506.04280."}