{"as_of":"2026-08-08T09:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:faf3dc0e21d36c0bc93ca37bf35cc1da58e0feaa0c22c575d9c8f5e230164760","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:10:23.293868Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:47:38.676727Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.937856Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-08-02T19:58:15.166907Z","title":"Mico: Multi-image contrast for reinforcement visual rea- soning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:15.166907Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:8f50de106e29cfbc2455cd984a06ebe4305c7cd40dbf65c8418d65da7d9132ec","observation_id":"56bbfb6a-5856-4629-9ef6-5dd15c4e0698","resolution":{"observed_at":"2026-08-02T19:58:15.166907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:594f487570b839dc4aa3e6413b25cfc431cdd87aa6b0feea35c0b5d6e19d8963","observation_id":"eac79354-ed08-4554-9934-83e1f5b37637","resolution":{"observed_at":"2026-05-11T19:16:08.367742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2606.21337","last_updated":"2026-07-31T19:36:30Z","snapshot_observed_at":"2026-08-07T09:45:00.435849Z","submitted_at":"2026-06-19T11:31:43Z","title":"DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T14:24:19.702588Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.21337"},"observation_digest":"sha256:b22b53ca0aebf12b282116867b7f46bd03480a9c8057f3db83980fb77e69c654","observation_id":"4ec5dc58-95fe-426b-8a51-454a61ac8dc6","resolution":{"observed_at":"2026-07-04T06:29:37.943816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-08-04T02:47:38.676727Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21337","last_updated":"2026-07-31T19:36:30Z","snapshot_observed_at":"2026-08-07T09:45:00.435849Z","submitted_at":"2026-06-19T11:31:43Z","title":"DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:38.676727Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.21337"},"observation_digest":"sha256:cb52d448179077c227cfe30daa8abe67656f34a2960e56dcada7d20d6c7bd214","observation_id":"ef3e5ca9-6892-4534-8b80-e6d8b0a38be8","resolution":{"observed_at":"2026-08-04T02:47:38.676727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:30e11a2f8df3155ba24de8a65fd788cc265eae7ddff366aaa7d8712f70df12ec","observation_id":"d0a7c20a-8dbe-416a-9703-83022d97f974","resolution":{"observed_at":"2026-07-04T15:09:54.939662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2506.22434","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-04T15:09:54.937856Z","title":"Mico: Multi-image contrast for reinforcement visual reasoning.arXiv preprint arXiv:2506.22434, 2025","venue":null,"work_id":"67ac2a49-64e8-4ed2-85b3-2c0a3a512a6d","year":2025},"citing_paper":{"arxiv_id":"2606.28266","last_updated":"2026-06-26T16:57:40Z","snapshot_observed_at":"2026-07-07T00:02:24.342539Z","submitted_at":"2026-06-26T16:57:40Z","title":"RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T04:09:32.397341Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2606.28266"},"observation_digest":"sha256:49cf652daff8dbf4e79a7cfbe0ba1ef0f961926d8fc60fceae6e5543314a4915","observation_id":"5d3575bf-4f7f-445a-a8df-ca754d0c73fa","resolution":{"observed_at":"2026-07-01T17:05:51.451562Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22434","snapshot_observed_at":"2026-07-31T21:55:17.360790Z","title":"arXiv preprint arXiv:2506.22434 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27967","last_updated":"2026-07-30T10:14:24Z","snapshot_observed_at":"2026-08-05T12:14:09.489312Z","submitted_at":"2026-07-30T10:14:24Z","title":"MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T21:55:17.360790Z"},"links":{"cited_paper":"/paper/2506.22434","citing_paper":"/paper/2607.27967"},"observation_digest":"sha256:8ee967e5737f46cd0c4b631a4c1fa2a4a38ff595148fb8c736de45db314ca64a","observation_id":"7c81efc5-ace3-4125-b140-de5c81811780","resolution":{"observed_at":"2026-07-31T21:55:17.360790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22434/citation-record","integrity":"/paper/2506.22434/integrity","json":"/paper/2506.22434/citation-record.json","paper":"/paper/2506.22434"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:10:19.661051Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.661051Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:b721be1803db504c46ce5e41bb0205bcb8bb460a32363f2d67a7c1b70034a708","observation_id":"a8b68a97-0e72-4a9c-9ad8-c454e6497c4d","resolution":{"observed_at":"2026-08-06T22:10:19.661051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:10:19.714681Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.714681Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:7d4505bac274a8eb28e07f183cd7c3b109afa67a9cdbc9fea2c4b8721e3b329e","observation_id":"b4c6f8d8-18de-4fd4-b427-3fca9ac4deae","resolution":{"observed_at":"2026-08-06T22:10:19.714681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.631164Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"df73c545-a318-482a-be9a-519398e3a245","year":2021},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.841634Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:4e7c902ce034dcd564236e2212711f819965e61f76d37e327394b712aa3b2ca4","observation_id":"6e0fbd76-dce3-4de0-8570-97c3b8910b53","resolution":{"observed_at":"2026-08-06T22:10:28.722552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T22:10:19.944658Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models.arXiv:2504.11468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:19.944658Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:ed96d75406cfd56358b58e15f19f2414cab11aed4a287915b44c6e24a8a3deb5","observation_id":"24113702-aa5e-43d8-9559-237ebc7b9ba6","resolution":{"observed_at":"2026-08-06T22:10:19.944658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:28.290080Z","title":null,"venue":null,"work_id":"e4932ee7-9a97-4051-9fe7-62e5a0f11591","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.024347Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:3b8c7043f96c19040998ade427c4d6627404120a7624bf70d53e17b2cf637426","observation_id":"295ed156-2397-45a4-8b99-322dc2aef68e","resolution":{"observed_at":"2026-08-06T22:10:28.465181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.963573Z","title":"Are we on the right way for evaluating large vision-language models?NeurIPS,","venue":null,"work_id":"36fecf94-e426-4cd5-ba31-018b7317ad1c","year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.104973Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:9c45c2dac2df02b78394f1f49aefab09ae39e1d74e49d46ce8c6590e45e315df","observation_id":"febea6a5-eb8a-4871-b738-a26a0ff716d5","resolution":{"observed_at":"2026-08-06T22:10:28.130827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.628856Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"944e588a-4036-49d7-9533-0912782b0715","year":2020},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.165768Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:bbe4af478164ab036b3326a5bf10222bd561ff168d4c9bd3db8ca62716c0df77","observation_id":"1ee3d4c4-9c61-42d0-b067-2fad28420e2d","resolution":{"observed_at":"2026-08-06T22:10:27.798641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.390021Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"019d6764-dcc3-4c80-bae2-f42d8e3b6c77","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.214041Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:4bf442dd7de14b111210f8a397add3b2c4e456a4a7ba10082650d0d94eeb57e8","observation_id":"efe40d4f-71f4-48da-bbb3-9fe78dd576c5","resolution":{"observed_at":"2026-08-06T22:10:27.481876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:27.115564Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"f78e4903-af28-4a06-9f81-d3a57c01f2c9","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.240390Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:35b2b5c3e14a813c2f53c93c4c81911eb45f45e323b263a773be518bca2539b1","observation_id":"35e6b1cf-aba6-497f-a8ab-26cd02e18cad","resolution":{"observed_at":"2026-08-06T22:10:27.260370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.826825Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"b29063da-38cf-4763-9002-73a0a7dd6a9e","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.266790Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:8c5680561f3253b8503e5a957e5701300580905e83881617f380b0b513f04b93","observation_id":"f806f609-79e3-4de7-9241-2314288d1859","resolution":{"observed_at":"2026-08-06T22:10:26.991239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.488317Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"b3ee0f2e-c32f-4035-bb02-f0b66968878c","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.284666Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:be180464584bd82eeff640c2601cf434c08b7edaf6c91b34d6c753bebab047df","observation_id":"df7af8c2-2dd1-4a87-9d21-0f599b0a5c6a","resolution":{"observed_at":"2026-08-06T22:10:26.661498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:10:20.303571Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.303571Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:cb7e952095aacbabef8fb3cdb6b22963c2107645569d45a3d74d299d62f8fb59","observation_id":"6ab5d93a-f684-4a9e-b584-7c5e5b073eec","resolution":{"observed_at":"2026-08-06T22:10:20.303571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:26.161237Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"12f6af9d-a268-4fe4-9078-f56a2d24f918","year":2022},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.347365Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:393213fbebcafe2e8cc5111173a6c366db7958d13c9412a2dfeabcc1d6718fad","observation_id":"3ad90e29-c3eb-4a72-b5e7-8228ec987354","resolution":{"observed_at":"2026-08-06T22:10:26.308149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.826785Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"e8e27e3e-b5a7-4627-9eb6-d94f8a7c0613","year":2020},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.380458Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:73d533fa01ddb0e334d651e2a22f65ef79ad3be1ea7283b02bde6d0729e07e38","observation_id":"a1702eba-3960-450d-8ef9-9564231be04d","resolution":{"observed_at":"2026-08-06T22:10:26.002413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:10:20.418100Z","title":"Gpt-4o system card.arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.418100Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:35873607422b970a945b153ef2b40e2852443975fca2c32445a5882c16da0a9a","observation_id":"30c8b7a1-2087-4abf-9a58-30f83bf48927","resolution":{"observed_at":"2026-08-06T22:10:20.418100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:10:20.487532Z","title":"Openai o1 system card.arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.487532Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:e48e0e16682ff7778f03b34d38ae18a851ee192c397c7f9a1921280ec70fbd66","observation_id":"3e64c7b2-2243-4638-a3ce-b61883e05687","resolution":{"observed_at":"2026-08-06T22:10:20.487532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.645412Z","title":"Llava-onevision: Easy visual task transfer.TMLR, 2025","venue":null,"work_id":"176d08e7-045b-4ccd-b244-5fdc87fbbed4","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.636213Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:cfa2a77e947ed629d3e0c7ae9ab9de691b13dd2c3aa85436ba4d6101231ee725","observation_id":"cff9c650-f687-4f86-9f3d-cdb099491a55","resolution":{"observed_at":"2026-08-06T22:10:25.699586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T22:10:20.772845Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.772845Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:66693fd789fbef6db09d37551fc91c093a7d555f3ed67925daa784a206a84f9e","observation_id":"491e6990-29ec-4934-a82d-bdedd27f0979","resolution":{"observed_at":"2026-08-06T22:10:20.772845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.490205Z","title":"Visual instruction tuning","venue":null,"work_id":"5a7baed1-5ab6-4c89-8865-46769f8c9ca3","year":2023},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.889944Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:3eb55991d56226f31fc0ada5561efd15d977b84f1bcc71bf27f9a5841c0dde62","observation_id":"694b5750-16b2-49ab-b776-38b59ea66a5d","resolution":{"observed_at":"2026-08-06T22:10:25.567251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:20.936461Z","title":"Noisyrollout: Reinforcing visual reasoning with data augmentation.arXiv:2504.13055, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.936461Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:2434fef42770d3ee1680958743dcfe940241e79f5e74f44559db97de655b198e","observation_id":"dd08eda1-bfeb-49df-bcf4-1b3c9cfd4720","resolution":{"observed_at":"2026-08-06T22:10:20.936461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.386618Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms","venue":null,"work_id":"e9170952-bc7f-4e7b-824b-f936c64adf26","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.990374Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:692296b805ac14dac551c3cefb1aca208ade72c1520061bc080a03df7d23ed0a","observation_id":"0d8b729d-bc4d-4c58-800b-669a16e0a869","resolution":{"observed_at":"2026-08-06T22:10:25.436256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.237918Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"ac2aa6a0-6992-4a0c-b876-eb0f3310d3e0","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.089298Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:e1b77ab5fa2792449e40c632622c548b8bfc59798720170f207c43370c7612fa","observation_id":"6def041d-365c-42d8-a439-367f88f6ffc7","resolution":{"observed_at":"2026-08-06T22:10:25.298666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T22:10:21.182215Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.182215Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:29bcc54b36e6f7db86950460e9c754a618897c39daaa19b7d6cfccf51d0b7212","observation_id":"c2810585-c011-4c7d-8ccb-bc2427e70979","resolution":{"observed_at":"2026-08-06T22:10:21.182215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:25.109310Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision- language models","venue":null,"work_id":"dfb044d0-0fae-4016-9a66-eec52fd012dd","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.303114Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:43eb52ea6d3ccefb8617e9348f3d7f297217a9b813484818468c5f36b683a201","observation_id":"508e4ff3-66f7-41f2-a4d8-e6703505eadd","resolution":{"observed_at":"2026-08-06T22:10:25.162989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-07T16:07:44.263463Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-06T22:10:21.421604Z","title":"Skywork r1v: Pioneering multimodal reasoning with chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.421604Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:d3a09d6e72715b5b5dac4701a0af30885f116d2a8e132208de849ea10604fbe0","observation_id":"41ca8a4b-5b82-4ff3-a3b4-f32a305a2bd7","resolution":{"observed_at":"2026-08-06T22:10:21.421604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-06T22:10:21.546619Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl.arXiv:2503.07536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.546619Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:f65b2367b774005c28aa40eb3428bc7f5a06aaeb43438fecc2cc401ae4ca91f6","observation_id":"1f566777-8f5c-4265-890a-d60523701d0c","resolution":{"observed_at":"2026-08-06T22:10:21.546619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:21.645213Z","title":"Seed-thinking-v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.645213Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:16d0d96ec0b5d741f988dbc1e24f72995e5f0a6cc4f42bd7c21debe5ab41ca1d","observation_id":"74b28711-97ec-463d-9e80-aa6dcca57847","resolution":{"observed_at":"2026-08-06T22:10:21.645213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:10:21.712099Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.712099Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:03db087053db724cae644b7e103feae06136936fe5d50f7f1b4c7e19c85fffa4","observation_id":"429e076a-6e03-4d5e-b0b4-22dd59d2653b","resolution":{"observed_at":"2026-08-06T22:10:21.712099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:21.814227Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning.arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.814227Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:afd50ef6945507104073a85f7927fc9e2313556f58f682bc25ba742ad3513946","observation_id":"82cc9a97-fd6c-4e9d-84df-525ab92e2c2c","resolution":{"observed_at":"2026-08-06T22:10:21.814227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-06T06:21:45.459224Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-06T22:10:21.932155Z","title":"Vidgen-1m: A large-scale dataset for text-to-video generation.arXiv:2408.02629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:21.932155Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:b62d08a1db760eeefe38de0886a9a447a202af140a8ecb2928438956b6656d33","observation_id":"f858776c-a47b-478c-b409-976b86053609","resolution":{"observed_at":"2026-08-06T22:10:21.932155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T22:10:22.028060Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.028060Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:e7a0895359a880b969a7cb4d7792f1e2b18c5b64024c6284fffa7984dbeb9f4c","observation_id":"b5ccabef-a66a-42c6-a438-ff63745e2410","resolution":{"observed_at":"2026-08-06T22:10:22.028060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.971768Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding","venue":null,"work_id":"33959bc7-85b1-4b63-a05b-c22ae4f437d8","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.089405Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:60b3ab0337a8702cd0dcd548fcc3692f4a4d1ecc2834ee963c9d3e6d61893ec9","observation_id":"7d9b5079-b267-42ad-8466-aa1573e257a6","resolution":{"observed_at":"2026-08-06T22:10:25.033961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T22:10:22.153445Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.153445Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:9f076fcd114f5144be7fa7dc0ea921a904ac36862218cde5ea6afd2332104844","observation_id":"65027c1c-7b21-48d4-9e46-8f1b6da2f3e1","resolution":{"observed_at":"2026-08-06T22:10:22.153445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-07T16:06:46.096701Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-06T22:10:22.226382Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement.arXiv:2504.07934, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.226382Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:b122676f8f839efb75f1a088a5a707e828edef46da914eece83c4cac10a75d8c","observation_id":"fa107860-b77c-457c-bd26-239bb6829ccf","resolution":{"observed_at":"2026-08-06T22:10:22.226382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.853613Z","title":"Omniedit: Building image editing generalist models through specialist supervision","venue":null,"work_id":"a66fff19-8fb1-463a-95d1-cb53ac990045","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.310213Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:40dfd584c49a6f5a8ab5c917bd24296fc39c33e0755e9d54a208055a83c7a283","observation_id":"89425d77-f32b-436d-8a79-d4d75a0b76e4","resolution":{"observed_at":"2026-08-06T22:10:24.899197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.747040Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"c7c003e9-f494-4a1f-9fcf-8291bc013ccd","year":2022},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.379211Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:8fd8aeddc0ca7f52f53a6522bf7d9240d7740eb3482343b13f71992f873aec82","observation_id":"aa15e761-d7e7-4dfb-bd56-d4c133797abc","resolution":{"observed_at":"2026-08-06T22:10:24.792525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.614411Z","title":"Towards open-ended visual quality comparison","venue":null,"work_id":"ac0c070b-ba36-433f-8e2d-2f28fde4fa7d","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.476519Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:d71ced5140951bbc69a6a429fbb9824a76f2f75d864ba83b9ff294a1e19e556f","observation_id":"f311559c-40f0-497b-bd9e-f8c5f4fb16d1","resolution":{"observed_at":"2026-08-06T22:10:24.690395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.512260Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"5d9407f7-530b-4b95-8759-44997e1c8bcf","year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.548940Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:ff0d239ef4ff9dd40df19b1e59390dcae296b7484d7821b58b8eae7fde81f1d5","observation_id":"7a41f29b-b701-4235-b643-88ca56801731","resolution":{"observed_at":"2026-08-06T22:10:24.556572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.393359Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"c2d81398-28d9-410e-ae9e-fc3c4a869ccd","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.635408Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:caf35217ed5c1f48bab1f3c61c19cb6cd4031602c5c00e8fc09027e87a4e8778","observation_id":"90f9bd71-b043-4599-ace4-89f419051ef8","resolution":{"observed_at":"2026-08-06T22:10:24.453840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12084","last_updated":"2025-07-02T07:38:09Z","snapshot_observed_at":"2026-08-07T18:11:33.173051Z","submitted_at":"2025-02-17T17:57:50Z","title":"VLM2-Bench: A Closer Look at How Well VLMs Implicitly Link Explicit Matching Visual Cues","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12084","snapshot_observed_at":"2026-08-06T22:10:22.722405Z","title":"Vlm2-bench: A closer look at how well vlms implicitly link explicit matching visual cues.arXiv:2502.12084, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.722405Z"},"links":{"cited_paper":"/paper/2502.12084","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:534c6c9ee8d7695af8ca437b6283ad8166b6682f2e1b0d5559aed235a916b429","observation_id":"0e367bb4-2cbc-4d97-ac8b-e3719455b251","resolution":{"observed_at":"2026-08-06T22:10:22.722405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20199","last_updated":"2025-04-28T19:02:18Z","snapshot_observed_at":"2026-08-07T15:58:28.837399Z","submitted_at":"2025-04-28T19:02:18Z","title":"Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains","version":1},"cited_work":{"arxiv_id":"2504.20199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.20199","snapshot_observed_at":"2026-08-06T22:10:23.511066Z","title":"Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains","venue":"cs.CV","work_id":"2c424537-9c38-47ff-9334-0343e8596568","year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.804765Z"},"links":{"cited_paper":"/paper/2504.20199","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:4d3d3b410cf7be949ab6640f5a0effb4e0670b693c61341f7299d539bb4cd694","observation_id":"1ed0821a-b305-4cb4-a1fe-aa014113d41e","resolution":{"observed_at":"2026-08-06T22:10:23.589277Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:10:22.903154Z","title":"Long context transfer from language to vision.arXiv:2406.16852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.903154Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:b42ce93f298734e068d4657df6dbbc0593c997062f0657526efd180ad9a808e8","observation_id":"ac77033f-768b-4197-b7c0-04d0923444c2","resolution":{"observed_at":"2026-08-06T22:10:22.903154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T22:10:22.971564Z","title":"Video instruction tuning with synthetic data.arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.971564Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:053582c038f22441991269369980200a446256083071f38f34b13ebd8dca2101","observation_id":"d6e43932-032a-497b-a74f-48c42b77f00f","resolution":{"observed_at":"2026-08-06T22:10:22.971564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12742","last_updated":"2024-06-18T16:02:18Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:02:18Z","title":"Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12742","snapshot_observed_at":"2026-08-06T22:10:23.068331Z","title":"Benchmarking multi-image understanding in vision and language models: Perception, knowledge, reasoning, and multi-hop reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.068331Z"},"links":{"cited_paper":"/paper/2406.12742","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:d4a0c034df65e2b1edcd178f60d568f36c2bcb7cf83d3635f3c13c53f7f8fa7c","observation_id":"8ba2266b-47ea-4432-87f9-5ebfd913950d","resolution":{"observed_at":"2026-08-06T22:10:23.068331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:10:24.220455Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale","venue":null,"work_id":"891ffbaa-274b-4b88-8e42-d2cde93d8a54","year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.158141Z"},"links":{"citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:f7d8d6154e7146c8abecf381820e8937bb71fd96c1e174f8594148b7f0bef1e1","observation_id":"626392d1-1c8c-4849-8999-a0fbb297730b","resolution":{"observed_at":"2026-08-06T22:10:24.301168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-02T10:38:59.539887Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04670","snapshot_observed_at":"2026-08-06T22:10:23.293868Z","title":"Are image1 and image2 the same?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:23.293868Z"},"links":{"cited_paper":"/paper/2501.04670","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:aa94bfe43df41895636ae81cd651d5802023e871b644df614eda1a2ab21a830e","observation_id":"cab53f23-af9c-4c36-83a5-25d31c6b7cc9","resolution":{"observed_at":"2026-08-06T22:10:23.293868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:01:48.405215Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 7 inbound Pith citation observations for arXiv:2506.22434."}