{"as_of":"2026-08-20T13:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:133b1825ae46069429a2be4cb0dc5eb08c43519631d0b6c8472177c27f6fc470","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:15:04.983727Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21552/citation-record","integrity":"/paper/2607.21552/integrity","json":"/paper/2607.21552/citation-record.json","paper":"/paper/2607.21552"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-16T15:21:35.471994Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-01T07:15:02.847030Z","title":"On-policy distillation of language models: Learning from self- generated mistakes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:02.847030Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:5285839bdb002adf6087f5e5a17087f55589c90bf73d3b37abd8faabeedd7af6","observation_id":"71a6533f-574e-4426-a546-25142e5b5830","resolution":{"observed_at":"2026-08-01T07:15:02.847030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00468","last_updated":"2016-10-27T03:50:19Z","snapshot_observed_at":"2026-08-15T14:20:20.896398Z","submitted_at":"2015-05-03T20:07:39Z","title":"VQA: Visual Question Answering","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00468","snapshot_observed_at":"2026-08-01T07:15:02.967101Z","title":"Lawrence Zitnick, Dhruv Batra, and Devi Parikh","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:02.967101Z"},"links":{"cited_paper":"/paper/1505.00468","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:c3d40d521e92a5e06cade54a87132049089fa6539a6bdba63f0bf53794c13fb5","observation_id":"0781f2a3-da3d-407b-a5fa-c91e235e5f03","resolution":{"observed_at":"2026-08-01T07:15:02.967101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T07:15:03.156066Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:03.156066Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:4ac89696415d08bf04294cd650ac28bbe49f4c5230fe13339abeed213a4f364a","observation_id":"8396bf06-f61c-47be-a502-36a5bdcef72b","resolution":{"observed_at":"2026-08-01T07:15:03.156066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T07:15:03.296979Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:03.296979Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d88477ed2abf1251ee4ad9799505117179108f1161b1a60795f9f3d8ff284508","observation_id":"180914bb-d7e5-44cd-8c4c-8d537a8c88ec","resolution":{"observed_at":"2026-08-01T07:15:03.296979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.23497","last_updated":"2026-06-03T18:11:47Z","snapshot_observed_at":"2026-08-17T00:50:39.033943Z","submitted_at":"2025-10-27T16:32:12Z","title":"VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.23497","snapshot_observed_at":"2026-08-01T07:15:03.465067Z","title":"V old: Reasoning transfer from llms to vision-language models via on-policy distillation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:03.465067Z"},"links":{"cited_paper":"/paper/2510.23497","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:4d3c9ce09bbf476a69829cf08d2550b156c8533c7e092700e0aa95d64119f755","observation_id":"a36c0025-9767-4c7b-8895-a2cbefa6679a","resolution":{"observed_at":"2026-08-01T07:15:03.465067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:03.629032Z","title":"Opendataarena: A fair and open arena for benchmarking post-training dataset value.arXiv preprint arXiv:2512.14051, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:03.629032Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:a76dbb00d8b0583f84dfb020d369eb9e8da26fd8919ce5c57034f044ef558fef","observation_id":"7eaf2dfb-94cc-4a69-9fc6-9e418eb6f26b","resolution":{"observed_at":"2026-08-01T07:15:03.629032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:03.783102Z","title":"Milestones over outcome: Unlocking geometric reasoning with sub-goal verifiable reward, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:03.783102Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:0e05da3b3d85cdb12db29fb713bd2312c3abdd701f180f0b714db8c344910463","observation_id":"34644cdf-1559-40eb-93c5-68d330c2e370","resolution":{"observed_at":"2026-08-01T07:15:03.783102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-01T07:15:03.968030Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:03.968030Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d20ab8de149f2169b1de425ae6f488856dfd8b711e9a6f65b98f75f7047fd27f","observation_id":"1eb74acc-2c37-47b5-b9ae-5177b50366b3","resolution":{"observed_at":"2026-08-01T07:15:03.968030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26646","last_updated":"2026-05-26T07:30:03Z","snapshot_observed_at":"2026-08-10T20:03:40.754036Z","submitted_at":"2026-05-26T07:30:03Z","title":"UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26646","snapshot_observed_at":"2026-08-01T07:15:04.134379Z","title":"Unitymas-o: A general rl optimization framework for llm-based multi-agent systems.arXiv preprint arXiv:2605.26646, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.134379Z"},"links":{"cited_paper":"/paper/2605.26646","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:9a413d309fe8a2431c626f1f20fbb4c45e03d3be00fcb303e0ac2600fcb641f2","observation_id":"fae82917-c0f9-4ff7-b926-1e414060d602","resolution":{"observed_at":"2026-08-01T07:15:04.134379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-01T07:15:04.259359Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.259359Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:789cd36ea674cc66b0d36810a117484e7fed2c61236e296602cfa17d4ccf76d6","observation_id":"ae8a265c-a60c-44de-ad60-2234738fcbae","resolution":{"observed_at":"2026-08-01T07:15:04.259359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.413380Z","title":"Plane geometry diagram formalization via vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.413380Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:5cc23894ffce2987f2250064d6ad3704f21cb37e2946a0913d7312e69b866f80","observation_id":"eb33b1dd-f226-4028-8d99-a23e00777795","resolution":{"observed_at":"2026-08-01T07:15:04.413380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.505288Z","title":"Addressing overthinking in large vision-language models via gated perception-reasoning optimization, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.505288Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:b0a9fa334f4f8151efe48bf941cea6958cb34ddcefa32848638cfc1b77e1f381","observation_id":"8dd728ff-911c-4ecf-9240-ee52be5316aa","resolution":{"observed_at":"2026-08-01T07:15:04.505288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-17T16:49:55.394145Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-01T07:15:04.612610Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.612610Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:2bcf0eed2dc0d51f3f42dab9c0fc419d849ddbd5d71c727d672bb36876e3fe03","observation_id":"70c9f362-4838-494c-b649-7b29b135f8fd","resolution":{"observed_at":"2026-08-01T07:15:04.612610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.669855Z","title":"Gemini 3 pro model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.669855Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:6d82ec65496cbb785c52c1cbab0b024886aa4f8ad9762384af918e5173e16fd8","observation_id":"4eb37d1b-0962-413c-951a-2aa2e2ee0170","resolution":{"observed_at":"2026-08-01T07:15:04.669855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.674576Z","title":"Bootstrap your own latent-a new approach to self-supervised learning.Advances in neural information processing systems, 33:21271–21284, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.674576Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:e5f133a68e811ae63a53a53e2396ef404cea751ff07041a98730d6a9eca11bf2","observation_id":"800abae5-d917-4ba9-96e3-94014f1dda76","resolution":{"observed_at":"2026-08-01T07:15:04.674576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-16T00:37:04.298248Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-01T07:15:04.679007Z","title":"Minillm: On-policy distillation of large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.679007Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:620ec0e14c1706aa106c6ada4fc94d98357fe7244f0d856e43dc43e8379a8721","observation_id":"56951897-8735-406f-85e2-f79f7d93c6f6","resolution":{"observed_at":"2026-08-01T07:15:04.679007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.683389Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.683389Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:a20e9ab1457220231eb5b236374efc2798f1dc0f10a588a2c706e32d61b1a864","observation_id":"70a39e2b-7351-4369-a54a-19d84e2fd27f","resolution":{"observed_at":"2026-08-01T07:15:04.683389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-01T07:15:04.687849Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.687849Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:323b798defeaf6014a788477f7fee37cae98d8f209198dcc41c1951112ab158c","observation_id":"94c65250-2228-4741-bbe0-87dfbd3b7bb2","resolution":{"observed_at":"2026-08-01T07:15:04.687849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-12T12:02:18.586804Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-08-01T07:15:04.692614Z","title":"Uni-opd: Unifying on-policy distillation with a dual-perspective recipe, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.692614Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:6c5a7813c84a30a941c00f480fa44e01542681a13bf5e3da8717f146c28c5e1b","observation_id":"443f92a8-abcc-484d-af78-424bcedd03b0","resolution":{"observed_at":"2026-08-01T07:15:04.692614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-01T07:15:04.697497Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.697497Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:7f0a4e313c2921c1763a4800f94806e23365675375c85e419026038407cc7d06","observation_id":"91fb44d0-25f9-4e35-954d-c95d1f68bc53","resolution":{"observed_at":"2026-08-01T07:15:04.697497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T07:15:04.702290Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.702290Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:3bb0d4759e212cc4a02e16882fdc962b1911aeebf71b6e492acf6474c04ed4e0","observation_id":"0b67fda7-2c7b-45fb-ac51-70a66e080723","resolution":{"observed_at":"2026-08-01T07:15:04.702290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-01T07:15:04.706821Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.706821Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:3f863129b876b75aec6066eec7feab4441446e259d0a0559315417cb9f13afea","observation_id":"9156d7fc-4933-4aa4-8bd0-8f9ebc7c575f","resolution":{"observed_at":"2026-08-01T07:15:04.706821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03986","last_updated":"2025-09-04T08:13:06Z","snapshot_observed_at":"2026-08-14T07:49:09.972633Z","submitted_at":"2025-09-04T08:13:06Z","title":"Promptception: How Sensitive Are Large Multimodal Models to Prompts?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.03986","snapshot_observed_at":"2026-08-01T07:15:04.711699Z","title":"Promptception: How sensitive are large multimodal models to prompts?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.711699Z"},"links":{"cited_paper":"/paper/2509.03986","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:428b277aaf2498c718fa90f79c2f1039617ac5d6eaac05744ab84d29318d53b8","observation_id":"ec02a296-0102-4221-ab72-2575174acf98","resolution":{"observed_at":"2026-08-01T07:15:04.711699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-01T07:15:04.716428Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.716428Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:eecec65f6611e8535545319c427c6d0cc9e59fff85c5d8e1b7a532437b36b6e0","observation_id":"c72feaa3-5c49-43e1-8a7a-eb50fc8a3ce7","resolution":{"observed_at":"2026-08-01T07:15:04.716428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-13T18:28:46.913210Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-01T07:15:04.721789Z","title":"A survey of state of the art large vision language models: Alignment, benchmark, evaluations and challenges, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.721789Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d2b912b5ed7fb72b955e856b4eacba9287f9d356b8412fb99790a6e7355d3c86","observation_id":"c052f202-f853-4631-9d9c-0740241e0da1","resolution":{"observed_at":"2026-08-01T07:15:04.721789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.726389Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.726389Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:911fc4c9b2ec1ec99d2cb483017f5ad80248b3e787f3b5f2bfb04387bab57acc","observation_id":"8a088de6-549d-45df-8b1e-110fcac39a8a","resolution":{"observed_at":"2026-08-01T07:15:04.726389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-01T07:15:04.736272Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.736272Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:13c2b649764c61a8e54c4cf8c6c7a41208d1b08ee61a921ecfd7cbb2e1b747e9","observation_id":"005c5b11-e4b4-4fdd-8178-c01b68297e34","resolution":{"observed_at":"2026-08-01T07:15:04.736272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.740678Z","title":"Act2see: Emergent active visual perception for video reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.740678Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:717ca1565e8d082a7b0cefc296727e928764caf33001843d718eacf36fed08ed","observation_id":"5ea76575-6e97-4265-850d-a528e7e9345b","resolution":{"observed_at":"2026-08-01T07:15:04.740678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-01T07:15:04.746663Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.746663Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:a5ac70271cfea8bb560f1a2886cb40dddd1de9829e6c5f43e5219fbd26a811ed","observation_id":"0a37c9d6-1e6c-4b5c-9347-42f16de6cc39","resolution":{"observed_at":"2026-08-01T07:15:04.746663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.751619Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.751619Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:c276b95209aa0f8dc47270330530b6dc61c874880592f2840e05825476b185ae","observation_id":"c45894b4-affa-4dd1-91da-6cfdeefce6e6","resolution":{"observed_at":"2026-08-01T07:15:04.751619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-16T13:22:43.390351Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-01T07:15:04.756097Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.756097Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:5e751a9ddf8d271107d55b0f7b2ba050b9c0165d358922c271f617357bd8060e","observation_id":"35cb7a66-a70d-4ed5-a400-cd06b3417592","resolution":{"observed_at":"2026-08-01T07:15:04.756097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.760746Z","title":"Recursive introspection: Teaching language model agents how to self-improve.Advances in Neural Information Processing Systems, 37:55249–55285, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.760746Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:0578f46dab426690c20e6306df281f163e2e4b5632e4efae6dc67a9e52b98b58","observation_id":"a8f7b739-3ed5-403d-bd74-93ccc2a9ccb9","resolution":{"observed_at":"2026-08-01T07:15:04.760746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.765215Z","title":"Pope: Learning to reason on hard problems via privileged on-policy exploration, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.765215Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:a5196444de4e3656dda7d726c627b67419cf57baa2ace64225ce2fc5e40d87ba","observation_id":"e2ed1393-efcb-4249-91a0-67336f91d9ed","resolution":{"observed_at":"2026-08-01T07:15:04.765215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04917","last_updated":"2026-06-18T15:34:46Z","snapshot_observed_at":"2026-08-11T18:23:10.166901Z","submitted_at":"2026-04-06T17:56:25Z","title":"Vero: An Open RL Recipe for General Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04917","snapshot_observed_at":"2026-08-01T07:15:04.769550Z","title":"Vero: An open rl recipe for general visual reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.769550Z"},"links":{"cited_paper":"/paper/2604.04917","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:0b819774a64e4d3afaff330508233eba23799a8e3f79367359e4718dc59a8080","observation_id":"5d12d4bd-0d5a-4a89-9a73-298062f7b31c","resolution":{"observed_at":"2026-08-01T07:15:04.769550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00448","last_updated":"2025-04-14T10:11:13Z","snapshot_observed_at":"2026-08-16T14:30:39.251880Z","submitted_at":"2023-12-31T10:53:58Z","title":"Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00448","snapshot_observed_at":"2026-08-01T07:15:04.773961Z","title":"Beyond chinchilla-optimal: Accounting for inference in language model scaling laws, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.773961Z"},"links":{"cited_paper":"/paper/2401.00448","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:a5b4845f4ffeecc1f4465dc59fd53d32c9e9f034c30e032ecfe4a55f4ac5541d","observation_id":"614edcb5-a55e-4295-b561-7e810942375c","resolution":{"observed_at":"2026-08-01T07:15:04.773961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T07:15:04.778440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.778440Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:f78bc8473217b98bd7fdcb80313570611fe764eda83cffda24e4f9983a64109d","observation_id":"4139cbd4-d2a3-486c-a35a-34ee54a98330","resolution":{"observed_at":"2026-08-01T07:15:04.778440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-15T04:42:50.651833Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-01T07:15:04.782715Z","title":"Self-distillation enables continual learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.782715Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:329a647fff9cab009555000066847eabd59092b636039234ae8dfde6e4852670","observation_id":"8ba6bff4-2494-4a2e-892c-aed4054e65e2","resolution":{"observed_at":"2026-08-01T07:15:04.782715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.787162Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.787162Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:f07d7469421a2c59234fffa13b870a041fa10acd7c43a54e8ffcd4a3603a9bef","observation_id":"14803639-0d63-41ae-9456-2f2189130775","resolution":{"observed_at":"2026-08-01T07:15:04.787162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17294","last_updated":"2024-10-08T06:58:27Z","snapshot_observed_at":"2026-08-16T13:39:53.511689Z","submitted_at":"2024-06-25T05:43:21Z","title":"Math-LLaVA: Bootstrapping Mathematical Reasoning for Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17294","snapshot_observed_at":"2026-08-01T07:15:04.791349Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.791349Z"},"links":{"cited_paper":"/paper/2406.17294","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:36e07ee5e1485978992ae115f4f60bf27f57abe4ddf29beed4f5c7dc3dcd6c19","observation_id":"3e71a487-fe57-4d44-8b08-4a006cbca7b2","resolution":{"observed_at":"2026-08-01T07:15:04.791349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14644","last_updated":"2025-08-20T11:55:19Z","snapshot_observed_at":"2026-08-15T06:07:09.904480Z","submitted_at":"2025-08-20T11:55:19Z","title":"LeanGeo: Formalizing Competitional Geometry problems in Lean","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14644","snapshot_observed_at":"2026-08-01T07:15:04.795934Z","title":"Leangeo: Formalizing competitional geometry problems in lean, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.795934Z"},"links":{"cited_paper":"/paper/2508.14644","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:8b543c6108f4aa8ee216b536986d428d527737418c6ea41e8d061a8e260923cb","observation_id":"0c36fd5a-6053-4441-96d9-7cee283e3f83","resolution":{"observed_at":"2026-08-01T07:15:04.795934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.801275Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.801275Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:cdb1e8184bbd5ab172473a34ff644d458402d7534cd4eacf687f5e4bce24382b","observation_id":"4c0140b4-8cce-49f0-ad26-7a3028f747e4","resolution":{"observed_at":"2026-08-01T07:15:04.801275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-14T07:48:23.313445Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-01T07:15:04.805957Z","title":"Mimo-v2-flash technical report, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.805957Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:02b618fa9d32db2dcce0322ca82d1535688f3355f5fe8572b0851c2281b818a3","observation_id":"20fa0a4c-086f-43d1-8655-67981f03080f","resolution":{"observed_at":"2026-08-01T07:15:04.805957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01347","last_updated":"2026-05-02T09:41:37Z","snapshot_observed_at":"2026-08-15T15:07:23.646536Z","submitted_at":"2026-05-02T09:41:37Z","title":"MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01347","snapshot_observed_at":"2026-08-01T07:15:04.810651Z","title":"Mad-opd: Breaking the ceiling in on-policy distillation via multi-agent debate, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.810651Z"},"links":{"cited_paper":"/paper/2605.01347","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:718c50637e0deae4330b3be3aabd616a617737648e49e3432fe8197ebc1459ef","observation_id":"dfd3fc61-235a-4883-9358-1f569245d082","resolution":{"observed_at":"2026-08-01T07:15:04.810651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-01T07:15:04.814859Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.814859Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:3a9b06b533c99a64809e3e40bb51e26bb08aa2b9af5a285ae761fe4c055f8f23","observation_id":"55740da8-8086-440e-b66b-fac6fe428c75","resolution":{"observed_at":"2026-08-01T07:15:04.814859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10557","last_updated":"2025-05-15T17:59:21Z","snapshot_observed_at":"2026-08-17T18:03:58.343855Z","submitted_at":"2025-05-15T17:59:21Z","title":"MathCoder-VL: Bridging Vision and Code for Enhanced Multimodal Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10557","snapshot_observed_at":"2026-08-01T07:15:04.819402Z","title":"Mathcoder-vl: Bridging vision and code for enhanced multimodal mathematical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.819402Z"},"links":{"cited_paper":"/paper/2505.10557","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:1df92c0b8a596456433b763193ea9bd29cc6811f58c974e709ee4772197dd97c","observation_id":"6d504318-332e-47ef-b723-b5c5ebe98013","resolution":{"observed_at":"2026-08-01T07:15:04.819402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-08-11T06:04:53.078032Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-01T07:15:04.823955Z","title":"Perception-aware policy optimization for multimodal reasoning.arXiv preprint arXiv:2507.06448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.823955Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:df6a9c6e26c269cf0f164d1c2de95f8c1b23198d2fca3603025dd6baf4cb4587","observation_id":"cf478290-8401-4027-90e6-4ac0fe3c2963","resolution":{"observed_at":"2026-08-01T07:15:04.823955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03173","last_updated":"2025-08-05T07:29:58Z","snapshot_observed_at":"2026-08-14T21:59:07.930197Z","submitted_at":"2025-08-05T07:29:58Z","title":"Geoint-R1: Formalizing Multimodal Geometric Reasoning with Dynamic Auxiliary Constructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03173","snapshot_observed_at":"2026-08-01T07:15:04.834215Z","title":"Geoint-r1: Formalizing multimodal geometric reasoning with dynamic auxiliary constructions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.834215Z"},"links":{"cited_paper":"/paper/2508.03173","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d1fd5af6c6a0774cc107bfbab6c85811006db1a7aa3a78bc425fa76b357f761c","observation_id":"01389ec1-5ced-4d68-884f-f6a263b9a779","resolution":{"observed_at":"2026-08-01T07:15:04.834215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16256","last_updated":"2026-04-17T17:15:18Z","snapshot_observed_at":"2026-08-20T01:50:12.370990Z","submitted_at":"2026-04-17T17:15:18Z","title":"Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16256","snapshot_observed_at":"2026-08-01T07:15:04.838927Z","title":"Do vision- language models truly perform vision reasoning? a rigorous study of the modality gap, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.838927Z"},"links":{"cited_paper":"/paper/2604.16256","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:3430bce88c9272c280dd1e2724adccbe0e18f3ef43f13ffb0a610aa77b3316db","observation_id":"e6ecad1f-9284-4c06-a33a-dd357aca7626","resolution":{"observed_at":"2026-08-01T07:15:04.838927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.843686Z","title":"Learning to deliberate: Meta-policy collaboration for agentic llms with multi-agent reinforcement learning.arXiv preprint arXiv:2509.03817, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.843686Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:9b2d411570efc8071d913f1f7eaf143df6c0d3135e24d1ca70f2f2fdb23743ba","observation_id":"65a83369-1dac-47ba-82fc-4363b8443820","resolution":{"observed_at":"2026-08-01T07:15:04.843686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.848204Z","title":"Maestro: Learning to collaborate via conditional listwise policy optimization for multi-agent llms.arXiv preprint arXiv:2511.06134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.848204Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:585fa36b3a8673f1cf558711eec57d89d8cd68681d6cd9b45db8def7a4357274","observation_id":"0161922b-e0b4-4734-a802-75fdbfe94ce2","resolution":{"observed_at":"2026-08-01T07:15:04.848204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.852468Z","title":"Auditing multi-agent llm reasoning trees outperforms majority vote and llm-as-judge.arXiv preprint arXiv:2602.09341, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.852468Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:09a018d3d373a05b4e8cd6d2a60dad48d4800be4c306a112516b724b32ecf472","observation_id":"6a9948f5-00cb-474f-b820-5b7a99e23541","resolution":{"observed_at":"2026-08-01T07:15:04.852468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-01T07:15:04.856634Z","title":"Learning beyond teacher: Generalized on-policy distillation with reward extrapolation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.856634Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:706e8ef2248a5ffdc8ae9c2a020523e84a64ec88dcc09c27254843a643d40509","observation_id":"18a83e59-66f3-4667-bf18-fa0a169c9470","resolution":{"observed_at":"2026-08-01T07:15:04.856634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-01T07:15:04.861211Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.861211Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:8380a888e3c3362c5e0876243bc245009ce7244e6580beb8d45d1683f8f4f296","observation_id":"21dbe5af-01fe-4b5e-994c-966e9fd7adc8","resolution":{"observed_at":"2026-08-01T07:15:04.861211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15616","last_updated":"2026-05-13T12:54:20Z","snapshot_observed_at":"2026-08-03T01:38:16.643054Z","submitted_at":"2025-05-21T15:06:59Z","title":"LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15616","snapshot_observed_at":"2026-08-01T07:15:04.865776Z","title":"Lens: Multi-level evaluation of multimodal reasoning with large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.865776Z"},"links":{"cited_paper":"/paper/2505.15616","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d3822cac582d4e1e1781b2d1928208f66f6e2b78f8eda4c38e0df34d50fe21bc","observation_id":"9add3ca0-4778-4f5d-be46-7c8428638404","resolution":{"observed_at":"2026-08-01T07:15:04.865776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-01T07:15:04.870137Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.870137Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:93604db2de3512c6c0b9d1d98b099ee7872e56ba4a6673d454a08d048f5b2e11","observation_id":"5c055d66-f9a4-428b-9b63-1a7351e0fd91","resolution":{"observed_at":"2026-08-01T07:15:04.870137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-01T07:15:04.874580Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.874580Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d25a6e5573dd1ce94d890ba53cb3820bc98624097028ddee11bf1629ea0217c7","observation_id":"d653697e-646e-4a4a-8dc8-8547195f7da1","resolution":{"observed_at":"2026-08-01T07:15:04.874580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06430","last_updated":"2025-01-11T04:08:44Z","snapshot_observed_at":"2026-08-16T12:59:13.118418Z","submitted_at":"2025-01-11T04:08:44Z","title":"Open Eyes, Then Reason: Fine-grained Visual Mathematical Understanding in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06430","snapshot_observed_at":"2026-08-01T07:15:04.879389Z","title":"Open eyes, then reason: Fine-grained visual mathematical understanding in mllms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.879389Z"},"links":{"cited_paper":"/paper/2501.06430","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:013ccf5d375986390cf353ff11605511420de16e5146e10f3ef218f767b79e46","observation_id":"81f6e23b-66ab-4ae6-ad96-9fcfdbc2014d","resolution":{"observed_at":"2026-08-01T07:15:04.879389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-01T07:15:04.883982Z","title":"Mul- timodal chain-of-thought reasoning in language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.883982Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:c253b2a5a0550ce89bcf38f32d88c9a278c9400d3292a075ae9c655937b37bbd","observation_id":"200a722c-570e-4549-bbe6-cdd1f70f4150","resolution":{"observed_at":"2026-08-01T07:15:04.883982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-01T07:15:04.888418Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.888418Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:b712521e8049175636856a4f5fe807196a73f36cee23928d8e591c0059b36911","observation_id":"bc43f842-cb12-4d39-8d2f-5cb5dee124ba","resolution":{"observed_at":"2026-08-01T07:15:04.888418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-01T07:15:04.893015Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.893015Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:2ef282777ff372ad8fcf43edaf5051816d90a8371b47afc3b388634cb84b5481","observation_id":"ea5c08ae-bd5f-4271-8a75-92071231de52","resolution":{"observed_at":"2026-08-01T07:15:04.893015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.897787Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.897787Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:4baa21ef4029aabefca5b1b8420479cd3cbf432f99331519f1de553bd02f02d8","observation_id":"868947be-c10e-418a-8ca7-04ad05f2cd59","resolution":{"observed_at":"2026-08-01T07:15:04.897787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.902144Z","title":"Check carefully that:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.902144Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:325aab3f7076f6b0ead3389adc307242c77be37fcbb1713029e55337f597494b","observation_id":"00667ec6-3ae4-49ad-9ed8-b5d2ceb4df91","resolution":{"observed_at":"2026-08-01T07:15:04.902144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.906594Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.906594Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:022138b41cb9aabda402a81a3b31370ba3f817cbbaf8bc543216e54c5cf88152","observation_id":"8e7053bf-9c12-415b-9ae3-b979d2e2ddf2","resolution":{"observed_at":"2026-08-01T07:15:04.906594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.911260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.911260Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:736b5c8e4fce41907de71ad9dc1726563f4531b7f20b0abd4c4af9fdfae8e679","observation_id":"c23ede00-c455-4b5e-9f67-4484b3c87a74","resolution":{"observed_at":"2026-08-01T07:15:04.911260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.916324Z","title":"• The marked angle corresponds to the intended angle, not its complementary or supplementary angle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.916324Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:64731ac537756bc08c6ddb41c745a930d651819a06b26286957f7bc0ffae8ac5","observation_id":"49ff2cdc-2808-49b7-95ad-c26163520187","resolution":{"observed_at":"2026-08-01T07:15:04.916324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.920804Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.920804Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:aeff8f197388d7a37aa162bf5b3e8b10c33c6f7577d662ebbb53bbc45bb96f34","observation_id":"7cb9553d-1ab7-43af-90cb-f9ecf6374d2e","resolution":{"observed_at":"2026-08-01T07:15:04.920804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.925165Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.925165Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:2d960c0443a66758cbac82c429a508dd979604cf6c7d6a6df2a52bc192530d53","observation_id":"26dceb38-985b-497c-9430-805f5a9e6c5f","resolution":{"observed_at":"2026-08-01T07:15:04.925165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.929292Z","title":"If any required element is missing, incorrectly marked, ambiguously represented, or misleading, judge the diagram as inaccurate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.929292Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:30436378a58a5bd586f097a6614c8ff36bd8d1278e0c5b329335c10ed1bfea31","observation_id":"c89801df-dfef-4915-a636-c5165dfbbd38","resolution":{"observed_at":"2026-08-01T07:15:04.929292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.933682Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.933682Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:bfe69faf43f2e2c0d05994510ea9861213546a650e9cff0a8d7f34f38a4f95d5","observation_id":"4d4a5799-ae73-41e5-b69e-68af5906a61b","resolution":{"observed_at":"2026-08-01T07:15:04.933682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.937896Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.937896Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:d206d39051560b7b17525054b535f9c76e9a5ec7fe1df52ebdcb5e58fc016752","observation_id":"4effeaaf-2518-4879-80f8-659c13b574dd","resolution":{"observed_at":"2026-08-01T07:15:04.937896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.942883Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.942883Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:49a7d06b6d8dfdc471a30775190898c2eac4e964ff7d7d959ce8ca885055cc18","observation_id":"d4825746-a52a-420b-8edb-aa3f05451c1a","resolution":{"observed_at":"2026-08-01T07:15:04.942883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.948116Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.948116Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:f32c8390943c29445e97da150e2c1153454c83401cda74018cde326ac50dd480","observation_id":"c8aee955-0f4c-4bad-8540-99364b467f9c","resolution":{"observed_at":"2026-08-01T07:15:04.948116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.952648Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.952648Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:700966b5c4039e809c30ca122b2b38305eef6ec6c98253245c87a6e8773b67ed","observation_id":"b14edf06-d223-47ec-9a2f-58bc67954ce7","resolution":{"observed_at":"2026-08-01T07:15:04.952648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.957062Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.957062Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:bdf7e151c7413b95550b134385dfa04ac6ce2bc2c69cabe10e70c7cbaf7a51fc","observation_id":"9a45a759-7d17-4f80-9839-5bb3d02b8f97","resolution":{"observed_at":"2026-08-01T07:15:04.957062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.961339Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.961339Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:caec25ca20b337ceaa4c47c287a6f5ccf0ad03bff90fcc2f9ae36a1384583d80","observation_id":"6bb00f4b-9e6d-4ed9-a3de-56911efc7ecc","resolution":{"observed_at":"2026-08-01T07:15:04.961339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.966233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.966233Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:7cf46791cbd1e883078c3de1826281d34e7fa66e0cc1b5483acf48f45eff3ca8","observation_id":"2d75836c-d67a-4f73-8861-0e1852c92859","resolution":{"observed_at":"2026-08-01T07:15:04.966233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.970525Z","title":"## Original question:<question> ## Rewritten question (visual-redundant info removed): D Examples D.1 Example 1 Summary The correct answer is 3 √ 2 + 2 √","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.970525Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:4b501966c7e5cb11d709ddc6e0efa69b844bca4c682b1d0c2524b8958d83088a","observation_id":"7e9a8f99-1614-4665-bc32-59862ab4bbe5","resolution":{"observed_at":"2026-08-01T07:15:04.970525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.974869Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.974869Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:101917860a9c747ad3292d08179ccc8e852dc912f5b9b6708d36ec8048039a37","observation_id":"f7529501-cde6-469b-b7eb-010876d64d36","resolution":{"observed_at":"2026-08-01T07:15:04.974869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.979119Z","title":"A square AEF G is constructed with AE as one side, and points A and G are on the same side of line BE","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.979119Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:1797e83a36ae18ee93695d0e99ccb5c332788eb4edecae43e02b2383c48272d2","observation_id":"a29c29cc-8fff-4802-aa5f-1ffa178ff698","resolution":{"observed_at":"2026-08-01T07:15:04.979119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:15:04.983727Z","title":"share a common side","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.983727Z"},"links":{"citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:e6f1ac99b20f68972e17a523b217483892d3cbe7d003582643433841d8ab5b5e","observation_id":"96b71f79-5b52-4d80-86d0-2ec2989b6881","resolution":{"observed_at":"2026-08-01T07:15:04.983727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-01T07:15:04.731318Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.731318Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:a4afd058afbecd1ed421fc39b2028bd3ef0fb16662152b4d8b693f016f13f255","observation_id":"3f734109-9592-4675-b136-0a4e7c87df0b","resolution":{"observed_at":"2026-08-01T07:15:04.731318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T04:10:55.730404Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":81,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2607.21552."}