{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6074b81cd5a26e5cf9aea28d56f27d08635404650b453308d3331e19da0b4c44","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:04:14.304184Z","state":"measured"},{"denominator":144,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":144,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":69,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:22:55.993691Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.282206Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:60a9ffe6ea12a58e0b2d90804717da10c2b702fcd3030aad8750c59270f09317","observation_id":"c28b2eff-3c30-4dc7-84c2-4f4f91a8c0bb","resolution":{"observed_at":"2026-05-22T19:32:01.014278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-07T04:22:55.993691Z","title":"Mimo-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T00:05:09.574699Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:55.993691Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:5ba1ccb88079f68012ab5692f3f9f20741f6ca61cf8820b3da286b4c27e1b736","observation_id":"61343ccd-0658-4382-8a41-57d7baedba20","resolution":{"observed_at":"2026-08-07T04:22:55.993691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T20:45:09.848642Z","title":"Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting He, Shuai Bai, Keqin Chen, Jialin Wang, Yang Fan, Kai Dang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:09.848642Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:d18a722f9f3cea1a0e042d8b576c4e10f5a03658b7fc0be90633786a4a6b8e18","observation_id":"b2c8541a-7675-4cd5-9fc8-2cb2f4bb202a","resolution":{"observed_at":"2026-08-06T20:45:09.848642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T19:14:04.898698Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:04.898698Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:d3eba6b3b4cfdefb2df6c2b3e9fe70b3d059863d4a97bcb4e01368fb9ad6d8a3","observation_id":"643527ce-67f8-431a-85b6-f4d5b2f11e23","resolution":{"observed_at":"2026-08-06T19:14:04.898698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T17:19:47.032597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11200","last_updated":"2025-07-18T16:56:02Z","snapshot_observed_at":"2026-08-07T20:38:25.739713Z","submitted_at":"2025-07-15T11:12:39Z","title":"How Far Have Medical Vision-Language Models Come? A Comprehensive Benchmarking Study","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:19:47.032597Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.11200"},"observation_digest":"sha256:54bcbaaf8fc1f3a847941ccbf8866614bca37adb69bf55fe06252b2d149b58be","observation_id":"46e0d4a7-b639-4306-8547-51f65d2169d2","resolution":{"observed_at":"2026-08-06T17:19:47.032597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T14:25:32.939651Z","title":"Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh J Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19478","last_updated":"2025-07-25T17:59:26Z","snapshot_observed_at":"2026-08-07T22:33:01.602402Z","submitted_at":"2025-07-25T17:59:26Z","title":"MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:25:32.939651Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.19478"},"observation_digest":"sha256:aca9242bf24e4994b77d2e78598a3ac70de98854a93acb802606e6b63c399b4d","observation_id":"cf116d3b-3523-42a2-b6d4-71f203e48e34","resolution":{"observed_at":"2026-08-06T14:25:32.939651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T13:23:34.638759Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-07T01:11:37.463830Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:34.638759Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:1459bf12536754b3261fd0571e18652047e2a0e2599adb843d5852d423240413","observation_id":"7b1b8f95-21da-41f6-abcb-9ef99a3cb01b","resolution":{"observed_at":"2026-08-06T13:23:34.638759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T12:40:09.085046Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21619","last_updated":"2025-07-29T09:18:22Z","snapshot_observed_at":"2026-08-07T23:36:20.034251Z","submitted_at":"2025-07-29T09:18:22Z","title":"EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T12:40:09.085046Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2507.21619"},"observation_digest":"sha256:2d458b42e9f3719c947e10ec2165d4a3d4cd89bd851524dc855fe64a991a4fa2","observation_id":"4d8ff12c-2c07-4a63-99f6-b547ba3544cc","resolution":{"observed_at":"2026-08-06T12:40:09.085046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T23:03:10.109377Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:10.109377Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:6b096e87c1f6ff86f14a3bb6b56b35080c4983c0608bc247f625a08847344818","observation_id":"71aee071-de03-4200-b863-2ceaaa125bea","resolution":{"observed_at":"2026-08-05T23:03:10.109377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2508.09521","last_updated":"2026-04-09T12:13:05Z","snapshot_observed_at":"2026-07-06T22:12:12.166886Z","submitted_at":"2025-08-13T06:09:32Z","title":"PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T23:16:13.165715Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2508.09521"},"observation_digest":"sha256:97c5d35489cd5409bf000949fb840539ddb7d42bf1c2c377a0d3b168c1b9e44d","observation_id":"9fd128e0-de73-428a-b81b-8ee18a9c45cc","resolution":{"observed_at":"2026-05-18T23:16:53.749435Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T16:15:27.996778Z","title":"MiMo-VL Technical Report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18805","last_updated":"2025-08-26T08:40:22Z","snapshot_observed_at":"2026-08-08T01:12:52.353250Z","submitted_at":"2025-08-26T08:40:22Z","title":"Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:15:27.996778Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2508.18805"},"observation_digest":"sha256:81027aa685ff4ee5893a6321474ad7204ebbe2ea42723b29b7faab133fd81155","observation_id":"0b3a079a-698a-45a6-aa9f-76a8f375d4b1","resolution":{"observed_at":"2026-08-05T16:15:27.996778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T14:42:21.112448Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21113","last_updated":"2025-09-02T13:37:38Z","snapshot_observed_at":"2026-08-05T14:42:19.666014Z","submitted_at":"2025-08-28T17:48:19Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:21.112448Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2508.21113"},"observation_digest":"sha256:e4898de407c9fd8b3712af749acb0a6a4e2f4c0985b2fb4a2ef108989c646062","observation_id":"318485fe-dbb2-4117-bac5-cd3e05544081","resolution":{"observed_at":"2026-08-05T14:42:21.112448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T13:24:39.805838Z","title":"Mimo-vl technical report, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.805838Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:9c50bbe5ea75d0f8ed8fce7d5a21cc2541abbf204aab9b0f3edf58931f59e825","observation_id":"1283b163-a25e-4989-99da-ea011bde4706","resolution":{"observed_at":"2026-08-05T13:24:39.805838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T12:28:32.039808Z","title":"dad\") lightly bites the little dog’s ear as a way of correcting the little dog’s improper behavior. This gentle bite is a common","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-07T09:15:48.717373Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:32.039808Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:3ec2390726e05f4aecb0bb91708a3210eeb50add27f4f673423e7d3206f0e121","observation_id":"83f477d4-a0ee-4e46-b838-1ef3770b3e50","resolution":{"observed_at":"2026-08-05T12:28:32.039808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2509.01986","last_updated":"2026-04-08T07:45:08Z","snapshot_observed_at":"2026-07-06T22:22:03.439592Z","submitted_at":"2025-09-02T06:06:52Z","title":"Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T20:04:00.773443Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.01986"},"observation_digest":"sha256:8fd311cb91c5e33178f164a63bfa1d18cd04a8b5feb26de8478db08332838cbf","observation_id":"66398f4f-8c4e-4ba3-b31d-33a74d5d8454","resolution":{"observed_at":"2026-05-18T20:06:50.111502Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T11:11:20.883362Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.883362Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:d8e49489f49bb555effb175d44cda383e874d954b36aded0ce54d2bebcf94136","observation_id":"0c8d68e1-e4a3-49ab-ae44-cdf495f6c7a2","resolution":{"observed_at":"2026-08-05T11:11:20.883362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-04T10:40:42.595790Z","title":"Shilin Xu, Yanwei Li, Rui Yang, Tao Zhang, Yueyi Sun, Wei Chow, Linfeng Li, Hang Song, Qi Xu, Yunhai Tong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09733","last_updated":"2026-07-28T12:35:46Z","snapshot_observed_at":"2026-08-08T01:13:54.575859Z","submitted_at":"2025-10-10T13:34:23Z","title":"VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:40:42.595790Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2510.09733"},"observation_digest":"sha256:b8882f3003f0d2f1ba3be27c738bfaa55aa5f782a8590bc0bfcb9ef36979883e","observation_id":"f71a09d5-6d54-4b7c-8b97-ee11e5773ca8","resolution":{"observed_at":"2026-08-04T10:40:42.595790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-04T08:15:57.154824Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-04T08:15:30.884838Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:57.154824Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:0389084a11b0a72f2c2e3adb3f410010441dc444244eee7a93eb2e278dcc063a","observation_id":"297e34fa-3fdd-4af5-ade9-56901d741640","resolution":{"observed_at":"2026-08-04T08:15:57.154824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-04T07:02:44.094748Z","title":"Tianbao Xie, Jiaqi Deng, Xiaochuan Li, Junlin Yang, Haoyuan Wu, Jixuan Chen, Wenjing Hu, Xinyuan Wang, Yuhui Xu, Zekun Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-04T07:02:38.694383Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:44.094748Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:8633c4e4e1984c664684901844043d213c9130a58a8650a453bbb6f73f2a98bc","observation_id":"b12fa6d3-9b00-4db2-95ce-68799fe4fb10","resolution":{"observed_at":"2026-08-04T07:02:44.094748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:f5c785627568eea1f84f6baed0f6c8af0624c4f310a564037750ba6e101b307b","observation_id":"c6250233-8598-4bfb-9014-55b6ec3f5792","resolution":{"observed_at":"2026-05-17T20:42:05.687903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:38:49.075457Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:9b13da7b423cee25c66d646c01621fb1dc3156b39678388bd9204b2ba4eee2e1","observation_id":"c82b5776-93cb-4903-8d1a-afe3ddaf8a8c","resolution":{"observed_at":"2026-05-16T08:40:46.378830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-03T05:14:24.167937Z","title":"and Team, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-03T05:14:21.502066Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T05:14:24.167937Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2602.02994"},"observation_digest":"sha256:06fc3602153f35c3f396b459a76d7efce7e5c284518fcd4d6f8705ac24d52147","observation_id":"73ec2059-50bf-408b-a4d9-affbcfca6975","resolution":{"observed_at":"2026-08-03T05:14:24.167937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T13:36:28.844714Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:65307e64f518b00dc0dc1d01452b9d8437a8ea8d9546f70133d394a6c3be7111","observation_id":"4bd98a5d-fed8-4758-8c26-3f7e5d93553c","resolution":{"observed_at":"2026-05-21T13:40:12.591587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-03T04:31:21.274478Z","title":"Singh, A., Fry, A., Perelman, A., Tart, A., Ganesh, A., El-Kishky, A., McLaughlin, A., Low, A., Ostrow, A., Ananthram, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.04802","last_updated":"2026-07-22T16:08:20Z","snapshot_observed_at":"2026-08-03T04:31:17.019218Z","submitted_at":"2026-02-04T17:48:55Z","title":"VISTA-Bench: Do Vision-Language Models Really Understand Visualized Text as Well as Pure Text?","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:31:21.274478Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2602.04802"},"observation_digest":"sha256:6b92af44dcae28aed2e4e2fb3a9d724aae91567ae2ca9dc6cf26f347ab0cf925","observation_id":"8628686b-b34e-440d-8232-120cf27510e9","resolution":{"observed_at":"2026-08-03T04:31:21.274478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-03T03:21:13.930637Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08503","last_updated":"2026-06-04T07:08:18Z","snapshot_observed_at":"2026-08-08T03:26:45.601937Z","submitted_at":"2026-02-09T10:55:13Z","title":"Learning Self-Correction in Vision-Language Models via Rollout Augmentation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T03:21:13.930637Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2602.08503"},"observation_digest":"sha256:1ee720b8b8cc1900ba484e43863376da78dc7901c0e46a75f015999be30b48b5","observation_id":"9f537819-a78b-4e4e-8494-e6c407fc8e08","resolution":{"observed_at":"2026-08-03T03:21:13.930637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-02T19:56:30.621170Z","title":"MiMo-VL Technical Report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-07T07:10:53.274893Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:30.621170Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:0ad9b694b2fe69545dc260d798c5dbc44a508e3008e9f216dcd6d7e46f958389","observation_id":"9a820de4-a910-4a8d-a76c-6440165bd6fd","resolution":{"observed_at":"2026-08-02T19:56:30.621170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:ced76d6c713dea41c08871ffb1c67352b974d420db6251c701d29ded4d1f03ca","observation_id":"54be8578-9b88-423a-8e54-6368f2bb3019","resolution":{"observed_at":"2026-05-11T09:56:01.057349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2604.18320","last_updated":"2026-04-20T14:20:44Z","snapshot_observed_at":"2026-08-02T05:38:32.357591Z","submitted_at":"2026-04-20T14:20:44Z","title":"EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T05:23:45.814042Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2604.18320"},"observation_digest":"sha256:1f9607230f90345e00182f5b171f207b2c238b436dc4079d57969e60e33540a0","observation_id":"2ad5634b-2940-4275-8fe7-d9223b08657b","resolution":{"observed_at":"2026-05-10T05:25:54.855125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2604.20705","last_updated":"2026-04-22T15:46:42Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T15:46:42Z","title":"SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T01:23:32.849326Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2604.20705"},"observation_digest":"sha256:7177d9e6a99bb77236727f6f3280ecb16870b5d783cb7733ec2e6c02441e5723","observation_id":"93ddcea5-acf8-4ffb-8237-018a3f76e2a3","resolution":{"observed_at":"2026-05-11T13:36:08.615360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2604.20806","last_updated":"2026-04-22T17:37:40Z","snapshot_observed_at":"2026-08-02T21:32:46.195325Z","submitted_at":"2026-04-22T17:37:40Z","title":"OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T00:40:47.562861Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2604.20806"},"observation_digest":"sha256:e5ce778fa7b995466269d31536dea2f53c163ff7d92801db60a72fc272d6525d","observation_id":"ccbc11e3-b927-4d3a-8df1-943a753f759e","resolution":{"observed_at":"2026-05-11T13:46:03.261247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:d521bb39fe3b796ecc52c6cf77d04f8807121be303d950626960fe0749e20ff9","observation_id":"a0dd9a59-629e-4a98-aa0a-89287382ae77","resolution":{"observed_at":"2026-05-09T06:55:43.902486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:fe11b4e4c960108e5eda0a631b636f3d0bb467e8450f6a1713204568378460f8","observation_id":"77cabe27-51d5-40c4-aa38-b3a2361805c2","resolution":{"observed_at":"2026-05-21T08:19:52.700497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.04503","last_updated":"2026-05-06T05:12:41Z","snapshot_observed_at":"2026-08-02T14:20:11.154625Z","submitted_at":"2026-05-06T05:12:41Z","title":"DiffCap-Bench: A Comprehensive, Challenging, Robust Benchmark for Image Difference Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T17:56:47.621050Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.04503"},"observation_digest":"sha256:4b5ef310102c8e94b45e33e9fcf64beca706ffc5085d029f93f637cbd3524d06","observation_id":"c4354bf9-2a8f-4871-91f3-eb6334a7b9e1","resolution":{"observed_at":"2026-05-09T06:55:44.279701Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:4416dd54a3a27d97ac176794024476b1eaad88420961aa425c732baa40a8472f","observation_id":"0f5b740a-da5a-4aff-b708-a435da384cba","resolution":{"observed_at":"2026-05-11T04:15:55.990591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.07872","last_updated":"2026-05-08T15:29:11Z","snapshot_observed_at":"2026-08-04T19:38:15.330922Z","submitted_at":"2026-05-08T15:29:11Z","title":"Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:20.880231Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.07872"},"observation_digest":"sha256:c17a0a3e7f0e0b5fa616fbe470af5936261f93f9312cea629b1dcfc6ed530778","observation_id":"c894e30b-280e-44aa-b709-a1bfb5edb5a9","resolution":{"observed_at":"2026-05-11T03:45:58.468198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-07-31T21:56:47.276347Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:35:09.568623Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:df261a0521f8e722844a639735a9b8973d30fa2fc7f28693d91d27dc0ee2295c","observation_id":"893cbb9f-1030-4cab-b4cc-941550d89e86","resolution":{"observed_at":"2026-05-13T01:37:03.526884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-07-31T21:56:47.276347Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-14T21:10:49.059686Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:7c087b74c98a41f87c647961b945141248abb7b7b23201f652deca834a287f57","observation_id":"3ac97830-2507-4a0b-98ad-ce6f04e24b6e","resolution":{"observed_at":"2026-05-14T21:18:00.124492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-07-31T21:56:47.276347Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:55.817334Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:97f3b1bbfb5f3a505dbf98dbf00eda8c1a5d1005242a10666edb1dcd2bba915b","observation_id":"0569c09f-ce8d-4b67-80c0-7a74e654719c","resolution":{"observed_at":"2026-05-19T17:02:40.597384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.11651","last_updated":"2026-05-26T04:36:02Z","snapshot_observed_at":"2026-07-31T21:56:47.276347Z","submitted_at":"2026-05-12T07:14:04Z","title":"Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T22:41:13.164195Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.11651"},"observation_digest":"sha256:14414be698a0b1400e68c3b14836c87755ed1460d445f3c12d51c32674b9020e","observation_id":"031d66aa-8f0a-4a00-b416-864604493087","resolution":{"observed_at":"2026-07-01T13:45:46.445675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.14733","last_updated":"2026-05-14T11:56:14Z","snapshot_observed_at":"2026-08-06T01:04:24.065010Z","submitted_at":"2026-05-14T11:56:14Z","title":"Video-Zero: Self-Evolution Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T21:32:16.939563Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.14733"},"observation_digest":"sha256:9315a68b2d8996464f12b3d370b61afb4b4c15d92392fa145d219c68bb161539","observation_id":"0334a5b5-72d2-44bf-8c11-5bb24cc56331","resolution":{"observed_at":"2026-06-30T21:35:04.412313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T10:58:01.621488Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:48eaa3e290e7c0e30ee51b9dbc32f96c04adc9df5dd0f008f229e151215f10e6","observation_id":"9e181396-0d43-4b55-809d-c86d586c3484","resolution":{"observed_at":"2026-05-20T10:58:13.489809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T18:28:21.605646Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:17e5570e273406f860e16f1f1776e912b926957d69c4fc42bde12fe0bd576a5b","observation_id":"e9a0c321-523d-4464-b0a9-c3eeeeffb87a","resolution":{"observed_at":"2026-07-01T14:55:48.506207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.21954","last_updated":"2026-05-21T03:40:22Z","snapshot_observed_at":"2026-07-06T23:32:20.708664Z","submitted_at":"2026-05-21T03:40:22Z","title":"MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T07:13:43.716510Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.21954"},"observation_digest":"sha256:6c7fdc42705630a84e27e6cc079410d03401df26f1cd7ec61d86d95538f1251b","observation_id":"f91bb6c9-f935-4c34-ab58-92281d03fbf3","resolution":{"observed_at":"2026-05-22T07:14:42.401670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.21973","last_updated":"2026-05-21T04:03:25Z","snapshot_observed_at":"2026-08-02T18:13:51.157847Z","submitted_at":"2026-05-21T04:03:25Z","title":"Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-22T08:04:55.680668Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.21973"},"observation_digest":"sha256:1e958ec88e99b391aba9bf72a2af71b1430a5fb9606625a2cd98006990738726","observation_id":"83e8f609-e1d0-4b50-9f14-5bc4fcd3faf0","resolution":{"observed_at":"2026-05-22T08:06:15.393088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.24503","last_updated":"2026-05-23T10:19:41Z","snapshot_observed_at":"2026-08-01T20:05:51.575035Z","submitted_at":"2026-05-23T10:19:41Z","title":"FoodMonitor: Benchmarking MLLMs for Explainable Compliance Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T13:51:47.455642Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.24503"},"observation_digest":"sha256:59a7db1d374003ef8cd7e82620d206ad839b7c1820aee01e7b7fd031259f2029","observation_id":"7fa44757-a829-4dcb-9436-49bcdd706b9d","resolution":{"observed_at":"2026-06-30T13:54:43.935849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.25706","last_updated":"2026-07-04T04:01:13Z","snapshot_observed_at":"2026-07-31T08:07:43.069382Z","submitted_at":"2026-05-25T11:05:37Z","title":"Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:02.455554Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.25706"},"observation_digest":"sha256:a58bce0f67cd7c90e7e91ce43d0c1dfe59c0a68546f044d727af7837af2b8ef8","observation_id":"a5a691c8-6b18-4d0a-91c3-a657e0f751e0","resolution":{"observed_at":"2026-06-29T23:24:02.166045Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2605.31174","last_updated":"2026-05-29T11:41:58Z","snapshot_observed_at":"2026-08-05T07:08:13.150772Z","submitted_at":"2026-05-29T11:41:58Z","title":"Detect in Any Scene: An Agentic Framework for Object Detection with Experience-Aware Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T22:38:30.213948Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2605.31174"},"observation_digest":"sha256:14098d4826a0ec6f43f2d616c38c4bfb78c045d80e862eacd2183a17b79030af","observation_id":"a6ec13b3-b844-40b6-8ed8-9bcf9aa26393","resolution":{"observed_at":"2026-06-28T22:42:46.667492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.01599","last_updated":"2026-06-01T02:52:49Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T02:52:49Z","title":"TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T14:55:07.045625Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.01599"},"observation_digest":"sha256:0500312f20c6f1adbfbd4e50083b06ac2e5f6f4defd7b2465625459ecc06cb33","observation_id":"a3b539c2-eae4-444f-ae51-e861be05b60f","resolution":{"observed_at":"2026-07-01T22:56:19.971431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.03920","last_updated":"2026-06-02T17:12:05Z","snapshot_observed_at":"2026-08-02T12:14:20.077142Z","submitted_at":"2026-06-02T17:12:05Z","title":"Benchmarking Visual State Tracking in Multimodal Video Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T10:43:06.811228Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.03920"},"observation_digest":"sha256:ed7a999c5ad8a0e434e5f6b3e636377f16d15ef5309496613d22e7d54307d76d","observation_id":"af881701-d82d-4273-839e-3ef5afd8e92e","resolution":{"observed_at":"2026-07-02T02:46:27.944526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.04591","last_updated":"2026-06-03T08:29:43Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T08:29:43Z","title":"Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-06-28T06:04:28.939248Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.04591"},"observation_digest":"sha256:a48df3f8e19c5934b694bd220722713d269d4d30eb35e5e4b01822c98f9cfb50","observation_id":"9ba9fe9f-ca95-473a-a74f-74f5ed8b7c7e","resolution":{"observed_at":"2026-07-02T08:26:47.984436Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.08239","last_updated":"2026-06-06T15:51:25Z","snapshot_observed_at":"2026-08-04T05:12:18.575932Z","submitted_at":"2026-06-06T15:51:25Z","title":"When No Answer Is Correct: Diagnosing Absent Answer Detection for MLLMs in Video Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T19:40:56.851297Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.08239"},"observation_digest":"sha256:e6152c4e7116fbee1088f358dbab5a2062d1c7d52eef1ccc73ea7b3f5528c2ca","observation_id":"229438a3-c704-4337-85dd-68bfdd291a7a","resolution":{"observed_at":"2026-07-02T21:37:24.811296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.12125","last_updated":"2026-06-10T14:19:15Z","snapshot_observed_at":"2026-08-04T05:43:14.707313Z","submitted_at":"2026-06-10T14:19:15Z","title":"Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T10:04:29.739632Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.12125"},"observation_digest":"sha256:4cae57b0612ef259f7b50353d2c6bf10297fddc5dd98e4ffe7e91b7e64d74263","observation_id":"f312811b-cd21-4be4-9a69-dd19e9c8f32e","resolution":{"observed_at":"2026-07-03T10:27:56.033020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.23678","last_updated":"2026-06-22T17:58:54Z","snapshot_observed_at":"2026-08-07T05:35:38.415603Z","submitted_at":"2026-06-22T17:58:54Z","title":"AIR: Adaptive Interleaved Reasoning with Code in MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T09:06:38.001604Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.23678"},"observation_digest":"sha256:7811b762ae134f2fb0627521e7f54bf765d8afb77522f7bc632523432bcc8faa","observation_id":"e8f54eff-88c8-4653-95b8-f558789e19cf","resolution":{"observed_at":"2026-07-04T10:09:44.983706Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-06T19:51:08.157500Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:f725181e85c528e9cc4b41beef1085ee672fbed057e80e7fc5383b33a8fb5924","observation_id":"6a3f5543-80b6-4747-bf82-9c2e3d3ef69f","resolution":{"observed_at":"2026-07-04T16:29:57.283757Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.27500","last_updated":"2026-06-25T19:36:38Z","snapshot_observed_at":"2026-08-07T13:35:50.634455Z","submitted_at":"2026-06-25T19:36:38Z","title":"Aloe-Vision: Robust Vision-Language Models for Healthcare","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T02:02:47.472868Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.27500"},"observation_digest":"sha256:617e443a5c868c4d4bb7aebe8eb143c8b170505244bb0045157b88f7147e1dfa","observation_id":"991bc27b-06fc-4768-8e66-36a67bbedc2e","resolution":{"observed_at":"2026-07-01T18:25:57.944069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":277,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:e949bb66d76f529465ca8b04dfab22a0292194fde391b18a5fd8d9abe4d18752","observation_id":"36501310-a408-4f0d-89a1-e547603e6e68","resolution":{"observed_at":"2026-07-01T15:45:47.594634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":277,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:880df83a6e0ea175d6349655a82c4cc13963f658aae789411cb11d326f7bec9a","observation_id":"485ee3cd-1f75-48bb-ade0-16c332cb0008","resolution":{"observed_at":"2026-07-02T21:17:24.078871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2506.03569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-04T16:29:57.282206Z","title":"MiMo-VL technical report","venue":null,"work_id":"ff16745d-77cd-4a78-8a08-7ce35908863d","year":2025},"citing_paper":{"arxiv_id":"2607.02096","last_updated":"2026-07-02T12:32:53Z","snapshot_observed_at":"2026-07-07T00:07:33.184524Z","submitted_at":"2026-07-02T12:32:53Z","title":"LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-03T15:41:03.548799Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.02096"},"observation_digest":"sha256:39317c2490482e27db87a802b138f018a0d6639368117cce49efa7a39ea73d83","observation_id":"e3295a0c-7ae7-45dd-8c0d-f85951fb995d","resolution":{"observed_at":"2026-07-03T15:48:35.007245Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-14T07:02:55.388823Z","title":"Mimo-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11106","last_updated":"2026-07-13T05:32:00Z","snapshot_observed_at":"2026-08-02T02:44:53.481299Z","submitted_at":"2026-07-13T05:32:00Z","title":"Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T07:02:55.388823Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.11106"},"observation_digest":"sha256:83265a991417c692452ef5784ddf3b7e6dd36bbc5880975729631c4e1a7656f9","observation_id":"45c10caa-2eb0-4a62-b485-f74be4e92864","resolution":{"observed_at":"2026-07-14T07:02:55.388823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-02T06:33:30.687572Z","title":"Mimo-vl technical report.arXiv preprint arXiv:2506.03569, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12477","last_updated":"2026-07-15T01:51:44Z","snapshot_observed_at":"2026-08-04T12:13:40.827631Z","submitted_at":"2026-07-14T08:04:31Z","title":"Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:30.687572Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.12477"},"observation_digest":"sha256:7ec19b5c850ef50be3db087907d5d96aff5af9b7dc5a44282e61b96b10ea4a35","observation_id":"1fb177ae-653c-4280-b4d2-86794a0e404f","resolution":{"observed_at":"2026-08-02T06:33:30.687572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-01T18:04:17.011960Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17423","last_updated":"2026-07-19T22:04:33Z","snapshot_observed_at":"2026-08-05T19:15:04.907010Z","submitted_at":"2026-07-19T22:04:33Z","title":"TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T18:04:17.011960Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.17423"},"observation_digest":"sha256:f179781ad4f6a50df4349c548c50722fcb4c43c6252be505575246e1856444ab","observation_id":"8c9a65e3-14b0-4b3d-bf4e-54edb7612293","resolution":{"observed_at":"2026-08-01T18:04:17.011960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-01T08:37:43.966698Z","title":"Mimo-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21061","last_updated":"2026-07-23T08:52:11Z","snapshot_observed_at":"2026-08-08T01:13:21.444754Z","submitted_at":"2026-07-23T08:52:11Z","title":"MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T08:37:43.966698Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.21061"},"observation_digest":"sha256:1cc3d34ca4bf8b8a442b489e46bca9f821d75b56ce24167fcb9b2503eddcb34a","observation_id":"bc403541-2b97-4b33-9b74-c58a6aa4d875","resolution":{"observed_at":"2026-08-01T08:37:43.966698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-30T12:15:47.193300Z","title":"Mimo-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23794","last_updated":"2026-07-26T18:36:23Z","snapshot_observed_at":"2026-08-08T08:49:45.206781Z","submitted_at":"2026-07-26T18:36:23Z","title":"PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T12:15:47.193300Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.23794"},"observation_digest":"sha256:5d6de9333cc6903d2ab13af29a4f17b19a950642cad6162d36bc105950a3f0e7","observation_id":"38a6600d-e2b8-4c86-bd0e-470aeb0b9fee","resolution":{"observed_at":"2026-07-30T12:15:47.193300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-02T09:49:33.571423Z","title":"MiMo-VL Technical Report.arXiv preprint arXiv:2506.03569, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24789","last_updated":"2026-06-27T06:51:58Z","snapshot_observed_at":"2026-08-08T01:12:52.012687Z","submitted_at":"2026-06-27T06:51:58Z","title":"NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T09:49:33.571423Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.24789"},"observation_digest":"sha256:a971cede2fd39e70419e3584b370ca33d289542dc12621974e71b25065b33102","observation_id":"72382549-ea31-40eb-a9bf-70cb567513b8","resolution":{"observed_at":"2026-08-02T09:49:33.571423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-31T00:05:16.891205Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25151","last_updated":"2026-07-27T23:50:46Z","snapshot_observed_at":"2026-08-06T12:12:05.597891Z","submitted_at":"2026-07-27T23:50:46Z","title":"HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T00:05:16.891205Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.25151"},"observation_digest":"sha256:9701149b83ddb7f32db709ac4a33a26fdf9a939a8705623d9e1408084787145e","observation_id":"958d1bf7-dbaf-43b6-8f45-47cd133a3c08","resolution":{"observed_at":"2026-07-31T00:05:16.891205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-01T01:14:37.781329Z","title":"arXiv:2506.03569","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27798","last_updated":"2026-07-30T07:36:53Z","snapshot_observed_at":"2026-08-07T23:12:16.555388Z","submitted_at":"2026-07-30T07:36:53Z","title":"MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T01:14:37.781329Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.27798"},"observation_digest":"sha256:e696270f51699bb035d4f14428a7f0f44f5152861bdf6ebec693b70a6a6e8641","observation_id":"aaca9b6d-975b-4fba-a7c6-4d74fcfd061d","resolution":{"observed_at":"2026-08-01T01:14:37.781329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-31T05:08:20.095639Z","title":"MiMo-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-07T17:45:50.081609Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.095639Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f63c59eb4996b594f753e8ac00895ba2bef21f2c5669202a9daff0105baec15b","observation_id":"a7a12be9-d250-4a05-8de4-ccfca55f846b","resolution":{"observed_at":"2026-07-31T05:08:20.095639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-04T15:43:56.781142Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02078","last_updated":"2026-08-03T11:27:29Z","snapshot_observed_at":"2026-08-07T09:34:47.772040Z","submitted_at":"2026-08-03T11:27:29Z","title":"CAVE: Competence-Aware Visual Boundary Evidence Alignment for Video Temporal Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T15:43:56.781142Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2608.02078"},"observation_digest":"sha256:836b923d21225fe777bf17a701ce3b68965b418672e9059c9a936b0982da89a0","observation_id":"1c0ff46f-77e5-48d1-af0e-05b385705b8f","resolution":{"observed_at":"2026-08-04T15:43:56.781142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-06T04:40:15.205510Z","title":"Mimo-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05131","last_updated":"2026-08-06T08:22:41Z","snapshot_observed_at":"2026-08-08T08:16:41.091072Z","submitted_at":"2026-08-05T17:53:06Z","title":"OPD-V: Visual On-Policy Self-Distillation with Modality Balance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T04:40:15.205510Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2608.05131"},"observation_digest":"sha256:ef025308a6179944d8de65ae9dc32a5df9f71ff0d7c7e0829c4d243d79bf516f","observation_id":"d5d883eb-ec4d-4405-ad37-cf7b0f03d325","resolution":{"observed_at":"2026-08-06T04:40:15.205510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03569/citation-record","integrity":"/paper/2506.03569/integrity","json":"/paper/2506.03569/citation-record.json","paper":"/paper/2506.03569"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.112495Z","title":"Alayrac, J","venue":null,"work_id":"5d7937fe-e476-4970-95e5-8dc24d3a8a8e","year":2022},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.025617Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:fe5ec07fe3951e4994dd8e5e7c4fa955e08f37661094ab54a52ff42290336cd0","observation_id":"9aa704c6-9745-4a83-9db6-73fd870606d3","resolution":{"observed_at":"2026-08-07T11:04:15.116017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:04:14.034077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.034077Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:209c8baaa45cea5ad127826969d84498fe42a759c6412b5b1c48d2bb85207df0","observation_id":"a2826d57-f206-4ba1-be60-983d963a0685","resolution":{"observed_at":"2026-08-07T11:04:14.034077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T11:04:14.038069Z","title":"Black, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.038069Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:1f30d5a036a0c14ee11333a2a24fc835f684521ccc2efb6f1484e45445a0dc9c","observation_id":"50a1dfbd-b5e8-4c7c-a3a4-32c2cb1cd12c","resolution":{"observed_at":"2026-08-07T11:04:14.038069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.102234Z","title":null,"venue":null,"work_id":"2756bb02-51ea-404c-872d-73a04c0035d5","year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.042192Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:de1f420145e8aef79841dfd59955a3e9c5534f965c1137f7df34be621fa37588","observation_id":"670331bf-23e3-4d08-8d1e-a9d3fb28f477","resolution":{"observed_at":"2026-08-07T11:04:15.105797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.09465","last_updated":"2021-11-08T08:31:44Z","snapshot_observed_at":"2026-07-06T10:34:53.435463Z","submitted_at":"2021-01-23T09:43:44Z","title":"WebSRC: A Dataset for Web-Based Structural Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.09465","snapshot_observed_at":"2026-08-07T11:04:14.045891Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.045891Z"},"links":{"cited_paper":"/paper/2101.09465","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:2601054b15fa16af5c1bc69c7c699971616e29147e47d19b544112cf26e9ccad","observation_id":"3ef05f39-56ca-4db7-97e5-7c698381868f","resolution":{"observed_at":"2026-08-07T11:04:14.045891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-08T01:11:54.830004Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-07T11:04:14.050518Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.050518Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:13adede92fc6e874ab4999a759c8d0d6bc42712b89efdefc8a3e3cd72ccf2103","observation_id":"106c8006-b943-42f6-89be-79b3fc2895ba","resolution":{"observed_at":"2026-08-07T11:04:14.050518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-07T11:04:14.055373Z","title":"Cheng, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.055373Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:5d027323b0e11af7b24443776801c3a82205786471aa39c8100eeafc3233281b","observation_id":"6488aff5-0583-4f75-86e2-4a7535c09af9","resolution":{"observed_at":"2026-08-07T11:04:14.055373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08687","last_updated":"2025-03-25T22:17:42Z","snapshot_observed_at":"2026-08-08T01:13:06.347998Z","submitted_at":"2024-12-11T18:59:46Z","title":"VisionArena: 230K Real World User-VLM Conversations with Preference Labels","version":3},"cited_work":{"arxiv_id":"2412.08687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08687","snapshot_observed_at":"2026-08-07T11:04:14.741774Z","title":"VisionArena: 230K Real World User-VLM Conversations with Preference Labels","venue":"cs.CV","work_id":"9ca24f14-54c3-4dd0-887a-509aa971f0c7","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.059734Z"},"links":{"cited_paper":"/paper/2412.08687","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:73059b792bd49020438c2d7b9c5dc468510c5b92ab3187a4fcfcbdeb2367aefd","observation_id":"6ff283ef-5fb7-446c-934f-e085a2eb0250","resolution":{"observed_at":"2026-08-07T11:04:14.747082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.063690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.063690Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:c04b0105ccbe880464bce426d4f1744b138031b80de15498f828b51e98aa90f2","observation_id":"d1f6d652-58c4-4a40-8837-16795209b209","resolution":{"observed_at":"2026-08-07T11:04:14.063690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T11:04:14.067321Z","title":"Deitke, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.067321Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b25ce23101854b478e0128f1c8130d442b309735e6b9f8537b2008ea513dc536","observation_id":"4c1e6125-b66b-4986-9ca1-38897496c9e4","resolution":{"observed_at":"2026-08-07T11:04:14.067321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T11:04:14.070645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.070645Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:d6947519740327c4bf0c8a0dc99c20d5cc1a34332551a044427358d3c05d7a26","observation_id":"8798a9b4-020a-40fc-8455-e5210490734d","resolution":{"observed_at":"2026-08-07T11:04:14.070645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-124","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.331697Z","title":null,"venue":null,"work_id":"f4aacd16-4b19-4a79-9ffe-72511890a09e","year":2019},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.074224Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:ec03c79b3939579ffcf80fa58f31735b3da3783831e37635e990d5d1293ffa94","observation_id":"298525a3-dc3f-44c8-bb97-016218fff5ec","resolution":{"observed_at":"2026-08-07T11:04:14.336562Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T11:04:14.077563Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.077563Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:796d55a8e7bf302623f4674bbef16eb1048ce6a3cc1de9c6919a64c57f0a80f8","observation_id":"dc824662-9735-4f92-aa61-5b0ab13b7362","resolution":{"observed_at":"2026-08-07T11:04:14.077563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.086853Z","title":null,"venue":null,"work_id":"bea81c9c-d755-4c68-a3b8-8a4b2b73fb99","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.081196Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:2decbcf381637ac0f9d6c977844ce6f6687b90ecee0dc725730483afcc71a836","observation_id":"c985dc53-33c1-440a-945b-883a04ae9c81","resolution":{"observed_at":"2026-08-07T11:04:15.090052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.085568Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.085568Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b7b183b88bf9d386f09baed935244b5ac769948f1c9d48c2740eac24be2f4965","observation_id":"a4c3bb18-9b57-45d0-bfea-258c3bcfb8ac","resolution":{"observed_at":"2026-08-07T11:04:14.085568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T11:04:14.088974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.088974Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:6f08d9c8c987506459b12ad492c1c28897ac07abd7982b1a22ed1678559bcb55","observation_id":"747b7261-a0d9-4748-8ab5-e02023921a45","resolution":{"observed_at":"2026-08-07T11:04:14.088974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T11:04:14.092481Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.092481Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:a47b6462ed7d471518efb0c10a020c7e97adb97709b5badfb9445e5a86877aee","observation_id":"987da426-a6e2-4e58-89e8-0e770f4d570b","resolution":{"observed_at":"2026-08-07T11:04:14.092481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T11:04:14.095997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.095997Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:a821a967373ce7664c119ba92f198c7c8c476e00bd02a20fdf1e874e43a1f3ba","observation_id":"d211c42b-33cd-43bf-a248-ebabe66b7dc9","resolution":{"observed_at":"2026-08-07T11:04:14.095997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T11:04:14.099478Z","title":"Jiang, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.099478Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:90865136f7483a09aa6db12ba5f1ac0c3e1b0a59c7ef8a53d8d5bf1151674e94","observation_id":"483754e1-be5e-4ab1-bffb-67493c08e6f3","resolution":{"observed_at":"2026-08-07T11:04:14.099478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.069998Z","title":"Karamcheti, S","venue":null,"work_id":"3d1d11cc-7e95-42d5-87ef-5003fdc7ae51","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.103006Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:4a09896c0528688e5df07108b18988a1540465d2026adec6eaab2161251b0603","observation_id":"4c2bb9ce-966a-4916-bb14-8d66bfb6ff6c","resolution":{"observed_at":"2026-08-07T11:04:15.073290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.059163Z","title":"Kazemzadeh, V","venue":null,"work_id":"40fc3ead-562b-4e61-9107-f1f105a3b09c","year":2014},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.106351Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:915af135dd1a0fe4b3e1ee61364579dc9ce20b8cfd43518df5c7e646458dfc98","observation_id":"b54d876d-a504-455c-a503-e2fdd9f8b944","resolution":{"observed_at":"2026-08-07T11:04:15.062551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.047464Z","title":"Kembhavi, M","venue":null,"work_id":"bce58559-90f8-41b6-b03b-9ac22ec23c3e","year":2016},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.109684Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:a1cc95f49d7726881822ec1c53396e89f7740eca9e81c57abb148b7141b8fb20","observation_id":"38e4f808-d3be-46c9-936a-82138f84335e","resolution":{"observed_at":"2026-08-07T11:04:15.052054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T11:04:14.112913Z","title":"Lambert, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.112913Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b43010a0c71f5601e275a88bc18bbbbe2fd649472f37c0396b5df75cd26ce04a","observation_id":"da410722-19b9-450b-b315-c59a0296f470","resolution":{"observed_at":"2026-08-07T11:04:14.112913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T11:04:14.116722Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.116722Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:f1359215ddd5999253da7337eae8598f90d2ca6e75bc232ac2595f9eb1d35393","observation_id":"f24a4638-6649-4dad-9272-65e048d80726","resolution":{"observed_at":"2026-08-07T11:04:14.116722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07981","last_updated":"2025-04-04T14:25:17Z","snapshot_observed_at":"2026-08-07T16:08:52.673312Z","submitted_at":"2025-04-04T14:25:17Z","title":"ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07981","snapshot_observed_at":"2026-08-07T11:04:14.120139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.120139Z"},"links":{"cited_paper":"/paper/2504.07981","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:ed359f354bce0fd9d0ca0039e6901e66738be97b5b16dbdaec372837a86c5c38","observation_id":"05a081a7-53ea-40d3-a02d-6246af5351d4","resolution":{"observed_at":"2026-08-07T11:04:14.120139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-07T11:04:14.123685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.123685Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b2d7de8764071f21ccf0501524119796bc781f88c627a12e50eca5727a59e923","observation_id":"350c9168-2d72-4d6f-92d7-aba2d8543642","resolution":{"observed_at":"2026-08-07T11:04:14.123685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.036926Z","title":null,"venue":null,"work_id":"5f0518fb-50b1-4104-b0e4-80132b42dfb1","year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.127539Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:3ebe737d298c960fab10929717cf46d557e3f2b8919bffa67913a96e737afcee","observation_id":"77e454d1-eab0-42c5-9876-16cbc6fc0224","resolution":{"observed_at":"2026-08-07T11:04:15.040120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-07-06T17:57:31.912970Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-08-07T11:04:14.131074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.131074Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:fc6706759f79600f5c8ba8087e8527dbdf6ae3722c9c9b3326664f2e6f98d925","observation_id":"db0c7814-3e4a-4b6f-86b6-8e5a0d247c6d","resolution":{"observed_at":"2026-08-07T11:04:14.131074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.026762Z","title":null,"venue":null,"work_id":"4a130417-d137-46cb-91d1-8a737769b833","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.135029Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:27c6c21b07fa2b1f3838c1c40203c7f6ba60b177cffe7ab3d24351314df20f94","observation_id":"c8b776c9-bfe4-4024-868a-d8d1b4f460a9","resolution":{"observed_at":"2026-08-07T11:04:15.030409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.016502Z","title":null,"venue":null,"work_id":"8156e053-b421-4042-bb8c-c3f798064ed6","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.138906Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:232df73dfa9a1331484fbf2ad61c49c07a2899f3f1be766b8768a3d09b326b1d","observation_id":"50380670-97b8-45ca-b403-70f4ae033c09","resolution":{"observed_at":"2026-08-07T11:04:15.020268Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T11:04:14.142694Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.142694Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:21b62304227537dc01edc074a50b909fde2446f78089729d22d29c6acccc47c6","observation_id":"6c7eed2d-cf0e-41f6-8551-7053f830d656","resolution":{"observed_at":"2026-08-07T11:04:14.142694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:15.005380Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"38f02228-6db0-4e24-81d3-4d8133b08887","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.148173Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:aabac593e06385ac0557036ab42c13af0ee3579c0e4973a54b86b7e05a142d02","observation_id":"4ef01348-6663-492a-9c0e-ae9a7d88f4e0","resolution":{"observed_at":"2026-08-07T11:04:15.009244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.994295Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":"c098882b-2dc7-4ee9-a449-86644746ec34","year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.151937Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:91fff2e58c44bf7836530a00a75afc7501953264b86f206af3c3efe0477ded63","observation_id":"5ce0a271-881f-47b4-8ed1-e218205e07d2","resolution":{"observed_at":"2026-08-07T11:04:14.997894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.984623Z","title":"Mangalam, R","venue":null,"work_id":"99015e49-9c3e-4a9f-8487-4047caf4646b","year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.156916Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:7543b91f7b2d16fde22b77ce58aabfaa4b2aa6f5251389d534e7f5e9a1fd965a","observation_id":"05505eba-d9a1-42e4-8397-5fd8b2c0c4f1","resolution":{"observed_at":"2026-08-07T11:04:14.988056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T11:04:14.160624Z","title":"Masry, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.160624Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:0187cabbde8b9b9b5e943a3017c06b9a42dd9e143ed35ed0ad26c62a569c764f","observation_id":"672eaaeb-cfdd-4f7b-8ac2-88fcf873d575","resolution":{"observed_at":"2026-08-07T11:04:14.160624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.974774Z","title":"Mathew, D","venue":null,"work_id":"77819e25-478a-4f48-967f-843625a28335","year":2021},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.164676Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:e1c653eeee253f11c0e927b5bc21c0fb2589fa3c62ad9a540e7398aeb1e4346f","observation_id":"7409a732-62cd-4b2c-ad5f-db677b1d8397","resolution":{"observed_at":"2026-08-07T11:04:14.978055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.963646Z","title":"Mathew, V","venue":null,"work_id":"6ff55e70-3f4c-4f8a-b504-5bd730436873","year":2022},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.168315Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:a7bcc9c251ee7f1ad6ff88b5776c4db98e2bc21770888e6751518991f4aeba62","observation_id":"0d41bc7b-b4d2-4d45-9f17-79c5146d37ac","resolution":{"observed_at":"2026-08-07T11:04:14.967115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.953654Z","title":null,"venue":null,"work_id":"72fc786c-7883-4026-a064-f95012d9482d","year":2016},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.174943Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:7e10fefee2f46706cbe9746770650dce4b36fad5457ae2f90110aaeb94464abb","observation_id":"d0b5c300-4c4b-4f15-b85b-fa571334f0b2","resolution":{"observed_at":"2026-08-07T11:04:14.957073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.179094Z","title":"Computer-using agent: Introducing a universal interface for ai to interact with the digital world","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.179094Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:1982fd5613f423227399f7faeefce17bd6d98c325ecd51dda727dc11812fc588","observation_id":"d9e6d50f-7a39-4fd0-a161-ca5687bd38fa","resolution":{"observed_at":"2026-08-07T11:04:14.179094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.937904Z","title":"Ouyang, J","venue":null,"work_id":"8c836b89-a9d0-4159-bbd2-92d7b08ed34a","year":2022},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.182835Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:66b5a7f1f1e693e75d9929661feb13faf96eb0d37eb04337d3906ee8ff50e825","observation_id":"38547bc7-66bb-49a5-973d-4edba5f007c4","resolution":{"observed_at":"2026-08-07T11:04:14.941293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02287","last_updated":"2024-05-03T17:59:55Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:59:55Z","title":"Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02287","snapshot_observed_at":"2026-08-07T11:04:14.186518Z","title":"Padlewski, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.186518Z"},"links":{"cited_paper":"/paper/2405.02287","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:cc3763d536468137bc19a3cd355836ce07a53719f067a5252d6a97cef7eb6029","observation_id":"393c8537-f874-4d32-8226-f091b85810bc","resolution":{"observed_at":"2026-08-07T11:04:14.186518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.926811Z","title":"Paiss, A","venue":null,"work_id":"e324ddb8-fae0-4d64-935d-5aa2db59181c","year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.190120Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:1ca27fe72b0fa80ef3d1a13e6b10225709ae96581b9b7dcb925633fc43aee13d","observation_id":"1dfcd675-3d31-4dbf-b1b1-035ce52f7aa0","resolution":{"observed_at":"2026-08-07T11:04:14.930841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-07T11:04:14.193506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.193506Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:6d012a44babcdabf2830495e1281ddf8c4ae023a5820868585e6d0e48b739336","observation_id":"f93ff15b-64ec-4967-b269-e728eda1e8f6","resolution":{"observed_at":"2026-08-07T11:04:14.193506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T11:04:14.200543Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.200543Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:4014c0f1aa17ab5cffb128823b38fdd0e58f219488a196a7a7a63ef5bb61666e","observation_id":"20a32917-7a98-4a22-8e4f-fd16a6b7521b","resolution":{"observed_at":"2026-08-07T11:04:14.200543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06581","last_updated":"2025-03-27T16:16:09Z","snapshot_observed_at":"2026-08-03T13:03:43.962537Z","submitted_at":"2024-07-09T06:20:17Z","title":"Vision language models are blind: Failing to translate detailed visual features into words","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06581","snapshot_observed_at":"2026-08-07T11:04:14.204341Z","title":"Rahmanzadehgervi, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.204341Z"},"links":{"cited_paper":"/paper/2407.06581","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:8f0043eca8dff29ec125a566c81ab1faa2f5b944673e95c03ca50bb91d5ee19e","observation_id":"4a7c6114-3b17-4b08-a388-ef2a0bdc0a10","resolution":{"observed_at":"2026-08-07T11:04:14.204341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.208120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.208120Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b3fa405fffd4c348b735e3ca2eb22505a2d9501fb3f1b8de07b0276540275ee6","observation_id":"1a87f416-d202-47dd-99c8-72f7bfeed1cb","resolution":{"observed_at":"2026-08-07T11:04:14.208120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.909107Z","title":"Rezatofighi, N","venue":null,"work_id":"3718b2ee-870f-48c2-8273-be705731144c","year":2019},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.211431Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:eba2957d031100ea7c248379463de103af5d3367b5c7772f38cd27915cc6c938","observation_id":"194075af-6572-413f-9fb6-d5da771e53de","resolution":{"observed_at":"2026-08-07T11:04:14.912787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:04:14.214574Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.214574Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:7c4739859f0e397cbd52cb7f86b93ac4e2f39846d0d8febb0cf6798697d00179","observation_id":"f7c35073-bd3c-4415-9f5e-2b0e483d572b","resolution":{"observed_at":"2026-08-07T11:04:14.214574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T11:04:14.217839Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.217839Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:1d1f5892bf2af9747e2e5ee6ffe2fe693b14bd0a6540b5404bed858f6b69499f","observation_id":"d1886f12-039c-49d5-9267-da3c22794b7c","resolution":{"observed_at":"2026-08-07T11:04:14.217839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T11:04:14.221120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.221120Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:24184dfa1259589e92fc9f61e7c7174e74960b17c5d8adf315aa199a89a294de","observation_id":"8d03c616-b330-429d-bf9b-6b6a85f18dd8","resolution":{"observed_at":"2026-08-07T11:04:14.221120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.898386Z","title":null,"venue":null,"work_id":"e961485a-1612-49da-89f4-48bf0c4a1a43","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.225004Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:a9dca78b3506acd36fff65023126153dcd28823f008901bb3bc0ba90406af248","observation_id":"a3fcf5b8-5082-45d0-836b-ec5d85db990a","resolution":{"observed_at":"2026-08-07T11:04:14.902472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.887532Z","title":null,"venue":null,"work_id":"43135bbb-45b9-4a05-b4a3-810cab13153b","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.228284Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:7d22c1d7a8bf6f7e4ccb429a4042c636a07fa028d2bad7f14141dfc33da4c7b2","observation_id":"a307c3cd-758c-45b7-a4c2-7b57ef8323ba","resolution":{"observed_at":"2026-08-07T11:04:14.891258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.876443Z","title":null,"venue":null,"work_id":"0a362403-2aa0-474e-85d9-65e8c301ac62","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.231882Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:d5c92e39537c5a94a0dc8aaf17c782f62833e3b054c9751446bc43c1c1d7c150","observation_id":"f5df548b-aabe-43e9-9ea2-31398e8463c5","resolution":{"observed_at":"2026-08-07T11:04:14.879951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-07T11:04:14.234976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.234976Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:3ef5fc1317ac6a62ba14ae06b3eec4b90de7d9afb104af357bfd495a1ed9a5a5","observation_id":"12058bba-b8d3-4e0e-bbc5-eab30b9b953e","resolution":{"observed_at":"2026-08-07T11:04:14.234976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.865669Z","title":null,"venue":null,"work_id":"d7906b9e-68a2-4f9a-8e73-8c15072574aa","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.238436Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:757e3a55fe9897e0638030e19e1e6614d793ebfc2b1a6529bec571122230582c","observation_id":"e708e028-114c-4a3e-b3dd-ed2805a5e282","resolution":{"observed_at":"2026-08-07T11:04:14.869525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-07T15:14:57.062481Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T11:04:14.241662Z","title":"Wu and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.241662Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:a46973b9e02b09326e23120ededeb1a3f76b054705d78380aa6e52aa4b3cbe0a","observation_id":"7599ee8d-24d9-4414-ba22-ad3aa2d74bf5","resolution":{"observed_at":"2026-08-07T11:04:14.241662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-07T11:04:14.245410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.245410Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:5f96f54d637b08c583c61042679df8e1180db87152601f8b0a20ee63e05cfd8a","observation_id":"c9641ad7-43ab-4fd8-919f-7e04dbdcd212","resolution":{"observed_at":"2026-08-07T11:04:14.245410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-07T11:04:14.248887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.248887Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:7046c418602b1065475403288022b6775288b4151bd2d5d481b9ed2ea8c212df","observation_id":"80a3932f-3008-446c-b213-fbec0feedcc5","resolution":{"observed_at":"2026-08-07T11:04:14.248887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07608","last_updated":"2025-06-05T11:49:09Z","snapshot_observed_at":"2026-08-07T15:47:50.795694Z","submitted_at":"2025-05-12T14:30:11Z","title":"MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07608","snapshot_observed_at":"2026-08-07T11:04:14.252398Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.252398Z"},"links":{"cited_paper":"/paper/2505.07608","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:7a8408fd3d37508790e5ae60df0054a42fba2d28d54ec6a392bdbcb1b327690f","observation_id":"64865b0b-3a69-4a7f-9f3a-9ebbb71b8cf6","resolution":{"observed_at":"2026-08-07T11:04:14.252398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.256447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.256447Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:53f7e1bdd6a132eb2cec52b6b481f525cafa3f81cdd135f7612e96a9fe1928ef","observation_id":"0557dbb1-cc66-48fa-902e-f0342f4081c9","resolution":{"observed_at":"2026-08-07T11:04:14.256447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.260139Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.260139Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:e477b30b1fe8a111c12ca2fac3adfb3cf0e1fa15745a7cb036e04a5140b9e4a8","observation_id":"6f58e01f-8ddc-42bf-84f5-462322cdc782","resolution":{"observed_at":"2026-08-07T11:04:14.260139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-07T11:04:14.263056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.263056Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b6bef98f599d3df506005b2e2c6f5957bdbd3471ed8b549172eda8b0df8abec6","observation_id":"41847435-2c5a-495e-8d21-d61fea1e607a","resolution":{"observed_at":"2026-08-07T11:04:14.263056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-07T11:04:14.266387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.266387Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:2265e02d806b60eb5338a41402857a8712ef108f4dd99f0f3910b615c233814d","observation_id":"9c68946e-d713-4c77-a7f8-b444e217f206","resolution":{"observed_at":"2026-08-07T11:04:14.266387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.848456Z","title":null,"venue":null,"work_id":"4a6991d7-9be3-4ba5-85a7-a958bb91e21e","year":2025},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.269556Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:72383219f897aeeb812084184d29b423558c340e9d8484378a60f99d47bf4dfe","observation_id":"90ae787b-39e1-450b-a93d-7d962954c39d","resolution":{"observed_at":"2026-08-07T11:04:14.851806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.838182Z","title":null,"venue":null,"work_id":"cea47a70-6144-459c-bd2c-78f2fab654ac","year":2016},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.272683Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:ef334cfe92a6089f99e5693573b810f1c6be33481aaf2b3593b16c5b4df2353e","observation_id":"d02eabf1-fe77-4d49-82fa-7cc796e5fc9d","resolution":{"observed_at":"2026-08-07T11:04:14.841678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.828515Z","title":null,"venue":null,"work_id":"1cde7770-d886-48d3-a9d0-1cd14af87fe2","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.275700Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:5b751ae7d6d05e5bdec3ad0cd79eee90268093f778593b95302835168cd57737","observation_id":"03125271-f4c1-45c0-89b3-0ed29a95ad57","resolution":{"observed_at":"2026-08-07T11:04:14.831752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.818192Z","title":null,"venue":null,"work_id":"e35a0857-e38d-4157-b3f0-e309a0c25bd4","year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.278666Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b368332747ef61e0739196cd6ec16762038b3bd959759825c5be6f0ae23e3405","observation_id":"3befae66-651f-4867-b1e4-fa7177b06cfd","resolution":{"observed_at":"2026-08-07T11:04:14.821600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T11:04:14.281418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.281418Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:691909c42ca6c3579a3f1332dc1f154e0c1de7223152671ca22eb1b9f65d05b7","observation_id":"feaed296-f60b-4e70-9790-c248f2ad0358","resolution":{"observed_at":"2026-08-07T11:04:14.281418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T11:04:14.284762Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.284762Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:f6e3414a4e6310e8bb7274455d9f8fc14a06f9ae6becf200e506fb73a3c9cd60","observation_id":"399f54ee-1809-460e-a0d9-df04827b9876","resolution":{"observed_at":"2026-08-07T11:04:14.284762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-07T11:04:14.288361Z","title":"Zhang, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.288361Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:56741dc92067a00d5f6c10389818f927162b92fc00ebe3b392019d3675957bb3","observation_id":"c3ef15d8-c794-4f89-ab02-c0dde79acb97","resolution":{"observed_at":"2026-08-07T11:04:14.288361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-07T11:04:14.291602Z","title":"Zhang, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.291602Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:d15045eea2ec2405811cfe48150644991893adde0dfc56acc18f6852c4149e75","observation_id":"3d2026df-3505-4a46-96e4-998670e66d1d","resolution":{"observed_at":"2026-08-07T11:04:14.291602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.807133Z","title":"Zheng, W","venue":null,"work_id":"f781c219-3aa7-4c99-8ec3-bc46aefd98e3","year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.294892Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:2af597abc449b5b746a9886e9f1b532daa9db2bb3bcb9ed0008f3a025b886b8d","observation_id":"67daf7b8-965b-439a-9e86-0d81d6023e52","resolution":{"observed_at":"2026-08-07T11:04:14.810708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T11:04:14.297922Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.297922Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:77e42113c79bd3cb0034e41e0be1173787bc11a3ee5877a789e3bffeb09eae9b","observation_id":"ecb9df86-496c-40c5-ad32-5a02543195af","resolution":{"observed_at":"2026-08-07T11:04:14.297922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:04:14.301233Z","title":"Zitkovich, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.301233Z"},"links":{"citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:2afd51f1a0c75ca3884d5036f6224f0e1c93eedca84d98e51053105702762c35","observation_id":"7578a60e-6a0d-4f9f-9c08-77af19bdbbc3","resolution":{"observed_at":"2026-08-07T11:04:14.301233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-07-06T19:43:46.557944Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-08-07T11:04:14.304184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.304184Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:84f4a0b27107dbb0ac615935dd34ae30fe711512f08059b5dc743feeac884083","observation_id":"1b61006d-4166-4d49-ad64-4c018a689bad","resolution":{"observed_at":"2026-08-07T11:04:14.304184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 69 inbound Pith citation observations for arXiv:2506.03569."}