{"as_of":"2026-08-05T14:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:394084c96666d8d8d4f5a4d39a390e7d079d57a0395171e8e72e22fddcd843e5","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T20:08:29.208550Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:31:46.679205Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08035","snapshot_observed_at":"2026-08-02T03:31:46.679205Z","title":"Dyco-rl: Dynamic cross-modal coordination for visual reasoning.arXiv preprint arXiv:2606.08035, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13860","last_updated":"2026-07-15T14:05:58Z","snapshot_observed_at":"2026-08-05T00:38:16.159860Z","submitted_at":"2026-07-15T14:05:58Z","title":"Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:31:46.679205Z"},"links":{"cited_paper":"/paper/2606.08035","citing_paper":"/paper/2607.13860"},"observation_digest":"sha256:91f5d96ad00d2e4db45c3c034ddfbb7a66aab298166c52548bb155bfc9858cc2","observation_id":"d320dcc6-4118-4dc5-b9f3-1d40a5ed7a78","resolution":{"observed_at":"2026-08-02T03:31:46.679205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.08035/citation-record","integrity":"/paper/2606.08035/integrity","json":"/paper/2606.08035/citation-record.json","paper":"/paper/2606.08035"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06477","doi":"10.48550/arxiv.2510.06477","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.06477 , year=","venue":"ArXiv.org","work_id":"96bbe6e4-8e47-4301-a6e2-72c0606a8004","year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:cedb63bdcce490feca575a8647761eec6a2caf9b363b9256d1804ed6923a9e87","observation_id":"582e515b-bd11-4609-84e1-890ce1bd32b3","resolution":{"observed_at":"2026-07-02T20:47:23.065620Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:33b0138a43dfa3fe266701a261d79fc988cabdef04939e465b221ab6ebf40af8","observation_id":"a676f31b-ce4b-4224-88e2-6982e9703f15","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:c27eb55f1513e9909e55e83d311cafd2101b41f1693b6ea7ddc03fcce0817bb2","observation_id":"09e8f39a-82e3-40cd-802b-7efa230a74ef","resolution":{"observed_at":"2026-07-02T20:47:23.092686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:fe6910417efe3a75e31f4eb1cfc69293aa4427457fd983e9f303327ff7018413","observation_id":"a1c8aef3-7b27-44b4-a0fd-5067f7784eeb","resolution":{"observed_at":"2026-07-02T20:47:23.102053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Hallusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:fe9dbac5c696be8c6eca653924d2ef47ff49eb5848824d1b8ca8c342778d7ea6","observation_id":"34c691ca-64e5-4090-8c06-2767c0c8131a","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s41095-022-0271-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Martin, Ming-Ming Cheng, and Shi-Min Hu","venue":"Computational Visual Media","work_id":"5bd10a2c-a647-4470-859f-0ee65aa508a1","year":2022},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:c1117ec66977ebf6d19f5e65184a254ea5e344af29daa04763adc95eed68021f","observation_id":"56956140-54b6-4060-8376-7f7e53d74533","resolution":{"observed_at":"2026-06-27T20:11:12.978750Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Visual attention methods in deep learning: An in-depth survey.Information Fusion, 108:102417, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:ba4ea05da75a510dd82514cf8aacff1f82b768a28214909628f4fe4f9847a2d6","observation_id":"b98a9876-c02b-4d23-9bf3-6a3a62f52207","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.102417","doi":"10.1016/j.inffus.2024.102417","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://www.sciencedirect.com/science/ article/pii/S1566253524001957","venue":"Information Fusion","work_id":"05d608fd-5b03-4d45-8b05-eaa233894819","year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:bfa3dd68510bf0457c4ff89630c7536f01d4d8166757f238cb36fe7edd557f81","observation_id":"3a9bff08-a24e-4be2-a0d7-9af113012c43","resolution":{"observed_at":"2026-06-27T20:11:12.974033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.104194","doi":"10.1016/j.imavis.2021.104194","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretable visual reasoning: A survey.Image and Vision Computing, 112:104194, 2021","venue":"Image and Vision Computing","work_id":"5572ba75-d4cd-45dc-b3c5-4002d7660040","year":2021},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:1282eb407d60346ad9535dff342af0e0cfc6b9d63f656f45e7b878773c74f97f","observation_id":"2fa58f46-4bb1-4717-bf55-e5cb53abe2a9","resolution":{"observed_at":"2026-06-27T20:11:12.976948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Distill visual chart reasoning ability from llms to mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:628ee9cdffa0cff8f433b48f3ed1a22eef00ef0be5419b96b9261c79cfc61502","observation_id":"0b97bbb4-d8eb-41ba-a587-19603332a4e5","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:47:23.083361Z","title":"Spotlight on token perception for multimodal reinforcement learning","venue":null,"work_id":"e036d6a7-44ee-4996-88fa-d3380e887a67","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:3ab2a150a4a175746fe44ba8e3f77dc3c1e7196a12e1718f01176ac58c4b5a4c","observation_id":"912b9290-22b4-437c-91c1-24863a2fa035","resolution":{"observed_at":"2026-07-02T20:47:23.084893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:19:57.714668Z","title":"Credit where it is due: Cross-modality connectivity drives precise reinforcement learning for mllm reasoning, 2026","venue":null,"work_id":"d96797e1-889d-4dd4-9a07-b2446d0095aa","year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:a3c45c58a110e64b0d3c0739da257d2ad4377c5fc70ebe4073b99854aaa1827d","observation_id":"0ddf6bf1-bf5a-499c-8f53-50cda13ae7da","resolution":{"observed_at":"2026-07-02T20:47:23.073667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-03T10:27:17.903246Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2508.17298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-07-09T01:19:37.179138Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":"39fbe7ae-8c78-4d6d-9290-40accec818bd","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:8d5761e22bde7c1e77b02bffa43ce64a906205507273b1a81a337eda68c7a8ba","observation_id":"bcf55865-2ecb-4bf6-907e-250b4f2f899e","resolution":{"observed_at":"2026-07-09T01:19:37.179138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i37.40441","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"ab21d6f0-cf1f-4a6a-9e9f-aa0c34530f4e","year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:75c614ae10182ac338a65745a1e683a777bb95f4dd11c7664087ab4a45bb6448","observation_id":"2651b951-387c-4c00-9ddd-c24f483a219a","resolution":{"observed_at":"2026-06-27T20:11:12.980820Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"What does rl improve for visual reasoning? a frankenstein-style analysis,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:fc743d1ec86b73410fe67e823c3c1525b384e3e7937973745410c5546eb013b9","observation_id":"b43941b8-f4d3-45ff-aa04-d7e46507aa91","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12395","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:47:23.085986Z","title":null,"venue":null,"work_id":"e9066efe-0aab-49a5-8e2c-d5c101732c5f","year":null},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:31a27f82de2f985cba2c088bc6ca1c9b442cb493787a2133490d55bdca9d27da","observation_id":"8576971e-b4bd-4132-b323-596baafc1934","resolution":{"observed_at":"2026-07-02T20:47:23.087569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Critical tokens matter: Token-level contrastive estimation enhances LLM’s reasoning capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:8a76533859a536748429e8cbba03446a33d3e5bf3d1c4675e0511d0a1b36b201","observation_id":"ded3bdf1-a0d6-49a3-ba14-8c779f7a77e2","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:0f4af78807a1882520ba7cb926dcdebedf518e8a49fc9fa5bbd51300a57fac4e","observation_id":"9cfe4eb9-6a13-42d8-af07-916feb82fcb7","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:962db4aaa4726d6d51fd6bf59d9cfc39abc2e36b05bdb241e1b5743a7a23835f","observation_id":"c728fae0-79da-4506-b42c-f0597fa79a34","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Cppo: Contrastive perception for vision language policy optimization.arXiv preprint arXiv:XXXX.XXXXX, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:db570b442235591b4701ef2bcef9024ed26896e892d2bb91368d6acd02a70fe8","observation_id":"f866d8bf-8b5f-4da2-b9c5-4d640f93ea7a","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:2ad62f0046e0958596f49dc64ee4fc7a15dab0f91deb8d200d017d240ac56057","observation_id":"24c960c3-c814-498b-a57a-e0d9cb1d8607","resolution":{"observed_at":"2026-07-02T20:47:23.086545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:e70e743d5234392229a94f923f4dc787af515d9f147ffce3d091814545593355","observation_id":"69b5d094-513b-422e-8731-8e498e982fc1","resolution":{"observed_at":"2026-07-02T20:47:23.090192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00916","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.525395Z","title":"arXiv preprint arXiv:2511.00916 , year=","venue":null,"work_id":"2c2ade7e-0801-43f0-b8d0-246517f118b3","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:7c7ea747091e8fe75d9d05a1984acaa199aa3c5c515b258092a25b94e5c8f29c","observation_id":"00d8e3da-6333-4448-82c2-3944ed297dc0","resolution":{"observed_at":"2026-07-02T20:47:23.095852Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Terrascope: Pixel-grounded visual reasoning for earth observation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:a347dcd72419da3630e5a4bf169b47b1b51acc373aeaf43094ab94e6de830cf9","observation_id":"d44c2315-de41-47d5-8808-fb4ade00f4bf","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15031","last_updated":"2026-03-16T09:32:21Z","snapshot_observed_at":"2026-08-02T08:46:00.749789Z","submitted_at":"2026-03-16T09:32:21Z","title":"Attention Residuals","version":1},"cited_work":{"arxiv_id":"2603.15031","doi":"10.48550/arxiv.2603.15031","metadata_source":"pith","pith_arxiv_id":"2603.15031","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Residuals","venue":"cs.CL","work_id":"7356447b-f55f-41d1-b128-b3a54c4c879d","year":2026},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2603.15031","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:128580edb32292bfce8bff4832f59892b252895659c91bffdf3a77cf1892eba2","observation_id":"ea5a36e1-cc8a-46e7-87dc-23c50209f99a","resolution":{"observed_at":"2026-07-02T20:47:23.055792Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T12:53:25.083932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Mllm can see? dynamic correction decoding for hallucination mitigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:90acea3e29e41bae206e955f357fbd3d552305696e90b85d2b2be1c3f8af3f4e","observation_id":"540c9ab2-f33f-4a51-b708-a774e13b85b0","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:6ba189b24487b42fcecfe7d1bd57606cff2565f1b5bbacc2d9227ccff03503c9","observation_id":"9b775aed-d7b4-4397-a070-2e5098f2278a","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":"2504.07934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-07-04T16:29:57.248099Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":"3af2dc47-c7ba-4654-9a4e-89fdcbfa9bc0","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:f2f5035c44661ca3da47e574cc2c9ae218039f43245eb93d10290eba62fa10cd","observation_id":"054e8c7e-f438-48cc-b2d1-32f7f80c9388","resolution":{"observed_at":"2026-07-02T20:47:23.075925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13640","last_updated":"2025-03-13T16:16:12Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T15:09:24Z","title":"Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation","version":2},"cited_work":{"arxiv_id":"2410.13640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13640","snapshot_observed_at":"2026-07-02T20:47:23.066378Z","title":"Latent space chain-of-embedding en- ables output-free llm self-evaluation","venue":null,"work_id":"45c80629-3e02-4419-bbb1-93216d810d02","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2410.13640","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:7619003a56b8cc3c93f053a72c8d321c52be48cada1557d14f9cbe89eb4b9081","observation_id":"b231af4a-3a9f-479c-bf24-841ad247d51a","resolution":{"observed_at":"2026-07-02T20:47:23.068117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:e88511607da6e1b4859cde9461cea3b89ab7fe24ebc4118039b7c01630fa7b2c","observation_id":"ffcadad2-aec4-47fc-afe0-0ef93208dae1","resolution":{"observed_at":"2026-07-02T20:47:23.104445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-04T21:46:45.619744Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2504.15279","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-07-08T23:55:43.050247Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":"cs.CV","work_id":"a380ccb5-e994-4933-b73d-d8df0105e038","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:a5e7f0ef5e6b2c842fc2ed4ba482a01e5dd26f5eabe3c03e8ddd6d5df7a5e300","observation_id":"c50f43f9-1964-4adc-a361-49b8fd08c196","resolution":{"observed_at":"2026-07-02T20:47:23.099001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07889","last_updated":"2026-07-27T01:08:26Z","snapshot_observed_at":"2026-07-30T23:54:33.150047Z","submitted_at":"2025-05-11T09:42:24Z","title":"BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science","version":4},"cited_work":{"arxiv_id":"2505.07889","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07889","snapshot_observed_at":"2026-07-28T02:22:20.781065Z","title":"Bioprobench: Comprehensive dataset and benchmark in biological protocol understanding and reasoning","venue":null,"work_id":"91150081-1961-4e83-b9a2-888bcb77c74b","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2505.07889","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:825ed73745b11d861de67971371b2705504f355445224af8dfd3e234cc55afdc","observation_id":"cd8caa39-9c92-487b-b70b-1771377efa11","resolution":{"observed_at":"2026-07-28T02:22:20.781065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:f66c93db05f70276775a46d5422584d5b90b8a37a10fa2eed35f3ab49cd096b4","observation_id":"4b0b781d-be45-438e-a111-41b6c7d9fcb5","resolution":{"observed_at":"2026-07-02T20:47:23.073078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:149e2913155023b23a8f19ec494203fa8d3f739d5de552de66d36afe7eac1e07","observation_id":"a8e2813e-a815-4476-8a2a-e98ae7d2016c","resolution":{"observed_at":"2026-07-02T20:47:23.097979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:06.451106Z","title":"Perceptual-evidence anchored reinforced learning for multimodal reasoning","venue":null,"work_id":"8a06bfac-11c9-402e-8934-f88acacdb736","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:112ff55b748758a49f007ce7b6d82bf336e769e4657b50ad1e0ec0f5486cb3d9","observation_id":"0837cd07-6d75-47b0-a2a7-eeb8d6e6209e","resolution":{"observed_at":"2026-07-02T20:47:23.042929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-07-06T22:08:45.542495Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"cited_work":{"arxiv_id":"2508.04416","doi":"10.48550/arxiv.2508.04416","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04416","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking with videos: Multimodal tool-augmented reinforcement learning for long video reasoning","venue":"arXiv (Cornell University)","work_id":"824594ad-21b0-49b7-88f8-fac8553528e3","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2508.04416","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:9a26e5ee7be1ef1e9d288761ea0401048e5a1d6b28c6f095ff109f51d5423bbd","observation_id":"6fb61329-55b6-4ac2-96a2-70ba13836a0f","resolution":{"observed_at":"2026-07-02T20:47:23.078516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-07-06T20:41:51.646955Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2502.17422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-07-11T03:17:51.651790Z","title":"Mllms know where to look: Training-free perception of small visual details with multimodal llms.arXiv preprint arXiv:2502.17422, 2025a","venue":"cs.CV","work_id":"60c37b5e-bbe5-4027-874f-8868378999bc","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:26c90874db0a76161febc2ab9cb9334d65e2e3c772011a2f8c9441dd4cc94946","observation_id":"d0e0f70c-5ecc-4ac2-b0ad-9f99da2cbee1","resolution":{"observed_at":"2026-07-02T20:47:23.070679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:ee41239342bb48bed9c3a5eb00ce9f11ee989005298ae78ac8e044cd5db8ce78","observation_id":"b175a55f-ddcb-477a-aeb9-7766730dae7b","resolution":{"observed_at":"2026-07-02T20:47:23.084111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:2832acf90907429026ecd9963d3f25cb4ff29574420e7d0e8cf645942e24d0f6","observation_id":"c818b8f7-dd24-4ceb-94b3-2f3cbee5dd23","resolution":{"observed_at":"2026-07-02T20:47:23.067963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T20:08:29.208550Z","title":"since angle ADE is 80 ◦","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:402d3fb872f7af77fd28168315d6c702790c181077d91a4269ef8a5a72cf8019","observation_id":"913cf652-56c7-4950-806c-e7793cf6d6d7","resolution":{"observed_at":"2026-06-27T20:08:29.208550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":13,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2606.08035."}