{"as_of":"2026-08-19T06:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76462e99fd03a29967caa2837e42ae5f8cc2a7265fd2184c9ce52925b5ac68af","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T01:07:06.861298Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10004/citation-record","integrity":"/paper/2607.10004/integrity","json":"/paper/2607.10004/citation-record.json","paper":"/paper/2607.10004"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:fbc9e0373960500a34151ab75b6ccdd9341f08a7cc9f744445812d90951582c4","observation_id":"69a58c99-618a-4049-9a3d-f2fc857e730c","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Reasoning in the dark: Interleaved vision-text reasoning in latent space.arXiv preprint arXiv:2510.12603, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:99af51be850da60712b10df3c80bbaa139e0ed0f2ed90cfb40a4cdd39866c49f","observation_id":"0e4f160e-9c36-4d44-8251-13a76a3702fd","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:7382437f568b7a23016427eea106025c5cca4b39ed1a387332c3a9b4d17ddc8e","observation_id":"38b977a1-16bb-4a65-9a9d-7361fec5b5cc","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-16T07:14:23.993847Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05331","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mint-cot: Enabling interleaved visual tokens in mathematical chain-of-thought reasoning.arXiv preprint arXiv:2506.05331, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2506.05331","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:34a6c7a45a3f9e3c2a5eb821a0d1fa99a50a3f767efd0ae3527f17a2f829bdb1","observation_id":"223faf9f-2329-42f4-a446-0399647c6251","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:7c9eec06022499fecb74974a1f1dde38a77e9f63652ef15ac49bc3ef64f057c3","observation_id":"c86377e5-063c-4b8d-ac55-921c6d72079c","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-17T01:11:44.872398Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Emerging properties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:0d576a5e80ed6a87f1de5d2542b627dc3de25b21a7f5a81d06a378efd9b0c827","observation_id":"41e34dee-a2fe-407c-9dd8-a5313d7f5253","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Codeplot-cot: Mathematical visual reasoning by thinking with code-driven images.arXiv preprint arXiv:2510.11718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:ae6fc369ef3bb83cb842029b3f287a0fdf4286d3d09b79d1b48503569124d5a8","observation_id":"e636d312-d701-4694-a1dc-29b0bdefab24","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10639","last_updated":"2025-03-13T17:59:59Z","snapshot_observed_at":"2026-08-16T19:00:31.865937Z","submitted_at":"2025-03-13T17:59:59Z","title":"GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10639","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Got: Unleashing reasoning capability of multimodal large language model for visual generation and editing.arXiv preprint arXiv:2503.10639, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2503.10639","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:38ed06481224b728c545616aaa4e3b1207c5d7db9d23a34c3b88e40b5d190bbf","observation_id":"cec7d7d6-c797-4468-a227-9ac89c904e7a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Interleaved-modal chain-of-thought","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:b6a47a973d1e8a6a0d5cb5561fd8bedf19476af09d09a59e3b844c0707d97725","observation_id":"5725318c-0a66-4463-a36d-c9198221cbfc","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-13T08:10:57.391295Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step.arXiv preprint arXiv:2501.13926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:bf3970ddca344e39b6a2146ad32e078c99c8e90aa62ec3e153c801a96ea29115","observation_id":"1730a604-eb8c-49ea-9e3f-50043610d767","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:fc177063467678eeb97a0058c78092eed30760697afd3cf0f81196c34087724c","observation_id":"f322e518-5c2a-4435-b8b8-fabde3996f6b","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Unicorn: Towards self-improving unified multimodal models through self-generated supervision.arXiv preprint arXiv:2601.03193, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:94fff81147d52adc88d38c5f3b8459144acbf49cf343a11e5e69a787d21d8238","observation_id":"ce384a81-1936-4c91-81f3-010ca7dd6e48","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:b81f851661e0dcaa2d22143f7f61ee67f171551af7118a0366632ac8511f34c9","observation_id":"953ff31a-902b-4624-b9fa-abc84c68bc07","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:cbac6039e99b518b24e6118afc479fa1a1dba8215e4d44b45a439c899bccf86b","observation_id":"f06ed034-8ad5-4d0d-881c-a52deae6483a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:0881c504928b5c42e5442d18dd8fd11bd9e4b14a93b46dc626a6e8cdcea1fa57","observation_id":"f459b292-e795-4203-9dfa-a44a4d617e20","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning.arXiv preprint arXiv:2507.16746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:9cfcfd2ae3d24ee6cc93a48341458b3c871ae9d73338b58f4e83e60941c9c915","observation_id":"0ae3453d-01e2-4625-b431-27095c5e4fa8","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-17T08:25:34.071490Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Imagine while reasoning in space: Multimodal visualization-of-thought.arXiv preprint arXiv:2501.07542, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:f5e68804fa103c007b670660bb55ee51a85ca92467155af68b8618ec6c8cc39f","observation_id":"291dd5fd-2f9b-4bcd-8d82-bbbf42fe7f0c","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25699","last_updated":"2026-07-21T17:19:46Z","snapshot_observed_at":"2026-08-14T11:17:34.656689Z","submitted_at":"2025-09-30T02:57:44Z","title":"AIM-CoT: Active Information-driven Multimodal Chain-of-Thought for Vision-Language Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25699","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Aimcot: Active information-driven multimodal chain-of-thought for vision-language reasoning.arXiv preprint arXiv:2509.25699, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2509.25699","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:853e8bbb33fa6800711e3a00b6ae76b6c0ac634a509177ffeac34e30daa82246","observation_id":"ccc1023c-1020-4d32-8fe7-0795c0589f22","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-08-17T03:52:54.598114Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.12623","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Rea- soning within the mind: Dynamic multimodal interleaving in latent space.arXiv preprint arXiv:2512.12623, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2512.12623","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:0cacb1e0ae5246293c6475952c27c768b3a48509af94cd475e488120e7a1130d","observation_id":"8572acd0-e2bb-4609-b66b-c4c5d7976d52","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Let’s think with images efficiently! an interleaved-modal chain-of-thought reasoning framework with dynamic and precise visual thoughts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:cc4ec9eb1230ed932973ca676f27fd384a39d4fce1b97848e08c150f9edb674e","observation_id":"a1a73ab9-c06d-46bd-880e-52615ef940d4","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:3d496b9b3db96b637548bca65ecdb97995a598d5a51b75e112b036fda35ad514","observation_id":"cb79be7a-55e3-4535-99d5-e6aa9a91bfa4","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23380","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Unirl: Self-improving unified multimodal models via supervised and reinforcement learning.arXiv preprint arXiv:2505.23380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2505.23380","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:85a70d17466b04cbb00a7b781b5b81ce2bda6ffa3e5cd40289e05aafb75e66d5","observation_id":"75fc4684-086d-4358-8cb7-ba8102369c62","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"We-math: Does your large multimodal model achieve human-like mathematical reasoning?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:b3994f6b024845ce4a945e4ebe324ff4602d4f19f780b7f0fcc96b2ffbe804a3","observation_id":"1b1df96b-c9bb-4e24-8364-eae0a0a2fd22","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Zoomeye: Enhancing multimodal llms with human-like zooming capabilities through tree-based image exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:4d9c75bbdd6a64ee2e74030ba139bac2f215fd9478c447af3fa25818bfcf9eaf","observation_id":"ac34e4d7-a7cb-4fbc-a915-d3a94461d78a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mathcanvas: Intrinsic visual chain-of-thought for multimodal mathematical reasoning.arXiv preprint arXiv:2510.14958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:bca56315611eaeb8e459ddb17947fb007eb3e1e61561c12450f7d4cdf368d7e2","observation_id":"0eeacc86-db98-4c73-9996-10309e73b28c","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21406","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Generation enhances understanding in unified multimodal models via multi- representation generation.arXiv preprint arXiv:2601.21406, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2601.21406","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:f78604246cfdec3ea261ff571a15b297f62b6fc42f7a67aa5c672eae0425bb83","observation_id":"c08a7f4e-7a9d-4e37-8503-fa604a3edb66","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Llamav-o1: Rethinking step-by-step visual reasoning in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:655d97127a4fc8e7a3bc9177b006f26bcdfcb8472f565b31b89fc4aed830c5cb","observation_id":"f21d88a5-67c8-4458-b5b9-09c3371864dd","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Unirl-zero: Reinforcement learning on unified models with joint language model and diffusion model experts.arXiv preprint arXiv:2510.17937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:e0401f2a98f51af94fb8a4e3da0236e8a00d1a54bd9544b67bd5741878c246f8","observation_id":"eb88b1f6-4543-469a-abd5-950832919542","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-08-15T21:58:54.708977Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Pixel reasoner: Incentivizing pixel-space reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:3ade3a9f74c461e330df2973ee0a190dccf18cda45c95c73208e7e678e5dce94","observation_id":"428361c6-ce4e-4d4a-a58a-93819de614f3","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:318f5ddea10a656ecfb70e9ad3e0af123b2b935689dd50b96c81c90d4e8a58ed","observation_id":"58d45922-b98c-42d7-8cf3-5bca708a1934","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mathcoder-vl: Bridging vision and code for en- hanced multimodal mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:065825334b57bbf641bfa2d2f5ae29b6be03f38bc903c499500c2748ae4b1248","observation_id":"630449c4-f800-4b15-b9f5-767023bc813c","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:9e1e91390953566a801c9c8f394c76ad14829de6269444f29a088e7c160dae22","observation_id":"cce4ce6a-476a-430f-9557-7ee0aabf3965","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Visuothink: Empowering lvlm reasoning with multimodal tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:af1d9f853bed4118bc9128c677b3d90a2aff1ba70827cfbfe916fe97317670cc","observation_id":"936b2489-440e-4bfb-b4b2-a333137daa9a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:2fc8bf9a9b705b03d1683319c780225d910f6684bd9d1e3beee530146db3a890","observation_id":"a22b2653-c294-4940-beea-19cade8475c4","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Muse-vl: Modeling unified vlm through semantic discrete encoding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:be82f05cb0bc4a310d210da5e5fdb92084e554420091aeeda9bdafb62fd55bc5","observation_id":"2f2ef16c-5b13-4d3b-a712-f50fefdfe3e1","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Llava-cot: Let vision language models reason step-by-step","venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:18e757b343cfde5536d4d82eb3df810384ef5887d100bc937dbd78feabf0ec14","observation_id":"b13ac0bf-9f70-42a3-b165-cf056b68049a","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-15T19:40:30.225099Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mulberry: Empowering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:adbd7120e65c6a5ce6a8bad94b133865846eaa008fde6cc823622a5c7df45af7","observation_id":"5e933b81-ad73-442f-8fe3-4765e11e0c6c","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07012","last_updated":"2024-12-29T03:52:23Z","snapshot_observed_at":"2026-08-16T13:00:22.377701Z","submitted_at":"2024-12-09T21:44:02Z","title":"ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07012","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Provision: Programmatically scaling vision-centric instruction data for multimodal language models.arXiv preprint arXiv:2412.07012, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2412.07012","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:8898178c38b0cb8008ec689d88a0e20cce84e576c68fdcfe5a0108e80ad56971","observation_id":"7054361a-4db7-44df-b67f-bc57e2443442","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:c220f93cb1eeb459f387cae1f6a31cce30a15e0efbda4b3300a4014419336856","observation_id":"d21586ff-b7b5-45eb-932c-c74f9cd391e6","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Mul- timodal chain-of-thought reasoning in language models.arXiv preprint arXiv:2302.00923, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:e22560c68ce5f99b6d30c186b54ca0d20efc75a7fb3cbffe040184a739452375","observation_id":"76c03e6f-6774-41c4-bc14-a322c95b0a9d","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities.arXiv preprint arXiv:2505.02567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:238ffb1615a778229b55197cc3e035c48b46565c63184b70f3d71bcd02a861a0","observation_id":"899d1151-7cee-4937-bffc-4768efccdcc6","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:5bfd4ecee43119ff8919ef438c41eb1972d222700378c7c2d5f6bdf343ac6a6a","observation_id":"12ae6135-258f-48cd-bab4-be5afc0ad744","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00836","last_updated":"2025-02-24T06:55:22Z","snapshot_observed_at":"2026-08-18T21:08:40.240698Z","submitted_at":"2024-10-29T17:29:19Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00836","snapshot_observed_at":"2026-07-14T01:07:06.861298Z","title":"×1×1−!\"×(2−1)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T01:07:06.861298Z"},"links":{"cited_paper":"/paper/2411.00836","citing_paper":"/paper/2607.10004"},"observation_digest":"sha256:c9019307ad69384294bcc491bd8a70a16469c738d3c7f88d0df693345830aa4b","observation_id":"ee54c62c-eef4-4ccd-ac6c-f89ced35fad5","resolution":{"observed_at":"2026-07-14T01:07:06.861298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10004","last_updated":"2026-07-10T22:03:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T20:11:04.127435Z","submitted_at":"2026-07-10T22:03:01Z","title":"Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.10004."}