{"as_of":"2026-08-04T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf2540271c68a4fbbc33e8088910dbe196ec479803394d0ddbd5a54ac090baad","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:40:33.133220Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T16:13:17.566716Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Imagination helps visual reasoning, but not yet in latent space.arXiv preprint arXiv:2602.22766, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:4ad40b0e5fe4869897ac1bce2b50379a8e995657e5e125fad1c35a2c659218ec","observation_id":"24b91e6c-2559-4804-b582-daf97d7125a4","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2604.21027","last_updated":"2026-08-02T16:15:42Z","snapshot_observed_at":"2026-08-04T07:11:22.125243Z","submitted_at":"2026-04-22T19:18:36Z","title":"HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T23:51:47.724033Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2604.21027"},"observation_digest":"sha256:1e48154db651b0cac0bfb3985cf9abd90e2e4dac568836d73e5d35ef0f72764e","observation_id":"5fc79739-d7a0-4ed0-963a-125bf430daa8","resolution":{"observed_at":"2026-06-09T02:06:14.979939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:4b08a660bbb4cb2b07ec63b18864181c59829d8686927c8c7b5220aaf9707216","observation_id":"1f98e667-4a78-42f7-afa9-c586a6b07fe4","resolution":{"observed_at":"2026-06-09T02:06:14.979939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:b9843b913eb52db52e319028a5232bba7e4f64a60a6caf8871a90ebabe2570b5","observation_id":"d74bd126-7483-4bab-8536-6c5a8cbcc5be","resolution":{"observed_at":"2026-06-09T02:06:14.979939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2605.18641","last_updated":"2026-05-18T16:46:02Z","snapshot_observed_at":"2026-07-06T23:29:29.105126Z","submitted_at":"2026-05-18T16:46:02Z","title":"Leveraging Latent Visual Reasoning in Silence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T10:27:13.859216Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2605.18641"},"observation_digest":"sha256:8b89ff72e2deb305c5947f424eb2e8b3f953db78e9a308e79d48d98058dd5b33","observation_id":"fa878595-6ea0-49fa-8ad1-0941655bfb2c","resolution":{"observed_at":"2026-06-09T02:06:14.979939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2605.25437","last_updated":"2026-05-25T05:29:07Z","snapshot_observed_at":"2026-07-06T23:35:21.734804Z","submitted_at":"2026-05-25T05:29:07Z","title":"Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T22:53:55.407461Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2605.25437"},"observation_digest":"sha256:01acd669807b2e5f3ba3bcec041ee773b0ef6e49ef23373b6a74c56b9663788c","observation_id":"d28a7293-3601-4959-a6dc-867fe7dd72f0","resolution":{"observed_at":"2026-06-29T22:54:00.567606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:e1596d2780ecb8384e3c238b857f22db0b7418646f32ca4676b103b1823bc9b7","observation_id":"577d28bc-7d29-476d-82ae-d4d2f274a02f","resolution":{"observed_at":"2026-06-28T19:52:36.114162Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2606.29712","last_updated":"2026-06-29T02:34:52Z","snapshot_observed_at":"2026-07-07T00:03:41.292432Z","submitted_at":"2026-06-29T02:34:52Z","title":"Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:43:20.893142Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2606.29712"},"observation_digest":"sha256:d8306ced2ec0483b158379df38fedac6f9327fd1ff6e18dd016af50f35674806","observation_id":"486b4aec-5c15-4fc2-a6f8-4f3e224ff635","resolution":{"observed_at":"2026-06-30T06:44:18.723523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2606.29712","last_updated":"2026-06-29T02:34:52Z","snapshot_observed_at":"2026-07-07T00:03:41.292432Z","submitted_at":"2026-06-29T02:34:52Z","title":"Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T06:43:20.893142Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2606.29712"},"observation_digest":"sha256:598d8a8a4efec69072240cd4a9380e1a6baa82af8c1a7381686fd29e67e4c7bf","observation_id":"2b0a8d99-35f9-4d5d-99a5-6314acc71f98","resolution":{"observed_at":"2026-06-30T06:44:18.270003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-31T16:13:17.566716Z","title":"arXiv preprint arXiv:2602.22766 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28154","last_updated":"2026-07-30T12:57:45Z","snapshot_observed_at":"2026-08-03T12:39:00.211104Z","submitted_at":"2026-07-30T12:57:45Z","title":"OPLD: On-Policy Latent Distillation for Multimodal Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T16:13:17.566716Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2607.28154"},"observation_digest":"sha256:d39aba80b7a4c3469ed533b8ab413ea35a68c2a53010a1c13e30ed89e9ee0413","observation_id":"e5f1ee6e-e977-453f-a050-81c227dbd18e","resolution":{"observed_at":"2026-07-31T16:13:17.566716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.22766/citation-record","integrity":"/paper/2602.22766/integrity","json":"/paper/2602.22766/citation-record.json","paper":"/paper/2602.22766"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-02T20:40:29.952041Z","title":"Emerging proper- ties in unified multimodal pretraining.arXiv preprint arXiv:2505.14683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:29.952041Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:12ab83034610a4ee31d0bc87813767b832dea2befb9234c389b24580e8bdc54a","observation_id":"07d9be5a-6a3a-4052-b3b9-a26c4d071aa2","resolution":{"observed_at":"2026-08-02T20:40:29.952041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:30.096225Z","title":"Interleaved la- tent visual reasoning with selective perceptual modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.096225Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:ae538ba54d18ede55549891782005ab1d252579bc8081de828f0082aadba88d7","observation_id":"e2cd370e-40e1-4075-870f-bd02d81978e0","resolution":{"observed_at":"2026-08-02T20:40:30.096225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-02T20:40:30.201984Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning.arXiv preprint arXiv:2501.00321, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.201984Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:f521b265b8878e70807ddd11c4d58e5faf3d240e0057db96e534febf4cb563ef","observation_id":"a128282c-278f-4391-be66-e1653b7e6678","resolution":{"observed_at":"2026-08-02T20:40:30.201984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05748","last_updated":"2025-09-01T03:21:53Z","snapshot_observed_at":"2026-08-03T10:59:41.466285Z","submitted_at":"2025-08-07T18:03:50Z","title":"WebWatcher: Breaking New Frontier of Vision-Language Deep Research Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05748","snapshot_observed_at":"2026-08-02T20:40:30.373169Z","title":"Webwatcher: Breaking new frontier of vision-language deep research agent.arXiv preprint arXiv:2508.05748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.373169Z"},"links":{"cited_paper":"/paper/2508.05748","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:9205dc59e463c9fb348f488780f2b7eed7e72e78634f4e84257b0f78d1855d60","observation_id":"7f4433c1-af72-4bb9-b18c-8b06d1776dcc","resolution":{"observed_at":"2026-08-02T20:40:30.373169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-02T20:40:30.486539Z","title":"Deepeyesv2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.486539Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:b03a8cfb7f199bce2daaf3322058697d343caeac5fb5c2457b1aa7c47e3fd2ce","observation_id":"33b1d44a-fff3-4fc8-b836-3d6432b2f32f","resolution":{"observed_at":"2026-08-02T20:40:30.486539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T20:40:30.646055Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.646055Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:36d401f3535cb6bc983bbf2fbbf36b40b3b6350feebe6b8431007e31fd7370f2","observation_id":"63eb841f-7c00-42b9-8373-d65bbda0b0d4","resolution":{"observed_at":"2026-08-02T20:40:30.646055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-08-02T20:40:30.917208Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.917208Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:3abaef1697de47f29ec27ceb3b9093ceeaee3b63c4121256c622a7af9f8f6ea0","observation_id":"ae73ebdb-72ed-41de-b204-c49c7679b7c1","resolution":{"observed_at":"2026-08-02T20:40:30.917208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-02T20:40:31.055040Z","title":"Mini-o3: Scaling up reasoning patterns and interaction turns for visual search.arXiv preprint arXiv:2509.07969,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.055040Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:3df3bdaa90829c0a6f08235f9879ad36260db057e06af4896df95255a6ecdad6","observation_id":"47907d39-fa10-4af2-9964-78c1cd2bb719","resolution":{"observed_at":"2026-08-02T20:40:31.055040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.210796Z","title":"B., Liu, O., Guo, P., Neiswanger, W., Huang, F., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.210796Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:7cb96aeead7c157fea7066fe4a20c246a008224aa20ba40374a4e17701785382","observation_id":"28d5b159-7743-40d6-83fe-83ac2a233031","resolution":{"observed_at":"2026-08-02T20:40:31.210796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.327405Z","title":"Think in safety: Unveiling and mitigating safety align- ment collapse in multimodal large reasoning model.arXiv preprint arXiv:2505.06538,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.327405Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:f8a9d75b50f3fffc5add2bf2a8c3fed75ef4fb4b74b9702400f3315dfca71a6e","observation_id":"e70cf8d5-0f20-4318-88e1-9a873790d2a9","resolution":{"observed_at":"2026-08-02T20:40:31.327405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.469656Z","title":"Being-h0","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.469656Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:cc1fc48d53f7fe28faa2abb502f55845281a3328b6a34582a293d811dabe8bdd","observation_id":"c0eae6df-1a43-4e21-a711-8aa1a53ed9b7","resolution":{"observed_at":"2026-08-02T20:40:31.469656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.638896Z","title":"M., Shiee, N., Grasch, P., Jia, C., Yang, Y ., and Gan, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.638896Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:745812fdf19ac82d568374e093bbd1842c6549af4e79f49ff4cfbd7d371eabba","observation_id":"b6289e5b-c661-4708-9443-3dc729af693c","resolution":{"observed_at":"2026-08-02T20:40:31.638896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.753183Z","title":"Instability in down- stream task performance during llm pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.753183Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:3c4bc2297917428a26d671b943d29c0dc7cfa52b332aec0e540ac3fc980c39a0","observation_id":"4ec13d74-bc9d-488e-abe8-b32c0508ce0f","resolution":{"observed_at":"2026-08-02T20:40:31.753183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21074","last_updated":"2025-09-23T08:16:08Z","snapshot_observed_at":"2026-08-02T19:02:30.418876Z","submitted_at":"2025-02-28T14:07:48Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21074","snapshot_observed_at":"2026-08-02T20:40:31.839844Z","title":"Codi: Compressing chain-of-thought into continuous space via self-distillation.arXiv preprint arXiv:2502.21074,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.839844Z"},"links":{"cited_paper":"/paper/2502.21074","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:8c41a93db9072f8faed43fd9114e09c2e222a01d090fbd69914b0f2ddcedf003","observation_id":"e93e813a-32be-4264-8589-c246781868d5","resolution":{"observed_at":"2026-08-02T20:40:31.839844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.897189Z","title":"Realunify: Do unified models truly benefit from unification? a com- prehensive benchmark.arXiv preprint arXiv:2509.24897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.897189Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:49902547b515bd75347d23ce1717b5e78263cdc826d85ecc68849a080288a788","observation_id":"60417fd9-288f-4e86-b5b6-843e3d305b41","resolution":{"observed_at":"2026-08-02T20:40:31.897189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:32.028919Z","title":"Sketch-in-latents: Eliciting unified reasoning in mllms.arXiv preprint arXiv:2512.16584,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.028919Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:f05ff5c727afecfd6af311d805bf50dfe64a1a5b97c79f04a9dd5d3de91360ec","observation_id":"69947571-c45f-4e8d-8af1-caeec6344576","resolution":{"observed_at":"2026-08-02T20:40:32.028919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-02T20:40:32.149994Z","title":"Pixel reasoner: Incentivizing pixel-space reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.149994Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:dcc38b023478c4b838d87bbf948d45f2357427194e50dd8953eb146e1b34a2e9","observation_id":"02d2c5fe-059d-4e64-b9aa-a03cbd686424","resolution":{"observed_at":"2026-08-02T20:40:32.149994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-08-02T20:40:32.339980Z","title":"Mmsearch-r1: Incentivizing lmms to search","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.339980Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:7caa47a50b07ffb54629b2e12089c92884ac32d3df9530d81b547d9ea6cacb1d","observation_id":"7bff5ccd-1286-4353-a6c1-ec7496ccef65","resolution":{"observed_at":"2026-08-02T20:40:32.339980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.04670","snapshot_observed_at":"2026-08-02T20:40:32.470141Z","title":"Cambrian-s: Towards spatial supersensing in video.arXiv preprint arXiv:2511.04670, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.470141Z"},"links":{"cited_paper":"/paper/2511.04670","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:2d1bc635b7e09e139169484704b9fda977f6b153dcef73fada728b994ae08f96","observation_id":"e1f60eea-823b-4954-9f2a-dd0c83311b1c","resolution":{"observed_at":"2026-08-02T20:40:32.470141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:32.644801Z","title":"M3 searcher: Modu- lar multimodal information seeking agency with retrieval- oriented reasoning.arXiv preprint arXiv:2601.09278,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.644801Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:424bb308e07f27d29960d2b0bef26fc47335acdd3095bd689755d303769466bd","observation_id":"a8c4b8ad-ec39-4edf-807e-ea0240cf2d78","resolution":{"observed_at":"2026-08-02T20:40:32.644801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25866","last_updated":"2026-04-12T05:51:58Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-30T07:02:01Z","title":"DeepSketcher: Internalizing Visual Manipulation for Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25866","snapshot_observed_at":"2026-08-02T20:40:32.762712Z","title":"Deepsketcher: Internalizing visual manipulation for multimodal reasoning.arXiv preprint arXiv:2509.25866, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.762712Z"},"links":{"cited_paper":"/paper/2509.25866","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:78ab4941ac53766204991295ad3f24b31b215ab17e6f4ce95b66319f91580699","observation_id":"3fa39389-5e51-42c6-8e59-2be427af8596","resolution":{"observed_at":"2026-08-02T20:40:32.762712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-08-02T20:40:32.906908Z","title":"Thyme: Think beyond images.arXiv preprint arXiv:2508.11630, 2025c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:32.906908Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:9acdba6236cb89555a9e9413c0c9e9f65b2765a377b891daf62d5c3d415e8f35","observation_id":"cebb0dfb-ba62-4084-a305-3045bc68de55","resolution":{"observed_at":"2026-08-02T20:40:32.906908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-02T20:40:33.008020Z","title":"thinking with images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:33.008020Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:ff145ee3853b0df74a96e9c03688004733b419973748b31c11813fc7943a12d0","observation_id":"79674270-4f43-4e0e-ab7b-79bf938e34be","resolution":{"observed_at":"2026-08-02T20:40:33.008020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-02T20:40:33.133220Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:33.133220Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:e7930af57f8629b7a96905ce6972923bace9b30ba4f2cf9d924a68054f92c357","observation_id":"4b668eb8-63fa-4ca9-9562-d79317790a4c","resolution":{"observed_at":"2026-08-02T20:40:33.133220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T20:40:29.696203Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":1971,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:29.696203Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:8dcef37d9ca399df3663915c7cffe7e2597468cca33bf1774de1ac72ac5b5211","observation_id":"2d4e5937-16ab-44ae-b78b-56bf087e50c2","resolution":{"observed_at":"2026-08-02T20:40:29.696203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16192","last_updated":"2025-05-30T06:35:34Z","snapshot_observed_at":"2026-07-06T21:28:15.523434Z","submitted_at":"2025-05-22T03:50:13Z","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16192","snapshot_observed_at":"2026-08-02T20:40:30.764822Z","title":"Vlm-r 3: Region recognition, reasoning, and refinement for en- hanced multimodal chain-of-thought.arXiv preprint arXiv:2505.16192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:30.764822Z"},"links":{"cited_paper":"/paper/2505.16192","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:344eedbcec001d6bc11bc97086884b8fb3a1cd83e7431122dbdd9fdf9d85aa2a","observation_id":"a120669a-8048-4583-8d48-6b584cac864b","resolution":{"observed_at":"2026-08-02T20:40:30.764822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-07-06T22:03:52.444959Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20766","snapshot_observed_at":"2026-08-02T20:40:29.809107Z","title":"Learning only with images: Visual reinforcement learning with rea- soning, rendering, and visual feedback.arXiv preprint arXiv:2507.20766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:29.809107Z"},"links":{"cited_paper":"/paper/2507.20766","citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:e282944f6c27354ac3135093ac44b65c8631bfacf9b1aa559b8cda66e6dff795","observation_id":"cb2a150f-a095-4477-bd0a-75518c38de64","resolution":{"observed_at":"2026-08-02T20:40:29.809107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:40:31.563249Z","title":"F., Feng, X., and Sun, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T20:40:31.563249Z"},"links":{"citing_paper":"/paper/2602.22766"},"observation_digest":"sha256:90079e8402b3317fe3d8d4fd468e151178eea13ff8a879fec9456629d4fe208b","observation_id":"a4d515d3-a572-4446-9d8a-7ed8b84e402c","resolution":{"observed_at":"2026-08-02T20:40:31.563249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T20:40:29.078367Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 10 inbound Pith citation observations for arXiv:2602.22766."}