{"as_of":"2026-08-11T17:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f71f7433eedb3643bb11b314246bfd0efb5b0750b0b14e7c146a665654f5611","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":51,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:03:11.626570Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2509.23108","last_updated":"2026-05-19T05:14:38Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-27T04:36:12Z","title":"Artificial Phantasia: Emergent Mental Imagery in Large Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-21T21:41:39.111769Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2509.23108"},"observation_digest":"sha256:87e8cd92c12d9d4baa610ecc2b0f7bc9b0b4ac2131c9dace150b84feb594b6c7","observation_id":"36665cc5-a23c-48f6-bd39-a2d07728ebc6","resolution":{"observed_at":"2026-05-21T21:44:22.816571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-04T00:15:17.918780Z","title":"Machine mental imagery: Empower multimodal reasoning with latent visual tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.02360","last_updated":"2026-05-26T12:26:50Z","snapshot_observed_at":"2026-08-04T00:15:08.705793Z","submitted_at":"2025-11-04T08:28:46Z","title":"LaRe: Latent Refocusing for Multimodal Reasoning","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T00:15:17.918780Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2511.02360"},"observation_digest":"sha256:22d64787d3ab250b75079fe51ba63ae9e429e29f6153a9fe464a42e2016d5a23","observation_id":"6a920d1b-defb-48d5-99e2-44aef54f2b2a","resolution":{"observed_at":"2026-08-04T00:15:17.918780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T23:02:28.588225Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2512.12623"},"observation_digest":"sha256:1385aac0970d9d3ec08033eee4283633e641f5c66970350571e203091ea7d3da","observation_id":"7755be9a-e860-4f09-9ecd-3c582b502929","resolution":{"observed_at":"2026-05-16T23:03:38.956148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2601.06803","last_updated":"2026-04-20T09:04:42Z","snapshot_observed_at":"2026-08-11T12:24:59.401094Z","submitted_at":"2026-01-11T08:30:49Z","title":"Forest Before Trees: Latent Superposition for Efficient Visual Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T15:58:03.654150Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2601.06803"},"observation_digest":"sha256:7a32ebb60b92686c251017408a7f0dca847f73ba675f235d6186dcd6104d67a1","observation_id":"c9dfc7df-df83-4685-b22c-9e0930945a01","resolution":{"observed_at":"2026-05-16T16:01:05.142885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-03T05:23:37.113526Z","title":"Machine mental imagery: Empower multimodal reasoning with latent visual tokens.arXiv preprint arXiv:2506.17218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-08T05:57:49.430723Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T05:23:37.113526Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2602.02465"},"observation_digest":"sha256:24d841998e2e2605a95c5acf3b779262846aaf2f43ffea3b3f4fea808e333ba7","observation_id":"c462f9b0-d339-43ff-b7b2-c46c9af7496d","resolution":{"observed_at":"2026-08-03T05:23:37.113526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2602.09850","last_updated":"2026-05-08T01:43:02Z","snapshot_observed_at":"2026-08-11T12:36:05.782029Z","submitted_at":"2026-02-10T14:54:17Z","title":"Towards Explainable Industrial Anomaly Detection via Knowledge-Guided Latent Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T03:08:58.617137Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2602.09850"},"observation_digest":"sha256:54731a7d1dd3dda2348139b67e659bd5efa82431cb323304c00335a34c2f0bb4","observation_id":"2c0febcc-f470-4614-8e5e-a846544225a0","resolution":{"observed_at":"2026-05-16T03:10:32.068867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2602.11731","last_updated":"2026-04-29T01:08:35Z","snapshot_observed_at":"2026-08-07T03:47:17.716581Z","submitted_at":"2026-02-12T08:54:02Z","title":"Thinking with Drafting: Optical Decompression via Logical Reconstruction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T03:28:32.264246Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2602.11731"},"observation_digest":"sha256:bcdbae12cfd68089d9628321f42fade7b7eee994e7a8f516e0dd6cd482e22c77","observation_id":"e4899f4c-3a74-4efb-9bb9-cff07c02b3f7","resolution":{"observed_at":"2026-05-16T03:30:32.901989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Machine mental imagery: Empower multimodal reasoning with latent visual tokens.CoRR, abs/2506.17218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":268,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:7168a3c9ca98010f6677847f87a9b5bc9c8241cf57120fa2197e4ae10a86a0f4","observation_id":"da6a259a-1b97-4c95-a63f-63120205b382","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.03179","last_updated":"2026-04-03T16:56:34Z","snapshot_observed_at":"2026-07-06T22:52:25.307426Z","submitted_at":"2026-04-03T16:56:34Z","title":"Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T20:48:52.130130Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.03179"},"observation_digest":"sha256:3ae913700298c0e24b6c3255eb80d3de8d908f1476b062ec3f9af9873b4c2362","observation_id":"de5ec7b8-5e89-464c-b21a-d2d6639880a3","resolution":{"observed_at":"2026-05-13T20:53:16.251755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.03307","last_updated":"2026-04-16T08:04:16Z","snapshot_observed_at":"2026-08-11T05:10:49.289444Z","submitted_at":"2026-03-31T03:57:56Z","title":"V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T23:57:47.657243Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.03307"},"observation_digest":"sha256:b8cb71b9c6fde5a984f7ad647b6aa4d9babe1a29ccc4d6121e09106542167429","observation_id":"570e609f-3dc3-41ae-9f50-edcad274807a","resolution":{"observed_at":"2026-05-13T23:58:28.561653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.07518","last_updated":"2026-04-08T18:52:27Z","snapshot_observed_at":"2026-08-11T06:45:22.438370Z","submitted_at":"2026-04-08T18:52:27Z","title":"Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:12:33.231488Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.07518"},"observation_digest":"sha256:c061925be361fe3cef46be36ed3a8e9e9f01f3788b2f1cc2b53d7f710514bf0e","observation_id":"612ebab2-b9f0-4a81-80bb-7c8312b62360","resolution":{"observed_at":"2026-05-11T07:21:00.710558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-08-11T10:27:12.624735Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:36.010169Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:0df38097a938716dd2ed44dc78c13e048ee47cf0b443eac5f42d56d03d4f4685","observation_id":"d03206f0-f22e-4813-ad06-6ceae2bd69f5","resolution":{"observed_at":"2026-05-11T08:11:04.298952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-08-11T10:27:12.624735Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:06.774877Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:e1ba3c862bb354996916c2580f172866045c6d9e189de03bbd641a3e17fc6de5","observation_id":"458f7de4-7dea-4b6a-852e-a8888eeb12bf","resolution":{"observed_at":"2026-05-12T06:06:24.030033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-08-11T10:27:12.624735Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-13T07:26:59.917150Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:0c29c08ade985f21bb1044d41c495847503fadf7c85894172aa01a8eb90426f5","observation_id":"d4c4efca-738a-4fc9-aaf6-3766dfcdea06","resolution":{"observed_at":"2026-05-13T07:27:29.419952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:708b706a7626c160639b1e9d453b94239525bfd772bb100db4fe3db7a4832308","observation_id":"4c6ad6c9-fdf3-43df-8778-46a1964bd261","resolution":{"observed_at":"2026-05-11T10:26:01.935651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-10T12:11:45.533669Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:33.668451Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:b00ea6bb7b89c934a9d105f649f0f683c7c5d40ad82fc2cf468ecc76a17e06b0","observation_id":"ab543ed3-ed1c-4606-ab82-51888183bee4","resolution":{"observed_at":"2026-05-11T13:41:04.107147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-10T12:11:45.533669Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-05T04:29:52.480873Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:21afe6e67b1dec823e1608ebd2c1434b06246c8a5227543c98a496458f2a6741","observation_id":"eaf0e5d4-9274-4335-b35c-4c0a6de31ea1","resolution":{"observed_at":"2026-07-05T04:30:40.700508Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.21144","last_updated":"2026-04-22T23:15:42Z","snapshot_observed_at":"2026-08-11T13:53:13.443978Z","submitted_at":"2026-04-22T23:15:42Z","title":"Using Machine Mental Imagery for Representing Common Ground in Situated Dialogue","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T23:44:12.093852Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.21144"},"observation_digest":"sha256:9238fd4e9801d4ae3b2cb06e412b57b716013d672f93eec72cd2e6f38ffa505e","observation_id":"e606c722-48a3-4a3e-a93c-928e86959529","resolution":{"observed_at":"2026-05-09T23:44:44.370094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T05:47:17.494531Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:52d97b8cb0f7321ad42e33c7760ed95b1ca4ebc9c631b6ea98659235076827fb","observation_id":"e55f0731-9dd4-4a79-b85f-7c009246b541","resolution":{"observed_at":"2026-05-12T10:31:30.107289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.28192","last_updated":"2026-05-07T14:00:44Z","snapshot_observed_at":"2026-08-11T13:04:08.180508Z","submitted_at":"2026-04-30T17:59:52Z","title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T03:00:26.352130Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.28192"},"observation_digest":"sha256:61e917f235f115611276f0abecb2cd8dce6e8949ac9aa5bee5c5c9d404b7b2f2","observation_id":"23a8ebd4-8ab7-409d-981b-149f75048b9b","resolution":{"observed_at":"2026-05-11T22:17:01.556370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:902f92f5fec53f18b5baf766b02a219e50a051507d33a316528f0681fdde1c58","observation_id":"9a002af4-fc4d-42c0-aece-bc49f199e477","resolution":{"observed_at":"2026-05-11T16:36:09.544273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:0d96e2674e6f41b95db974bec700f0065a29899a482b67826ec9af347c80fc5d","observation_id":"b3257744-8fbc-4791-9ae0-3a7d3ed086b0","resolution":{"observed_at":"2026-05-11T04:35:59.653902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.08802","last_updated":"2026-05-12T08:46:05Z","snapshot_observed_at":"2026-08-11T14:47:36.703009Z","submitted_at":"2026-05-09T08:47:00Z","title":"CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:19:04.590978Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.08802"},"observation_digest":"sha256:66e926baf7d8ec317b0c7d464fede692e06a822d98bda7cde96d99841b7ac022","observation_id":"74cd7e14-0902-4f29-aff7-f5af4f4c9fdb","resolution":{"observed_at":"2026-05-12T08:06:28.732533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.08802","last_updated":"2026-05-12T08:46:05Z","snapshot_observed_at":"2026-08-11T14:47:36.703009Z","submitted_at":"2026-05-09T08:47:00Z","title":"CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:08:52.879854Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.08802"},"observation_digest":"sha256:dbf96937602dd536e356b33854d2d02d6313f3454d40f0ef512070919bc73156","observation_id":"d0b8133f-092f-4eeb-af0b-6605c8d66833","resolution":{"observed_at":"2026-05-13T07:12:28.475592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:52919ad9d7456f4ec419d156b839cad0c3683faffd525c0957d90305d6db13b4","observation_id":"5f99935c-c814-4684-883d-47d9657b2ae0","resolution":{"observed_at":"2026-05-13T07:32:29.393294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-13T07:14:48.918959Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:545ccb0a902f6e00fbf365cbea632a712d0473af89a14f817beed1b5d4677886","observation_id":"1e03b941-5181-467c-84b0-33d1b30f8bb6","resolution":{"observed_at":"2026-05-13T07:17:29.031174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.12163","last_updated":"2026-05-13T02:23:44Z","snapshot_observed_at":"2026-08-02T15:57:40.981833Z","submitted_at":"2026-05-12T14:13:08Z","title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-14T21:47:50.595481Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.12163"},"observation_digest":"sha256:2235e84d5a2271870e1839d66d0fb94e53c23d48f972abae2bc8082f974f7ea7","observation_id":"1990d930-630b-401f-bcc9-866ca4e740da","resolution":{"observed_at":"2026-05-14T21:48:00.596427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-05T07:57:54.689541Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T07:21:40.803291Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:611a0b00909ea8da87058fb9d2afb9f8c38df9ffac40929e97aeb2b008c34abc","observation_id":"3e38a023-09e2-4746-815b-27852730357b","resolution":{"observed_at":"2026-05-13T07:22:28.475379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-05T07:57:54.689541Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-19T16:48:20.132240Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:346dfcf9e899dae91740965e395286726f945b178fc13fc44f53e14829b596c1","observation_id":"80d05957-b336-4b20-81ef-ef27be586518","resolution":{"observed_at":"2026-05-19T16:52:40.176676Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-05T07:57:54.689541Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T08:02:00.980836Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:4b305ad1ba80ceb9a3d604fb6e39ed37852e6c2556aed822eb6931d3c2f99bd1","observation_id":"4003f055-b9ec-4812-9534-a002f7a4233c","resolution":{"observed_at":"2026-05-21T08:04:02.670279Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-03T16:06:14.906537Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T06:40:55.537488Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:5d12286950d7365827185bcd2500514e4cbdbb9277ad8fc19781fd95517add53","observation_id":"cfd3c977-46db-48ce-b02b-29fbdf57809d","resolution":{"observed_at":"2026-05-20T06:43:05.879132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-03T16:06:14.906537Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:17d9ecdaca3c58cb8cc79bea2edc3a42abb470daf94df1cf1142eaa6be58fce9","observation_id":"eb7fdc95-373b-4b52-b6ed-90d17d125bc0","resolution":{"observed_at":"2026-06-30T18:55:00.794774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.26014","last_updated":"2026-05-25T16:33:00Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:33:00Z","title":"STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T23:04:21.463842Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.26014"},"observation_digest":"sha256:859363775ff68077a3599767ba9cc157861a0688cce8d51e1628c74b6359aef4","observation_id":"ead86fe9-3639-44a2-b16f-34c923b51c50","resolution":{"observed_at":"2026-06-29T23:14:02.161748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.30587","last_updated":"2026-05-28T21:34:40Z","snapshot_observed_at":"2026-08-09T23:39:02.203768Z","submitted_at":"2026-05-28T21:34:40Z","title":"ReGuLaR: Relation-Grounded Latent Reasoning for Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T07:39:30.470848Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.30587"},"observation_digest":"sha256:18079f5c1c966972faae26d68f3fcd604c69c56f07abdfeaf1b595eee6c4a57d","observation_id":"bb8b15b3-3e80-4378-9f3e-ad26b684b386","resolution":{"observed_at":"2026-06-29T07:43:13.719590Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:23b1fe03a034e77c72606e6c501306c136337c5a3978754cf679cafccefc3c46","observation_id":"6ba625fa-0b2a-4d40-a6da-45ce7edfe9b5","resolution":{"observed_at":"2026-06-28T19:52:36.136273Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.03005","last_updated":"2026-06-02T01:24:30Z","snapshot_observed_at":"2026-08-04T20:14:57.624898Z","submitted_at":"2026-06-02T01:24:30Z","title":"MUSE: A Unified Agentic Harness for MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T11:14:31.395762Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.03005"},"observation_digest":"sha256:d031c616c64e81bc8d6915e12a365ae07b0b9678615bc6880ad556e0a8eb4a21","observation_id":"52cd2762-eb65-4afb-ad5e-50ad477b734d","resolution":{"observed_at":"2026-07-02T02:06:26.900218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.03988","last_updated":"2026-06-03T04:16:22Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:59:17Z","title":"Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T09:56:05.047862Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.03988"},"observation_digest":"sha256:bbd70c8a50818171a1d579775079386256ced02a314e2bbfe465d205ec1b3e8b","observation_id":"4a2d7c9e-0a34-482d-b5d2-cb01938830fa","resolution":{"observed_at":"2026-07-02T03:36:29.341511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:ecb4e7e397aba14d87e037571a83fa9403f4bdab94e205f7785646f016b2eca7","observation_id":"63ddab03-9136-4c40-b3b6-1604641457a1","resolution":{"observed_at":"2026-07-02T03:06:29.449658Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-03T03:37:13.228116Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:a2734faf73754bb977da9c2a380f50137325982d01c36ef214dbe6c8507daf68","observation_id":"f4828936-c2d8-4ae9-b5fb-d69f471cdd29","resolution":{"observed_at":"2026-07-02T11:56:55.390969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.22476","last_updated":"2026-06-21T12:35:43Z","snapshot_observed_at":"2026-07-06T23:57:18.596834Z","submitted_at":"2026-06-21T12:35:43Z","title":"CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T10:54:49.774490Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.22476"},"observation_digest":"sha256:7b328fa945898be105455dbd76de64a234dfbfc005ccb72f621cbfa8447012c7","observation_id":"ce7a9a48-e4f8-463f-9f72-d77fae6558b2","resolution":{"observed_at":"2026-07-04T08:49:42.497880Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.24233","last_updated":"2026-06-23T07:22:22Z","snapshot_observed_at":"2026-08-06T19:51:08.157500Z","submitted_at":"2026-06-23T07:22:22Z","title":"Latent Visual States for Efficient Multimodal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-26T00:38:11.619574Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.24233"},"observation_digest":"sha256:06ba6e364261639ac93042c093c8edc5303c7c742aeccc13ab52323141659e11","observation_id":"4566a277-a066-4f04-b0c2-2e3f3257905d","resolution":{"observed_at":"2026-07-04T16:29:57.230432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-04T23:24:39.482468Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:19b262dca6578b19c787bc05223891baa48e73514c168a507f171e231aa74673","observation_id":"9a33ec06-f553-4f50-86d2-08e2a6d7f46a","resolution":{"observed_at":"2026-07-04T19:30:06.790782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.29712","last_updated":"2026-06-29T02:34:52Z","snapshot_observed_at":"2026-07-07T00:03:41.292432Z","submitted_at":"2026-06-29T02:34:52Z","title":"Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T06:43:20.893142Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.29712"},"observation_digest":"sha256:18ebdd4027cb9905434b3ea317200efd4593031d6ffc1e1e6201c2f32613cde7","observation_id":"a49e6b72-f388-4693-968b-e6cf3c29b957","resolution":{"observed_at":"2026-06-30T06:44:18.300595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.30168","last_updated":"2026-06-29T11:44:09Z","snapshot_observed_at":"2026-07-07T00:04:05.275293Z","submitted_at":"2026-06-29T11:44:09Z","title":"Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:16.868238Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.30168"},"observation_digest":"sha256:845be6aa25b13fa0fc5482107647dd81006b735725b5a5b2b04708135f6896fd","observation_id":"f9abef83-1b04-44f2-82ef-22b99f6802f1","resolution":{"observed_at":"2026-06-30T06:44:19.792879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2607.00461","last_updated":"2026-07-01T05:29:02Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T05:29:02Z","title":"Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-02T15:06:38.215137Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.00461"},"observation_digest":"sha256:1b2569620fa740adf3164581d4a4b15911a6b6600951978dca9f68921aca2832","observation_id":"28cff490-528d-4d2c-8319-8c703119c9e4","resolution":{"observed_at":"2026-07-02T15:07:03.807955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-12T06:13:16.894125Z","title":"ArXivabs/2506.17218(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02907","last_updated":"2026-07-03T03:14:11Z","snapshot_observed_at":"2026-08-02T18:53:38.421944Z","submitted_at":"2026-07-03T03:14:11Z","title":"ProLaViT: Learning Progressive Latent Visual Thoughts in Structured Latent Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:13:16.894125Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.02907"},"observation_digest":"sha256:cfab75f775f12fec3468184f737b812052ab661f74466affbf17bde573caead7","observation_id":"2e019a78-9093-467e-877b-216c3b32a019","resolution":{"observed_at":"2026-07-12T06:13:16.894125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-06T07:19:16.030350Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:719d757a34107d95e5b6e97bd69805134752c23525404e6b5ccb9a797623a049","observation_id":"4ee2f962-6b5e-4826-b422-3518eb5e0a6b","resolution":{"observed_at":"2026-07-10T13:37:06.835539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2607.08724","last_updated":"2026-07-09T17:30:49Z","snapshot_observed_at":"2026-08-05T03:35:49.427704Z","submitted_at":"2026-07-09T17:30:49Z","title":"Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T02:59:21.353359Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.08724"},"observation_digest":"sha256:98a9da1dca6d11eaa029af428e3612f033fec0cc20e01004a4ec6395a367e993","observation_id":"17d753cb-9dbb-475e-9f20-82b549c88feb","resolution":{"observed_at":"2026-07-10T03:06:43.680965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-31T16:13:17.497272Z","title":"arXiv preprint arXiv:2506.17218 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28154","last_updated":"2026-07-30T12:57:45Z","snapshot_observed_at":"2026-08-03T12:39:00.211104Z","submitted_at":"2026-07-30T12:57:45Z","title":"OPLD: On-Policy Latent Distillation for Multimodal Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T16:13:17.497272Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2607.28154"},"observation_digest":"sha256:627d0671cb97baa483abecca6b12db6c698d5fbf80bcd6e06308bb627bf8ab81","observation_id":"2dd301e0-1288-4f03-aad9-e60e3a6b54d8","resolution":{"observed_at":"2026-07-31T16:13:17.497272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T00:28:16.479658Z","title":"Zhang, Y.; Liu, X.; Tao, R.; Chen, Q.; Fei, H.; Che, W.; and Qin, L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00743","last_updated":"2026-08-01T16:27:45Z","snapshot_observed_at":"2026-08-08T13:32:58.204109Z","submitted_at":"2026-08-01T16:27:45Z","title":"LUT: Latent Utility Training for Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:28:16.479658Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2608.00743"},"observation_digest":"sha256:3ef3b8295b7ad5e7b22bcd867c090e8b5c4e3a66f228e09f5b56a6976edf18c4","observation_id":"27386c4e-2c67-4476-a2b4-570bcd9b295d","resolution":{"observed_at":"2026-08-05T00:28:16.479658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T19:03:11.626570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03450","last_updated":"2026-08-04T10:46:10Z","snapshot_observed_at":"2026-08-09T08:30:22.690408Z","submitted_at":"2026-08-04T10:46:10Z","title":"Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T19:03:11.626570Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2608.03450"},"observation_digest":"sha256:3074d1162b8e9aa1ca96593e516050d9e2fc6812e3b046ed406f1b3df7bda588","observation_id":"d9f77a4a-2a24-479b-8e50-eb7f1c101a61","resolution":{"observed_at":"2026-08-05T19:03:11.626570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17218/citation-record","integrity":"/paper/2506.17218/integrity","json":"/paper/2506.17218/citation-record.json","paper":"/paper/2506.17218"},"outbound":[],"paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 51 inbound Pith citation observations for arXiv:2506.17218."}