{"as_of":"2026-08-01T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddb936a55263fa22bcb54d72fb0e7b30a60acb66ff947dc8dac3379c78745718","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T15:47:49.982564Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T16:13:17.573307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02735","snapshot_observed_at":"2026-07-31T16:13:17.573307Z","title":"arXiv preprint arXiv:2605.02735 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28154","last_updated":"2026-07-30T12:57:45Z","snapshot_observed_at":"2026-08-01T19:43:18.090093Z","submitted_at":"2026-07-30T12:57:45Z","title":"OPLD: On-Policy Latent Distillation for Multimodal Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T16:13:17.573307Z"},"links":{"cited_paper":"/paper/2605.02735","citing_paper":"/paper/2607.28154"},"observation_digest":"sha256:90d4c608b6dd945fbc710f9dba268e62c622e37ab222cd8ed7d5e431a63f5742","observation_id":"577b9ca7-52c3-4b31-a8f4-fca40918c88f","resolution":{"observed_at":"2026-07-31T16:13:17.573307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.02735/citation-record","integrity":"/paper/2605.02735/integrity","json":"/paper/2605.02735/citation-record.json","paper":"/paper/2605.02735"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:6900dd7cc87901e614a023a02212806c2804985f69e9024780070b0c3a0c3549","observation_id":"3a2c6d5f-8b2d-4508-80e2-23be1da2faab","resolution":{"observed_at":"2026-05-11T16:36:09.579251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.459543Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"19dbc933-eff7-47da-894e-0cb819f498b9","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:d6c917e26b0b2e57caa02aabc861166c6180a2929aad80d2970c87cf6873989a","observation_id":"cc5c100b-b3ca-4721-848f-e2f4db540260","resolution":{"observed_at":"2026-05-26T01:06:25.991467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-07-06T21:26:59.423358Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14231","doi":"10.48550/arxiv.2505.14231","metadata_source":"pith","pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Univg- r1: Reasoning guided universal visual grounding with re- inforcement learning.arXiv preprint arXiv:2505.14231","venue":"cs.CV","work_id":"fad4943c-f29d-4daa-a7ba-dd6f03aac5aa","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:2da396bac655f708a748ebb1eda08fe9ea31163ac00fc77d65dd0da1eac06967","observation_id":"66037d08-075a-43d3-afba-1f975d3c4ec1","resolution":{"observed_at":"2026-05-11T16:36:09.631193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":"b0771cca-30e1-4cea-9736-8612e3b3c58a","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:09fb09c86e54fc692eab2476dfd6b7e95a88b41427e4c158b5cbf0bb77fcb87e","observation_id":"519fb987-1521-4309-885f-e59d3d4a5cf7","resolution":{"observed_at":"2026-05-26T01:06:25.978226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-07-06T17:53:11.000124Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:93899c946d5e35ab375631bd7c630240f02ec926c88fdb7576d0cd42c435a20b","observation_id":"ba3b1d82-cfba-413d-aa70-88101c9f74d8","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think with 3d: Geometric imagination grounded spatial reasoning from limited views","venue":null,"work_id":"b2e813ac-f59e-48cd-adc3-d913798f9ce6","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:c022f95eb5d0e45032c376342f1fa8f9bb8e4d44a410d55113a7f89e98b488fc","observation_id":"529ad48e-7849-43da-8eb9-57d01a694020","resolution":{"observed_at":"2026-05-26T01:06:25.917571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:02.175554Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"321b2bd4-950a-44f0-ab50-e70251e75187","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a56b1e8cf5f4e8ffb44a5ac06423a0c726a80ae1913f52ac31e72ebc2f02a88d","observation_id":"a6291f43-4fd3-49e4-ab53-0d6edfb426e7","resolution":{"observed_at":"2026-05-26T01:06:25.984613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:d56dcc56424ec41b85d6a34c630f693bb2ee6a07e08aaee51111599e8e0ce6a8","observation_id":"ed1cadea-6207-4b5c-8aa3-40ecee404002","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.599461Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":"fccf4299-b140-4802-a868-310aa5c76a08","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:9f4b3e3b1e1e581b56c648af7682777b97f8cd49fe2127aa7361e2f867e9f1c8","observation_id":"8f4b7016-b63a-4096-99f4-7ea0ca3e514f","resolution":{"observed_at":"2026-05-26T01:06:25.998588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":"4d3584ee-56cb-4c17-9320-0f305171ebf0","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:c9635458b003feb6727e4b86c2404076246d74779178562d1ea29df6104396db","observation_id":"c7ec3e4d-a5c5-44ff-bfb8-fa94413f0e62","resolution":{"observed_at":"2026-05-26T01:06:25.949019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interleaved-modal chain-of-thought","venue":null,"work_id":"b3444e36-ad02-4c2e-8e6e-7d42183806d3","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:85c5e2837b740a9966e7d5fa629a1e70bb97613c388ac508a95df6d823045b72","observation_id":"8c2ee88f-a43e-4f6a-9657-550f5c015b93","resolution":{"observed_at":"2026-05-26T01:06:25.926002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallusion- bench: An advanced diagnostic suite for entangled language hallucination & visual illusion in large vision-language models","venue":null,"work_id":"05d0040c-d33d-4938-9606-6b52b98cd8bd","year":2023},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:f326c362b5811f2ca3a1d47aa70037367e0aab3480a786f0de4ac1d48ddbe6c9","observation_id":"8733b059-e4b1-4135-a7a5-2a44b73fe9cc","resolution":{"observed_at":"2026-05-26T01:06:25.929162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":"632ef0ac-9583-4c18-a1b3-255da7640a00","year":null},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:82443c3dc238c3c9bdd4f2ae45de9616c4f9769c23eebcc89ef6b52051b9b62a","observation_id":"2e6e0cbf-20a7-46d9-8a0a-bb77addb9cae","resolution":{"observed_at":"2026-05-26T01:06:25.988336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379","venue":null,"work_id":"b127bb1c-d2a0-4d07-a4af-63f1cfb68ee3","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:666631126711d9653d71a67eff2d25bb0e66d04dc4c49fc3c7ffa05784332bc0","observation_id":"7334ff85-fe9c-46cf-b2cb-208cf32169fb","resolution":{"observed_at":"2026-05-26T01:06:25.900376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent visual reasoning","venue":null,"work_id":"33ca8bc8-0de5-4670-9cc2-a81a046c9cc9","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:beaa25fd22b305443e3c04817819d15f60197389e4c7c96d62fa91c211160d3a","observation_id":"f6492854-552e-441c-886a-1a135ae0c3e4","resolution":{"observed_at":"2026-05-26T01:06:25.981224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"cited_work":{"arxiv_id":"2512.12623","doi":"10.48550/arxiv.2512.12623","metadata_source":"pith","pith_arxiv_id":"2512.12623","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","venue":"cs.CV","work_id":"4fe1a03c-93cb-4535-b329-a37b70c8e3dc","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2512.12623","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:6f34ebc8a75ac5ed11f808489a8f8425182a63906f98eaf1cb242d5fae4f113a","observation_id":"89b6da3e-4c93-40b6-9ea1-d17d776ad77d","resolution":{"observed_at":"2026-05-11T16:36:09.585493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deliberation in latent space via differentiable cache augmentation","venue":null,"work_id":"a3ba53fa-6d8c-4533-af48-6e99827aa5a7","year":null},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:7bddf003787927d8610e54374d44347ed341e56fffb77b40cd4c7318ea6842a6","observation_id":"c32a2eec-c6af-4597-af8e-4d48820cc54a","resolution":{"observed_at":"2026-05-26T01:06:25.888577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"fa9c3f29-8eaf-4b7a-b528-7dc25c524f3f","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:e2b8fb5471e12ba2fcd6a079ad1b00dc5eee276f222be80a75a9d6f8c8469aaa","observation_id":"68ca0288-8ca9-4a17-af42-fc0c5bc3dc2d","resolution":{"observed_at":"2026-05-26T01:06:25.880107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ca2c433f-5447-47c3-96c9-24f2e7852a92","year":2022},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:8bcda41aa243c73596a050a3c9106952ecc4fc9c30880a7a93ff1ec41064d601","observation_id":"b958fd74-c7a4-425d-8d34-807959c82865","resolution":{"observed_at":"2026-05-26T01:06:25.974192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on latent reasoning.arxiv","venue":null,"work_id":"57d7c21f-06a1-4005-b667-8d2baee347ff","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:0c080eb726be1078481b983707a99f7d0b82ed2fec55d1376d296c1788e9e2a2","observation_id":"68d1ffcb-7056-4b6f-a2bb-f2ef99f2c862","resolution":{"observed_at":"2026-05-26T01:06:25.995586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02360","last_updated":"2026-05-26T12:26:50Z","snapshot_observed_at":"2026-07-06T22:34:48.431368Z","submitted_at":"2025-11-04T08:28:46Z","title":"LaRe: Latent Refocusing for Multimodal Reasoning","version":4},"cited_work":{"arxiv_id":"2511.02360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02360","snapshot_observed_at":"2026-06-28T20:22:37.715477Z","title":"Cocova: Chain of continuous vision- language thought for latent space reasoning","venue":"cs.CV","work_id":"88d40f49-8f78-4627-82ad-06f9f4610821","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2511.02360","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:ab5fa507bd901b99a7b8a104ec57d06b3f251f3fd5f940c207dc44b6b4f79346","observation_id":"4c330125-d170-4c8c-b72b-e0ff100b5b08","resolution":{"observed_at":"2026-05-27T02:05:07.580934Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":"6fe32806-5f36-42a7-8b0e-6ef807d56a11","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:0f13507f1fa07cc62b1ae137160fdadc346e746d6d33915583add7bc75f06153","observation_id":"b4a50e53-5de6-4bc5-885f-d95cabce7c8c","resolution":{"observed_at":"2026-05-26T01:06:25.884686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.883595Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:1c57d70bd6ba6bd8d50322c5724512c1e41610f1ccbbae23a1e05a6692c33b38","observation_id":"29a6f4c4-47ec-4893-b174-e1fb73bfccf8","resolution":{"observed_at":"2026-05-11T16:36:09.615772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7951337b-d699-4816-b5e2-cc625aeacb62","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:33257fb553106b92d9f8482bd7bb92b34362d8190d8f9c522f634fa206fc223f","observation_id":"c279abb1-582c-4ea8-a1fa-71ac6c0e3188","resolution":{"observed_at":"2026-05-26T01:06:25.921888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.620761Z","title":"Codi: Com- pressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":"1a10cfac-e21f-4603-9bcd-6bd82a9489d4","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:b747051e6b16240287e0b348341fba7ff7a9b0921e5439fa4462d92f944910ba","observation_id":"7f7ffa2f-596d-483c-9e4e-3a37b04ef130","resolution":{"observed_at":"2026-05-26T01:06:25.913984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swireasoning: Switch-thinking in latent and explicit for pareto-superior reasoning LLMs","venue":null,"work_id":"91f791ef-f8fc-4974-a313-68904a88b772","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:bfa7c195123d5832780fc16c25653bd74c06fb59c1899c5771c6e1a1a39a0654","observation_id":"f4718f76-c2a1-4d4d-9cbb-71c311ed7cce","resolution":{"observed_at":"2026-05-26T01:06:25.892022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think silently, think fast: Dynamic latent compression of llm reasoning chains.Advances in Neural Information Processing Systems","venue":null,"work_id":"30337c6c-b850-4260-8799-cf1bd49d0b73","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:98a0249bd5209fe764c51ecbd9f2482c003dd423b592475ff16c1a3a7a04bb43","observation_id":"239432c9-d6be-4f55-b0e5-7af43b159614","resolution":{"observed_at":"2026-05-26T01:06:25.952508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual position prompt for mllm based visual grounding.IEEE Transactions on Multimedia","venue":null,"work_id":"5f1fa1bb-0f5f-4f72-99b7-2507bbc0cccc","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:4f8e6f229142b4fe415614a471255dcb601ec6d29fc3b8a1ee9a478b07123e0d","observation_id":"df45b34b-7cbc-46f8-9c89-5636f31c0502","resolution":{"observed_at":"2026-05-26T01:06:25.942767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"9fc53378-cb24-43c1-a4c4-254ee8c93507","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:cd45e0ebda1fcad3f1ed44f64c7843ff0796083dcc2b47d51199143431c542cf","observation_id":"eeb952a7-f6e8-4310-a861-0b4fbc97e246","resolution":{"observed_at":"2026-05-26T01:06:25.896455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLLM can see? dynamic correction decoding for hallucination mitigation","venue":null,"work_id":"f096ae98-2fb5-40d8-9d8e-ff4c3edc7a7b","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:788db5827915ea2c7f89a1f15ef26ed26e9b12b0e2b0d547bd3d64e207acdae1","observation_id":"5283bfd8-3b5b-4718-8c67-41d8414ae3e9","resolution":{"observed_at":"2026-05-26T01:06:25.933325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21395","doi":"10.48550/arxiv.2511.21395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Monet: Reasoning in latent visual space beyond images and language","venue":null,"work_id":"ce4ac531-7907-4d8a-afe2-9a0dae21ffa5","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:322c71e64d09d5eb0f48452ea037493154e9d36585fe0c6d3f0df4b25a3420bb","observation_id":"f569092e-9845-4108-8277-7acd9e655a91","resolution":{"observed_at":"2026-05-11T16:36:09.653976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-07-06T21:31:40.171357Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"cited_work":{"arxiv_id":"2505.21547","doi":"10.48550/arxiv.2505.21547","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21547","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Image tokens matter: Mitigating hallucination in discrete tokenizer-based large vision-language models via latent editing","venue":null,"work_id":"6946dc00-f4df-488f-bf2c-d6ea3e167010","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2505.21547","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:75fdb455182bb6f3831272a45e296707ec14aa4b6efe4a19280689f0261af672","observation_id":"12eb500d-62b4-4d9f-aa2d-6fbc85357130","resolution":{"observed_at":"2026-05-11T16:36:09.558238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2503.12605","doi":"10.48550/arxiv.2503.12605","metadata_source":"pith","pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","venue":"cs.CV","work_id":"a8fbb385-8ed1-4952-9ee8-8d03be2b6821","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a9366bec9095c1afaa99bb5e6cead3345a33d98d192105f3c973ff6262bd679e","observation_id":"4cda328c-e917-4ec3-b5fa-2aeecf482a0d","resolution":{"observed_at":"2026-05-15T17:18:53.866178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.595164Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a3ac3b4d-8c58-4772-ad55-18e8fb162bd1","year":2022},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:e83bffbd37afcd167227f68239429d979a9ae92abd1a3e29e9865435c7dfa7e5","observation_id":"85060b44-8a35-4beb-a7e4-89efad4d3055","resolution":{"observed_at":"2026-05-26T01:06:25.960259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepscientist: Advancing frontier-pushing scientific findings progressively","venue":null,"work_id":"5cb28282-1c61-41b4-9ff5-7fd0c803784a","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:ea43da85f3b55f2ad4254b2b69c7b10d35b28ead99e6781e6df4762021610504","observation_id":"eafd2daa-e09f-407c-8b0e-5ec8fd47dbd8","resolution":{"observed_at":"2026-05-26T01:06:25.963118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind’s eye of llms: visualization-of-thought elicits spatial reasoning in large language models","venue":null,"work_id":"8de973be-d70b-4856-aa4e-68b84fded901","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:84e65ff235a300b8b257a70e840ca88a9ff20255cff6ea9b8b1c685365cc4016","observation_id":"f4a84c9d-0c51-4dc0-baac-ab8e51beee06","resolution":{"observed_at":"2026-05-26T01:06:25.936641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mini-omni-reasoner: Token-level thinking-in-speaking in large speech models","venue":null,"work_id":"91409554-c2df-4e0c-a93d-7ba118d45c23","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:2f09b991402ee4cc59e1f0eb06730280f512f7344c14debee3abfa06f1d2559c","observation_id":"d98ebe88-1f9a-4510-ba6b-49e297132419","resolution":{"observed_at":"2026-05-26T01:06:25.906496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13366","doi":"10.48550/arxiv.2603.13366","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Thinking in uncertainty: Mitigating hallucinations in mlrms with latent entropy-aware decoding.arXiv preprint arXiv:2603.13366","venue":null,"work_id":"58cebb04-4928-48e5-8d65-6463878d1f71","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:f664ef786401efec326e0f3ad4e05b628906e1e6fc357101f19ca4f2543721fb","observation_id":"464b87df-fffc-4add-9810-35f6daf5ca5f","resolution":{"observed_at":"2026-05-11T16:36:09.643792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":"797b20fd-0f88-42fa-84ae-bdfa1bc18dbd","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:7a3d002192a8ba1a36cbeb4d38e1481fabe1e10fd42b1b341c35ffa1f17ea91e","observation_id":"d8d1f104-679d-44e3-a497-29f2b09baa2e","resolution":{"observed_at":"2026-05-26T01:06:25.945927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-07-06T21:45:25.136396Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-10T13:37:06.834211Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:4da72beee0f5990eefddb7731e271709dcae4ef3f9a78af931271aa604a19562","observation_id":"9a002af4-fc4d-42c0-aece-bc49f199e477","resolution":{"observed_at":"2026-05-11T16:36:09.544273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion of thought: Chain-of-thought reasoning in diffusion language models.Advances in Neural Information Processing Systems, 37:105345–105374","venue":null,"work_id":"3bdd7184-384c-4507-b6d1-cedf401f87de","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:32bb7b57a6c52e903dd3863efd96fd6d0a61b6a488a108c4b02e9c4760716188","observation_id":"6aa3f6b0-6b4b-4750-8c29-d17ec79da595","resolution":{"observed_at":"2026-05-26T01:06:25.968119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.435051Z","title":"A survey on multimodal large language models.National Science Review, 11(12):nwae403","venue":null,"work_id":"811a7fd9-1a17-4b79-aa76-eae69f657966","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:5b498a90b49b6f3ee7d5ece8876bb52977d7ed805d15bfbf83dcddb38fe3df7a","observation_id":"a8175318-fcaa-4440-94db-57ad8b7afcd5","resolution":{"observed_at":"2026-05-26T01:06:26.002163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-cot:a benchmark for probing vi- sual chain-of-thought reasoning in multimodal models","venue":null,"work_id":"da80aeaf-ad7d-401e-a4ac-9836bfc77781","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:6392519d465d2b13f276e502012a81329d27b8e0fd7689757f5df7987dff1a96","observation_id":"15e7bcb6-1472-4bf6-9258-728eb6b02d07","resolution":{"observed_at":"2026-05-11T16:36:09.609725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- modal chain-of-thought reasoning in language models","venue":null,"work_id":"3c11008f-fd3d-480c-beac-1f3824a6f62d","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:d2f7b2a4511edc0f1ef0f8c6cda336787ac9891f51888064971127f598f271c0","observation_id":"41d65bfa-371a-4fec-a898-e8b6bd0e72bb","resolution":{"observed_at":"2026-05-26T01:06:25.910229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Promptcot: Synthesizing olympiad- level problems for mathematical reasoning in large language models","venue":null,"work_id":"1166d739-43c1-4723-a2bb-67353b09e602","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:0bf8a792f52a7183ea7679fac03bdbda32334853f30c6e4ff0d65cf22b0bd20c","observation_id":"19905017-6415-4da5-86b3-dd82f0ef7ca5","resolution":{"observed_at":"2026-05-26T01:06:25.955941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-07-06T18:18:07.839497Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.13872","doi":"10.48550/arxiv.2405.13872","metadata_source":"pith","pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-07-10T07:36:58.023300Z","title":"Image-of- thought prompting for visual reasoning refinement in multimodal large language models","venue":"cs.AI","work_id":"b297e4fe-c03f-49c9-896a-2d505bdf26ce","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:dbb976f291b5689aec5e4f163c87f6986b79dea9e8aa4d57d9f4e6b52f401325","observation_id":"82f72304-2dd1-4caf-b824-de36c125a1ef","resolution":{"observed_at":"2026-05-11T16:36:09.568637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25040","doi":"10.48550/arxiv.2603.25040","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Intern-s1-pro: Scientific multimodal foundation model at trillion scale","venue":null,"work_id":"5328cad1-083e-4346-916e-8d865c99f0ac","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:dfac298b081d77a42950630af3cdd24d58e005ff0d76f693597756a9d1e9c45e","observation_id":"6c795bb6-3c09-41eb-bc64-b841891ac706","resolution":{"observed_at":"2026-05-11T16:36:09.664141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":14,"verified_fuzzy":31},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2605.02735."}