{"as_of":"2026-08-01T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:299ba50de4976dc1814c4c139e2315a9694d1fe120f8c83b2443620677c54959","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T07:32:03.466222Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:47:31.725395Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T13:38:19.098461Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2605.11856","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.11856","snapshot_observed_at":"2026-07-03T13:38:19.098461Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","venue":"cs.CV","work_id":"89ee0ce8-e491-42c5-ae2c-d234a942dca1","year":2026},"citing_paper":{"arxiv_id":"2606.12847","last_updated":"2026-06-11T03:22:00Z","snapshot_observed_at":"2026-07-06T23:51:40.528967Z","submitted_at":"2026-06-11T03:22:00Z","title":"Language-Guided Abstraction for Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T07:47:31.725395Z"},"links":{"cited_paper":"/paper/2605.11856","citing_paper":"/paper/2606.12847"},"observation_digest":"sha256:281c77fc3a34d2a1e5deac2b146f890397a3e587b0482f0c5f52f45046ad56ed","observation_id":"23770e47-94ca-4045-b471-e45bb3e7c596","resolution":{"observed_at":"2026-07-03T13:38:19.099762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.11856/citation-record","integrity":"/paper/2605.11856/integrity","json":"/paper/2605.11856/citation-record.json","paper":"/paper/2605.11856"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-07-06T21:49:47.325553Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":"2506.23918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-07-11T03:17:51.399835Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":"cs.CV","work_id":"760ebd7d-977d-4280-afae-adb421d49ed4","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:c7ae6437390e261be96a7563e6dcfcf942028834d36f0124096898942239ad88","observation_id":"6e4c205f-be54-4385-afe7-442d47abb0a9","resolution":{"observed_at":"2026-05-13T08:34:23.540456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"f9392710-88d2-4448-ae62-02ebe19d6639","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:45b3db2b97ef568b31af843c4dea1fcd42cf74a5085b5f0c07010af61394d61f","observation_id":"d0dedd2a-68cf-4a47-a1a3-37b8197b89c6","resolution":{"observed_at":"2026-05-13T07:32:30.748855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"df93a4c3-22b0-43d3-ae91-a2f0113cbf63","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:bbe69380695fae2d0271031e4eb4414528350245011959bd1b44a6a6e9916f5e","observation_id":"70a06127-e3e8-49ae-9dad-b6a44a274cfc","resolution":{"observed_at":"2026-05-13T07:32:30.764546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"42d2317f-c40a-4533-9795-a248cd611649","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:e46ffdf75d9ad96742c695ad529eaa2485a239bc702bf571a5049a64d53bb89e","observation_id":"c90818c4-39fd-4989-b189-fcdca557321d","resolution":{"observed_at":"2026-05-13T07:32:30.752238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme-realworld: Could your multimodal LLM challenge high-resolution real-world scenarios that are difficult for humans? InICLR","venue":null,"work_id":"de3d025b-f122-4c13-9d5a-291bab457f82","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:5049122760f4c27f283cd5192ff1dbf352d388038a8e0224714b1d500b14e2c7","observation_id":"a46a3294-d575-4971-983b-365af24137ea","resolution":{"observed_at":"2026-05-13T07:32:30.728858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smith, and Ranjay Krishna","venue":null,"work_id":"b16c46cf-afc4-4110-a24d-8fa873d3ff1f","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:2897b2299507f874d3fb07cd8e36161ccf279a5d26786557f875977f2b7ad34d","observation_id":"fa674638-a829-47fe-889e-8a772044b1bd","resolution":{"observed_at":"2026-05-13T07:32:30.745369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:09:44.987304Z","title":"Vtool-r1: Vlms learn to think with images via reinforcement learning on multimodal tool use","venue":null,"work_id":"09e9aeff-7314-468c-b3c4-e45fe4def91a","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:a2553c1b81ed50bedfdd5faf9e3abddd93335473199218d473271aef0537e13f","observation_id":"7b3dd458-1509-4e74-8f23-263ef115effa","resolution":{"observed_at":"2026-05-13T07:32:29.374623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.14362","doi":"10.48550/arxiv.2505.14362","metadata_source":"pith","pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","venue":"cs.CV","work_id":"5f6cf57b-2407-4127-b39c-d8a61494e474","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:b3a0ee98ce4bb0a67eccc0b6ef4610132c616ecdb2f1d73707805c1241ae14f0","observation_id":"188e7e8a-7044-4727-ac5e-b9fa6597ddb4","resolution":{"observed_at":"2026-05-13T07:32:29.420726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.15966","doi":"10.48550/arxiv.2505.15966","metadata_source":"pith","pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-07-10T13:37:06.857138Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","venue":"cs.CV","work_id":"878c3e90-ce55-4ba3-a588-2abe369013e6","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:0005f189d11dcad682c740710fae67ae0195d11f6bb6c6fa245909cff659998c","observation_id":"35e617ca-f4f6-43c7-a018-ee7baef37a02","resolution":{"observed_at":"2026-05-14T02:22:27.090901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-07-06T21:45:25.136396Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-10T13:37:06.834211Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:e8300cb16bf60f6a1bc6aaa74612b3c5d586c6aa1cd7bb20bdb9a6593820f4ec","observation_id":"5f99935c-c814-4684-883d-47d9657b2ae0","resolution":{"observed_at":"2026-05-13T07:32:29.393294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2509.24251","doi":"10.48550/arxiv.2509.24251","metadata_source":"pith","pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-07-11T03:17:51.433935Z","title":"Latent Visual Reasoning","venue":"cs.CV","work_id":"b6468cfa-4f13-4e02-b0ec-24ff5cd6785a","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:3615b636e06d04943256e89e4ed2d650ceb446318321bce2b9c8df7bccf3ac0d","observation_id":"9aded464-3ad4-4290-9513-98cad20d3116","resolution":{"observed_at":"2026-05-15T18:41:30.500607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21395","doi":"10.48550/arxiv.2511.21395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Monet: Reasoning in latent visual space beyond images and language","venue":null,"work_id":"ce4ac531-7907-4d8a-afe2-9a0dae21ffa5","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:6b0bebd6bd9f1ba2971068cef8b35c8ddad8c702a7081d708000437adfadf98f","observation_id":"708d1a0c-3374-4dbe-834f-65601273b857","resolution":{"observed_at":"2026-05-13T07:32:29.387207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T04:30:40.735725Z","title":"Sketch-in-latents: Eliciting unified reasoning in mllms.arXiv preprint arXiv:2512.16584","venue":null,"work_id":"46adadd8-c41c-4fc6-ada3-e996ed5f58c7","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:8efa9185c83717db79bb61fa35f2f640350630b127ddf9ec49d7f5c2cde7f7d9","observation_id":"0c1a9b78-3b78-444c-b17e-5a4bb08faa5a","resolution":{"observed_at":"2026-05-13T07:32:29.309729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"cited_work":{"arxiv_id":"2512.12623","doi":"10.48550/arxiv.2512.12623","metadata_source":"pith","pith_arxiv_id":"2512.12623","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","venue":"cs.CV","work_id":"4fe1a03c-93cb-4535-b329-a37b70c8e3dc","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2512.12623","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:8881266b9744a6324ffed9fc6c63047c461e4a26eff9864abbba27958f4ad0c6","observation_id":"78d87c49-8154-448c-8817-e8647146a4a3","resolution":{"observed_at":"2026-05-13T07:32:29.443170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.883595Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:85747675f6bac2ce776c5f458e115e35a991b5f601a0518e52c46d25ed27a369","observation_id":"72477733-2df0-4a69-8be5-372fadc98951","resolution":{"observed_at":"2026-05-13T07:32:29.321234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-11T00:37:42.845448Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:9c14449565587736ce61f7de97799d9964c29138f98862e0cae9cf65cb8abdf5","observation_id":"da58669f-b94e-4167-81c6-8168cbfae508","resolution":{"observed_at":"2026-05-13T07:32:29.315676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15778","last_updated":"2025-05-21T17:29:15Z","snapshot_observed_at":"2026-07-06T21:27:56.777489Z","submitted_at":"2025-05-21T17:29:15Z","title":"Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space","version":1},"cited_work":{"arxiv_id":"2505.15778","doi":"10.48550/arxiv.2505.15778","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15778","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Soft thinking: Unlocking the reasoning potential of llms in continuous concept space","venue":null,"work_id":"52bee262-b7e4-4fda-b669-ae201751aed4","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2505.15778","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:c4fbb457d98bfd7e3814d39d7a5f5d37133cb9f46e0e113dfd5291fdfb8ef33f","observation_id":"d1bb62b3-0fc0-489f-a284-00343f25ba29","resolution":{"observed_at":"2026-05-13T07:32:29.327633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:14.091393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:14.091393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"cited_work":{"arxiv_id":"2604.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02029","snapshot_observed_at":"2026-07-09T05:36:01.166323Z","title":"The latent space: Foundation, evolution, mechanism, ability, and outlook.arXiv preprint arXiv:2604.02029","venue":"cs.AI","work_id":"66adad9d-c3df-4cf7-9601-cf9d67d19ef5","year":2026},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2604.02029","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:578ae64c908c2f04350ad1d9d7bbc388a39d66c27c9bef8494902db418b38418","observation_id":"e35ead35-e169-48d5-bda4-5f564d0dfaed","resolution":{"observed_at":"2026-06-08T02:03:55.088792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing thought","venue":null,"work_id":"a860ecc5-2955-4a2d-9f09-933a9b64bad3","year":2013},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:3224371524404d1996c8b06026ab329ce4d11f770f89bc87d27d3b4b86983e9f","observation_id":"e01bd607-1f63-4cb0-a68a-461c49279de7","resolution":{"observed_at":"2026-05-13T07:32:30.710078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIT press","venue":null,"work_id":"78e8fe82-7e55-4fc1-a461-70b50ebe57fe","year":1995},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:fe29032a66b3266cbbdc70365cc93d3f04c8ede62f45d8c29db302fd6f4f87a3","observation_id":"c020d510-63f3-47c0-971c-b970a9622734","resolution":{"observed_at":"2026-05-13T07:32:30.714164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":"2510.18234","doi":"10.48550/arxiv.2510.18234","metadata_source":"pith","pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-07-10T17:07:25.735032Z","title":"DeepSeek-OCR: Contexts Optical Compression","venue":"cs.CV","work_id":"e85551be-f243-4764-886f-76a8813ccbb8","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:6934f207b0b7507e99c954d51b8d394ea7fa6ae922af81f8abd57d90f509f0b0","observation_id":"ae4437ed-a8ee-40f5-bddb-ff61fc9a7353","resolution":{"observed_at":"2026-05-13T07:32:29.448698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.20552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:07:25.727485Z","title":"Deepseek-ocr 2: Visual causal flow","venue":null,"work_id":"9886dce9-776e-4ad6-b96c-fbf9037ca41c","year":2026},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:2160d8551ca0764b8ff31c60da5a8a6f0e1e27d0f59647669f76ebe829c6cece","observation_id":"dd9681af-dae1-4dcd-a15c-e18ebf63b01d","resolution":{"observed_at":"2026-05-13T07:32:29.350855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:5ee7f807700503d95cc478890be140704b0a00c97372d6f1603a78d86edddc48","observation_id":"b8e1891c-c662-413a-96ae-15ede4279f62","resolution":{"observed_at":"2026-05-13T07:32:29.362335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:528ff18bf6b56b5f902c9dfc462e8925abf39bf6bcc04184a3c0a325e40c5e10","observation_id":"7c45dfc5-734a-47f1-b215-58d34ba55fc4","resolution":{"observed_at":"2026-05-13T07:32:29.398745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.13738","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T21:43:59.059914Z","title":"Onelatent: Single-token compression for visual latent reasoning.CoRR, abs/2602.13738","venue":null,"work_id":"66ba0f71-7b8b-4809-98f7-e9b3ff7ccfb8","year":2026},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:27483f1692429de72309e268daefe8c2b81ed564387e82d334c9283403bd20a9","observation_id":"19073b14-44b4-4473-bd2f-80103f7a1c60","resolution":{"observed_at":"2026-05-13T07:32:29.357250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14750","last_updated":"2026-05-31T05:30:22Z","snapshot_observed_at":"2026-07-06T22:42:26.083572Z","submitted_at":"2026-01-21T08:09:25Z","title":"Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning","version":4},"cited_work":{"arxiv_id":"2601.14750","doi":"10.48550/arxiv.2601.14750","metadata_source":"pith","pith_arxiv_id":"2601.14750","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Render-of-Thought: Rendering Textual Chain-of-Thought as Images for Visual Latent Reasoning","venue":"cs.CL","work_id":"a3e8c06c-5aa9-4d0f-92d1-f6f6bdd30820","year":2026},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2601.14750","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:0a76601672b8d116780c849cc864a389a32a6edf4079765d0db714b8112af2dc","observation_id":"a4a6595e-2d3e-4a5b-83c2-bacef615f717","resolution":{"observed_at":"2026-05-13T07:32:29.303557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:58443c3c9b1229bcf3b6026192a49ea81ed3b6d7691a3c5fa229c6a642ab3acb","observation_id":"ce2199f9-5350-4d7b-aaf3-e8bfac8a39c3","resolution":{"observed_at":"2026-05-13T07:32:29.380375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Token fusion: Bridging the gap between token pruning and token merging","venue":null,"work_id":"fc0e98d8-de93-4889-b423-ca5194e15685","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:d901be22f6ef2da7813f202b409046eac28ca1d0ed65453c3cda0245c0e4d34a","observation_id":"d97c809e-1c30-4871-9a3e-afda60a8cfa2","resolution":{"observed_at":"2026-05-13T07:32:30.717384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":"2502.02013","doi":"10.48550/arxiv.2502.02013","metadata_source":"pith","pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","venue":"cs.LG","work_id":"7b4ac06a-e804-4f0a-8305-c45f2735afb5","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:7916becc782dc5c6d2073a8a7454ea25262fb2207231788b5a2d3444eef2c51b","observation_id":"2d9ec589-cfb8-4756-bf8c-b3f019891e01","resolution":{"observed_at":"2026-05-15T16:30:37.615120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":"b1897d83-f628-4398-8f14-49f49d3b07c1","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:c8a75e9b8a4872a66a529cdc47e94bfe526e1ef9cffcf22a972d4c3be26d5e40","observation_id":"729e7149-e502-4063-ad96-9c568b3a3011","resolution":{"observed_at":"2026-05-13T07:32:30.724247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tamp: Token-adaptive layerwise pruning in multimodal large language models","venue":null,"work_id":"4b3dead7-02d3-46eb-95db-bb4fee3bf692","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:a205d95362943f21f9ab00d1220d22083ae215c1568f32b42e2538a488a2bc6b","observation_id":"2d4cae9c-be33-475b-b9ad-9b15033c3085","resolution":{"observed_at":"2026-05-13T07:32:30.720835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your large vision-language model only needs a few attention heads for visual grounding","venue":null,"work_id":"21dccf77-5d5d-414b-b0aa-e6ed54c9a1e8","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:aafb27e23e2830f030f9db7539dc8aa2042dac7152fba59a0acce479fdd72075","observation_id":"8dc8993a-6458-4839-b7ee-4f59ac2fe259","resolution":{"observed_at":"2026-05-13T07:32:30.736427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"59b95024-f078-43d8-9f32-d5607152c251","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:c05cce098321f1e4484ab48030b49bd65fa77a5a12a8458f86be5a7b5a824708","observation_id":"92a01683-c2ac-4333-97da-26c6d49c4f63","resolution":{"observed_at":"2026-05-13T07:32:30.732983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:17:51.862251Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning","venue":null,"work_id":"dea15336-3efa-4a03-a26a-baa3a38efb90","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:18c75ecd684a2d998363ff4880ea7cf3f70eac75cfcc797a41ef4f1d6e593d70","observation_id":"f249090c-00d3-4db9-8b6d-37e4c327e92f","resolution":{"observed_at":"2026-05-13T07:32:29.333597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.844600Z","title":"Towards vqa models that can read","venue":null,"work_id":"33f55abe-fe38-483c-a026-05c983a173d2","year":2019},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:2ac5a2fdaab78712dcdad317c34260185f47eaeb0221fd76d819ff71ffe0f38e","observation_id":"59f6eab1-3774-490f-80d0-3adf561923e2","resolution":{"observed_at":"2026-05-13T07:32:30.769502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:9db65e30cee6c2ae43599126f23e003d8c0ecbb3df0e20b2e192d2a1480c6000","observation_id":"e5426542-f55c-4b5d-a579-277c59fc8689","resolution":{"observed_at":"2026-05-13T07:32:29.410502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2305.10355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-10T11:37:03.198858Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":"cs.CV","work_id":"66d8ac3e-c134-4995-b528-550afa17586f","year":2023},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:7e42df3d6d54dddef6a435f18a5053058813252f33a94c8e21f68d5c2ca22a4f","observation_id":"0866d340-7582-42bc-8547-3398a0513d59","resolution":{"observed_at":"2026-05-13T07:32:29.404046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:95f9c35f029052f5ef92c2a630a1f9e527b26f191f94a3f57e613982c0882100","observation_id":"76e35c7d-dd7a-4c35-842b-eb8a79b59493","resolution":{"observed_at":"2026-05-16T21:55:41.398838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.03099","last_updated":"2015-09-23T16:35:42Z","snapshot_observed_at":"2026-07-06T04:20:24.700334Z","submitted_at":"2015-06-09T20:33:47Z","title":"Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks","version":3},"cited_work":{"arxiv_id":"1506.03099","doi":"10.48550/arxiv.1506.03099","metadata_source":"pith","pith_arxiv_id":"1506.03099","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks","venue":"cs.LG","work_id":"1a965236-854f-47b7-881d-65e2b20fd8a5","year":2015},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/1506.03099","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:faabc65c5eca9177f8faf5d4985d226722dc99178ca8bfd61a2b7549f2acd8b9","observation_id":"d09703d3-6e32-438f-9a3d-a83ae7aba2ef","resolution":{"observed_at":"2026-05-13T07:32:29.437886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As outlined in Algorithm 1, the canvas width is constrained by a minimum threshold and the scaled auxiliary image","venue":null,"work_id":"2d0e313e-3e13-4432-8d96-9c9ee3fa4648","year":null},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:48de4c8c1ea671250146e58fe37b0b157c54e6e39d72f2e7e642566154fd6082","observation_id":"0ac2d947-d46e-4000-82c8-b39ce1bf6c7c","resolution":{"observed_at":"2026-05-13T07:32:30.760221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As detailed in Algorithm 2, the canvas has a fixed width but dynamic height","venue":null,"work_id":"76688a98-725d-4c84-9555-078197c33607","year":null},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:4cac9bcd357ef980381106567f16c4ef73961793cc256ff3cf0c6764a65f8470","observation_id":"ee2cde56-338c-47f8-a770-801a626c7756","resolution":{"observed_at":"2026-05-13T07:32:30.740309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"As described in Algorithm 3, the canvas dimensions are rigidly constrained (e.g., 1024×1024 )","venue":null,"work_id":"145e3900-db93-405d-8091-6a24e21df693","year":1919},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:468c8109d1fc63d31f52749fb37465edbff0501346581f78b53d66e1bc835dcd","observation_id":"0aff2764-704c-4721-8767-5dd9fb13983d","resolution":{"observed_at":"2026-05-13T07:32:30.756424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":16},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2605.11856."}