{"as_of":"2026-08-02T00:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2bbf0f2293bc78660f3a86834e0ccc4ec8952c7d5ccf6686c7fab5e48bba04c","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:12:22.931098Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:06.999018Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07106","snapshot_observed_at":"2026-07-31T04:55:06.999018Z","title":"Retrieve, integrate, and synthesize: Spatial-semantic grounded latent visual reasoning.arXiv preprint arXiv:2605.07106,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-02T00:20:55.667645Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:06.999018Z"},"links":{"cited_paper":"/paper/2605.07106","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:124a9ec59bf06c86172cf8d3d321306cd0c6cf6b68260bc61b57766eb33d508c","observation_id":"7a903fe6-ff2c-4282-b772-bc3acbc5e319","resolution":{"observed_at":"2026-07-31T04:55:06.999018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.07106/citation-record","integrity":"/paper/2605.07106/integrity","json":"/paper/2605.07106/citation-record.json","paper":"/paper/2605.07106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.595164Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a3ac3b4d-8c58-4772-ad55-18e8fb162bd1","year":2022},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:a32726a4d9267f3cc4db45a36888b59b74e718908b24f2de585bc41c8c6ccd3e","observation_id":"f30be200-80c3-4379-a9f3-a4352cdede76","resolution":{"observed_at":"2026-05-14T17:27:31.373546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.030675Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213","venue":null,"work_id":"4e01a1de-c54d-4105-8a25-d2d9c98bbc5a","year":2022},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:33c69aa9bc18395683bfed0e6ccb370734cccb6a987ca4c82701c6eb2fca94ac","observation_id":"2a2659ef-4497-472f-947e-1bc1c23f2b93","resolution":{"observed_at":"2026-05-14T17:27:31.383327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"1a0c8b15-d0e9-4ea0-8e2b-6f2deddb8f47","year":2022},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:4676bdb0dff4d4bfba7283e4f5c1cfd9b579522c51933036e6e126ed6b2cb33c","observation_id":"b718ad6d-f801-4db6-aea0-66706690e3f9","resolution":{"observed_at":"2026-05-14T17:27:31.366423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-07-06T21:49:47.325553Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":"2506.23918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-07-11T03:17:51.399835Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":"cs.CV","work_id":"760ebd7d-977d-4280-afae-adb421d49ed4","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:44e5bc7d079218ee44f2a4b7950f4e818566eae7655c30f6de197600867a700d","observation_id":"19d474a0-ae56-435c-92a8-b4c16eccf2b3","resolution":{"observed_at":"2026-05-13T08:34:23.540456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":"2303.11381","doi":"10.48550/arxiv.2303.11381","metadata_source":"pith","pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","venue":"cs.CV","work_id":"6dc43db8-227d-438e-8658-0c8acecba08a","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:b1ce1e7ff831a260956f2493bda4e34309cb5930fa8f926e6c6b3da6efe88251","observation_id":"3adfb8e0-4d71-4e5f-b3a2-9fb6e0822618","resolution":{"observed_at":"2026-05-14T01:17:58.977376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"1010b0c0-3433-41fc-9eb2-09bd3c057fec","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:76a3601325960a10d14882550de04b17ac4bd07f85532a75098831862149774e","observation_id":"e5d4afc5-7a43-4bcf-9b08-e5f02efe6293","resolution":{"observed_at":"2026-05-14T17:27:31.445108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.23590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jigsaw-r1: A study of rule-based visual reinforcement learning with jigsaw puzzles","venue":null,"work_id":"659e85ba-e742-4f40-866a-7c14ea27eb37","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:14c0c9c8b7e33c6b0e38281a0992bfb2c2179bc8ab27476cb58db7b08baa62df","observation_id":"730654a4-c88c-4cf8-9781-d7fc512a27e9","resolution":{"observed_at":"2026-05-11T04:35:59.640305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":"9f2cc711-91e5-4b8c-b6c8-51348698a7ed","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:11cdba0e3b992a34f7546efb0ef09a296324dfb2430f5b1149c67a2d3f63b7f6","observation_id":"772fc35f-fb3f-4c72-8320-ed114569a506","resolution":{"observed_at":"2026-05-14T17:27:31.452265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.759888Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"508e14a6-ab4c-40aa-852c-82323b429767","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:4f52088bcfcc19129afd1a633bde2aeb8d01e14bf5354b87613bde98e9547f48","observation_id":"049a28f5-82cd-4c0b-9b02-2f215d44fe27","resolution":{"observed_at":"2026-05-14T17:27:31.468839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program distillation: Distilling tools and program- matic reasoning into vision-language models","venue":null,"work_id":"6d424d53-1289-4e03-bd0e-6da916f5631f","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:762ffd83330faea9f3d9c70c7daa9a55adf8d963d88029f1c42d0d10abf251e3","observation_id":"fd48fd69-35e0-4bb2-804c-a5b2753e6e72","resolution":{"observed_at":"2026-05-14T17:27:31.437297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"cited_work":{"arxiv_id":"2604.02029","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02029","snapshot_observed_at":"2026-07-09T05:36:01.166323Z","title":"The latent space: Foundation, evolution, mechanism, ability, and outlook.arXiv preprint arXiv:2604.02029","venue":"cs.AI","work_id":"66adad9d-c3df-4cf7-9601-cf9d67d19ef5","year":2026},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2604.02029","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:6b114bd36de67453ab7e2b22f0419ecc6d28e9fbae3da647ab9be46cd631ae17","observation_id":"29593fa8-184e-4cd6-a4a2-33cad8972be6","resolution":{"observed_at":"2026-06-08T02:03:55.088792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2509.24251","doi":"10.48550/arxiv.2509.24251","metadata_source":"pith","pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-07-11T03:17:51.433935Z","title":"Latent Visual Reasoning","venue":"cs.CV","work_id":"b6468cfa-4f13-4e02-b0ec-24ff5cd6785a","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:7f3b74a29b21283341094b4fa19d9bb6d2a54ae06cec8b42d76cf8553a719e3a","observation_id":"402a1fec-1c14-4069-919b-65d696137a6b","resolution":{"observed_at":"2026-05-15T18:41:30.500607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21395","doi":"10.48550/arxiv.2511.21395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Monet: Reasoning in latent visual space beyond images and language","venue":null,"work_id":"ce4ac531-7907-4d8a-afe2-9a0dae21ffa5","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:1e3270589a9764069c0a21900d41a1ea3a3edf7cb07381ef7838d735157a9000","observation_id":"5da0f996-d261-4397-a636-c57c874ce105","resolution":{"observed_at":"2026-05-11T04:35:59.550348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22766","last_updated":"2026-06-07T11:29:15Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T08:56:23Z","title":"Imagination Helps Visual Reasoning, But Not Yet in Latent Space","version":2},"cited_work":{"arxiv_id":"2602.22766","doi":"10.48550/arxiv.2602.22766","metadata_source":"pith","pith_arxiv_id":"2602.22766","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Imagination helps visual reasoning, but not yet in latent space","venue":"cs.CL","work_id":"3c18fa46-7ceb-410e-bbbb-a4b656259287","year":2026},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2602.22766","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:76a308d1e040852e4d03362f024c53293aa4cc7c4b568f14bdbb8c679d70fa2f","observation_id":"1f98e667-4a78-42f7-afa9-c586a6b07fe4","resolution":{"observed_at":"2026-06-09T02:06:14.979939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:9a9f84a1a83cf32643f2e7a542ed09594c5225e956aa72ba40ce7951ec2db99a","observation_id":"151ac1cc-7389-4b8c-9675-c8f91395a498","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2503.12605","doi":"10.48550/arxiv.2503.12605","metadata_source":"pith","pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","venue":"cs.CV","work_id":"a8fbb385-8ed1-4952-9ee8-8d03be2b6821","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:f832b54ca1834192229386c387a4ce7012dbdf152c80ca1f832032199932b788","observation_id":"3ea7456d-c685-4ce1-bd30-b3387d2be9ef","resolution":{"observed_at":"2026-05-15T17:18:53.866178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-07-11T00:37:42.845448Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:bcd71132193fa40f4b663aede3db7b7d7544f704d1810cce40c61d8bf627a85c","observation_id":"24f70aeb-2147-4bdd-98a5-b9771943db9d","resolution":{"observed_at":"2026-05-11T10:29:05.896693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.620761Z","title":"Codi: Com- pressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":"1a10cfac-e21f-4603-9bcd-6bd82a9489d4","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:b68712c1b3e54342211e4f98979cd46e6a055c358f4ce97d7041efd2b310c8cf","observation_id":"e5910887-2f0f-4c79-8e06-dd73ae5c1bbc","resolution":{"observed_at":"2026-05-14T17:27:31.461386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15522","doi":"10.48550/arxiv.2510.15522","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Fan, Y ., He, X., Yang, D., Zheng, K., Kuo, C.-C., Zheng, Y ., Narayanaraju, S","venue":null,"work_id":"61635942-d332-438e-bf44-97a5c1ecfc83","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:94d012e9987ad29a73d27456931ad31e22c68ddbfda4959e348e27e01d3d8013","observation_id":"4cbd606c-8f58-4820-8a63-acba136633d7","resolution":{"observed_at":"2026-05-11T04:35:59.524353Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-07-06T21:45:25.136396Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-07-10T13:37:06.834211Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:a73cc78bd31d3c34512f8036189e5d33a34469862e8bc36d9a62c89428f41fb6","observation_id":"b3257744-8fbc-4791-9ae0-3a7d3ed086b0","resolution":{"observed_at":"2026-05-11T04:35:59.653902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hudson and Christopher D","venue":null,"work_id":"ed354ba0-828f-4e70-8f33-74d09ecfc386","year":2019},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:da9290d2d90ba76a2f3d229c0c3206e7456336ff124a4dfd1300940f9903495a","observation_id":"ade04805-f270-47f2-9564-23bc3b7da21f","resolution":{"observed_at":"2026-05-14T17:27:31.388478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:cdd81609275ebfa338320a18ea96f3e300f342e902e4d840604ac594d56d635e","observation_id":"17493145-aec6-408f-828c-c56646fb4f58","resolution":{"observed_at":"2026-05-11T04:35:59.609673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.537511Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"8cce8101-1a0a-4da5-a8d4-8b72b9d0c60f","year":null},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:9a6ea80ea6f15737ce042bb55eeabaf9f941dd164b9edfe6cb84a7f20e414457","observation_id":"0ecea5ee-58eb-4429-967f-0d32834f2e75","resolution":{"observed_at":"2026-05-14T17:27:31.399164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:bb508edcc0d1842711948f864327e952f81f6873b57704f60bd49302c6eac6fc","observation_id":"4fd9394f-8fca-4044-86be-7736e1e946ca","resolution":{"observed_at":"2026-05-11T04:35:59.633185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2733.2024","doi":"10.1109/cvpr52733.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Emogen: Emotional image content generation with text-to-image diffusion models","venue":null,"work_id":"7efbc2dd-b0f2-4f71-bb1c-d2fcf110d805","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:18d8b03105df594586a96b41aa6a6e617c7ba13aaf0e3795225e9e8c41d1a878","observation_id":"a309c390-f6e4-4aca-8955-d4c92ae5057b","resolution":{"observed_at":"2026-05-11T01:15:51.823830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.577684Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"18e020b7-d80c-49a4-9868-c69a03ba15de","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:78c0799de7e9ad8faa9672868e5c048db19ed73b34aefc5762226280e0c04e23","observation_id":"53566c6c-b41a-4d84-b6ff-701b49d4a4b9","resolution":{"observed_at":"2026-05-14T17:27:31.409051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:14:30.559513Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"b6e49ece-cf6b-436a-987f-4e6e369d5b22","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:34c378a254347dd3ebbe643f76203c06a0e790a89b22078fdb55d5ac648f3473","observation_id":"b2a722a3-2039-47e8-943d-ca67f1c46170","resolution":{"observed_at":"2026-05-14T17:27:31.428672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.594632Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"0f53fdf1-7151-4197-86a2-081455a42131","year":2024},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:2c96052f214f0510bbc319f43065f1dbf5e8d83ba62eebc39b69929c89dac9a9","observation_id":"ab48df36-fd47-46a8-af7d-1414478f447a","resolution":{"observed_at":"2026-05-14T17:27:31.420059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.883595Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:9521873396ed4d5ee627f1c68a64072a6f19158c32704c10959c3bc5429a48b8","observation_id":"dde8b3f4-8951-41de-841d-81380f1b3855","resolution":{"observed_at":"2026-05-11T04:35:59.662703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-01T06:32:01.292127+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":13},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2605.07106."}