{"as_of":"2026-08-16T03:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b726543d0f8019d04ef355508735bd24f7c335bf7ef3d3d6fedb5546669ec325","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:48:04.370230Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.19342/citation-record","integrity":"/paper/2605.19342/integrity","json":"/paper/2605.19342/citation-record.json","paper":"/paper/2605.19342"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:5525a69996879c776798fbf6e4cb157bb08ac24abc09fb442d5c6bdf66a40ba9","observation_id":"2d0d8c2c-85fc-4243-8bb4-ab2794584cac","resolution":{"observed_at":"2026-06-30T18:55:00.802055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:c587181cce97c31333fd1e76d24f15de33696bd2399aa70353bcc391dc7b3ad7","observation_id":"5b0361da-21aa-41f1-b420-ca32b8214f6b","resolution":{"observed_at":"2026-06-30T18:55:00.773699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15522","doi":"10.48550/arxiv.2510.15522","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fan, Y ., He, X., Yang, D., Zheng, K., Kuo, C.-C., Zheng, Y ., Narayanaraju, S","venue":"ArXiv.org","work_id":"61635942-d332-438e-bf44-97a5c1ecfc83","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:503d3818fdce28124815385e512a4b7344466ff557d0e85e20256252ebcfbdd5","observation_id":"c9831f50-bdaa-4a63-9999-ce89286902a1","resolution":{"observed_at":"2026-06-30T18:55:00.787211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:d0db3bc6617a3f22cb89cbb8e36dc504da9142a7475e073e3d7d0c41c78701e4","observation_id":"e3fadffb-52c9-4660-ad93-24a21d412f49","resolution":{"observed_at":"2026-06-30T18:55:00.779157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-15T20:23:25.637230Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":"2412.06769","doi":"10.48550/arxiv.2412.06769","metadata_source":"pith","pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","venue":"cs.CL","work_id":"3ddd0fd2-c176-408f-9b58-0666c2707f2d","year":2024},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:06f5eb42e657c927cdc245e489891dbccae312eda4c149acb0a7936e407f9b91","observation_id":"a2d50dbf-c337-47f2-8d10-e4b1338a2ba8","resolution":{"observed_at":"2026-06-30T18:55:00.781451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:44.826594+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:54:28.861858Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"36ffb648-56a9-46da-b759-3430ea672b13","year":2016},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:f2a97fb25c116bad086794bf234a7c89a872019ba5c8776e56c09350948d7519","observation_id":"23c6f834-5a0d-4bd6-b3a3-3c5dc009c600","resolution":{"observed_at":"2026-07-08T02:54:28.863213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-08-10T21:20:13.670725Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2509.24251","doi":"10.48550/arxiv.2509.24251","metadata_source":"pith","pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Latent Visual Reasoning","venue":"cs.CV","work_id":"b6468cfa-4f13-4e02-b0ec-24ff5cd6785a","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:866568ea7339acdc3b99d9ba1ebf107c320c3c0e64fa7dbd0ea9d48e07778900","observation_id":"7981f732-ccff-4dd8-a4d2-2522bdb2b282","resolution":{"observed_at":"2026-06-30T18:55:00.789619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-15T16:01:07.680571Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":"2508.19652","doi":"10.48550/arxiv.2508.19652","metadata_source":"pith","pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","venue":"cs.CV","work_id":"f3c4619b-51fc-4ee6-8104-624d408c678f","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:c32f18d503184b8603c467b188797b966e373e2f11c8c293a06f7a44641d3d7e","observation_id":"d0de086b-62db-40ae-92d4-842f5e7410dc","resolution":{"observed_at":"2026-06-30T18:55:00.783814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12081","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:54.984614Z","title":"VisionReasoner: Unified visual perception and reasoning via reinforcement learning","venue":null,"work_id":"ee12759a-d7d2-4e0e-9356-44af3786e20b","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:6b98936b9d1f7e5d1ff8b2952045c3e2a769886ffa755a4c7c77bf2e323d031d","observation_id":"be1a0c49-92a6-4ada-b386-815925ec4914","resolution":{"observed_at":"2026-06-30T18:55:00.771162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:b35c77842e44e72b5d315305743ba250f5b4c4dd859fb24ccbb4971aa3eb7c7d","observation_id":"be14c65a-cfbd-49b9-bfbe-8ab71e326f53","resolution":{"observed_at":"2026-06-30T18:55:00.792405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:210cbb3c2f4dda9e0960b9febc12ad4f65e4daa856dadc356b417ad3228adea5","observation_id":"912d9698-11e9-4ddf-a44e-09154c0087c4","resolution":{"observed_at":"2026-06-30T18:55:00.784282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-13T04:24:55.131656Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":"2402.04236","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-07-03T17:38:44.141179Z","title":"Cogcom: A visual language model with chain-of-manipulations reasoning","venue":null,"work_id":"17fe4c29-c3ca-4e59-b83c-f15d3993c89b","year":2024},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:7168dd2324b71978fdaf78a39f2f49c35bbaf0f6190cc9e66717fb7fc6e2c28e","observation_id":"5917e295-2c5d-499d-bed6-0bab35cd9b31","resolution":{"observed_at":"2026-06-30T18:55:00.787051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10941","last_updated":"2026-04-30T17:59:42Z","snapshot_observed_at":"2026-08-11T07:20:28.569646Z","submitted_at":"2025-12-11T18:59:08Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","version":2},"cited_work":{"arxiv_id":"2512.10941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10941","snapshot_observed_at":"2026-07-10T13:37:06.836665Z","title":"Mull-Tokens: Modality-Agnostic Latent Thinking","venue":"cs.CV","work_id":"a831fe1f-0927-46d3-a512-9e9b3a906248","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2512.10941","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:fd3488b3c500312254dcc1c7366cb8aecba4341afd621c59035afdfddce52d37","observation_id":"bffc31fc-6cf2-4ccf-a88b-f356890a06bf","resolution":{"observed_at":"2026-06-30T18:55:00.773515Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-07T16:05:50.340309Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":"2504.10342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-07-04T09:09:43.184299Z","title":"Visualpuz- zles: Decoupling multimodal reasoning evaluation from domain knowledge","venue":null,"work_id":"98a56c91-cb1d-437e-b69a-3f8fca36abfc","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:924b63583c3c7bf7b1d7709462df88dc18370a2462b1406f2f4c71e1b61efe54","observation_id":"db4ee2f6-c4f7-4e38-97bb-966aba36fff3","resolution":{"observed_at":"2026-06-30T18:55:00.779176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:4f100a55ce2415e68e2039ce0b6914bcc5b515c009f04582aaba3250f06bab28","observation_id":"f70a3516-3401-4dc4-b33f-363901e667a1","resolution":{"observed_at":"2026-06-30T18:55:00.771422Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21395","doi":"10.48550/arxiv.2511.21395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Monet: Reasoning in latent visual space beyond images and language","venue":"ArXiv.org","work_id":"ce4ac531-7907-4d8a-afe2-9a0dae21ffa5","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:1c46fb7282fd1eafad015bd0de0dad6eba70cdd39b79c428ed9c82fc4ccd537b","observation_id":"5b40eb2a-5fc4-4f12-be67-d2b34629640a","resolution":{"observed_at":"2026-06-30T18:55:00.795638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20912","last_updated":"2026-05-21T02:54:31Z","snapshot_observed_at":"2026-07-06T22:30:46.129271Z","submitted_at":"2025-09-25T08:58:10Z","title":"DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning","version":4},"cited_work":{"arxiv_id":"2509.20912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20912","snapshot_observed_at":"2026-07-04T15:49:57.348954Z","title":"Ouro: A self-bootstrapped frame- work for enhancing multimodal scene understanding","venue":"cs.AI","work_id":"58f4ee83-be23-4c54-a151-dc2e28d4aa90","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2509.20912","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:46c6e6b0a0c0f99727bdf2b3be061dba6d81a0ea50345ce108fcdd63b2fee3a6","observation_id":"545241dc-6884-4843-9c04-a2b7507f72d5","resolution":{"observed_at":"2026-06-30T18:55:00.797119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-13T03:28:19.590253Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:652e7a05815a17460b947a5f98f7e2965892e984d55f756cca18bfa5f6f9c9a6","observation_id":"eb7fdc95-373b-4b52-b6ed-90d17d125bc0","resolution":{"observed_at":"2026-06-30T18:55:00.794774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24514","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:29:52.004856Z","title":"Latent sketchpad: Sketching visual thoughts to elicit multimodal reasoning in mllms","venue":null,"work_id":"b88a3f18-3bbc-44da-82ee-292b974b146d","year":2025},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:9e060c142e3fc6d7fce43343023e0b813e9f103cc5bfe1b51f757db4f268b57a","observation_id":"4c60180f-f141-4bd9-add2-7747d4321919","resolution":{"observed_at":"2026-06-30T18:55:00.799636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:48:04.370230Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2605.19342"},"observation_digest":"sha256:b3a91566ec6ee2e086b1af94e59065b2bf3aa3b1c02ca4a89a58be2afa5d4dd0","observation_id":"bbeead68-561b-43bb-af50-b9751db0a840","resolution":{"observed_at":"2026-06-30T18:55:00.798016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19342","last_updated":"2026-05-27T02:07:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T12:46:15.439000Z","submitted_at":"2026-05-19T04:29:33Z","title":"Semantic-Enriched Latent Visual Reasoning"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":1},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2605.19342."}