{"as_of":"2026-08-23T04:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5f91ad7b943873ee99f22866d771e556a4676a6a5694c8958bc5c03887426b8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:16:06.189513Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T13:37:06.883595Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2601.18664","last_updated":"2026-05-18T05:37:00Z","snapshot_observed_at":"2026-08-19T06:25:21.667783Z","submitted_at":"2026-01-26T16:40:37Z","title":"S$^2$GR: Stepwise Semantic-Guided Reasoning in Latent Space for Generative Recommendation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T14:23:44.856958Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2601.18664"},"observation_digest":"sha256:3ad0c018ad47ce74298d8f2bbf6b2259f8b0ec91c7566d28542a5f7256b609b3","observation_id":"415c3fb6-0612-4776-906d-dbc5242dc3cb","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2602.04476","last_updated":"2026-05-12T10:07:13Z","snapshot_observed_at":"2026-08-11T01:23:00.247206Z","submitted_at":"2026-02-04T12:04:02Z","title":"Vision-aligned Latent Reasoning for Multi-modal Large Language Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T07:48:23.272002Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2602.04476"},"observation_digest":"sha256:5e66a8b441379804c347136cd90e10e8d46e7891bddb33d3d1c8729f7451c659","observation_id":"024008d7-3f12-4e05-887c-3a826b5cf2c7","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2602.20323","last_updated":"2026-05-03T05:21:29Z","snapshot_observed_at":"2026-08-15T12:29:10.947979Z","submitted_at":"2026-02-23T20:18:35Z","title":"PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T20:05:30.324309Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2602.20323"},"observation_digest":"sha256:deab1c0fbf65e66445bdb555ffa5ca5aac6f05df3579d070223b1d52568c60b6","observation_id":"66860c5b-fb59-4d77-a478-adfcb95ec9b7","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2604.03307","last_updated":"2026-04-16T08:04:16Z","snapshot_observed_at":"2026-08-17T00:04:40.616003Z","submitted_at":"2026-03-31T03:57:56Z","title":"V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T23:57:47.657243Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2604.03307"},"observation_digest":"sha256:76e21882447c2ac2e340de5a461b240881f31cdf3414ad686b0ac31e18bd2584","observation_id":"fe43b6ab-f6b0-41d2-9969-3d02a9f9dab1","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2604.21079","last_updated":"2026-08-18T21:11:53Z","snapshot_observed_at":"2026-08-22T23:09:28.088788Z","submitted_at":"2026-04-22T20:44:24Z","title":"Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T00:16:34.362000Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2604.21079"},"observation_digest":"sha256:eea2463aa36745dce908d1b4f217383d4a8ed775063ce14bb40ac0d5e962262f","observation_id":"332ed0d5-66b7-4381-932c-598029270170","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2604.24919","last_updated":"2026-06-01T00:50:05Z","snapshot_observed_at":"2026-08-15T03:11:06.203859Z","submitted_at":"2026-04-27T18:59:49Z","title":"Agentic AI for Remote Sensing: Technical Challenges and Research Directions","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-08T04:29:22.477531Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2604.24919"},"observation_digest":"sha256:24367e52f6af7791c972ffee18299b6fcacabe9aff40e9a93962ff199364d8a4","observation_id":"2230289f-a68f-4432-a02f-1679240ba3a0","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2604.24919","last_updated":"2026-06-01T00:50:05Z","snapshot_observed_at":"2026-08-15T03:11:06.203859Z","submitted_at":"2026-04-27T18:59:49Z","title":"Agentic AI for Remote Sensing: Technical Challenges and Research Directions","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-14T20:55:38.841743Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2604.24919"},"observation_digest":"sha256:8d6518b022d78e06ca9c7968955e86949be59c0c12de40ba0861bae55e4eaa24","observation_id":"828b4f3c-b286-43f2-8f83-e45b4e1f1f49","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.02442","last_updated":"2026-05-04T10:42:26Z","snapshot_observed_at":"2026-08-15T23:26:09.618748Z","submitted_at":"2026-05-04T10:42:26Z","title":"Measuring AI Reasoning: A Guide for Researchers","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-08T18:53:18.586923Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.02442"},"observation_digest":"sha256:d24c1af6568c4ca283aa58e58c4111964dbe66d27d9b29bd61dc5ca2901e894c","observation_id":"1e42d526-7246-4f84-8d8b-b40e242b3769","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-08-18T22:45:54.392550Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:42a1e20a17a65656b9ac8956c0451e32d8c72ad20c94f5c57404f80beaddffda","observation_id":"29a6f4c4-47ec-4893-b174-e1fb73bfccf8","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.07106","last_updated":"2026-05-08T01:33:58Z","snapshot_observed_at":"2026-08-11T06:14:46.186862Z","submitted_at":"2026-05-08T01:33:58Z","title":"Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:22.931098Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.07106"},"observation_digest":"sha256:e514827d2f384e4ec363de319d76197a775c7190c72a8dd50538c82a58ef63c5","observation_id":"dde8b3f4-8951-41de-841d-81380f1b3855","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.08802","last_updated":"2026-05-12T08:46:05Z","snapshot_observed_at":"2026-08-12T15:34:22.235592Z","submitted_at":"2026-05-09T08:47:00Z","title":"CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:19:04.590978Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.08802"},"observation_digest":"sha256:8fb83369048f1ddea1814d0d48a104e5ef7422fb105845f0b85474eca88e0862","observation_id":"bd6c5859-2c73-4cd6-9052-9b8f2382596b","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.08802","last_updated":"2026-05-12T08:46:05Z","snapshot_observed_at":"2026-08-12T15:34:22.235592Z","submitted_at":"2026-05-09T08:47:00Z","title":"CoLVR: Enhancing Exploratory Latent Visual Reasoning via Contrastive Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:08:52.879854Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.08802"},"observation_digest":"sha256:a08f393780b1dba4ae030d8b5294e430a0e5b207beed9aa2307e054fbea2d524","observation_id":"8f687679-4021-44a3-9f30-f15f0c604874","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.09614","last_updated":"2026-05-10T15:53:11Z","snapshot_observed_at":"2026-08-13T19:01:42.951240Z","submitted_at":"2026-05-10T15:53:11Z","title":"Reflection Anchors for Propagation-Aware Visual Retention in Long-Chain Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:24:12.349405Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.09614"},"observation_digest":"sha256:b35f3de470455d81580e634104dfe8bc269666af1b3317c63ce8d324bc819e7f","observation_id":"79502fa9-73f8-462b-a20f-e29db0484ff3","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.11856","last_updated":"2026-05-12T09:40:03Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:40:03Z","title":"UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:32:03.466222Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.11856"},"observation_digest":"sha256:8772a69ae27bf242e2a60d30d3e0b0d0d413f8fbf4905973ec30d4835c2f6097","observation_id":"72477733-2df0-4a69-8be5-372fadc98951","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-05T07:57:54.689541Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T07:21:40.803291Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:a041485b5872aa8bf6c2c32ecca747abf437c7d6c0babcdc5e1616c200345cee","observation_id":"aac11c40-288b-40d2-9883-86ff09096d21","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-05T07:57:54.689541Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-19T16:48:20.132240Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:ba3fe3975e2665fc24fe7abd1bed4774cb738b43f6ec00d5f714ca7453764c25","observation_id":"5bece33e-239d-49a6-a35e-1810cf6ba7d5","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.12374","last_updated":"2026-05-25T11:34:51Z","snapshot_observed_at":"2026-08-05T07:57:54.689541Z","submitted_at":"2026-05-12T16:41:09Z","title":"Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-21T08:02:00.980836Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.12374"},"observation_digest":"sha256:365eb53331c350a9c60e798f9c6dd84078d1d3117e9d680e8658a3e18ac6a79b","observation_id":"4b889f7c-f74e-4ca4-937c-f06a49d481b9","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.18641","last_updated":"2026-05-18T16:46:02Z","snapshot_observed_at":"2026-08-15T12:24:30.050872Z","submitted_at":"2026-05-18T16:46:02Z","title":"Leveraging Latent Visual Reasoning in Silence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T10:27:13.859216Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.18641"},"observation_digest":"sha256:f403c26af366af2e8d5b1dc52a023b808ef1c24f60ffbad949d26496e54f98b4","observation_id":"2783319f-9c3d-49f6-b13e-65d03832f5f9","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-18T11:55:51.678572Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T06:34:57.483234Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.22012"},"observation_digest":"sha256:e16a654729e2318a326ce7d566b85ebd9e6c6a69a209a30a56bd5b59ffc197ea","observation_id":"569bb120-c6ce-4032-aca6-33bc406ff07b","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:28c55e31991dcf67b604b4a6f6fade828d24e32a1bbceddc6a62558477a04e96","observation_id":"f2f93d21-680e-48fa-bf2f-d22a1295e56c","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.04433","last_updated":"2026-06-03T04:31:15Z","snapshot_observed_at":"2026-08-16T05:52:59.513477Z","submitted_at":"2026-06-03T04:31:15Z","title":"Stateful Visual Encoders for Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T07:26:01.601557Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.04433"},"observation_digest":"sha256:2364d449d3dc00b4b1165290f27f5400b234b803c886ed70e695b32a37c8bd27","observation_id":"fd9d4cd1-b958-4a87-bc8c-c0fb0bc8b837","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.05736","last_updated":"2026-06-04T05:55:15Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:55:15Z","title":"VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T01:52:44.785582Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.05736"},"observation_digest":"sha256:1d5ca7d1de9a3e73cb49b46ad8534bab0cc3cb4061bc929b11a994e26b024595","observation_id":"e8a03cbc-b5f1-4887-bdbf-4dae7a60d7bc","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.05769","last_updated":"2026-06-04T06:53:19Z","snapshot_observed_at":"2026-08-13T09:56:57.676160Z","submitted_at":"2026-06-04T06:53:19Z","title":"Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T02:46:50.373450Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.05769"},"observation_digest":"sha256:7cd80806d8162b32c6197a998ae15dd8fa8430aa66b863a5a87f58556c50ff6a","observation_id":"2dc9067c-81bc-4c19-96c2-6032e97c53e6","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-08-12T18:50:06.738816Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:3ed48147e1a09ed537a59a1e4c30063a5f8bc721219ec72eaa9319f29781ea94","observation_id":"7ca19a15-9184-420b-9c50-ce3bff914cb1","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:cfb4f8b7ac29288d52fcb0cb16fbae1c8927dd420bfba0f1d0501ffdea5611c6","observation_id":"dd3366ce-45d7-4e7a-885f-b9472943a6d0","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2606.30168","last_updated":"2026-06-29T11:44:09Z","snapshot_observed_at":"2026-07-07T00:04:05.275293Z","submitted_at":"2026-06-29T11:44:09Z","title":"Latent Noise Mask for Reducing Visual Redundancy in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:16.868238Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2606.30168"},"observation_digest":"sha256:37adf91a5faf97ff2c17fddfc2c8767247e0d392bae64209000afb72b1986e67","observation_id":"a470d566-ba39-4dd5-acc0-9c6f6dbbac73","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2607.08024","last_updated":"2026-07-09T01:02:35Z","snapshot_observed_at":"2026-08-16T01:36:27.382056Z","submitted_at":"2026-07-09T01:02:35Z","title":"APIVOT: Adaptive Planning with Interleaved Vision-Language Thoughts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T13:33:17.574108Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2607.08024"},"observation_digest":"sha256:8df7924e8f9626d61a8296dc541985eeb8f92d9615077f1a13589474856f03cd","observation_id":"55fc931d-9a60-4fab-b378-0040574e6bbb","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-12T00:39:05.844143Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens.arXiv preprint arXiv:2511.19418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08021","last_updated":"2026-08-08T09:02:10Z","snapshot_observed_at":"2026-08-18T21:41:36.802509Z","submitted_at":"2026-08-08T09:02:10Z","title":"Evidence-RL: Towards Evidence-intensive Visual Reasoning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T00:39:05.844143Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2608.08021"},"observation_digest":"sha256:3481a57c88addc7f9672b3e261c7be6c2c48f8e8af381183e898d90dd5906e5d","observation_id":"44272ef2-07fa-4948-8519-60251738e985","resolution":{"observed_at":"2026-08-12T00:39:05.844143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-14T04:16:06.189513Z","title":"arXiv preprint arXiv:2511.19418 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.189513Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:8d0b641dbde76349b90b3f150781b78ca307d2d2e30076c06d235ff9175cec23","observation_id":"d1c4922b-b9c9-4a04-b667-3d21bc76b694","resolution":{"observed_at":"2026-08-14T04:16:06.189513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.19418/citation-record","integrity":"/paper/2511.19418/integrity","json":"/paper/2511.19418/citation-record.json","paper":"/paper/2511.19418"},"outbound":[],"paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T15:50:18.460039Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2511.19418."}