{"as_of":"2026-08-10T00:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b07bb3529c6ced91bb2a56da5df0616dc48dc2ad754f8d15b4a717eccafc777","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:19.034618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:26a86a3f2392ffa20437b28f804a6c7e80d53d2df77d679bc8e657acb42bf995","observation_id":"c4752a49-937d-4f37-8801-70f4bc348d93","resolution":{"observed_at":"2026-05-16T02:56:42.239118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":147,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:33ce2732b282ace8b8ee597231e7f6936c20611ab161a0a3fccc677da62badea","observation_id":"5d2ab2cf-19a8-45c1-8e0d-6a1e5c44ce3f","resolution":{"observed_at":"2026-05-11T13:10:21.236393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c704ab3de1d0149a68e7ced6646e42f33c6da51abc9e5b89111755924589f02a","observation_id":"1d2ef04f-9865-412b-9b35-1307004e607b","resolution":{"observed_at":"2026-05-11T05:26:05.692676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:dcd1599405c244a8ba0ca027712848f6c9b3e58e81f251b5cb3b17d7386962bf","observation_id":"5684eb9b-6dd6-4071-a5a2-23d709b86867","resolution":{"observed_at":"2026-05-22T01:05:52.086561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T12:29:19.034618Z","title":"Preprint, arXiv:2312.14135","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24354","last_updated":"2025-05-30T08:46:23Z","snapshot_observed_at":"2026-08-07T12:22:24.010971Z","submitted_at":"2025-05-30T08:46:23Z","title":"Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.034618Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2505.24354"},"observation_digest":"sha256:57ee9b49de3832bd518862830a509f8b9db685a90fafae9c505c8bbfec79c497","observation_id":"71f3e515-41de-4d7a-b0bf-ad75ebc445e9","resolution":{"observed_at":"2026-08-07T12:29:19.034618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T11:04:14.241662Z","title":"Wu and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-10T00:26:12.133363Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.241662Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:400097920c8ad18fbcefd9c0d8fbb9c73e82376e7db674e2ef6bfcfd4be9b642","observation_id":"7599ee8d-24d9-4414-ba22-ad3aa2d74bf5","resolution":{"observed_at":"2026-08-07T11:04:14.241662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-07T10:41:23.231324Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.ArXiv, abs/2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-07T10:34:45.625540Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:41:23.231324Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2506.04633"},"observation_digest":"sha256:2084b1c27578655e341f8800e7aac8894290e0b55ac1552013e7609f631b5ffd","observation_id":"858d4b93-a6c5-4dbe-9a08-d68c203ae2d6","resolution":{"observed_at":"2026-08-07T10:41:23.231324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T13:24:39.885634Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-07T21:36:21.058533Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T13:24:39.885634Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.00676"},"observation_digest":"sha256:ce895e00bc6dd03c35d080794ec72a613fcce9d0e77b448dc4f5eef7141ecafd","observation_id":"e3c446d9-6703-4203-825c-4baea7897aba","resolution":{"observed_at":"2026-08-05T13:24:39.885634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2509.22746","last_updated":"2026-05-14T08:41:49Z","snapshot_observed_at":"2026-08-07T17:13:19.123990Z","submitted_at":"2025-09-26T04:33:53Z","title":"Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-18T13:33:12.508639Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2509.22746"},"observation_digest":"sha256:ae983b5f7e64524be1a4443de8cb39a343619b42d8750a79070b9f6e23cead50","observation_id":"e64e0d55-fe91-403e-8dc5-24610c1afd0b","resolution":{"observed_at":"2026-05-18T13:36:25.246023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2510.00054","last_updated":"2026-06-04T08:28:39Z","snapshot_observed_at":"2026-08-04T14:42:56.041128Z","submitted_at":"2025-09-28T08:31:48Z","title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T21:11:47.804851Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2510.00054"},"observation_digest":"sha256:03f5a90357d70837aa538479b9014c2b44685109d337e918dea731c7b50a42fa","observation_id":"a052efc3-2ef7-4196-8175-27680ac2b9d1","resolution":{"observed_at":"2026-05-21T21:14:22.807207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-04T14:42:58.310244Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00054","last_updated":"2026-06-04T08:28:39Z","snapshot_observed_at":"2026-08-04T14:42:56.041128Z","submitted_at":"2025-09-28T08:31:48Z","title":"HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:58.310244Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2510.00054"},"observation_digest":"sha256:190a0cca5c01478c478b8a2ea552a0c0b17d97737c3bf44ba982d7c7ab805f79","observation_id":"e7edd0ef-5bc5-42cd-8a8d-baaa308ee84a","resolution":{"observed_at":"2026-08-04T14:42:58.310244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-04T08:15:57.799831Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-09T00:06:37.608642Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:57.799831Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:e5445e4fd49f003f8eaf257c103c2abe3d27e0fbca8e5998f40be9751667c74d","observation_id":"0bead9c2-52c2-44ea-9125-0979bab87762","resolution":{"observed_at":"2026-08-04T08:15:57.799831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-03T17:09:38.165356Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023.URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.10548","last_updated":"2026-05-23T16:19:27Z","snapshot_observed_at":"2026-08-09T18:59:31.056898Z","submitted_at":"2025-12-11T11:27:25Z","title":"Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T17:09:38.165356Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2512.10548"},"observation_digest":"sha256:315b19e9ad55abd7fc83bc67769ac8eedee5071477b389fd287c7e74aee9f970","observation_id":"978dc477-32ba-4afb-8e4c-f600cbfa318b","resolution":{"observed_at":"2026-08-03T17:09:38.165356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2602.13310","last_updated":"2026-05-07T08:00:36Z","snapshot_observed_at":"2026-08-03T02:11:51.693223Z","submitted_at":"2026-02-10T03:53:25Z","title":"Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:53.694506Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2602.13310"},"observation_digest":"sha256:eab59ed6e29b9455b458760dc1f6f1da4c47bea0b4fd44f93e9800fc3500e9f6","observation_id":"92a875fa-dc60-4fdb-91e4-ed1ceac05f94","resolution":{"observed_at":"2026-05-16T03:30:33.046213Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2602.23622","last_updated":"2026-05-19T03:38:52Z","snapshot_observed_at":"2026-07-06T22:47:15.482910Z","submitted_at":"2026-02-27T02:59:34Z","title":"DLEBench: Evaluating Small-scale Object Editing Ability for Instruction-based Image Editing Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T12:04:08.487678Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2602.23622"},"observation_digest":"sha256:63e3cde125e567b78386a84b46a9d66deb6837a9c8f76fc4405f0ce2d26094c0","observation_id":"1c20257b-e448-47cf-bad4-28b558dd828a","resolution":{"observed_at":"2026-05-21T12:05:04.972295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-13T19:34:58.789459Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.arXiv preprint arXiv:2312.14135, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23483","last_updated":"2026-07-06T05:32:03Z","snapshot_observed_at":"2026-08-07T04:45:34.480037Z","submitted_at":"2026-03-24T17:45:47Z","title":"SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T19:34:58.789459Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2603.23483"},"observation_digest":"sha256:42cb263609f323126dd38b792f7ad28c203eda322cb128c23adf65fe292512d2","observation_id":"1e1dfc9c-74da-4b71-a0dc-5347b54124fa","resolution":{"observed_at":"2026-07-13T19:34:58.789459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-02T17:26:40.239147Z","title":"Yijia Xiao, Edward Sun, Tianyu Liu, and Wei Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.25629","last_updated":"2026-07-26T21:57:04Z","snapshot_observed_at":"2026-08-09T23:01:13.609206Z","submitted_at":"2026-03-26T16:41:59Z","title":"LanteRn: Latent Visual Structured Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T17:26:40.239147Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2603.25629"},"observation_digest":"sha256:a9678b4bdcb5f9117960c24e5f1f663af2ebb4b34bd7e412fdd420cfcd29258d","observation_id":"cc98f7b9-99a6-49ed-a866-90b9366f1cf1","resolution":{"observed_at":"2026-08-02T17:26:40.239147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-04T18:58:19.981225Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:b45cc38ce21c732e11d2e83439ef03c2948c26a639001ce65af8cfb6a01a944b","observation_id":"40ed16f7-83f2-455c-a1fc-4d451d3d4b24","resolution":{"observed_at":"2026-05-11T00:00:51.617866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.08065","last_updated":"2026-04-09T10:27:32Z","snapshot_observed_at":"2026-08-02T09:58:21.644966Z","submitted_at":"2026-04-09T10:27:32Z","title":"Multimodal Latent Reasoning via Predictive Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:26:27.683269Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.08065"},"observation_digest":"sha256:a2daa17427ce1fcb1be740aed7337c560f155cf2b7ac00f2b83438cd20c2b780","observation_id":"7eb14478-c1d8-4d8c-9be8-ebd448c8b100","resolution":{"observed_at":"2026-05-11T06:46:52.537656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-07-06T22:57:31.046146Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:af92a2b03136668bc110b62412c54ae20e30654cb9beed7b542e1e62ca95bca6","observation_id":"d99eb290-4d03-4448-8e02-44676820aed7","resolution":{"observed_at":"2026-05-11T07:16:10.605697Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.09167","last_updated":"2026-04-10T09:51:42Z","snapshot_observed_at":"2026-08-08T08:04:53.159613Z","submitted_at":"2026-04-10T09:51:42Z","title":"MAG-3D: Multi-Agent Grounded Reasoning for 3D Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T17:25:31.097385Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.09167"},"observation_digest":"sha256:a2d7de010c0714e552f20e257c4617b23630c2c43987192e0728f3ab8e5ee814","observation_id":"83b8a0dd-9add-4223-8527-8a5659dfeeff","resolution":{"observed_at":"2026-05-11T06:51:18.794113Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T16:03:15.222571Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:0c152bc5589e77dfb79e02232c53ce1b88b5ba8fb2bdf8d9adc9cf7c437bc66a","observation_id":"d3c74dd9-a762-4006-bd93-04f769f35297","resolution":{"observed_at":"2026-05-11T09:25:58.822046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-12T22:48:45.647588Z","title":"V*: Guided visual search as a core mechanism in multimodal llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.10219","last_updated":"2026-05-28T16:20:33Z","snapshot_observed_at":"2026-08-01T16:49:58.717615Z","submitted_at":"2026-04-11T13:59:05Z","title":"Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-12T22:48:45.647588Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.10219"},"observation_digest":"sha256:862c484417548c16ca6fb34cae687cddfd8571bb6a1f7e401876927deedabc6d","observation_id":"983d9ea9-53f7-41d6-abae-b8d9662b0c16","resolution":{"observed_at":"2026-07-12T22:48:45.647588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:fb4ba2086eee41922002d2b75346aa5d22dee01c8598e0695d6bfade092f5cb7","observation_id":"814f6ec7-7150-4d8d-9bf2-18e47e7f8447","resolution":{"observed_at":"2026-05-10T09:43:49.502913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.22875","last_updated":"2026-04-28T04:48:22Z","snapshot_observed_at":"2026-08-03T02:43:56.733861Z","submitted_at":"2026-04-23T22:33:15Z","title":"SketchVLM: Vision language models can annotate images to explain thoughts and guide users","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-09T21:32:08.503584Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.22875"},"observation_digest":"sha256:76ec0f6adaa9139ec3de3765f3a662571cf509ae799e160e7772fce82973b513","observation_id":"ea694479-978c-4604-9b46-9c67c71b600d","resolution":{"observed_at":"2026-05-09T21:33:27.942692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-07-06T23:10:33.821313Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:781636cab5348c7a30b0eb1e439c39a6d22ca39c5bd0d12c2f5f3c38cdcec2b1","observation_id":"d44ab193-c2c8-4f94-9ecf-b6b415bbd7b6","resolution":{"observed_at":"2026-05-11T21:41:17.052295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.07817","last_updated":"2026-05-08T14:49:10Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:49:10Z","title":"GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T02:03:52.566413Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.07817"},"observation_digest":"sha256:4b7afca9eca22d3ee14f81c9ebafacfa9c041f2aaf3b6b8681f601d8781e7b30","observation_id":"4d1a14b4-c409-4d27-8502-8d53df71a759","resolution":{"observed_at":"2026-05-11T04:00:54.650794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.18445","last_updated":"2026-05-19T10:08:18Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:14:49Z","title":"What's Holding Back Latent Visual Reasoning?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T11:59:14.134917Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.18445"},"observation_digest":"sha256:0e2bbf4ff724fff4e71893ed1df333013f216f3986f517e577d7a9c3d2e068da","observation_id":"ccad97df-3074-475e-b73f-7de3b8ff1d3e","resolution":{"observed_at":"2026-05-20T12:03:15.473753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-07-12T16:34:33.771955Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:32.238241Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:f9bece1506bee5863a4fd74c87be670bbae82271d6dea7dbe46c409507a69640","observation_id":"e89677b3-b613-488c-9467-a4394c408300","resolution":{"observed_at":"2026-05-20T10:53:13.123588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-12T16:34:34.452430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-07-12T16:34:33.771955Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T16:34:34.452430Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:988514f2dae4f3863f8b5f3bbe655064063c7b12fc8d57bb7efec688e501fffe","observation_id":"a867bb2b-1d00-4b86-9775-0b198c98424d","resolution":{"observed_at":"2026-07-12T16:34:34.452430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2605.28741","last_updated":"2026-05-27T17:01:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:01:39Z","title":"Self-Prophetic Decoding to Unlock Visual Search in LVLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T12:53:40.783281Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2605.28741"},"observation_digest":"sha256:ed720f9c519ecfb7552422469b8f72c6016614e252ad7a0f4e116e845667fb8e","observation_id":"d5408f8a-eebe-4ad9-a88a-24da1b98dd3f","resolution":{"observed_at":"2026-06-29T13:03:26.884105Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.03054","last_updated":"2026-06-02T02:44:27Z","snapshot_observed_at":"2026-08-02T04:55:02.222478Z","submitted_at":"2026-06-02T02:44:27Z","title":"ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T10:38:41.735204Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.03054"},"observation_digest":"sha256:b3c76372a5e100e731f1b7f90b6fdbce15c1bb1401d7e5b8adb7b4cef43c1765","observation_id":"22009e46-56ed-46c6-ab6a-b1cf6c9a5d9a","resolution":{"observed_at":"2026-07-02T02:46:28.939546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:d0d0c50cd53b334ad19710da04034aea3b7c56b8007e437faeba15693f304fbe","observation_id":"79c455c0-6e7c-4123-848c-947c636d6fd2","resolution":{"observed_at":"2026-07-01T22:26:17.951269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.18974","last_updated":"2026-06-25T02:14:41Z","snapshot_observed_at":"2026-08-02T20:17:43.258482Z","submitted_at":"2026-06-17T11:59:15Z","title":"Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T21:47:51.437284Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.18974"},"observation_digest":"sha256:c1ee067c5ca3f9f48b71748c93a386be5ead4ef93eccc36ea0e2db377d7bb7ff","observation_id":"02a06411-4ac5-46f5-9891-ef32db2a3b91","resolution":{"observed_at":"2026-07-03T23:49:02.271066Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.21968","last_updated":"2026-06-20T09:49:52Z","snapshot_observed_at":"2026-08-06T02:34:44.129324Z","submitted_at":"2026-06-20T09:49:52Z","title":"Look Before You Zoom: Adaptive Routing for the Resolution-Context Trade-off in Visual RAG","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T12:54:06.319322Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.21968"},"observation_digest":"sha256:30a8451d72f14e2610a76ca99d314fc2cb43189992185566587578476d81cd09","observation_id":"8497a1cf-e8ba-4d0d-a171-6b6a1eee502d","resolution":{"observed_at":"2026-07-04T07:49:38.554498Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2312.14135","doi":"10.48550/arxiv.2312.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":"arXiv (Cornell University)","work_id":"1f7ff232-18b6-44e2-b9ab-40803319aea0","year":2023},"citing_paper":{"arxiv_id":"2606.23581","last_updated":"2026-06-22T16:47:00Z","snapshot_observed_at":"2026-07-06T23:58:16.163783Z","submitted_at":"2026-06-22T16:47:00Z","title":"Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-26T07:13:19.593093Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2606.23581"},"observation_digest":"sha256:74d8f0a30422bc5d5a976246d18347ad7c5af49d0549afd3389790b2b3f67ebf","observation_id":"3b1d8caa-5deb-486b-8c29-6611a5ad14b9","resolution":{"observed_at":"2026-07-04T12:09:48.891429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-01T16:48:36.519393Z","title":"Xu, G., Jin, P., Wu, Z., Li, H., Song, Y ., Sun, L., and Yuan, L","venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2607.17884","last_updated":"2026-07-20T12:35:05Z","snapshot_observed_at":"2026-08-07T08:03:33.617792Z","submitted_at":"2026-07-20T12:35:05Z","title":"ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T16:48:36.519393Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2607.17884"},"observation_digest":"sha256:0f7d4b5b6e309c1a18d6d9981eb95e761c869d7ab3df74259acdc70bc22047ed","observation_id":"e17be238-b3bf-460a-8f63-3713f499ddcd","resolution":{"observed_at":"2026-08-01T16:48:36.519393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-07-31T02:56:58.290582Z","title":"V*: Guided visual search as a core mechanism in multimodal llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-06T14:14:02.472307Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.290582Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:0d8e736373470a81ed013f28854a13f8a0f303cadfbab094626f7c0d06725c9c","observation_id":"54c1de77-47be-4752-be6a-b354061bc3c3","resolution":{"observed_at":"2026-07-31T02:56:58.290582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14135","snapshot_observed_at":"2026-08-04T02:46:49.732380Z","title":"V*: Guided visual search as a core mechanism in multimodal llms.arXiv preprint arXiv:2312.14135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00013","last_updated":"2026-06-24T13:23:33Z","snapshot_observed_at":"2026-08-06T23:11:31.052908Z","submitted_at":"2026-06-24T13:23:33Z","title":"What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:46:49.732380Z"},"links":{"cited_paper":"/paper/2312.14135","citing_paper":"/paper/2608.00013"},"observation_digest":"sha256:0897ff72ec707fc34e3d2d8acc775f948ff4280a07846a9573fa71f0a035fc29","observation_id":"3c555d85-f35f-4299-851a-8fcf9e14a703","resolution":{"observed_at":"2026-08-04T02:46:49.732380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.14135/citation-record","integrity":"/paper/2312.14135/integrity","json":"/paper/2312.14135/citation-record.json","paper":"/paper/2312.14135"},"outbound":[],"paper":{"arxiv_id":"2312.14135","last_updated":"2023-12-26T15:20:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T12:08:37.537636Z","submitted_at":"2023-12-21T18:55:06Z","title":"V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2312.14135."}