{"as_of":"2026-08-08T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a706813f58062167be6d6800d4aa9b3e057d42faaed982cddc97999385650eff","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:54:56.387608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T19:52:01.847188Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:76ce84d70b887438c70934583e53267a7f26a1992e00ae777365f4ac173338e1","observation_id":"a9e8b27d-9201-4c1e-92c0-a0ba5b52c41d","resolution":{"observed_at":"2026-05-16T07:59:32.756615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:3ad3abb601edafa07ee89a1597c446d0239ea6a64dea8e23f6a2233c079f53ce","observation_id":"050d4782-a562-4c0b-ad4b-9dfb6841be5f","resolution":{"observed_at":"2026-05-19T11:08:27.814263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:c21c7a574889ffe7c24a0de08c77f561c4e60464b4aaf71189eb69900a47fc32","observation_id":"2a1add6b-2778-4f07-9329-22dcd1aed3ee","resolution":{"observed_at":"2026-05-17T21:08:19.635675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-08T12:54:56.387608Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07411","last_updated":"2025-03-21T14:21:30Z","snapshot_observed_at":"2026-08-08T12:49:56.621702Z","submitted_at":"2025-02-11T09:45:06Z","title":"EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T12:54:56.387608Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2502.07411"},"observation_digest":"sha256:931a21c22c17c9967d39c8bf9ef23c74821108ceeae663bb7bdef19d7bd57b72","observation_id":"8c8b5f18-f5f1-4841-8f7e-5927283508ab","resolution":{"observed_at":"2026-08-08T12:54:56.387608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T18:23:50.516471Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:50.516471Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:5d177e6a3b49a7b10f97064fb46ba0cce36068fe61be83973b2ca7ae030e9392","observation_id":"f8a1bd3f-8f1a-4e44-ac29-90882517e885","resolution":{"observed_at":"2026-08-07T18:23:50.516471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:50c5c88cdabc080d1cb12baf2d38d409a8c908691ced9fdd3d3a429baa034222","observation_id":"55c7d61c-77b3-48d8-a6b7-88c4aa8ead28","resolution":{"observed_at":"2026-05-22T19:52:01.848900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T15:16:01.697010Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models.arXiv preprint arXiv:2406.08487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15774","last_updated":"2025-05-21T17:26:11Z","snapshot_observed_at":"2026-08-07T15:09:42.504814Z","submitted_at":"2025-05-21T17:26:11Z","title":"Beyond Hard and Soft: Hybrid Context Compression for Balancing Local and Global Information Retention","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:01.697010Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2505.15774"},"observation_digest":"sha256:bdb6f2396b9e3be3ace40f0a6a2ac73e8fd058ac7518a8fc5536d5128260d6de","observation_id":"e9b2a7ad-a09d-464c-adfa-027d2a0f65bb","resolution":{"observed_at":"2026-08-07T15:16:01.697010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T13:40:25.686235Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-07T21:47:39.640757Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:25.686235Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:b967829a63fabeea3d4a44862ea6f4ad4517dbc55c9f655ce6b3f428f1674886","observation_id":"80f2e1f6-1317-4010-b328-cee0148f0e27","resolution":{"observed_at":"2026-08-07T13:40:25.686235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T00:48:34.329669Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.329669Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5c0259cd8d8ab018a710d884ba76d4a6322d5f137e1c381e3c5fc8e3e337a87b","observation_id":"309da78b-8d1e-4153-836e-aa64ee4ed65e","resolution":{"observed_at":"2026-08-07T00:48:34.329669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-06T23:57:28.778358Z","title":"arXiv preprint arXiv:2406.08487 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:28.778358Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:74b74c6e0ef27bf1fea1972087e9cf8f6b7b193961b0cf1cf3981df2ac3885ff","observation_id":"8e3c2543-df55-4b6f-86a9-bb839450d42e","resolution":{"observed_at":"2026-08-06T23:57:28.778358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2507.05920","last_updated":"2026-04-20T01:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T12:05:05Z","title":"High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T06:10:57.219445Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2507.05920"},"observation_digest":"sha256:71733be85bebce100ea9ffd67d08598e9d0cc41e851834e918fb80da309d3031","observation_id":"858439a1-fa26-45ca-af18-97a616067348","resolution":{"observed_at":"2026-05-19T06:12:07.101562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-06T05:51:16.113242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-07T10:22:34.344208Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:16.113242Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:7289d3136c49ae197ff72be1df8a829a06dfb1a2ebbee5831c3d12964159aa5d","observation_id":"2f9c8825-b548-405f-a355-b60ea1a8aa1c","resolution":{"observed_at":"2026-08-06T05:51:16.113242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-05T14:42:32.838564Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models.arXiv preprint arXiv:2406.08487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.838564Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:3027cedbb5171533f482ef363cc63e3dc024a02fc4e0575aa6fdcdfd4d6c208a","observation_id":"3bfbd8f8-02de-442e-a511-6d69283bce5f","resolution":{"observed_at":"2026-08-05T14:42:32.838564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2510.22102","last_updated":"2026-04-28T03:11:40Z","snapshot_observed_at":"2026-08-02T17:36:08.610766Z","submitted_at":"2025-10-25T00:58:47Z","title":"Mitigating Coordinate Prediction Bias from Positional Encoding Failures","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:11:30.734633Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2510.22102"},"observation_digest":"sha256:d189ccf39d5daeac8af0249209571a7d7557416cde1b166af35a362eb53c54ca","observation_id":"54d06397-c0d5-4151-a839-fb563950427b","resolution":{"observed_at":"2026-05-18T05:12:23.524070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-02T20:19:17.878795Z","title":"CoRRabs/2406.08487 (2024) 2, 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23615","last_updated":"2026-07-08T09:59:15Z","snapshot_observed_at":"2026-08-07T23:59:50.152219Z","submitted_at":"2026-02-27T02:43:35Z","title":"HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T20:19:17.878795Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2602.23615"},"observation_digest":"sha256:8e668e157cea4c6c84cf8b17cd24b7821d18134657a0402923e8d6313422d43d","observation_id":"2825c939-e432-4838-a4b1-6456fd772dab","resolution":{"observed_at":"2026-08-02T20:19:17.878795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":"2406.08487","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"7e67b72f-8098-400f-815c-6fad9f857c42","year":2024},"citing_paper":{"arxiv_id":"2605.05126","last_updated":"2026-05-06T16:55:44Z","snapshot_observed_at":"2026-07-06T23:17:48.161262Z","submitted_at":"2026-05-06T16:55:44Z","title":"ConsisVLA-4D: Advancing Spatiotemporal Consistency in Efficient 3D-Perception and 4D-Reasoning for Robotic Manipulation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-08T16:40:19.057979Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2605.05126"},"observation_digest":"sha256:7a2ca14c49f3b5169c4e31b62ea53987aaf9918180dd08b8529d7b676f722a19","observation_id":"2517de30-451d-4e1f-ad06-5ddc7ee99579","resolution":{"observed_at":"2026-05-11T18:06:06.159651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2406.08487 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:1903654fed0027ea6e060001850c284fc3691192dc3c5bd388d3ebdf7e23722b","observation_id":"aa753e71-a650-4be4-807e-36b50e213599","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08487/citation-record","integrity":"/paper/2406.08487/integrity","json":"/paper/2406.08487/citation-record.json","paper":"/paper/2406.08487"},"outbound":[],"paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2406.08487."}