{"as_of":"2026-08-08T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42cacdec146efaa228bf3fefcea54dc16471af7ab7fa0b5e3af791ecc28a456d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:56.264830Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T12:55:40.367899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T15:42:56.264830Z","title":"V oco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-07T15:35:48.142895Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:56.264830Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.14231"},"observation_digest":"sha256:f7c6c170dc3f9332d67665b1db93807ce861ebb6fefd249d9cc7b7801cab06ed","observation_id":"0d1d4fab-a1c0-4627-895a-05d81901127d","resolution":{"observed_at":"2026-08-07T15:42:56.264830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T14:46:44.748456Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-07T22:51:12.206699Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:44.748456Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.17670"},"observation_digest":"sha256:4dd1f9f53837442ba3082b2848c44d12aeb342cf548182d23e7834d62d54a06f","observation_id":"03a1e32b-abe3-466e-a411-0abe0a4039db","resolution":{"observed_at":"2026-08-07T14:46:44.748456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.12275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2406.12275 (2024) 1","venue":null,"work_id":"155a8d96-720e-4bca-a9ff-17138f39f883","year":2024},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:193c96efee106d6a1977f5dd264dfd533657f9348d861b12fb377eb427d1bfb9","observation_id":"949cbecf-4b31-44f1-933a-4ae41c6f8d5f","resolution":{"observed_at":"2026-05-16T12:55:40.369819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T14:26:17.253571Z","title":"V oco-llama: Towards vision compression with large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19235","last_updated":"2025-05-25T17:16:34Z","snapshot_observed_at":"2026-08-07T20:41:54.292300Z","submitted_at":"2025-05-25T17:16:34Z","title":"CoreMatching: A Co-adaptive Sparse Inference Framework with Token and Neuron Pruning for Comprehensive Acceleration of Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:17.253571Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2505.19235"},"observation_digest":"sha256:838447440675417882311c7e13429adaf82ce60f006daedec3cb570940153d36","observation_id":"085c94df-aa16-4d8f-926b-7d6a5fec40e2","resolution":{"observed_at":"2026-08-07T14:26:17.253571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-07T10:50:50.940626Z","title":"Voco-llama: Towards vision compression with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04344","last_updated":"2025-06-04T18:02:07Z","snapshot_observed_at":"2026-08-07T10:41:57.726484Z","submitted_at":"2025-06-04T18:02:07Z","title":"GEM: Empowering LLM for both Embedding Generation and Language Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:50:50.940626Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.04344"},"observation_digest":"sha256:d597bc03058d74bb9adb45735191e1e28489e66875edd940a801bbaec2b46f20","observation_id":"fa0c8107-91a4-4810-9bac-fc901fbcce76","resolution":{"observed_at":"2026-08-07T10:50:50.940626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T22:36:39.267392Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-07T05:11:16.145844Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.267392Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:d54d34a79762eeeeb57d4b8e2459ff367b8c1da94ff0bfdef1622942e05bf97d","observation_id":"68ed76ec-112b-4f43-92a6-a1c7b91af129","resolution":{"observed_at":"2026-08-06T22:36:39.267392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T22:24:35.303741Z","title":"V oCo-LLaMA: Towards Vision Compression with Large Language Models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-07T08:24:31.697101Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:35.303741Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:54acbe2188615839e8b69e5030e0b461236740a7ff0e08e629d136a4507d11b9","observation_id":"a52528c2-d11a-43dd-a239-7af0352ca0dd","resolution":{"observed_at":"2026-08-06T22:24:35.303741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T18:39:07.070965Z","title":"arXiv preprint arXiv:2406.12275 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08064","last_updated":"2026-06-06T18:51:46Z","snapshot_observed_at":"2026-08-06T18:26:57.432317Z","submitted_at":"2025-07-10T16:47:25Z","title":"PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:07.070965Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2507.08064"},"observation_digest":"sha256:33749368cabcccd7008e9d4c8f377b40e8cdd4f7cc096a434c7adc6d7b6d35cd","observation_id":"451ae934-c65c-42c8-9c5d-bad3c4c82881","resolution":{"observed_at":"2026-08-06T18:39:07.070965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-06T18:03:03.529576Z","title":"arXiv preprint arXiv:2406.12275 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-08T00:12:13.692263Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:03.529576Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:6419d336ac6e0bb04474059ba761f9a7c1de588599ab68c5a767264f49752025","observation_id":"84c13542-3f1b-49c4-b010-e4b1694cf24c","resolution":{"observed_at":"2026-08-06T18:03:03.529576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-08-03T20:57:34.402360Z","title":"V oco-llama: Towards vision compression with large language models.arXiv preprint arXiv:2406.12275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:34.402360Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:b87ac03eaaae13e7baf973cae4fbb1a71fb5624a1dcb1fb5bea4174fdb508c1b","observation_id":"876f6bfa-4589-495d-878e-6a2f0db7cf72","resolution":{"observed_at":"2026-08-03T20:57:34.402360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12275","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2406.12275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":201,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2406.12275","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:83f567f3bfa1174aed2b246d6e85df1e588124eb3c0070e96495ae00a7359d83","observation_id":"d3e064d2-1d8b-4cfb-8768-b50960fa318b","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.12275/citation-record","integrity":"/paper/2406.12275/integrity","json":"/paper/2406.12275/citation-record.json","paper":"/paper/2406.12275"},"outbound":[],"paper":{"arxiv_id":"2406.12275","last_updated":"2025-03-03T09:05:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T05:05:12Z","title":"VoCo-LLaMA: Towards Vision Compression with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2406.12275."}