{"as_of":"2026-08-15T13:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf673f826b6bab971fbaf28b87d4489b12003eda41541867c91d9034420eaa25","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:38:56.881537Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08771/citation-record","integrity":"/paper/2412.08771/integrity","json":"/paper/2412.08771/citation-record.json","paper":"/paper/2412.08771"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T17:38:56.716772Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.716772Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:188dcf246409955fe37a7e4f1903ef4c3335e2fb55d4c8ba6b46d141ce45e989","observation_id":"3da70c1f-c91b-4a78-ac6f-1045cbf86f16","resolution":{"observed_at":"2026-08-11T17:38:56.716772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.724332Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.724332Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:a2dc98eb088f0e698ebc00dbdfe80139d69dfdb544494a2c9b54a299fa5cfe30","observation_id":"a876d2af-f907-4e5f-9bd7-fb52c28479a1","resolution":{"observed_at":"2026-08-11T17:38:56.724332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.730122Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.730122Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:f0b0117f18db6389411d6a7a8c3a622ee725891d6e7d788a96420a8dc5e43e78","observation_id":"b2f2f848-a4e1-4498-ae03-80ec1bd017a6","resolution":{"observed_at":"2026-08-11T17:38:56.730122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.306233Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"7b0ff706-15ed-4604-8424-51d3e3092874","year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.735300Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:5a773698191667a7a714679e98bf728faf97d3cfd1447b84c97bbb72c7dad61f","observation_id":"af58c3fd-2e36-494f-9fd3-029e451b498c","resolution":{"observed_at":"2026-08-11T17:38:57.311285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10994","last_updated":"2024-12-17T02:05:27Z","snapshot_observed_at":"2026-08-14T05:35:56.747067Z","submitted_at":"2024-09-17T08:56:27Z","title":"Less is More: A Simple yet Effective Token Reduction Method for Efficient Multi-modal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10994","snapshot_observed_at":"2026-08-11T17:38:56.742024Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.742024Z"},"links":{"cited_paper":"/paper/2409.10994","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:73a881e25bef14eaa4e8e36a7480986a1c71a6775fa0c94a1d8c2b6699318b28","observation_id":"20390628-8090-428a-907a-0c1a15a05ccd","resolution":{"observed_at":"2026-08-11T17:38:56.742024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-11T17:38:56.747030Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.747030Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:e20eb18df7e96cda1c8708f02c05c3ed4e24765391d47bfe860419d8b2303667","observation_id":"b17128a6-cf98-48ea-bcac-7682aca48906","resolution":{"observed_at":"2026-08-11T17:38:56.747030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10945","last_updated":"2024-12-25T01:27:01Z","snapshot_observed_at":"2026-08-14T23:00:20.153734Z","submitted_at":"2024-08-20T15:34:27Z","title":"HiRED: Attention-Guided Token Dropping for Efficient Inference of High-Resolution Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10945","snapshot_observed_at":"2026-08-11T17:38:56.755180Z","title":"Hired: Attention-guided token dropping for efficient inference of high-resolution vision-language models in resource-constrained environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.755180Z"},"links":{"cited_paper":"/paper/2408.10945","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:8ffa7605e26dc69950bd43118587a0b71f13e39776d79041cd7f0225a7505948","observation_id":"082004d0-bfd8-4a5a-a00f-5ae86d088b6f","resolution":{"observed_at":"2026-08-11T17:38:56.755180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17430","last_updated":"2024-07-29T17:59:28Z","snapshot_observed_at":"2026-08-13T07:57:14.788572Z","submitted_at":"2024-05-27T17:59:56Z","title":"Matryoshka Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17430","snapshot_observed_at":"2026-08-11T17:38:56.762019Z","title":"Matryoshka multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.762019Z"},"links":{"cited_paper":"/paper/2405.17430","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:1e5dd83eeaa2019fcdb535ff0c3f0fa9feaf8c0c8bbbc2b6d83dbf7d18927ad3","observation_id":"eefffb81-b279-4120-ada8-0c530d5cf11d","resolution":{"observed_at":"2026-08-11T17:38:56.762019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.767350Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.767350Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:6b20cca8e0d71d6718affce96fb42692471f6034a6f5368f75338763f9784f1b","observation_id":"6b22601a-7576-4731-bf58-c7d046f3fc20","resolution":{"observed_at":"2026-08-11T17:38:56.767350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-08-13T13:07:22.672801Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-11T17:38:56.772419Z","title":"Focusllava: A coarse-to-fine approach for efficient and effective visual token compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.772419Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:8f4dc7ad3d14cde719fe5176a3ef61956614f20cefcc964fbed34aeaad55e311","observation_id":"81522011-0c70-4c50-b4e6-f46a7adcdf3e","resolution":{"observed_at":"2026-08-11T17:38:56.772419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:38:56.776843Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.776843Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:fd27281d62687cd263ea77cd26ee6f3d83b3b2c26cc93b10024ff5d24bb376ab","observation_id":"66b5eed6-4f90-499c-9ac5-849f2171c11c","resolution":{"observed_at":"2026-08-11T17:38:56.776843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.781775Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.781775Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:722d2375847008e0f39fbf4beb51f3e654ee95c0bbe808c40a58aa20929d0636","observation_id":"51d5bba8-1fb1-493c-b520-d423a3a07391","resolution":{"observed_at":"2026-08-11T17:38:56.781775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.787378Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.787378Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:4c59f8746d2b0b4c47cd2a306e9ed48490dbf9c0f78ccf856b35ae639b0c8f1f","observation_id":"886b59ed-d335-4c77-9271-7b21ec3dfb4a","resolution":{"observed_at":"2026-08-11T17:38:56.787378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.256152Z","title":"Lmms-eval: Accelerating the development of large multimoal models, March 2024","venue":null,"work_id":"e2551ab5-6367-4702-8483-c17313789b6b","year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.792098Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:791b8bf090bbb6135bc772ee5211e8c56854d366ea026d119d977006ed2f7b2e","observation_id":"0462a536-8991-45ab-a93b-062bd723a3a9","resolution":{"observed_at":"2026-08-11T17:38:57.263040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.240567Z","title":"Gqa: A new dataset for real-world visual reasoning and com- positional question answering","venue":null,"work_id":"95ace0b0-9031-4752-a1cc-0a7161718171","year":2019},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.796485Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:6caf42577954adfbf5279c296e35cc090b878a13d6ae329d9f4b01c5ad147866","observation_id":"ff118de8-15c3-40fb-b0f8-34609c1c92f9","resolution":{"observed_at":"2026-08-11T17:38:57.245227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.806224Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.806224Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:4f08cd0e68bd4dd3708034e7352c88f1a43c6ab2c7cdadd6c8fcdfa377d6eb9b","observation_id":"1574031e-206e-434c-86c5-f0d001fa7d8b","resolution":{"observed_at":"2026-08-11T17:38:56.806224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.811310Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.811310Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:2004f688d78190e853ad3fac16b62feb02bbab5d72a56df3cdab4cb03e96857f","observation_id":"522ece48-3d03-42b5-834c-122ee1b67971","resolution":{"observed_at":"2026-08-11T17:38:56.811310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-11T17:38:56.816229Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.816229Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:f2e1974bbcdfe4a27275fac5a3757a716cfd36192a432e159ce495ef636a59be","observation_id":"21ed474f-098d-4ec1-aa90-6b8977507d4d","resolution":{"observed_at":"2026-08-11T17:38:56.816229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T17:38:56.821977Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.821977Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:6971935daf33c48d9e2ebe2d4ca92f0c760a1b6cfff70ddd23d0882161c5482d","observation_id":"e9f6b0d1-199e-4e39-9103-f02365561dc9","resolution":{"observed_at":"2026-08-11T17:38:56.821977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-11T17:38:56.826692Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.826692Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:0b75ff4b7a7b09e8b5514438231eb6e273f1affc7db923bda8702b0f05ca8aed","observation_id":"7136a7d0-242b-432d-bf2d-ed56bf59d1e0","resolution":{"observed_at":"2026-08-11T17:38:56.826692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T17:38:56.832530Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.832530Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:5692570c843947b141fc5bd2a2b4d639217f9ac888b044a77b9911a7e7d6413a","observation_id":"9ba0145d-d6af-4293-9300-b83a1639c68b","resolution":{"observed_at":"2026-08-11T17:38:56.832530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:56.837330Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.837330Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:ed33d28b53d318b6d7914bdb9a793051ecf1a6d309f503df023603f819e8a910","observation_id":"deac9b71-a821-4eb7-8923-97a186334a82","resolution":{"observed_at":"2026-08-11T17:38:56.837330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-11T17:38:56.844734Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.844734Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:cdc743c2291588a50ce4aa2c032ad2cef477346effe56df43394c51a846016e4","observation_id":"63e0699d-71d1-4c86-a7f4-0503c5dbf140","resolution":{"observed_at":"2026-08-11T17:38:56.844734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.196943Z","title":"Ray: A distributed framework for emerging {AI} applications","venue":null,"work_id":"5b672273-0f57-4a22-a04c-7fb2159f7ad7","year":2018},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.851157Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:61e4d40e29ae1f4f5e4d0f272a0e80f280913ac5d41653ef96d0029d0ac59577","observation_id":"32b3dd32-1c17-48d5-b54e-60ce82f730ef","resolution":{"observed_at":"2026-08-11T17:38:57.201146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:38:57.176246Z","title":"Ffcv: Accelerating training by removing data bottlenecks","venue":null,"work_id":"9ab916de-d921-466f-9faa-9c74db0b16ca","year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.861083Z"},"links":{"citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:c28a3581ac96815a9d99e6daf8654b5642dc2c2177b9a40e97a35b472219de1d","observation_id":"d516df20-98d7-4ee1-b139-f49f5193a639","resolution":{"observed_at":"2026-08-11T17:38:57.182475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T17:38:56.867338Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.867338Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:18dc48b77b4c3366fdd3d03c29d4359ed28c462fd1ac1be16ed619378fd9ec29","observation_id":"6e4c7e81-8d2f-4afb-a905-1232853e6952","resolution":{"observed_at":"2026-08-11T17:38:56.867338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T17:38:56.881537Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:38:56.881537Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.08771"},"observation_digest":"sha256:32110f1e6f25ccd40208901c10ca3335c530a4e3e0ca4ed574b0c9914d88d26a","observation_id":"885f5b81-3a33-4fd7-9e6d-36c80160fe4d","resolution":{"observed_at":"2026-08-11T17:38:56.881537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08771","last_updated":"2024-12-11T20:46:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:53:16.500099Z","submitted_at":"2024-12-11T20:46:06Z","title":"LLaVA-Zip: Adaptive Visual Token Compression with Intrinsic Image Information"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2412.08771."}