{"as_of":"2026-08-18T16:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ff0aff208212de3a729ea2d24fecee0161488065617af0fbaef95dc1ca6e230","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:48:16.136813Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T07:14:08.479610Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:21.980388Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.11945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11945","snapshot_observed_at":"2026-07-03T14:08:21.980388Z","title":"arXiv preprint arXiv:2505.11945 , year=","venue":null,"work_id":"ac849681-1622-4cc7-8332-59fd06e9d9e7","year":2025},"citing_paper":{"arxiv_id":"2507.21420","last_updated":"2026-04-28T19:54:45Z","snapshot_observed_at":"2026-08-13T06:15:37.784587Z","submitted_at":"2025-07-29T01:07:09Z","title":"ReGATE: Learning Faster and Better with Fewer Tokens in MLLMs","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-19T03:18:11.993413Z"},"links":{"cited_paper":"/paper/2505.11945","citing_paper":"/paper/2507.21420"},"observation_digest":"sha256:ec1f8dcd86ab2122e77a510696ac9c4eb38d6013c4579b36b0e3723ec6f57578","observation_id":"bbac5bfd-94e9-46e3-a2ec-9a76cecb0132","resolution":{"observed_at":"2026-05-19T03:22:01.131202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2505.11945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11945","snapshot_observed_at":"2026-07-03T14:08:21.980388Z","title":"arXiv preprint arXiv:2505.11945 , year=","venue":null,"work_id":"ac849681-1622-4cc7-8332-59fd06e9d9e7","year":2025},"citing_paper":{"arxiv_id":"2606.12883","last_updated":"2026-06-11T04:19:32Z","snapshot_observed_at":"2026-08-15T12:32:37.485308Z","submitted_at":"2026-06-11T04:19:32Z","title":"The Hidden Power of Scaling Factor in LoRA Optimization","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-27T07:14:08.479610Z"},"links":{"cited_paper":"/paper/2505.11945","citing_paper":"/paper/2606.12883"},"observation_digest":"sha256:3a6d048dd54112d3f648350248f4932eb5a96c3234357145970465064a32e9f4","observation_id":"0403b79d-6273-4590-8527-cf80380382d0","resolution":{"observed_at":"2026-07-03T14:08:21.981648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11945/citation-record","integrity":"/paper/2505.11945/integrity","json":"/paper/2505.11945/citation-record.json","paper":"/paper/2505.11945"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.816262Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"2da2d12a-4c4f-4b29-a667-4ecb63e8063e","year":2022},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.621753Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:5abdb2ca669f2f7e85b1108e87834d02b11e065dd68090d9ee5a54ed21e612e5","observation_id":"f62878cd-7277-4c8d-a45e-65f364e40591","resolution":{"observed_at":"2026-08-15T20:48:17.822537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.798523Z","title":"Vita: An efficient video-to-text algorithm using vlm for rag-based video analysis system","venue":null,"work_id":"f63ff0bb-fd10-4a10-ad7f-a5a29b24494d","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.632476Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:cbf7602eefd29a7d1fa340e557880be8ab41cb31c9cf80cae66854c43b7e43ff","observation_id":"2f9599b4-91f2-4f73-a3f4-4b4f9829b513","resolution":{"observed_at":"2026-08-15T20:48:17.804808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T20:48:15.639409Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.639409Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:86371aa9bcb158a5e358f2991474633fd1bde5307d9608b83fb1297af1b11eda","observation_id":"0861b875-b5a0-4ac6-8897-3dfa2c7dd57c","resolution":{"observed_at":"2026-08-15T20:48:15.639409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.782532Z","title":"Honeybee: Locality- enhanced projector for multimodal llm","venue":null,"work_id":"87234aed-3e03-4cfb-9230-2e9390f99f70","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.652965Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:d85bdf84249400ce048c669bc70a15fa87b66b8908f5b066815a141a81dfa6d0","observation_id":"9b1e6f6c-b87d-48a1-8d1b-2ff46a275d0c","resolution":{"observed_at":"2026-08-15T20:48:17.788084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.766192Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"be725601-4b6a-4431-a1c1-17dabffb222f","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.662831Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:7867f2b7783994c720135c116827fd1b3812e266fa7d34fdab602f9062ac697b","observation_id":"5e5dd523-61d0-4079-9fc0-db871464aa34","resolution":{"observed_at":"2026-08-15T20:48:17.771427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.674264Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.674264Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:61460f6dd119bcddcd02a7672960570041ccef47a8e7d8d3643aab35ca4806c7","observation_id":"f9dee378-b90f-4403-a288-3f01828d9a88","resolution":{"observed_at":"2026-08-15T20:48:15.674264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.681307Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.681307Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:b3f3e7f5c7c948f7ac228ddf582ff90fbd6893543320779569e32d4a6ee4c9d1","observation_id":"6d2fa2d2-90f0-4c95-bf16-5145408b2b86","resolution":{"observed_at":"2026-08-15T20:48:15.681307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.687604Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.687604Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:382042e7d53546e7e98d78b944119c8e764f8594027c538f92b1e272c7d6c105","observation_id":"3d3af01d-f0fb-4eab-bff0-c6108479f7a8","resolution":{"observed_at":"2026-08-15T20:48:15.687604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.712639Z","title":"Don’t look twice: Faster video transformers with run-length tokenization","venue":null,"work_id":"8c1ca360-44c3-40f8-90f4-797efef5999a","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.694497Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:1821c6d7733c0cea99ce30b34e04288fd4de3a34f658557f89e328661b84e59f","observation_id":"77f1ecc6-94c2-4125-a27b-15255b2174bf","resolution":{"observed_at":"2026-08-15T20:48:17.717428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-15T20:48:15.699140Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.699140Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2debb934d1a86123721a49ff97308cbf616e1e61ea4f43420c864206b4188345","observation_id":"d8f9a9cd-0d68-487f-b0a9-7502e8ef8f87","resolution":{"observed_at":"2026-08-15T20:48:15.699140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.695436Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"09a72483-d085-4303-88c2-f9e30f5b88b8","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.705318Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:e5b16b29dbd20fdc4b97e15f13b044ad9a324b6259c33c1e132fc0feebe7cab3","observation_id":"31b2899d-2898-49e0-aba3-f4e768f28024","resolution":{"observed_at":"2026-08-15T20:48:17.701206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03206","last_updated":"2024-09-05T02:54:17Z","snapshot_observed_at":"2026-08-17T06:00:13.352459Z","submitted_at":"2024-09-05T02:54:17Z","title":"TC-LLaVA: Rethinking the Transfer from Image to Video Understanding with Temporal Considerations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03206","snapshot_observed_at":"2026-08-15T20:48:15.713164Z","title":"Tc-llava: Rethinking the transfer from image to video understanding with temporal considerations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.713164Z"},"links":{"cited_paper":"/paper/2409.03206","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:c9fd853549c80b326a880b996c301fe1227c9de199dae777d886be8a4c832f37","observation_id":"0df83c2a-7098-47dc-8e16-ab180eeb1650","resolution":{"observed_at":"2026-08-15T20:48:15.713164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.678210Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"2577822f-e8cd-442c-8f5c-85f1523fe5b2","year":2017},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.718760Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2eeac68671ed3581aec3364b9357764c5979dd6456f107f334620a8b504ae837","observation_id":"12e9f6d2-3058-4da3-91a6-df0fd278f016","resolution":{"observed_at":"2026-08-15T20:48:17.683415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-15T20:48:15.724986Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.724986Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:00be2feda4b6529a1a8c5f51f2ff180f47cf2f631889ba79fd640ed1f0121426","observation_id":"16cdcd33-faf0-496f-96e7-ee146fc3d012","resolution":{"observed_at":"2026-08-15T20:48:15.724986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.661303Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":"07a991e3-2f01-4f61-a233-16c545337aa2","year":2022},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.732650Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:04b272eb7eb6ef41fe8222e653bdad3747d59878e71f8e1d2b5d1985c09c3220","observation_id":"40832420-5bc7-414a-96e0-626514df2af2","resolution":{"observed_at":"2026-08-15T20:48:17.666969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.642611Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":"c4c6ff75-6ccf-48b0-844d-4ef358060ffc","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.739852Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:4aa224ba2a1b121b0d6b64974557477e6c69146b3ac94b984a1b6c29bf94aa35","observation_id":"98a84017-9be8-4346-9658-a016bab80d0a","resolution":{"observed_at":"2026-08-15T20:48:17.647982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.625270Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"50c0beec-6d17-41e8-a826-fed3fedee1c5","year":2018},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.746571Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:0fe1c7275e7aa6f6ff79a810962a199f343bb15791fd5c68e1c2287aeefc984b","observation_id":"58d24812-16da-4f2f-8774-ff66ed7f39a4","resolution":{"observed_at":"2026-08-15T20:48:17.631083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.602546Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions","venue":null,"work_id":"25c58a06-616e-4da1-b3b4-94d8c5e97467","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.752539Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:3791e0fb43c1cf44dc3b7c2432a2abab7ed18eaf85c0486e79cd1774f19b7a06","observation_id":"0cf33c95-b05d-45aa-a327-2103b752530d","resolution":{"observed_at":"2026-08-15T20:48:17.608997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.759340Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.759340Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:1016a5cb5e5cead2e874743c5161f39ec37cee0c84bcbf6f971a33bdc6a8d733","observation_id":"055fb796-142a-4db1-9318-de1e4de9a968","resolution":{"observed_at":"2026-08-15T20:48:15.759340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.575135Z","title":"Token compensator: Altering inference cost of vision transformer without re-tuning","venue":null,"work_id":"7bde39d3-d041-4ef2-95a0-d86ac0cff94a","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.767540Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2c412d890ab25de924a6f856de9190e2bdef4634ffe0b8ddfe9aad1b1a7d0e04","observation_id":"d026d179-89cc-4830-9ce7-8dd29369ae1e","resolution":{"observed_at":"2026-08-15T20:48:17.580654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.556444Z","title":"Logicad: Explainable anomaly detection via vlm-based text feature extraction","venue":null,"work_id":"10c8ca87-e3fd-4f0c-b962-dd7f62460104","year":2025},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.773640Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:90bae8d046103d44eb4741e21f3a6a9ceb6395d9350265bf8e45aadce521c9d5","observation_id":"cee4edba-c37a-4e81-92ca-93dbacb28d72","resolution":{"observed_at":"2026-08-15T20:48:17.561972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.540040Z","title":"Llms meet vlms: Boost open vocabulary object detection with fine-grained descriptors","venue":null,"work_id":"8905352e-8264-4cf4-af37-a9d31b1072b8","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.780005Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:d43a0699b343ea353e4cfc421a586284dc370d6d4dfaeea1a666a89c74262faf","observation_id":"56fef084-41e6-4492-88a2-c0fbfcbcb10a","resolution":{"observed_at":"2026-08-15T20:48:17.545350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.523003Z","title":"Mm-reasoner: A multi- modal knowledge-aware framework for knowledge-based visual question answering","venue":null,"work_id":"3fb6707f-3d9b-43ca-a8f7-e8a92e56bfbf","year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.786893Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:229a764b170cfbb89acb7ad35b30b3368abeb283040f6d15579f4886c6d738c3","observation_id":"c870c746-a0ec-401c-8f2e-ef8df16d13c7","resolution":{"observed_at":"2026-08-15T20:48:17.528772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.504523Z","title":"Vlm-pl: Advanced pseudo labeling approach for class incremental object detection via vision-language model","venue":null,"work_id":"2fbdbcc2-3098-4ecc-b354-2ba5991c6dfe","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.795802Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:965dbf3cc7339200a88aa00477e03732120adbb7bb33c30b8bd4443a935b789b","observation_id":"40462433-8ad0-4bf1-a6ce-6d052dd65f80","resolution":{"observed_at":"2026-08-15T20:48:17.510182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.487091Z","title":"Lookupvit: Compressing visual information to a limited number of tokens","venue":null,"work_id":"f1350d2d-e0f4-4452-9c55-c47706a1d400","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.801917Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:eb50532ccf0759c7311587256840535dc8d091fb14a1da49d81ef4e61763f2cb","observation_id":"48131032-88e0-498d-b4d1-dba3fbf890d3","resolution":{"observed_at":"2026-08-15T20:48:17.492474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.808159Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.808159Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:17c8da7ef6c3dcaee5c542efc1eda26083e4aed4df5f896f5cc6d220110f64ed","observation_id":"16f1ee93-5146-4761-b480-e14b0c4e315a","resolution":{"observed_at":"2026-08-15T20:48:15.808159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.456966Z","title":"Ez-hoi: Vlm adaptation via guided prompt learning for zero-shot hoi detection","venue":null,"work_id":"24c8517f-1554-4268-a29a-b616ee6921be","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.814482Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:fd25c25ae89faef6926201fdeb3b0be4ae7ba3d7fceafe96e447e497609d6653","observation_id":"04c32cae-143e-4ffc-9aee-35d91ae85dbb","resolution":{"observed_at":"2026-08-15T20:48:17.463194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T20:48:15.820689Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.820689Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:63d500556ca3c7a9f1c323594a36e098530061d967f1469ed44b442e0ed7a125","observation_id":"3601f0f1-856f-4326-8837-e95d082e1208","resolution":{"observed_at":"2026-08-15T20:48:15.820689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-15T20:48:15.829103Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.829103Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:4d73bf0f152a9a98d7058616de566f8bc28190032ff8b7fd71ae36a3dcf56aed","observation_id":"d080d537-2f39-4dff-b5bb-e43875d8d4e6","resolution":{"observed_at":"2026-08-15T20:48:15.829103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.425485Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":"6ca10a61-6ddd-4c06-b2a5-93594d6e7bb3","year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.836127Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:7097872995fbd27b7a5085718fce8e3d5a36681e4fc40d48bcd4f0f53f468081","observation_id":"832cf5ed-d8b9-492e-921a-8ff379890722","resolution":{"observed_at":"2026-08-15T20:48:17.444494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.349389Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"bb636c3d-163f-4fe4-a21f-e9faa418a8e0","year":2022},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.842487Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:df700a88050f7151a4d75149b4d1dea35def1cb6a1a26fd7d933b722eccc55ca","observation_id":"f1754f53-f7dd-44a1-b20f-3ddb0d75739e","resolution":{"observed_at":"2026-08-15T20:48:17.407845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03312","last_updated":"2025-04-21T09:34:59Z","snapshot_observed_at":"2026-08-18T12:52:11.126989Z","submitted_at":"2024-11-05T18:54:21Z","title":"Inference Optimal VLMs Need Fewer Visual Tokens and More Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03312","snapshot_observed_at":"2026-08-15T20:48:15.850545Z","title":"Inference optimal vlms need only one visual token but larger models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.850545Z"},"links":{"cited_paper":"/paper/2411.03312","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2f0ae3a68ecc029de8cf0398e0688098938a11c99451dad0606534a97ae0837a","observation_id":"82cf2356-dfab-4ab6-ac15-a58e88dd345e","resolution":{"observed_at":"2026-08-15T20:48:15.850545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-18T12:53:08.716441Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-15T20:48:15.856988Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.856988Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:887d09b1f985d65347c2f5a521f70a180794297adb0fa978e6a5461fb25d753c","observation_id":"8b7a0790-66f6-455b-a4f4-4dedf1e16902","resolution":{"observed_at":"2026-08-15T20:48:15.856988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.316461Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"51387c4a-39bf-4002-ab82-a5da6350c1cc","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.863990Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:3ca4af6524a0af0fced52ecaa4cf10c17943b126939731694841b0d1768e764b","observation_id":"bb0d0afe-d458-4f1f-8384-fc77cc1ea76f","resolution":{"observed_at":"2026-08-15T20:48:17.322034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-15T20:48:15.872063Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.872063Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:dafee3592539e7970e72bf82b276f8f685fb4f9349258db0ed2f2c2520598bc6","observation_id":"204187f5-f6e1-456a-8ead-79c436535559","resolution":{"observed_at":"2026-08-15T20:48:15.872063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.299535Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"223babd6-a147-4d60-a4d2-469a7f2a12db","year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.879546Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:ecaef453ba918534cc8abe785e9279dd9f7875cb8bbb799d6b3a09a0ecccaac5","observation_id":"e10ef480-4df8-47ca-afc9-4380f5a04b49","resolution":{"observed_at":"2026-08-15T20:48:17.304591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.283440Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"1773712e-2b52-45cd-88b0-4090b29973b7","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.885567Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:03fe2880fcdde17eabb363b48d78e58c698b070eeb5ce41f6f0d358487ca4690","observation_id":"f4aab4f0-8be9-4c5d-aee7-460d243a8e03","resolution":{"observed_at":"2026-08-15T20:48:17.288374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.266671Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6b27cee1-df6b-4dd7-b366-c293b1a21f10","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.892662Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:1b5c54b1182a31371aeafa49e3c71831d96d4064b61d1889c7d6d7745adbb95f","observation_id":"c32f603e-a5f6-491e-9037-dc2f2dfe2e2a","resolution":{"observed_at":"2026-08-15T20:48:17.272213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-15T20:48:15.899314Z","title":"Sphinx: The joint mixing of weights, tasks, and visual embeddings for multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.899314Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:564caf1bc451c033ff0e1fa987ea2569bee295b8318597063a4e2947cb998c26","observation_id":"12e92281-0c0f-4df5-b138-a885811ccef5","resolution":{"observed_at":"2026-08-15T20:48:15.899314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.907057Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.907057Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:73d2b500d194ed5e5c7bea3d75567ea90defce845835b9f69cb79edb4d0074e3","observation_id":"2e34a6ef-d5ad-49b4-9c7e-9fbcb4e6a523","resolution":{"observed_at":"2026-08-15T20:48:15.907057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.912723Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.912723Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:31c3382ec0e0c98d9c4c8a888223769afea77e9686cff82bc8ae6ea16fb9e283","observation_id":"b195c883-cf1e-4be7-8117-1de4ed7fd9f6","resolution":{"observed_at":"2026-08-15T20:48:15.912723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.917778Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.917778Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:4ea79a8a5ca491288a20c1053be9caf019ba2843e0ed8624c6bacc594e3e3be4","observation_id":"b99e44de-561b-47f8-bb64-419825bc6dc4","resolution":{"observed_at":"2026-08-15T20:48:15.917778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10803","last_updated":"2024-11-16T13:45:33Z","snapshot_observed_at":"2026-08-18T09:00:36.136914Z","submitted_at":"2024-11-16T13:45:33Z","title":"Multi-Stage Vision Token Dropping: Towards Efficient Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10803","snapshot_observed_at":"2026-08-15T20:48:15.924724Z","title":"Multi-stage vision token dropping: Towards efficient multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.924724Z"},"links":{"cited_paper":"/paper/2411.10803","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:00007caa0b089b19007a4c1c82196a7e0013540d9ab490b11855265953efb1b0","observation_id":"2af17887-9523-4eef-99ba-52009acf4f1a","resolution":{"observed_at":"2026-08-15T20:48:15.924724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.932776Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.932776Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2dc7a0c56567cfe0a5607e3c4c108661c6f8f0f078f49a9058855fb29ff320cb","observation_id":"53b9be14-69f3-4160-b451-211b1d53e57a","resolution":{"observed_at":"2026-08-15T20:48:15.932776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-15T20:48:15.938326Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.938326Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:9d33fd4c152e43832e705f347b97865944c75f07afec95dbe7a1dbd581700ce3","observation_id":"f529d4dc-f324-43c3-9a9b-4adefaa2e53f","resolution":{"observed_at":"2026-08-15T20:48:15.938326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.197391Z","title":"Questioning, answering, and captioning for zero-shot detailed image caption","venue":null,"work_id":"97a33672-6a55-476d-91ab-4426cef46722","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.944171Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:ed0e3d0366d4a5e6f8d78427bde796a5ba58b6679b8cd3a68ce57176578d15ad","observation_id":"7d473a4a-7a10-416e-9a8a-d5879019c480","resolution":{"observed_at":"2026-08-15T20:48:17.203605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.175969Z","title":"Does vlm classification benefit from llm description semantics? In AAAI, pages 5973–5981, 2025","venue":null,"work_id":"2d0583e4-33d1-4c26-808a-cb12fdb6488f","year":2025},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.950924Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:7fcc04cfb466cfb1ff00b94d6dcf098bc1e8424d3aad6934e45012dc4df168b8","observation_id":"7ed2d803-7c77-41b0-a3a6-b31c97e84256","resolution":{"observed_at":"2026-08-15T20:48:17.183406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-15T20:48:15.956976Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.956976Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:97dc77463908cefeee15140be7c70248b809842065067454ae908a139b637c87","observation_id":"6b057137-b19c-434d-9e52-c74a4c018f8b","resolution":{"observed_at":"2026-08-15T20:48:15.956976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.156976Z","title":"Infographicvqa","venue":null,"work_id":"e22cc6a5-b172-4af7-a8b8-c8596b64ccbb","year":2022},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.962777Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:707f16340fa8547d99feaaa866d2595f793d3040579dcfefac0b37495aaa1b5b","observation_id":"33740278-dc71-4c6b-a779-fae282c58dc3","resolution":{"observed_at":"2026-08-15T20:48:17.162471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.136142Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"503254b0-d127-41a1-b452-ec5198a60bca","year":2021},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.968333Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:4d4ea61d75b735682dd7ed389f8a8a17c3c3b1f3984d36db9a942b58c6701720","observation_id":"44c17a7c-f79c-437d-89f4-eb8960cce2f0","resolution":{"observed_at":"2026-08-15T20:48:17.142650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.098354Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"d756738b-35ef-4f09-825b-5334d6cb4d68","year":2019},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.974801Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:6eb72fd817060ca072ae95b5748bde1ed94961826bb82215da59dfe62009401c","observation_id":"404e1c35-cf10-4e80-b998-2b129e6b152d","resolution":{"observed_at":"2026-08-15T20:48:17.106857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-16T14:38:42.941850Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-15T20:48:15.981135Z","title":"X-instructblip: A framework for aligning x-modal instruction-aware representations to llms and emergent cross-modal reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.981135Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2fe0c71931bb6d01d1c49116735aaea039b57a0cabfade167c777715f600d32e","observation_id":"a17bc5c5-59a7-4933-b169-1d602e105c20","resolution":{"observed_at":"2026-08-15T20:48:15.981135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.988182Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.988182Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:0c7144226f474fe52b70ed18f1e472339a87a815258bce452bdc2dbf648129a7","observation_id":"4c172126-ab99-41b1-96c4-0fb76ffaa218","resolution":{"observed_at":"2026-08-15T20:48:15.988182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:15.996657Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:15.996657Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2e4c69d196dfe1de0c08d50f22bfc1063f00e45237f75c0555cee78145e31af2","observation_id":"524c67da-e1ee-419d-8dca-9bef68068679","resolution":{"observed_at":"2026-08-15T20:48:15.996657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.005761Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.005761Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:74d12ca153e25c24b75c341c51deec81046e713b830ea6f3bee37e192a84efdf","observation_id":"2f748f79-0d26-435b-8d19-8eed9c027152","resolution":{"observed_at":"2026-08-15T20:48:16.005761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.014992Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.014992Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:c03af3e36f5099879692fe11af5c89a36375bb27309f3194551e8ed08f5f6f4d","observation_id":"d8c46163-dada-4f41-a7ff-6e278ad53d2a","resolution":{"observed_at":"2026-08-15T20:48:16.014992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.046058Z","title":"Less is more: A simple yet effective token reduction method for efficient multi-modal llms","venue":null,"work_id":"f7cb81fe-f341-4f63-85d8-aff3403f36ba","year":2025},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.022616Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:c5c473e6733c9fc4a8c5f03f93634103801d488c2cf01baf85d97fcbe54229ba","observation_id":"cbc2e32c-88a0-4a0e-9659-ace1bc2b6246","resolution":{"observed_at":"2026-08-15T20:48:17.053996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T20:48:16.030070Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.030070Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:a23d330d665e92ca1765b7a3fbe11048f99fc4355ac8742e8d35d62a94e1364e","observation_id":"77bb4be7-8de6-4b4c-9f86-11a44302791e","resolution":{"observed_at":"2026-08-15T20:48:16.030070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13303","last_updated":"2025-05-15T22:00:19Z","snapshot_observed_at":"2026-08-15T01:32:05.414283Z","submitted_at":"2024-12-17T20:09:55Z","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13303","snapshot_observed_at":"2026-08-15T20:48:16.039140Z","title":"Fastvlm: Efficient vision encoding for vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.039140Z"},"links":{"cited_paper":"/paper/2412.13303","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:dbb3fc9dc13174e963a4fb9d9789d062fc709aea6409ff93e512f2537e934dd9","observation_id":"e2c41836-a8eb-4564-bef9-77486e1a450e","resolution":{"observed_at":"2026-08-15T20:48:16.039140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:17.016927Z","title":"Marvelovd: Marrying object recognition and vision-language models for robust open-vocabulary object detection","venue":null,"work_id":"955c0c4e-15de-4da3-b152-9d4e3a178365","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.050031Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:8d3106f4654dc146e5a48ef4b3b363003cff91a4ed027eaf0292b785a7c13362","observation_id":"1d4f5561-1963-4097-8a5c-13ca50a36610","resolution":{"observed_at":"2026-08-15T20:48:17.023069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.997049Z","title":"Fashionvqa: A domain-specific visual question answering system","venue":null,"work_id":"f9e3be86-3bb0-4863-965a-c00a300377b1","year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.059553Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:a4d4b520a6c476c37c59d75ee5dceab414e44eea1e925f3595c620dd3a50839d","observation_id":"2a1795cc-d234-44ba-9259-e91f96f51404","resolution":{"observed_at":"2026-08-15T20:48:17.002072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.069768Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.069768Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:07f97db686280ba1be2d87021ac737d95f41f63eb353f1cc87b662a87b8e1855","observation_id":"ae314ba2-7d11-4713-9bc4-f20418aa3413","resolution":{"observed_at":"2026-08-15T20:48:16.069768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.969397Z","title":"Rl-vlm-f: reinforcement learning from vision language foundation model feedback","venue":null,"work_id":"c6444def-5ac3-400e-a692-728e3ae59267","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.075698Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:a50bad6459274c264200a91967f770afad773604b04d2437b90328a5badc4f9b","observation_id":"e9ba78d9-d7b9-4fdc-9969-9a291cf2c333","resolution":{"observed_at":"2026-08-15T20:48:16.974689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.950647Z","title":"Vary: Scaling up the vision vocabulary for large vision- language model","venue":null,"work_id":"78efb9e3-f1da-4823-8c1c-be358dbd7882","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.081522Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:9532a8cb371f284322a23be1b4ebe7c09d27da74b6a9e4431503ac3a095e7e00","observation_id":"f8610864-5872-44be-8ce8-29b904cb20d5","resolution":{"observed_at":"2026-08-15T20:48:16.956137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-15T13:28:02.644563Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09613","snapshot_observed_at":"2026-08-15T20:48:16.088460Z","title":"Pvc: Progressive visual token compression for unified image and video processing in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.088460Z"},"links":{"cited_paper":"/paper/2412.09613","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:9e3ee8fdd8ca0bd6c91ba5f059b464f3146bed22dac5793080972645c9bad195","observation_id":"31167906-34d2-4242-b1e7-f9d258976af0","resolution":{"observed_at":"2026-08-15T20:48:16.088460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.094655Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.094655Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:bf9dc57b4cf54e45d0ac038d80f0815f2290cb1a13fab1b16afd0716c225af3a","observation_id":"19fe73d8-5170-463b-81d9-29179927abc9","resolution":{"observed_at":"2026-08-15T20:48:16.094655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-15T20:48:16.099677Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.099677Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:a2b1083ad0f0bbafe07aa4682134f8d0d3747cc206cb03d9cc1a6b66db1ef3ac","observation_id":"3dce44ee-3c80-4486-8fa8-017cc21a1f7b","resolution":{"observed_at":"2026-08-15T20:48:16.099677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.924146Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"08dfe73f-36f6-43cd-871f-ee5e47de3aa6","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.104787Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:84aac745961ca0a53baede1b3ebd2efa3f9a5e26051b87ad49aa462433ac46ad","observation_id":"39af3fc9-e525-42ce-b7e7-76b20d873fbd","resolution":{"observed_at":"2026-08-15T20:48:16.930470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.905161Z","title":"Good at captioning bad at counting: Benchmarking gpt-4v on earth observation data","venue":null,"work_id":"eb4978d0-7eb0-4aeb-9a87-c50b47fb37cc","year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.110320Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:53406344770c58ccde4a6553a55244fd7a42e3480e174d1c52163f7a5b568eb3","observation_id":"c5d5a9a8-76c3-467a-ba48-ed8a6b1fbd4f","resolution":{"observed_at":"2026-08-15T20:48:16.911023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-17T07:14:12.508584Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-15T20:48:16.116057Z","title":"[cls] attention is all you need for training-free visual token pruning: Make vlm inference faster","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.116057Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:2dcd1365b0d61c52305f638ec291abb43c76454409ddec18f557ffd94877d667","observation_id":"5b262117-94e1-4ebc-a208-b54d27729888","resolution":{"observed_at":"2026-08-15T20:48:16.116057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.880075Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":"e12fd09e-0445-4da3-915b-cc863539c3d1","year":2025},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.122911Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:8741c999170daad9c1637b983cec76643436b8094d2f8a762f224dd59bdfa5a5","observation_id":"0e4b296a-43fb-4a93-82f4-ad1d4a8dabd1","resolution":{"observed_at":"2026-08-15T20:48:16.889049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:16.128579Z","title":"Minigpt-4: Enhanc- ing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.128579Z"},"links":{"citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:440a21035562db1c32635b39b48c0cea85475d20499c715ca69a02c10b3ff374","observation_id":"ec64c60e-2bcd-4618-af58-83360ab3a170","resolution":{"observed_at":"2026-08-15T20:48:16.128579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-08-13T13:07:22.672801Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14228","snapshot_observed_at":"2026-08-15T20:48:16.136813Z","title":"Focusllava: A coarse-to-fine approach for efficient and effective visual token compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:16.136813Z"},"links":{"cited_paper":"/paper/2411.14228","citing_paper":"/paper/2505.11945"},"observation_digest":"sha256:8b77cdd1830723add449c97bfba55a28717092cba6c94eb7ccbe2258fb2a4d11","observation_id":"bc6ac840-ab06-4b33-b0cd-7d4836c0c254","resolution":{"observed_at":"2026-08-15T20:48:16.136813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11945","last_updated":"2025-05-22T15:10:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T09:01:24.893140Z","submitted_at":"2025-05-17T10:22:29Z","title":"Top-Down Compression: Revisit Efficient Vision Token Projection for Visual Instruction Tuning"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 2 inbound Pith citation observations for arXiv:2505.11945."}