{"as_of":"2026-08-15T13:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22bed119329ae5473d306cc1758539fd1b66836d382cdd0d4bfaefe8d1d091d2","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:46:07.815623Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:18:00.869557Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T22:18:04.010679Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07138","snapshot_observed_at":"2026-08-07T05:18:00.869557Z","title":"Learning compact vision tokens for efficient large multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11120","last_updated":"2025-06-10T02:24:32Z","snapshot_observed_at":"2026-08-14T19:40:00.631851Z","submitted_at":"2025-06-10T02:24:32Z","title":"SDMPrune: Self-Distillation MLP Pruning for Efficient Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:18:00.869557Z"},"links":{"cited_paper":"/paper/2506.07138","citing_paper":"/paper/2506.11120"},"observation_digest":"sha256:60f81dcd5c3225343ab5459095d0d1b8750ef4eef2fc4b4372fef5e678b872fa","observation_id":"c71ed3b0-259e-4ab7-9df1-52cbaf754290","resolution":{"observed_at":"2026-08-07T05:18:00.869557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2506.07138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07138","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diversity-guided mlp reduc- tion for efficient large vision transformers","venue":null,"work_id":"5edd8a84-f66a-46b9-be7d-a5eefdbdeaf3","year":2025},"citing_paper":{"arxiv_id":"2603.27383","last_updated":"2026-04-10T19:04:13Z","snapshot_observed_at":"2026-08-11T14:39:01.939262Z","submitted_at":"2026-03-28T19:29:38Z","title":"Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-14T22:17:47.203589Z"},"links":{"cited_paper":"/paper/2506.07138","citing_paper":"/paper/2603.27383"},"observation_digest":"sha256:dc225b30472220ad36abbe1058efdfddcf842877d0b05ca42bd671dfac7b8923","observation_id":"cb49eef2-ff18-401d-a49c-9f8578789311","resolution":{"observed_at":"2026-05-14T22:18:04.014300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07138/citation-record","integrity":"/paper/2506.07138/integrity","json":"/paper/2506.07138/citation-record.json","paper":"/paper/2506.07138"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.221778Z","title":"Gpt-4 technical report","venue":null,"work_id":"9b0de995-ed65-4f5a-82cf-243b590eab04","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.693148Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:299861657d186400f32bb3e1f5b6e92de5051304ee0848f76875baa59055aad5","observation_id":"51da7a16-600f-4cdb-aa5e-df1301accd5a","resolution":{"observed_at":"2026-08-07T05:46:08.224549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.213003Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"0063dfe6-18a2-469e-b6f7-3012b2136bca","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.696975Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:8df78dfad8d11e2b8b0dd8159275edd651d4547f8fe4de5052eecc89060531b5","observation_id":"242480fd-5e69-4532-937f-d1e28933de3d","resolution":{"observed_at":"2026-08-07T05:46:08.216143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.203935Z","title":"Llavolta: Efficient multi-modal models via stage-wise visual context compression","venue":null,"work_id":"d7058bce-a9a4-49b5-b200-5e358600a345","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.700136Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:ec3fe89c7da37763d62dd8ef72910d0f545249a09371752fff80d36112243746","observation_id":"47b7ccb5-ecec-4232-aa66-fdd0e4a612cf","resolution":{"observed_at":"2026-08-07T05:46:08.207041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.194792Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"2380e224-b8c6-4198-97c1-99c7ae81e787","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.703600Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:8c9adc5b57eb25b5ae66c1b6cf75f87ddc7d57bf5523e6cf7bfdaa39ccebe49e","observation_id":"801ecf1d-d2b5-4ccb-8796-7d3024829c01","resolution":{"observed_at":"2026-08-07T05:46:08.197947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.185623Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, march 2023","venue":null,"work_id":"bd334dd5-aca6-4fad-a9e8-9dea0185873f","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.706893Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:6d48e3457f7c024c058897a0a184f84473c03f7d61ebd8ca6657c325ffa22a07","observation_id":"a5725ba3-bb26-4992-8729-7bca59097c77","resolution":{"observed_at":"2026-08-07T05:46:08.188962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.176549Z","title":"Funnel-transformer: Filtering out sequential redundancy for efficient language processing.NeurIPS, 33:4271–4282, 2020","venue":null,"work_id":"37702bd7-a63d-4672-840f-61f8703dff06","year":2020},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.710429Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:f015da2be8586dd83205d848af479dbb088e828fd432f8eef98c0eb058287a31","observation_id":"2daf0eb1-0da0-4355-a70c-aa749f051295","resolution":{"observed_at":"2026-08-07T05:46:08.179814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.167149Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"b4ef4e86-bc79-42de-aff4-caf2330fdb72","year":2020},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.713930Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:39422e146fc7fa003d509ab6e8ceb9c98fa2327684768353a81fbadbaf9c4e8a","observation_id":"7bd3348e-dfab-4b74-9a06-0e3d3a1b3da2","resolution":{"observed_at":"2026-08-07T05:46:08.170478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.157594Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"9de2407e-77e4-4b64-8e2a-52564ae2f079","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.717719Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:259b7f2c94de6fc67b6a5f996c20d3978ca22aa2dc203b9c1790f491f8154366","observation_id":"daba7e17-70db-4bb9-bec1-7ae646e68133","resolution":{"observed_at":"2026-08-07T05:46:08.160697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.148800Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":"9365c8db-9e10-46c7-a06e-54d329f6eca3","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.720813Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:0c58aa1847e925f6ce88345c787d586c19ee4cf396e27fac48158d17e353eb19","observation_id":"d92b89d5-1e62-425e-b63f-2aa2053392e7","resolution":{"observed_at":"2026-08-07T05:46:08.151659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.139629Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"d896f202-024e-4864-9d3c-f59f3b30bc7e","year":2017},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.726782Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:4fcbbe88cfa5ba01b06f1c7601796fd65be4770dc704b9d93fddc820c43155a9","observation_id":"aca5367f-5d25-4ca1-a0fe-0fd6e65d4311","resolution":{"observed_at":"2026-08-07T05:46:08.142867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.130634Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":"d905ff13-a70a-4153-a6b5-eb02d17d73e4","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.730088Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:18d0b013987d25d02144db2aa48dd3ab2ccd086bb8656a7f452bd7d179c63028","observation_id":"d5bca0a3-8e1d-4418-af6a-33bd85c37fc3","resolution":{"observed_at":"2026-08-07T05:46:08.133673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.121921Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"c45a2b85-c456-4f24-9515-9291ceba014a","year":2018},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.732964Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:ca78e905ada074a7054059309b9702696200fbf6c57d368028d7838ac1715512","observation_id":"8e06c92b-03c3-444c-a377-47214adbdf06","resolution":{"observed_at":"2026-08-07T05:46:08.124924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.111511Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"dd944782-0056-41c6-9c72-0544babe7977","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.735580Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:feb2cb41df43e6c7211697bf7755349b540b75d7f96e7cc6a11aebcbec30744d","observation_id":"4769ae5f-cd76-453f-bbed-d41799705769","resolution":{"observed_at":"2026-08-07T05:46:08.115256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T05:46:07.738326Z","title":"Gaussian error linear units (gelus).arXiv preprint arXiv:1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.738326Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:ace675705d314e90e79c911075ff0f290ad2935d432dad259ecc3a50a143bcf5","observation_id":"bfaac42d-eeec-4e09-8532-e67ba4abd52b","resolution":{"observed_at":"2026-08-07T05:46:07.738326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.100928Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"5a10755f-26a7-4814-b436-b7c59dea54e0","year":2019},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.741473Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:334becccbf7c5e5736b0f4eb86d62439cf6ababa752a2224359d9a203027a028","observation_id":"e66b3781-7f0e-48ba-ac60-57e40cc8b359","resolution":{"observed_at":"2026-08-07T05:46:08.104245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.090994Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"8cd6e62c-4a3a-468f-aee4-0a35b82ef85e","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.744103Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:073de03300d4043ccd612eeee0a82de789bb614f4c203ef62e6783451cd9b685","observation_id":"950b0f9c-fc84-421f-8560-abb520e05b58","resolution":{"observed_at":"2026-08-07T05:46:08.094345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.080607Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":"685bb769-02e7-4d32-af0a-58b18207540c","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.746877Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:44d88651e8effc3ec6699e88aadc52bb959de0f06fc2eebb75b1bede125ff92b","observation_id":"e73ff6e0-9ac9-4781-8b96-d51dee059a30","resolution":{"observed_at":"2026-08-07T05:46:08.083761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.070186Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":"f1dea1b6-4f2c-41ba-b5c1-21f32183fbd2","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.749749Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:9a4a2d5ba4d78f7f8dbfb54b5d3e57a8f2b497c4321e8d4e453dc6368ed895f8","observation_id":"e7917c06-20eb-4107-8422-23d6d2c4e03a","resolution":{"observed_at":"2026-08-07T05:46:08.073771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.059706Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"ece6fa54-2f7e-45fd-8b7a-54cdaaf215ca","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.752764Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:491c53f8471484804fb7f74e4f879296100b8c2fc6172071ad3ef14b24e7cba1","observation_id":"b47089e5-752d-45e9-b401-9ac7e88e70e1","resolution":{"observed_at":"2026-08-07T05:46:08.063681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.755519Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.755519Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:db351437e73b1024aac21e682aa6e4ac82de5490581a6ed96cbd75f68bdf3601","observation_id":"09630c67-f9b0-4bd9-bca4-aae99b6e66cf","resolution":{"observed_at":"2026-08-07T05:46:07.755519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.758411Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.758411Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:31d7e8e81a2e6f7b58b633d0fd5546dbfe8e361f1cd6195c69818847f91fe51e","observation_id":"d5b7854e-9639-456f-b092-1c9da409e187","resolution":{"observed_at":"2026-08-07T05:46:07.758411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.036313Z","title":"Mmbench: Is your multi-modal model an all-around player? In ECCV, pages 216–233, 2024","venue":null,"work_id":"75295b15-276e-49db-8d68-e75aa29dc1d9","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.761374Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:f1ff79d9616390f3ee77ac356e8f4b312b3045a86228295fe296f78365632afc","observation_id":"3230107c-e0a4-43c6-a16d-116a70d0056b","resolution":{"observed_at":"2026-08-07T05:46:08.039655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.026307Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.NeurIPS, 35:2507–2521, 2022","venue":null,"work_id":"9572d12f-d4c8-4fc7-8513-37b9ebd134a1","year":2022},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.763943Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:3fd25f6e0370370926bd86614c5c5e2b1471f54c8d3e677af614b80b7d566995","observation_id":"f77dbf56-8bcc-49c9-b43f-de9eea84a03a","resolution":{"observed_at":"2026-08-07T05:46:08.029686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.015871Z","title":"Are sixteen heads really better than one? 32, 2019","venue":null,"work_id":"b01efa5d-00e2-4ab6-b5d3-7264c4cf2ca3","year":2019},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.766796Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:82279d56d0b68155c6f3c71de368207dc737f3c82d83c84626f43271f157ee91","observation_id":"c35a9f06-369b-4659-9e0d-b75570a45183","resolution":{"observed_at":"2026-08-07T05:46:08.019633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:08.005726Z","title":"Efficient transformers with dynamic token pooling","venue":null,"work_id":"1e9940eb-a92b-4478-9ecc-f750eaf9bc71","year":2022},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.769515Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:cb04bd4a886d704668b59fe9860d42aca67db53c6dd83e4e4fc31a4c94dd0d9e","observation_id":"a5937e6c-aeca-4516-acf9-e22563477cc9","resolution":{"observed_at":"2026-08-07T05:46:08.009085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.772408Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.772408Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:1bf04ae8009af513bb55f65239a285220edf90cbe0de663e4bbdbb9dd6c937a6","observation_id":"1974f68b-547a-4176-ac2b-2e6379512855","resolution":{"observed_at":"2026-08-07T05:46:07.772408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.775586Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.775586Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:1812220acd14235f79b985e29d631e8564dfe781a3da979f3f653923daf5e005","observation_id":"65373317-e8cd-4802-be78-97e2c620473b","resolution":{"observed_at":"2026-08-07T05:46:07.775586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.981776Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"2be491a7-9812-4688-b053-7d7f0865b5d0","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.778748Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:9e6d9717368b2d3afe698ca4b1262e3af6f54e2c03a0ea50bfd33e968ffa97e9","observation_id":"6c900fbc-8a38-45fb-8e84-9bc63e91248f","resolution":{"observed_at":"2026-08-07T05:46:07.985357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12243","last_updated":"2023-06-29T12:14:59Z","snapshot_observed_at":"2026-08-13T11:12:37.853359Z","submitted_at":"2023-06-21T13:03:47Z","title":"Inter-Instance Similarity Modeling for Contrastive Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12243","snapshot_observed_at":"2026-08-07T05:46:07.781803Z","title":"Inter-instance similarity modeling for contrastive learning.arXiv preprint arXiv:2306.12243, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.781803Z"},"links":{"cited_paper":"/paper/2306.12243","citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:64204713f011fbf45953d757d4028e488514b166485f5abf51dbe0d9cc4e684b","observation_id":"34caa49b-be5c-4abe-ac0b-bb8a93e3d73a","resolution":{"observed_at":"2026-08-07T05:46:07.781803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.785130Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.785130Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:7708466a5a4a4a05273d8d1ad7cf8fb8d5924dd2e413e366645bc3e642e7e07f","observation_id":"9472e061-3934-41ec-b802-547a485a9f57","resolution":{"observed_at":"2026-08-07T05:46:07.785130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.965695Z","title":"Data-efficient multi-scale fusion vision transformer.Pattern Recognition, 161:111305, 2025","venue":null,"work_id":"6d6d34ce-c2d1-4472-9dc6-36516156d6a9","year":2025},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.787948Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:47b0fb03acf5ebf127092a7925511b5eeee22aaa83b389c3abcebef4abe5c0e9","observation_id":"bcd25046-4cd4-4547-bf4a-a9afc2d8984d","resolution":{"observed_at":"2026-08-07T05:46:07.969118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.956334Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":"1138fd98-e3d7-47fa-bf82-2235917433ae","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.790822Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:1bf1a0992c23ee39a3749022338687f4b05ea5c39ef2a52be92fd4d70ab14fba","observation_id":"1e4993ce-e0cb-48f2-82c4-8bb6a410038d","resolution":{"observed_at":"2026-08-07T05:46:07.959421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.946541Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":"92f5b85e-a065-4801-a99d-4c6a032f6adf","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.793639Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:15db3bd1b11b977f7173ce9858c05a729c98fe86968fa04b781a3f0a94df0d43","observation_id":"39e2a535-6473-4740-b768-40ed8d323bdc","resolution":{"observed_at":"2026-08-07T05:46:07.949990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.796342Z","title":"Attention is all you need.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.796342Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:8daac53973d805526d19211078ca2a2f35247e2f076ec67031fa400d8922f53e","observation_id":"e5e1a986-84f4-4c31-9c98-24dd65ce52d2","resolution":{"observed_at":"2026-08-07T05:46:07.796342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.929136Z","title":"Calflops: A flops and params calculate tool for neural networks in pytorch framework, 2023","venue":null,"work_id":"44688ae6-cadf-4541-b434-bc4659a6737e","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.799344Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:dce60da81dd8a2e13dafaa86cfc81c3a810cd0d14d3d3bc31d94d1c5332f8754","observation_id":"1aec081c-b095-4e6d-82fb-aba3f29c9209","resolution":{"observed_at":"2026-08-07T05:46:07.932441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.917993Z","title":"Texthawk: Exploring efficient fine-grained perception of multimodal large language models","venue":null,"work_id":"c3dce0e9-b804-46fa-8ae3-73126e24f51a","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.802200Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:ffc1ad7ddd1f9839b49a01baca9fbb01d93d0f4597cc1abe9a3707a4181e9161","observation_id":"20d354e2-bcc9-4296-84ce-84320e6d704f","resolution":{"observed_at":"2026-08-07T05:46:07.921814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.907655Z","title":"Vcc: scaling transformers to 128k tokens or more by prioritizing important tokens.NeurIPS, 36:20260–20286, 2023","venue":null,"work_id":"04aa51e2-da5b-4136-ae7c-76f576a77301","year":2023},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.804847Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:4ef5d2260e53d1b3b699b27dd582865809f0e4ae665668a4b20b9b02cc805e61","observation_id":"9f0b0680-df8c-4f28-beba-fce3e75b9e52","resolution":{"observed_at":"2026-08-07T05:46:07.911031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.897453Z","title":"Tinychart: Efficient chart understanding with visual token merging and program-of-thoughts learning","venue":null,"work_id":"f2d1315f-7530-4956-929b-f569edc722d1","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.807634Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:5c644e7ed2cbc6409e3cd94c41afcbecbb86c6a261450bb95249996d69592655","observation_id":"e8199289-00c0-46d1-8199-3dfd759be749","resolution":{"observed_at":"2026-08-07T05:46:07.901187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.886293Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token","venue":null,"work_id":"e76e4a8f-8383-4149-8b44-9c019e8313a9","year":2025},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.810330Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:18c33741f6cc462726c35731c503e89e36449ebaf78936ea552923ceb30d2f26","observation_id":"45577e7b-f0ee-4765-8fb5-8d49e649f5e2","resolution":{"observed_at":"2026-08-07T05:46:07.889734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.875393Z","title":"Diversifying the expert knowledge for task-agnostic pruning in sparse mixture-of-experts","venue":null,"work_id":"974ed699-1e88-497a-8643-0bb5d46dab60","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.812915Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:49906b23bcadb216df5b9516d15a1fb91c3807605a240c88a85e48914fb29a1e","observation_id":"a8f7b169-0b02-4f72-a8ee-6909f489d59f","resolution":{"observed_at":"2026-08-07T05:46:07.879090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:46:07.861910Z","title":"Treat visual tokens as text? but your mllm only needs fewer efforts to see","venue":null,"work_id":"ba7cc3e3-5b86-4876-8205-784ed9b26054","year":2024},"citing_paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:46:07.815623Z"},"links":{"citing_paper":"/paper/2506.07138"},"observation_digest":"sha256:7dd31d8adbfe07841640d4a382fa8fccfdfbd117ecc24cf3960be5ea66272bb1","observation_id":"a30af405-ec88-473f-a549-af8c0623ceb9","resolution":{"observed_at":"2026-08-07T05:46:07.867788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07138","last_updated":"2025-06-08T13:36:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:39:00.952778Z","submitted_at":"2025-06-08T13:36:06Z","title":"Learning Compact Vision Tokens for Efficient Large Multimodal Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2506.07138."}