{"as_of":"2026-08-12T12:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dafd8dcf13856561184a5a2d1cba1eb2302bfcae7b7fa232a08b53c17091cda9","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:37:08.457373Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:40:05.730181Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:16:15.637500Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"cited_work":{"arxiv_id":"2412.04317","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04317","snapshot_observed_at":"2026-07-01T22:16:15.637500Z","title":"FlashSloth: Lightning multimodal large language models via embedded visual compression","venue":null,"work_id":"975da055-ceb8-4f94-b7cf-7622f3efaa01","year":null},"citing_paper":{"arxiv_id":"2606.02842","last_updated":"2026-06-01T20:06:50Z","snapshot_observed_at":"2026-08-02T06:55:51.435821Z","submitted_at":"2026-06-01T20:06:50Z","title":"Spectral-Progressive Thought Flow for Lightweight Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:40:05.730181Z"},"links":{"cited_paper":"/paper/2412.04317","citing_paper":"/paper/2606.02842"},"observation_digest":"sha256:e409879f61024d48f3807fb5950b473ff09fae6f87775db0fac4299e888de6ab","observation_id":"a4d841cc-d0f7-44db-9149-201bb63d1284","resolution":{"observed_at":"2026-07-01T22:16:15.639326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04317/citation-record","integrity":"/paper/2412.04317/integrity","json":"/paper/2412.04317/citation-record.json","paper":"/paper/2412.04317"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T21:37:08.227561Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.227561Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:22c059372aad8a5b52c56d2cb83336cd52575f044ddf92e48bd88845e1dc5709","observation_id":"b8a476c1-9b94-4994-8048-469c0fea17c3","resolution":{"observed_at":"2026-08-11T21:37:08.227561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.231500Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.231500Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:48a3cf199fe0e5759502fe95fed517e0c8913d16f6c1f383bc2a394f9a8e50f2","observation_id":"630a6798-b520-4f35-bebb-085cdcd1846f","resolution":{"observed_at":"2026-08-11T21:37:08.231500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T21:37:08.234380Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.234380Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:acb222f168b4598a39b19b22fdf05f3a9f60e8bde3702ac6c51a241ce276a7db","observation_id":"7153172c-ea37-4214-8c96-4f76675d4715","resolution":{"observed_at":"2026-08-11T21:37:08.234380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.237958Z","title":"Gemma: Introducing new state-of-the-art open models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.237958Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:58b4f5b1e8c7b91465b3d7849cfc05c3b2bd579b437d00f2cc61be24937efb9a","observation_id":"1bbea82d-0bf0-4f1b-98f7-05fb89259d53","resolution":{"observed_at":"2026-08-11T21:37:08.237958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.240691Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.240691Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:3bfce833f0a399d41ed34c1e621848049ead48394c461b1bf68f5c5e967e175f","observation_id":"48487edc-c0c6-4e0c-9400-a6d7a23f3fca","resolution":{"observed_at":"2026-08-11T21:37:08.240691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.243430Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.243430Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:48212d285963234f71c37adf8e540de6a5f5ee6bc7959b836e2989a4a09b7f7b","observation_id":"997d8738-1bd1-4fd5-9852-7e9055b7c5f3","resolution":{"observed_at":"2026-08-11T21:37:08.243430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-11T21:37:08.246133Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference ac- celeration for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.246133Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c27f3de0126492dc254888cebe3ba1116717c9f1cdd662d9b1130feac7847425","observation_id":"c5ce3a98-1b80-4e69-8f83-431aa4261138","resolution":{"observed_at":"2026-08-11T21:37:08.246133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.249780Z","title":"Lawrence Zit- nick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.249780Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:44879cffb94ca76a61fe32d8eb62e25d487c3402fada68c5580822f9ab2fa368","observation_id":"a2f7a125-3085-4c86-8b39-27d816b7fb04","resolution":{"observed_at":"2026-08-11T21:37:08.249780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T21:37:08.252944Z","title":"Pali: A jointly- scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.252944Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:cd2b57f5f1592d1d163e196e199e216ea4275be0c5494242e05bb60ef6e9813a","observation_id":"25bd50ef-cdc9-4fcf-95db-4c4bdd09e788","resolution":{"observed_at":"2026-08-11T21:37:08.252944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.256084Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open- source suites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.256084Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:3a7258d28d7d9a80d2b524b1d86d9bdcc0ed86d013891edfc05dacae8b7c01f9","observation_id":"4da9f6f9-2f64-4a7e-bc1e-72e72a807aee","resolution":{"observed_at":"2026-08-11T21:37:08.256084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-11T21:37:08.258655Z","title":"Mobilevlm: A fast, strong and open vi- sion language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.258655Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:9b24a6d9080fbed67da039454b04b42299d2135ae6e775c791c41417123872a2","observation_id":"5dffd154-db90-4c29-a3ad-c7e60474eb54","resolution":{"observed_at":"2026-08-11T21:37:08.258655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-08-11T21:37:08.261489Z","title":"Mobilevlm v2: Faster and stronger baseline for vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.261489Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:55f61d6f57fe9256e68d7164bda8038842c2766af8494cabac1d3c07e35e1745","observation_id":"2cfabdcd-b567-4d75-9956-05574f714485","resolution":{"observed_at":"2026-08-11T21:37:08.261489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.264453Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.264453Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:7559e3797b4d8681b2439ff09a1fad4bd3f526103a1762dff5498db63ea7b006","observation_id":"9544fdc1-b620-420f-9a3f-199c7d42de2d","resolution":{"observed_at":"2026-08-11T21:37:08.264453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:09.004805Z","title":"Mme: A compre- 9 hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"e56a7c94-7f42-41d0-8a60-c20efc7c33b9","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.267203Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ae006f00d9c7843cae818f4608d58e715ce75d12891970106ec75882e2a8e9ea","observation_id":"402e63c1-ce06-472d-b65b-62a8131ba07d","resolution":{"observed_at":"2026-08-11T21:37:09.007536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.997379Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"bfb8a9dd-e9f8-464f-aebf-d31b604dd399","year":2017},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.269857Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ff9222fe538c316a96bf860a24a7ffbc8d0c406695e1b35ac419e7de0950b026","observation_id":"2e3c46bf-2041-457c-a0a3-71607bc6ddfc","resolution":{"observed_at":"2026-08-11T21:37:09.000272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.990058Z","title":"Minicpm: Un- veiling the potential of small language models with scalable training strategies, 2024","venue":null,"work_id":"7eb361be-5f01-45b3-9663-a3d788765eed","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.272901Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:41393a469189bc8d307a0414f715b5b0097aa91a24bb15edf895cee5b023e605","observation_id":"527398e0-0bf9-48a6-a377-b88a7d565e53","resolution":{"observed_at":"2026-08-11T21:37:08.992917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T21:37:08.275372Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.275372Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:58a0b299631483f76e1b2783e2eea1d16f9ad464fcf42d6637b3fc20491b76b9","observation_id":"eab121c9-2d36-4c35-a170-f3587b65e6eb","resolution":{"observed_at":"2026-08-11T21:37:08.275372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.982204Z","title":"Token merging for training- free semantic binding in text-to-image synthesis, 2024","venue":null,"work_id":"0868355a-92c5-4301-a008-5493be2a1254","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.278335Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:cefb11b52dfc5fa2d33d00838750f8d96511c78c72704d67e4ded63b7389c729","observation_id":"6f0c000c-631d-492c-97a2-2c3ead4dec59","resolution":{"observed_at":"2026-08-11T21:37:08.985333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.974496Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"454de97e-8f00-416c-af6e-e9a4db2cbf75","year":2019},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.280814Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:2789aa6a8470d7531e8a2319b296c5fd119c48051ac4782e2c9e55f05e36a40b","observation_id":"dc1890a4-bb9d-4e1a-bc26-0cbe64f298a1","resolution":{"observed_at":"2026-08-11T21:37:08.977404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.966863Z","title":"Phi-2: The surprising power of small language models","venue":null,"work_id":"90add1d2-468a-45b6-b129-7bfc3acf60df","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.283336Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c2ccae7a148caed1301b45100c9187593979bef79d75e202bb86409ce35b5f19","observation_id":"e149fc0b-b43f-464a-b106-f780aadeb0cb","resolution":{"observed_at":"2026-08-11T21:37:08.969681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.959480Z","title":"In defense of grid features for visual question answering","venue":null,"work_id":"65409f93-2574-4007-a1c4-d6ef5cd4d4d2","year":2020},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.285778Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:caf0b51e0862107ba1e0bc012153285a7fc3592e5214d065fd9e2e7f288b90f9","observation_id":"5200a819-4edd-424e-bdc8-2efbd06283bb","resolution":{"observed_at":"2026-08-11T21:37:08.962265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.952036Z","title":"Contrast and classify: Training robust vqa models","venue":null,"work_id":"e3cdefc6-6574-4401-a66d-3536be95a12b","year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.288247Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:396cdcc759d43fcd81c0ffe8113e5d6c7d20396fe4c49d4c0d0a15e90aa3e93e","observation_id":"2f69eca5-7024-437d-b957-f3d20f9fb4be","resolution":{"observed_at":"2026-08-11T21:37:08.955006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.944545Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"105cc2e7-71f3-4d88-890f-5d03b05e068a","year":2014},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.290817Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:3c4c1557309680b7f9cdd1ad5be82ca6c0dcb9c31998a20a6c14d4dc9706dbed","observation_id":"295cde2f-b1d4-433a-9d22-a4aa1aad5b48","resolution":{"observed_at":"2026-08-11T21:37:08.947365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.293615Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.293615Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b12b4d30065237340b23516e5b2b1a0ab22ad82f39d174b17e02044b4eb892dd","observation_id":"14175937-1d25-4def-9bdb-51590fdf9c75","resolution":{"observed_at":"2026-08-11T21:37:08.293615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.933287Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":"959feec8-db03-45eb-b057-40664306b381","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.296242Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:6b1dbf759004db743ecc7320eee6691032b5e5521c32ddab449590262b7d2c25","observation_id":"19186a00-6f9d-426d-a3ce-03d6c2c877e0","resolution":{"observed_at":"2026-08-11T21:37:08.936399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T21:37:08.299006Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.299006Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f29bb670d186a4e81d4de3a89a3bdd4bb7f196b8a10953aba8da56556178a862","observation_id":"6fb39a02-0e10-4c36-befe-608ae9bd53d9","resolution":{"observed_at":"2026-08-11T21:37:08.299006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.301741Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.301741Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:71546cb8c3dc014096fd67e1f74e85d52c496c11faf4faeda8cc58ea8e4bdf17","observation_id":"f294ee1a-9caf-4144-95ce-b22068d88a12","resolution":{"observed_at":"2026-08-11T21:37:08.301741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.922134Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"19f66c41-f1c4-4158-aa9e-69ee64808a73","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.304194Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:255aaea1816b1c916acdf54cb1a7ca75161025816aac8a02354dd8578cc96dde","observation_id":"d3339ae5-77eb-42b9-97b5-e22a2112aad6","resolution":{"observed_at":"2026-08-11T21:37:08.924912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-11T21:37:08.306619Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.306619Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:895be6987aab85c7f4ea1f189d2cf1d16f3de11775a84fef99295fe473a88734","observation_id":"64483dff-5527-4c2b-ba48-8dfb8a2a7b10","resolution":{"observed_at":"2026-08-11T21:37:08.306619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.914485Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"4cb37dd5-069a-4168-b020-37f3c7d1e2e6","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.309221Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ec236b98986300ea456e086543afefae3d8e12e2903bb0d42c9501ee3ca55a55","observation_id":"d0e2b9f2-4dee-4358-9153-54d800348272","resolution":{"observed_at":"2026-08-11T21:37:08.917574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-11T21:37:08.311714Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.311714Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:8d035feeedc9c45861c90296246ea63cde6297234d2c4057327c1a9c7bc4723e","observation_id":"be65e829-2862-4674-a628-60aeec5efeb0","resolution":{"observed_at":"2026-08-11T21:37:08.311714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.906791Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"d215fa07-bed3-4240-ba88-a1548f253613","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.314473Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b67f61f52b5c73d8a29c65cf69ff5aaaba0ff97070921a5e691dcd1cff4513e2","observation_id":"6ec3cd88-490d-46c8-b9b7-102a66d57b8f","resolution":{"observed_at":"2026-08-11T21:37:08.909721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.899462Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"f48771b2-b542-4edf-a5be-3a0b82cd19dd","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.317072Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:a594dcac5dc2719555d5d3fa5c7a5ef9633c6c3895421a704a1fb98b503189a5","observation_id":"1a3aeb31-8b46-455b-aa92-cc18366b8b84","resolution":{"observed_at":"2026-08-11T21:37:08.902388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.891430Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"fe1d73fa-b897-4f6f-98dd-4858a255c2f4","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.319771Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:afb24f12d3ca48539568bde23a9013f1c7ff93c9383f9daded87863b23c3b8ad","observation_id":"e5c29df2-6b30-4368-b898-6e8415d2ca4f","resolution":{"observed_at":"2026-08-11T21:37:08.894198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.882630Z","title":"Visual instruction tuning","venue":null,"work_id":"b87a0127-5334-45cf-b14a-915de3ecb317","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.322118Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f712815ecc5f373e2522cf8d043506f6f21a7b901464446eb8e0756b4947a2a5","observation_id":"b77bb695-f88d-4844-aa9e-2d08401f8d9f","resolution":{"observed_at":"2026-08-11T21:37:08.885784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.874164Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"9b8ac3b9-0778-4307-b3ac-8620bc9ea40c","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.324392Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:93a2953c04f9798c5b23f72da767c1a9859155f59ee00d53948ee488fc7bbd85","observation_id":"8e6abf79-d0d5-4d55-a27f-6f3591ac9396","resolution":{"observed_at":"2026-08-11T21:37:08.877386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T21:37:08.326784Z","title":"Fixing weight decay regularization in adam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.326784Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:1697fe07e94c9a3eed86c8fda3a16d64d40efd99c6b38b86c81807a3e06b8c96","observation_id":"4effb140-fbb8-4d2c-943c-6b91af32192d","resolution":{"observed_at":"2026-08-11T21:37:08.326784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T21:37:08.329705Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.329705Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:53097c56538f5cfbe72e6c01413f7000c75acd1da9d68a243fe69ec6a9644a6e","observation_id":"26d39eb5-e572-43be-ad1b-f553186cd52e","resolution":{"observed_at":"2026-08-11T21:37:08.329705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.332592Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.332592Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:4ab77dfa82b74a198b769f63cf487ef6d5815121fc46ee15d2ecfe5673ebd0d0","observation_id":"ab43a5b8-737a-4264-a66a-835219ebd03b","resolution":{"observed_at":"2026-08-11T21:37:08.332592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T21:37:08.335366Z","title":"Mathvista: Evaluating mathemat- ical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.335366Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:d4d3d35051d1da817f08068f803c92d00c08267868475ae2de7c945537a96dd6","observation_id":"72c5abab-e79f-4606-9c23-25d0eb12da07","resolution":{"observed_at":"2026-08-11T21:37:08.335366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.862182Z","title":"To- wards lightweight transformer via group-wise transforma- tion for vision-and-language tasks","venue":null,"work_id":"eeca2cd1-046c-4a3e-861c-bc9aac4b1e1f","year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.338155Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ed945f11c76ecc34dc37c45e74310274348e38b0a5951ea715609bbe222a6062","observation_id":"7327ee58-e4d1-4ef8-ac14-950aa62dff77","resolution":{"observed_at":"2026-08-11T21:37:08.865032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.854454Z","title":"Cheap and quick: Efficient vision- language instruction tuning for large language models","venue":null,"work_id":"0d11b4e5-ccf9-44a4-a8e5-a22ca83b0254","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.341165Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5d9a405e38ea1c92ff5aeb50e486032854d2ad78edc7e15d11442f090fe704f7","observation_id":"f496d380-de84-48cd-9559-242a5d46327a","resolution":{"observed_at":"2026-08-11T21:37:08.857341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.343738Z","title":"Moil: Momentum imita- tion learning for efficient vision-language adaptation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.343738Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:9c7b86593dfb81c16da128d57cfd4537069ec3bd81161c67b23ddb971d41384b","observation_id":"f99125b1-42d1-4b03-b293-14644c5b97a5","resolution":{"observed_at":"2026-08-11T21:37:08.343738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.843071Z","title":"Towards language-guided visual recog- nition via dynamic convolutions","venue":null,"work_id":"48f1706f-f32c-42d6-a4af-0f26c6384d2b","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.346149Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b8968d8d6e65d709b94f5d6b91c6c1e5e7d0d88da776dd4b291064427c998298","observation_id":"c9fbdc75-f9fc-4890-b09e-5eb04d28568a","resolution":{"observed_at":"2026-08-11T21:37:08.845990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-10T11:40:09.342794Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-11T21:37:08.348453Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.348453Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:15c4f9fa03208c2c29db3219e1eea7a75f8f7b12a5a20a2ba715f63d6ee5c842","observation_id":"a0e638c8-4f5a-4ed1-ba4a-15faa67b0baf","resolution":{"observed_at":"2026-08-11T21:37:08.348453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.834873Z","title":"Chartqa: A benchmark for question answer- ing about charts with visual and logical reasoning, 2022","venue":null,"work_id":"39e62f3e-e28b-4c25-b82c-970567c3d5cc","year":2022},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.351277Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:098718079ce8a155816820807170a6a841042a606f40c932c0d77ccc89a25447","observation_id":"8e27a5ca-7e74-46f2-ae78-61ad377c1b7f","resolution":{"observed_at":"2026-08-11T21:37:08.838006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.826803Z","title":null,"venue":null,"work_id":"05dae5c9-3595-49b9-8b41-f68bfb4d628c","year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.353618Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:87cf9fbf2208324e0afc21b4bbb169b4de4a91d53f0c7c47777ee6b62144d508","observation_id":"b94b76ec-e7bd-4786-92b9-4028b6f44007","resolution":{"observed_at":"2026-08-11T21:37:08.829927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T21:37:08.356012Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.356012Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:200ead9d72f354cebb18724d6bf1faf8b38fe12b23a130eb41569e1e066bc496","observation_id":"0cc2e6e6-aab0-40db-b992-db6c012216f2","resolution":{"observed_at":"2026-08-11T21:37:08.356012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.358592Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.358592Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:df2ebae95a36a6cadee0104e7689f94348e7be0070e1582ef281725f9173896f","observation_id":"208567de-d3f6-45da-9e74-a99002bd76a9","resolution":{"observed_at":"2026-08-11T21:37:08.358592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.361676Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.361676Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:4ecbc19a51a83d4a1748cfeb155897bf59bea4896532d02062d1cfb721e66419","observation_id":"f54f0555-8992-441c-8355-7a9e7a0297b2","resolution":{"observed_at":"2026-08-11T21:37:08.361676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12107","last_updated":"2024-05-30T02:47:10Z","snapshot_observed_at":"2026-08-11T12:22:25.536240Z","submitted_at":"2024-05-20T15:23:19Z","title":"Imp: Highly Capable Large Multimodal Models for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12107","snapshot_observed_at":"2026-08-11T21:37:08.364232Z","title":"Imp: Highly capable large multimodal models for mobile devices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.364232Z"},"links":{"cited_paper":"/paper/2405.12107","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:ebe5b59b75d1ed94964a402eee1c46b08a406b4000b22c9b04172b9b183dd42c","observation_id":"f09e7d82-b271-4736-aea6-4599f8fcc571","resolution":{"observed_at":"2026-08-11T21:37:08.364232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.810170Z","title":"When do we not need larger vision models?, 2024","venue":null,"work_id":"f48f7646-d22c-4d36-80ab-8b502536e91b","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.367027Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:2ea50507e2e27195ede63da8522f9068ee7889893c28269db6a24fff4ba84b1b","observation_id":"873ba2fe-e190-4711-860f-6bf6827ed107","resolution":{"observed_at":"2026-08-11T21:37:08.812922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-07-06T19:07:16.252072Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-11T21:37:08.369438Z","title":"Eagle: Ex- ploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.369438Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:2474a3d96ed90a684e1db5327159d30b5a414a90c5b775bb28af685780503429","observation_id":"16054fb2-0a0c-4f1b-8662-43a7cd5815a4","resolution":{"observed_at":"2026-08-11T21:37:08.369438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.802678Z","title":"Towards vqa models that can read","venue":null,"work_id":"880f86ae-296b-4e40-a9ef-b7f387a70880","year":2019},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.372029Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:7f331972fdfe48a8a276e9cd27df1035fe44dfa3f5b9b39e353a66fcc2683b46","observation_id":"60bbf9ad-f9a3-4482-b029-b3826a42ba27","resolution":{"observed_at":"2026-08-11T21:37:08.805615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T21:37:08.374548Z","title":"Gemma: Open models based on gemini research and tech- nology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.374548Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:78c161fc393926412b920da41ef673a1349014d7852eb31c840e92f376f2f25c","observation_id":"32e1e7cc-c75c-48c7-bf92-4d50e1954a75","resolution":{"observed_at":"2026-08-11T21:37:08.374548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T21:37:08.377247Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.377247Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:fa0e43b3def8326d2e348cdfd330780f2adc78e37eb857e79a6d7c7b482401e8","observation_id":"92d80c96-c396-4a7f-8abc-a8b4742a2691","resolution":{"observed_at":"2026-08-11T21:37:08.377247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08962","last_updated":"2019-09-25T22:55:20Z","snapshot_observed_at":"2026-08-10T01:19:36.052302Z","submitted_at":"2019-08-23T18:02:05Z","title":"Well-Read Students Learn Better: On the Importance of Pre-training Compact Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08962","snapshot_observed_at":"2026-08-11T21:37:08.379783Z","title":"Well-read students learn better: On the im- portance of pre-training compact models","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.379783Z"},"links":{"cited_paper":"/paper/1908.08962","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b8c73719670c8e6eb1f729489338eabcc3351eea5a44d58f7e7447cd280adf0a","observation_id":"ef2dddbc-3ab3-413d-bbb2-889b9be9d0df","resolution":{"observed_at":"2026-08-11T21:37:08.379783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T21:37:08.382822Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.382822Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f2fedd4acf24faf57a7125e4c7471538f5c592e27d29a8815d0c86e18a69ae0f","observation_id":"a4b708de-7375-4531-97d7-9e73da4f9c3e","resolution":{"observed_at":"2026-08-11T21:37:08.382822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03044","last_updated":"2016-04-19T16:43:09Z","snapshot_observed_at":"2026-08-08T08:37:34.322347Z","submitted_at":"2015-02-10T19:18:29Z","title":"Show, Attend and Tell: Neural Image Caption Generation with Visual Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03044","snapshot_observed_at":"2026-08-11T21:37:08.385543Z","title":"Show, attend and tell: Neural image cap- tion generation with visual attention","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.385543Z"},"links":{"cited_paper":"/paper/1502.03044","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:723a6413b498b84a19b7602c886e01b3616654e662fc341348b0e3464f4ef890","observation_id":"f271e797-ccf5-484f-8716-5a434963d2a9","resolution":{"observed_at":"2026-08-11T21:37:08.385543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.795078Z","title":"Stacked attention networks for image question answering","venue":null,"work_id":"69e51151-6942-4cd6-96bd-df0027e86144","year":2016},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.388241Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:59bc28d8fc223c9660efa68d5ec0f230aac898472a3e274258ed7e40bf6f5638","observation_id":"df808884-647b-4e16-bd72-646e0931afae","resolution":{"observed_at":"2026-08-11T21:37:08.798043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.787497Z","title":"mplug-owl: Modularization empowers large language mod- els with multimodality, 2024","venue":null,"work_id":"00957da1-5f2a-4401-a1fd-c57fa00f9b08","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.390580Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:cf02363596caa5bcbf9168853dc7053f64ea81dbd293b608304fe8339fd92264","observation_id":"2bf59c01-1ee7-41e3-ad7f-a02e7a9590f1","resolution":{"observed_at":"2026-08-11T21:37:08.790234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10197","last_updated":"2024-12-25T04:30:16Z","snapshot_observed_at":"2026-07-06T19:16:01.172484Z","submitted_at":"2024-09-16T11:43:19Z","title":"Fit and Prune: Fast and Training-free Visual Token Pruning for Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10197","snapshot_observed_at":"2026-08-11T21:37:08.393098Z","title":"Fit and prune: Fast and training-free visual token pruning 11 for multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.393098Z"},"links":{"cited_paper":"/paper/2409.10197","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:dbbe46449cbefa66c11be65477b61a9b84a17cab754238ee3b0ed3f32ce0f23b","observation_id":"55a8b314-8652-4f49-8c5e-a1fc978e722e","resolution":{"observed_at":"2026-08-11T21:37:08.393098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.779603Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities, 2023","venue":null,"work_id":"26392e18-1c9f-40d6-b95c-d7dce329e140","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.395868Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:c597d743c671f68fa209573ce98c30d492956ddaa3702775362800c7038f8ba5","observation_id":"92f936f9-cd1b-4c9a-9078-69b019d9c7ef","resolution":{"observed_at":"2026-08-11T21:37:08.782501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.772370Z","title":"Deep modular co-attention networks for visual question an- swering","venue":null,"work_id":"961b4108-c012-43bf-aa59-d38e6018b934","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.398429Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e664baf43d340e331fb225bb135c198e65f78bec128a3db3886977b501a9858f","observation_id":"a8ab1367-712e-4e3e-ab80-7da9fa0e8e85","resolution":{"observed_at":"2026-08-11T21:37:08.775215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.764703Z","title":"Tinygpt-v: Efficient multimodal large lan- guage model via small backbones, 2024","venue":null,"work_id":"7b13ae68-67af-425d-a933-72ed0f51e2a8","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.401027Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:cd9381f3c4526b5c62f54951cdc522785d7f97da294016c740c0a42bb97f735d","observation_id":"f72e0beb-c44f-48c2-96de-368aa8556536","resolution":{"observed_at":"2026-08-11T21:37:08.767930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.757120Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":"9674b5d1-5eaf-4317-8108-16b84ad31339","year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.403823Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:d303c482f4f7a797c35ebccb92d6865f64d8adb62c6cd5be5d305d9251978fc6","observation_id":"caa8085a-2a3c-4a56-a9cc-ff0e030ee692","resolution":{"observed_at":"2026-08-11T21:37:08.760040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.407076Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.407076Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f7c1f3c928b3d94c85b88ecb08232f94b6e2612f5c5616648e72069b42854dbe","observation_id":"b2f69a39-5f6d-4fe1-94ea-6661d0005158","resolution":{"observed_at":"2026-08-11T21:37:08.407076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-11T06:10:10.405420Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-11T21:37:08.409547Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.409547Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:11bac782234f02cafac2da34257ca973085ada28de2a8f9c14340dece6073e83","observation_id":"acf37657-d8f1-4fec-a07d-c07e8a932943","resolution":{"observed_at":"2026-08-11T21:37:08.409547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.412907Z","title":"Lmms- eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.412907Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:f58de68debd9153940bb6e40b4d79ef161677648ff00080bed85cd66240a7d5a","observation_id":"b0f53947-2e19-437d-93ad-4e44cb06403e","resolution":{"observed_at":"2026-08-11T21:37:08.412907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.415267Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.415267Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:09f5cc653ac44985b85db0481873723fae68490fb38acad44a7827f6f16cbd05","observation_id":"5c07de0f-ffba-412b-b950-8ba9bbd313f2","resolution":{"observed_at":"2026-08-11T21:37:08.415267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T21:37:08.417720Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.417720Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:3c0c35d2b854c20144c090021bffb85a65c437c5b0587e4bbf07b67c90e28ffa","observation_id":"4536e021-a980-4ee2-8a99-b48b30bccffe","resolution":{"observed_at":"2026-08-11T21:37:08.417720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.737497Z","title":"Free vqa models from knowledge iner- tia by pairwise inconformity learning","venue":null,"work_id":"78026874-1fd8-4a44-9073-3e3fb8acac55","year":2019},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.420493Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:66282c9c695b10a8ae933980b40de04b6cbb02b4ec845120909731becf89e872","observation_id":"4dd6a1d4-33c7-4ec0-94cd-52a422597aae","resolution":{"observed_at":"2026-08-11T21:37:08.740215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.730123Z","title":"Trar: Routing the attention spans in transformer for visual question answering","venue":null,"work_id":"81b4230c-76f1-4c0d-a5ba-94d5b4e4f367","year":2021},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.422900Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:0dc2f327b6344be07d6ae6937c213899c82172aa0f8d79647fd04d63309aa603","observation_id":"39a79b3a-3f8d-4519-9f6c-dfb5d8b3ebd6","resolution":{"observed_at":"2026-08-11T21:37:08.732876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.722419Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models, 2023","venue":null,"work_id":"ea5e0371-0da7-41fa-87f0-beec8d295715","year":2023},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.425431Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:e2f81ca2eb5a9a75db86a8c8da6e2585273491a48c9ac3743e0bab4f6428e36d","observation_id":"863d176b-39ce-4965-b82c-bc35082c741d","resolution":{"observed_at":"2026-08-11T21:37:08.725697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06199","last_updated":"2024-03-25T05:36:56Z","snapshot_observed_at":"2026-08-12T05:31:16.202473Z","submitted_at":"2024-03-10T12:43:27Z","title":"Mipha: A Comprehensive Overhaul of Multimodal Assistant with Small Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06199","snapshot_observed_at":"2026-08-11T21:37:08.427822Z","title":"airport\": xxx,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.427822Z"},"links":{"cited_paper":"/paper/2403.06199","citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:7431b6d5131d03456d2b75446833e682f794a4a20a0a3f43479221627dcb749e","observation_id":"6d31a72e-f5cf-467c-bda0-e859e0ea21ac","resolution":{"observed_at":"2026-08-11T21:37:08.427822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.715309Z","title":null,"venue":null,"work_id":"a1c52de5-aa02-4af7-ae66-e8e5b0109b26","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.430767Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:dab17116631d0e5a2f239a32593cfad66616b4e3caf8cc1e35fbdd0f25faab20","observation_id":"7a1cb42e-0145-42bc-93d2-d71b52a7757a","resolution":{"observed_at":"2026-08-11T21:37:08.718218Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.708276Z","title":null,"venue":null,"work_id":"6c97c50c-236e-4ec6-b2ea-35337fd9577b","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.433171Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:40308a088841b15fa561477dec5c2e03f66c61b6d4c6219a6e399028344be88c","observation_id":"044164c0-8c90-40f7-8768-cc4f0c7ebb24","resolution":{"observed_at":"2026-08-11T21:37:08.711080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.700103Z","title":null,"venue":null,"work_id":"37d18042-14c7-4777-92dc-a2efa4429bf7","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.435461Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5501d73f632423a9818ddfa1cddd6188328c6c4a89f444752d712dcd538622c5","observation_id":"9803d311-a481-4c98-9916-a256a7ef60a0","resolution":{"observed_at":"2026-08-11T21:37:08.702909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.692338Z","title":null,"venue":null,"work_id":"4bded7f4-148f-436a-8556-ff6c131f23e7","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.437867Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5b202a307a601b69ca849ac2a5b96b360bc3c08cca8a05543ba5af9a13f05fbb","observation_id":"b8c945af-388a-4435-8980-7a542ac4e4a4","resolution":{"observed_at":"2026-08-11T21:37:08.695244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.683557Z","title":null,"venue":null,"work_id":"03776b10-7bae-4674-a17a-7f8c262a7650","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.440180Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:a2b76c30184922bbe5de54ddf7c5e4373e0b46ea31bd74f4813b7a3076659a16","observation_id":"e7484725-fc2b-4fdf-8647-f81f95fc8b3c","resolution":{"observed_at":"2026-08-11T21:37:08.686740Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.675801Z","title":"Therefore, the value of the square in the figure is 2","venue":null,"work_id":"768f91de-6bd7-4db1-8970-5f5ca12c4b7c","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.442544Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:dfb6ea488f1215f4264dc0e49d615874cf194adfaa5d495a40d648aa47d21626","observation_id":"5d5ce4cc-e1d8-4f57-97bb-d4ec7709e76a","resolution":{"observed_at":"2026-08-11T21:37:08.679023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.668269Z","title":"control center","venue":null,"work_id":"cfda3fc1-f1b7-4ace-a54e-5c5171b350cc","year":null},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.445034Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:31dc6883a55ea876e9d9b4eb668c66d95f8a5cb9aeb0e7077f23ba6d5b35c1a0","observation_id":"823a836a-6e37-43b4-bf38-f2db8912ba61","resolution":{"observed_at":"2026-08-11T21:37:08.670988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.653287Z","title":null,"venue":null,"work_id":"c462f014-8f2e-4e4b-b376-fc6d0a9c6ed3","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.450057Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:5b62ed04b664bfb805026881dfcbf780a8127fd0038159dbb57d133e74d4d4bb","observation_id":"3ab4ddba-1331-4c01-9e1b-b3940d8881e0","resolution":{"observed_at":"2026-08-11T21:37:08.655902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.646009Z","title":null,"venue":null,"work_id":"74cc123e-4da0-4a0c-945a-b245569e9049","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.452450Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:59215fccc094159d38941277baa78449960ece2f4ae523937b9d95e4f0379cec","observation_id":"ad67f5a0-d0b2-4b9b-95da-b78400b582a0","resolution":{"observed_at":"2026-08-11T21:37:08.648609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.638737Z","title":null,"venue":null,"work_id":"5c790530-cac8-4dee-a18b-642bc4e59ecd","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.454943Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:0bfbe222d5ad52a20b5aa19f9b2569f2738103cafd5238309381d00055aa0bba","observation_id":"275209cb-2bf7-4178-aac4-6d48a670f5a5","resolution":{"observed_at":"2026-08-11T21:37:08.641489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.630079Z","title":"RIGHT\",","venue":null,"work_id":"d7bf3f44-68a3-40c6-a89e-bd144db0362a","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.457373Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:46c0345bcb3b520226ddacc6ed0e74d720283bc60a46032a7e831a7b23dba615","observation_id":"9c492150-ab38-4202-8025-e9e1cf4e7473","resolution":{"observed_at":"2026-08-11T21:37:08.633594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:37:08.660534Z","title":"Decreased","venue":null,"work_id":"155a9e21-59fc-432e-987b-75bc7392f232","year":2012},"citing_paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:08.447590Z"},"links":{"citing_paper":"/paper/2412.04317"},"observation_digest":"sha256:b9d9be9878c7eda18425545b70e3e8df7290957177c014a98186cf05345a853f","observation_id":"6c5fd70e-35c4-484c-aaea-fffc2a260bd9","resolution":{"observed_at":"2026-08-11T21:37:08.663257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04317","last_updated":"2024-12-05T16:34:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:14:29.944254Z","submitted_at":"2024-12-05T16:34:07Z","title":"FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 1 inbound Pith citation observation for arXiv:2412.04317."}