{"as_of":"2026-08-07T08:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2221b8c33f3f228bed653548555fe313e87b4e00d367fa81f5159f7e2a78682","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:33:14.960504Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16305/citation-record","integrity":"/paper/2607.16305/integrity","json":"/paper/2607.16305/citation-record.json","paper":"/paper/2607.16305"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:33:14.733672Z","title":"STEM: Scaling Transformers with Embedding Modules","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.733672Z"},"links":{"citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:d62fda466debbb0e035e24180a29d71e66edf4bfab83c1ce4595b988c8b8b158","observation_id":"784c5693-f5f3-466a-be2e-2504a5d758a8","resolution":{"observed_at":"2026-08-02T06:33:14.733672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-02T06:33:13.908702Z","title":"DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:13.908702Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:0b1476a1817d73c5a5ab97020f133e6a281dc2118b5c5ac3f7dd6b2c30ce67ec","observation_id":"8c04fa4d-8e33-418b-b576-0591770ed8f3","resolution":{"observed_at":"2026-08-02T06:33:13.908702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-02T06:33:14.240999Z","title":"arXiv:2409.17146","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.240999Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:b64a60f83b217a450ec96cab89d71d48bb4a29a63d62ef5fcf5420e13a2c81a8","observation_id":"d30f5a49-2cbe-4992-96d7-716a8ed7b9b0","resolution":{"observed_at":"2026-08-02T06:33:14.240999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:33:14.292946Z","title":"Dosovitskiy, A.; Beyer, L.; Kolesnikov, A.; Weissenborn, D.; Zhai, X.; Unterthiner, T.; Dehghani, M.; Minderer, M.; Heigold, G.; Gelly, S.; Uszkoreit, J.; and Houlsby, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.292946Z"},"links":{"citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:1f1b0d5ad49caff936cb97fe4315b22ace35d8d905b03fc9c53e2159c1e5db17","observation_id":"051a2367-bb40-4d66-9543-81b4c9972659","resolution":{"observed_at":"2026-08-02T06:33:14.292946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-08-02T06:33:14.485161Z","title":"arXiv:2410.18558","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.485161Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:34c398a12ffa2f5a7914089f74ce776f4b44a25e7eb81bb7a6fc5a184675987d","observation_id":"57187ae8-b034-49f7-b94c-ce96b817a597","resolution":{"observed_at":"2026-08-02T06:33:14.485161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T06:33:14.625608Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.625608Z"},"links":{"citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:a8006e9c651b54e0867700c3d1087f3dae6199c4472f0689502eaa4f60ace630","observation_id":"6ff32895-0b63-44fc-a9a8-248689c4b32f","resolution":{"observed_at":"2026-08-02T06:33:14.625608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-02T06:33:14.677496Z","title":"Mathew,M.;Bagal,V.;Tito,R.P.;Karatzas,D.;Valveny,E.; andJawahar,C.V.2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.677496Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:2ddfa0f4d04448631696b4d69d47341c1071f87f7f5c2c2941abce7dcaf07f75","observation_id":"54b5273f-5f12-4f84-afcf-746401790819","resolution":{"observed_at":"2026-08-02T06:33:14.677496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-02T06:33:14.864080Z","title":"arXiv:2406.16860","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.864080Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:93f714f1f257e59f88cc4909d1c2480639ed35d06cc303d3ced659b9dd1cd789","observation_id":"4598b522-f40d-4cee-a40e-a82abf03f44a","resolution":{"observed_at":"2026-08-02T06:33:14.864080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-02T06:33:14.945938Z","title":"Wiedmann,L.;Zohar,O.;Mahla,A.;Wang,X.;Li,R.;Frere, T.;vonWerra,L.;Gosthipaty,A.R.;andMarafioti,A.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.945938Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:aba05b8207e9567cfa04f94aae5c9e18b64f17d96f30a74bb24c6176c65c37ac","observation_id":"9c39c865-9dfc-45e6-b333-9540fc28ef60","resolution":{"observed_at":"2026-08-02T06:33:14.945938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-02T06:33:14.950666Z","title":"arXiv preprint arXiv:2412.10302","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.950666Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:285d76dcfe7e31578a2b16059a3a96fc0fbf1c52cbc4618b91a647a575d27bdf","observation_id":"90a3810e-e305-42f1-ad6f-b6eea24e9090","resolution":{"observed_at":"2026-08-02T06:33:14.950666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-02T06:33:14.955758Z","title":"arXiv:2501.07888","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.955758Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:0eca15b98ab795edd99a6a2698052bc9139b3170a7588c5df6e2710c2f5f9cce","observation_id":"5a5680dd-462b-49e5-a284-ee7adb09ce1f","resolution":{"observed_at":"2026-08-02T06:33:14.955758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-06T15:15:51.847048Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10318","snapshot_observed_at":"2026-08-02T06:33:14.960504Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.960504Z"},"links":{"cited_paper":"/paper/2501.10318","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:48d20cf027c2484d5ee9a3b4ed62fbc282890be6acf21f7d337f5b845529843f","observation_id":"e8af6555-174f-49e8-9fb3-4932eeb61e6d","resolution":{"observed_at":"2026-08-02T06:33:14.960504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-02T06:33:14.797043Z","title":"In Proceedings of the International Conference on Learning Representations (ICLR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.797043Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:c511bed8647763be8c56e7d601eac9e54c0b7db7fc1cf5ff9625cfb4d766ea3c","observation_id":"42d5e4bf-7495-4e17-83bf-3cfd89cc6bfc","resolution":{"observed_at":"2026-08-02T06:33:14.797043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T06:33:14.541340Z","title":"Li, J.; Li, D.; Savarese, S.; and Hoi, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.541340Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:6aa058ffa607b2cbc48221a7c08abbab7871a065b3f2ef79cc1f37cabaf5d034","observation_id":"3caceb63-a5fb-44fe-8d15-e6ac4b03e2c4","resolution":{"observed_at":"2026-08-02T06:33:14.541340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-02T06:33:14.400943Z","title":"Fu, X.; Hu, Y.; Li, B.; Feng, Y.; Wang, H.; Lin, X.; Roth, D.;Smith,N.A.;Ma,W.-C.;andKrishna,R.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.400943Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:2d8865e2360911759521b1c22daf40349da61f01315f49926a491487c9e78dc1","observation_id":"968911c8-70be-4eee-8090-d09f98d0d120","resolution":{"observed_at":"2026-08-02T06:33:14.400943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T06:33:13.537859Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:13.537859Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:caed8ced6a413881d516ddd7a07746b658220b89f85481c9ea6b1bdf03bafa8e","observation_id":"4ec2d70e-32a6-46ad-8d09-a3446753db47","resolution":{"observed_at":"2026-08-02T06:33:13.537859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-02T06:33:14.128871Z","title":"arXiv:2412.19437","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:14.128871Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:4f31700930157afcc48c80ef4cea4aba036d8af2dd12868d1c0372a86eec70cc","observation_id":"f39be760-bfdb-4680-ac30-fe4801ecc271","resolution":{"observed_at":"2026-08-02T06:33:14.128871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T06:33:13.628554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:13.628554Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:9859b16a1229f226502ab5310938b293bee01abe2976a544d98f57cc27f4458b","observation_id":"6f5fc2fc-0d84-4509-993b-c3462782ca18","resolution":{"observed_at":"2026-08-02T06:33:13.628554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07372","last_updated":"2026-07-12T07:41:31Z","snapshot_observed_at":"2026-08-06T19:10:40.703812Z","submitted_at":"2026-01-12T09:54:49Z","title":"Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07372","snapshot_observed_at":"2026-08-02T06:33:13.744408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T06:33:13.744408Z"},"links":{"cited_paper":"/paper/2601.07372","citing_paper":"/paper/2607.16305"},"observation_digest":"sha256:0af106e0d9bb3db511c8d7292cfc8ef0c860d442db247924c25b541ba4114d76","observation_id":"33dd7702-4e23-4626-8262-b2c0afafed97","resolution":{"observed_at":"2026-08-02T06:33:13.744408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16305","last_updated":"2026-07-14T08:03:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T06:23:20.065573Z","submitted_at":"2026-07-14T08:03:00Z","title":"LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2607.16305."}