{"as_of":"2026-08-21T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:496120e986bf26b2dbeb5a8e07b4173824b8a4f0bb39c60fe93b7048c168f27a","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:11:06.855494Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17608/citation-record","integrity":"/paper/2506.17608/integrity","json":"/paper/2506.17608/citation-record.json","paper":"/paper/2506.17608"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.812570Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.812570Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:0c064475405459a96266cb7425c3841630097fd58d9180823c06dba5fa77a42b","observation_id":"5c678bbb-6371-4031-a950-bbd2d6a19665","resolution":{"observed_at":"2026-08-15T19:11:06.812570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-08-16T13:46:54.220691Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-15T19:11:06.816752Z","title":"Dragonfly: Multi-resolution zoom supercharges large visual-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.816752Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:547e9bd041f2920e96ecb56bd613759d25f02cb273c01fe658a8296a19ed5de2","observation_id":"46f92de4-27b7-46b0-9d78-5e8e9266305d","resolution":{"observed_at":"2026-08-15T19:11:06.816752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.820646Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.820646Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:692bf1e1c9d406feaa81c0811384836f73b2267e9fd94e4a2d4e176cc3422c51","observation_id":"fc9aecbf-803f-476e-a325-b104ade7fe17","resolution":{"observed_at":"2026-08-15T19:11:06.820646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10516","last_updated":"2024-04-01T20:57:45Z","snapshot_observed_at":"2026-08-18T07:27:45.881648Z","submitted_at":"2024-03-15T17:57:06Z","title":"FeatUp: A Model-Agnostic Framework for Features at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10516","snapshot_observed_at":"2026-08-15T19:11:06.824017Z","title":"Featup: A model- agnostic framework for features at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.824017Z"},"links":{"cited_paper":"/paper/2403.10516","citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:dc9c378ee8c7b2d973921ec3e76a218a5d49245bd0426aee7cdaca644c214146","observation_id":"07927673-49a2-4b5d-b93f-51541d26839f","resolution":{"observed_at":"2026-08-15T19:11:06.824017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T19:11:06.827940Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.827940Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:4792f0ec41c09ace19a5e6985f35969c1f1a8972a12de07f0a54fb7d23666bb7","observation_id":"95fb0188-136b-44d8-bb27-6aba2ac748a8","resolution":{"observed_at":"2026-08-15T19:11:06.827940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.980304Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"53ff0a83-472a-40c5-9933-ed8bbc4d4151","year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.831872Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:6abdb22d662aa44d5e2cfa6aea00714a5d12d18c4f2109bfcbd44e8baaa6ec14","observation_id":"3c670d6b-7212-4179-8c99-b3ca8edcca4f","resolution":{"observed_at":"2026-08-15T19:11:06.983729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.835300Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.835300Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:5da6e6240ca1b97261ace3c59e545b36b4024523e3bc5100e5f7f33b996c3f43","observation_id":"8650848e-a45d-4d0a-813d-b0a74636c121","resolution":{"observed_at":"2026-08-15T19:11:06.835300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.838648Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.838648Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:efeceb8227f09523a57bd407af056071343c476ae2bef4c3130b6d8e64de1e79","observation_id":"8114acb9-f031-43d0-a778-e39bd9f25df8","resolution":{"observed_at":"2026-08-15T19:11:06.838648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.956241Z","title":"When do we not need larger vision models?, 2024","venue":null,"work_id":"bd5e58c3-d80c-4c5d-b26b-2729cd6aa6c2","year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.842102Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:6f1a233df9bcb1f0909f2ca244d6493a0cfc0ae08ffe70ada6f6422e5709f91d","observation_id":"05c5e45a-10e5-45e2-98c5-33f914cbf4ce","resolution":{"observed_at":"2026-08-15T19:11:06.960347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.944778Z","title":"Lift: A surprisingly simple lightweight feature transform for dense vit descriptors","venue":null,"work_id":"c2618466-c174-4f18-b19a-c11d7bae9a9a","year":2025},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.845562Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:1efbb7959efd51bbfb96cca1ae2d318ef1583e3e65f788462df5cd9a550c93c6","observation_id":"44a41b24-1df3-43a7-ae9f-3416e7d382d8","resolution":{"observed_at":"2026-08-15T19:11:06.948957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.933552Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models, 2024","venue":null,"work_id":"ef55adfd-daf9-46bc-800a-266363dcadc5","year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.849093Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:9f3da58ed898cd89651952fbee4f61cf2d3968a2883dfd57aa754bc77d9361f8","observation_id":"66f3a4a0-2c27-4ec8-a72f-ffad3f0ec65d","resolution":{"observed_at":"2026-08-15T19:11:06.937353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.920388Z","title":"Cogvlm: Visual expert for pretrained language models, 2024","venue":null,"work_id":"fc18cf30-2a4a-4255-af69-85738cbf97d0","year":2024},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.852153Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:41feae5375ad6a3e3ad974367ad461f6d403ffd2a24fd57bf638a2166175e9ae","observation_id":"5cf71c3b-621d-49c7-9850-7f71fb4a476a","resolution":{"observed_at":"2026-08-15T19:11:06.925819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:06.855494Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:06.855494Z"},"links":{"citing_paper":"/paper/2506.17608"},"observation_digest":"sha256:586cea7b95aa9f75726b367f0b6db5e19ea15b9e070fddf8125ffaf4f2cb0226","observation_id":"6b0ab73c-bd1c-4a6a-ac5f-5a46d228ac3a","resolution":{"observed_at":"2026-08-15T19:11:06.855494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17608","last_updated":"2025-06-21T06:13:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:47:44.745472Z","submitted_at":"2025-06-21T06:13:56Z","title":"HIRE: Lightweight High-Resolution Image Feature Enrichment for Multimodal LLMs"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.17608."}