{"as_of":"2026-08-13T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f58a83f219e8d9b36387a6342084a97ac76e103b74cbf1e27a3a6ff935254ae","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:47:52.532503Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.19289/citation-record","integrity":"/paper/2412.19289/integrity","json":"/paper/2412.19289/citation-record.json","paper":"/paper/2412.19289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.337518Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.337518Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:c9e8777e8a52c68523e5394e889bacd9591833c64e01ea9d0dd4b200467f1139","observation_id":"226f241b-a6e8-4021-897a-0b4095f4c58e","resolution":{"observed_at":"2026-08-11T00:47:52.337518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.342475Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.342475Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:23eadcdd4fa886708ec9c1e671b7ac1b93430973c22b4da6116dfce88df49bbf","observation_id":"0dae187d-1325-49b4-b159-77c04d02c43b","resolution":{"observed_at":"2026-08-11T00:47:52.342475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.347000Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.347000Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:eff4cbbf31e98d57a4bb09577ee5e8d12d3c83a5147662dcf64d9c23f277a7a2","observation_id":"7a818e42-d0de-4553-b90a-7c042df8278c","resolution":{"observed_at":"2026-08-11T00:47:52.347000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08822","last_updated":"2016-07-29T14:26:27Z","snapshot_observed_at":"2026-08-13T00:07:09.124752Z","submitted_at":"2016-07-29T14:26:27Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08822","snapshot_observed_at":"2026-08-11T00:47:52.350966Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.350966Z"},"links":{"cited_paper":"/paper/1607.08822","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:46c6415f3e62a9b0051a67f4137b49d3937af10266ad3faea5b7b153c13caf09","observation_id":"cff45548-ce89-437c-9505-aa5874459687","resolution":{"observed_at":"2026-08-11T00:47:52.350966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-12T09:14:21.453940Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-11T00:47:52.355230Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.355230Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:bfacaed86e185c3aa77a3a25aa1e14dbc3d0bea86bb5ec58e13156a78ae9c11f","observation_id":"d878a7b6-5845-47db-b99b-6ce4702cdc54","resolution":{"observed_at":"2026-08-11T00:47:52.355230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10492","last_updated":"2022-02-21T19:04:46Z","snapshot_observed_at":"2026-08-12T09:13:43.797523Z","submitted_at":"2022-02-21T19:04:46Z","title":"CaMEL: Mean Teacher Learning for Image Captioning","version":1},"cited_work":{"arxiv_id":"2202.10492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.10492","snapshot_observed_at":"2026-08-11T00:47:52.928433Z","title":"CaMEL: Mean Teacher Learning for Image Captioning","venue":"cs.CV","work_id":"6adf8e1f-5245-4f65-90c3-7b47e6ab5b82","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.359461Z"},"links":{"cited_paper":"/paper/2202.10492","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:6a367ed68b87a5f7c49feed60670f79764f8622f57dd5b07202ffd7e82af7c50","observation_id":"28adb247-1126-4345-9a50-40070c3b7b43","resolution":{"observed_at":"2026-08-11T00:47:52.932804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T00:47:52.363799Z","title":"K.; Riquelme, C.; Steiner, A.; Angelova, A.; Zhai, X.; Houlsby, N.; and Soricut, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.363799Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:9797ca5227851c1815531039a2032cb004bca766a1f056c02d1ce276e81c2ddd","observation_id":"a8898f81-acc2-45bb-a3c5-fa492e59170d","resolution":{"observed_at":"2026-08-11T00:47:52.363799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.367994Z","title":"E.; Stoica, I.; and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.367994Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:7430a647fd2c94c20c572f62354a8bb3627d1bb6213d4d1ebafd5a6adc482ec0","observation_id":"e671ddb3-7ad5-420c-9562-2c709005c4c4","resolution":{"observed_at":"2026-08-11T00:47:52.367994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.049971Z","title":"J.; and Lavie, A","venue":null,"work_id":"88dc4c31-4147-4183-9424-f7db6d8bb1ff","year":2014},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.372139Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ec02b843c88562847980552bdc35401464ed939c959da12c98d5080e2c55993b","observation_id":"8aa8e136-3c00-4fcf-9234-2aebaf9832a4","resolution":{"observed_at":"2026-08-11T00:47:53.053822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16525","last_updated":"2023-07-31T09:47:06Z","snapshot_observed_at":"2026-08-09T16:15:19.316086Z","submitted_at":"2023-07-31T09:47:06Z","title":"Transferable Decoding with Visual Entities for Zero-Shot Image Captioning","version":1},"cited_work":{"arxiv_id":"2307.16525","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16525","snapshot_observed_at":"2026-08-11T00:47:52.902949Z","title":"Transferable Decoding with Visual Entities for Zero-Shot Image Captioning","venue":"cs.CV","work_id":"7e1fa52c-e237-4123-9301-9c5f736e8c4f","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.377156Z"},"links":{"cited_paper":"/paper/2307.16525","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e600979ca1d2ba8b3401a70db92b2685c445f63d4c8e8074f1f3a58463e84fd3","observation_id":"023456da-f5ef-4eab-86e7-e8132b51b89e","resolution":{"observed_at":"2026-08-11T00:47:52.907331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15723","last_updated":"2021-06-02T12:41:36Z","snapshot_observed_at":"2026-08-10T05:00:18.764813Z","submitted_at":"2020-12-31T17:21:26Z","title":"Making Pre-trained Language Models Better Few-shot Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15723","snapshot_observed_at":"2026-08-11T00:47:52.381700Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.381700Z"},"links":{"cited_paper":"/paper/2012.15723","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:f31c87cada4ea6df41e79856eaa6fe9aa5a4a7f8aa112e8b6472580a31f80a30","observation_id":"b9500f88-5c56-4d37-8c59-36dc115bd496","resolution":{"observed_at":"2026-08-11T00:47:52.381700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01998","last_updated":"2024-03-31T22:58:09Z","snapshot_observed_at":"2026-07-06T16:56:38.112343Z","submitted_at":"2023-12-04T16:22:06Z","title":"Language-only Efficient Training of Zero-shot Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01998","snapshot_observed_at":"2026-08-11T00:47:52.386106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.386106Z"},"links":{"cited_paper":"/paper/2312.01998","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:caee3f0e390127a9e3f9bd65bdb70040b9f78f8b2be8dac918377c820dbd7f0a","observation_id":"49d42f1d-8228-409b-9826-da1b7e270051","resolution":{"observed_at":"2026-08-11T00:47:52.386106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12233","last_updated":"2022-03-26T02:02:42Z","snapshot_observed_at":"2026-07-06T12:11:38.494286Z","submitted_at":"2021-11-24T02:30:22Z","title":"Scaling Up Vision-Language Pre-training for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.12233","snapshot_observed_at":"2026-08-11T00:47:52.390168Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.390168Z"},"links":{"cited_paper":"/paper/2111.12233","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:121d6893ca24e5b282d6fa7e43bf1cad81dc078530049341d0eca53fb889174c","observation_id":"f8c9a401-df39-491f-bc5d-a55c981f36aa","resolution":{"observed_at":"2026-08-11T00:47:52.390168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05221","last_updated":"2023-04-03T08:32:39Z","snapshot_observed_at":"2026-08-03T16:32:45.929187Z","submitted_at":"2022-12-10T06:17:56Z","title":"REVEAL: Retrieval-Augmented Visual-Language Pre-Training with Multi-Source Multimodal Knowledge Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05221","snapshot_observed_at":"2026-08-11T00:47:52.394111Z","title":"A.; and Fathi, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.394111Z"},"links":{"cited_paper":"/paper/2212.05221","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:0f889d0b49fb04e68029f6a2459ea919020f51f0157bc806b3538ee9857713cc","observation_id":"0d0790bb-0b6f-4354-a632-5587ddb2eefb","resolution":{"observed_at":"2026-08-11T00:47:52.394111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-08-11T01:45:10.663640Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-11T00:47:52.398127Z","title":"V.; Sung, Y.; Li, Z.; and Duerig, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.398127Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:21af03d430afc9a26514a24c6d1bf2d1e00e727716d38fae72421062bc7d7a76","observation_id":"cdcd0b62-1ac9-42fd-beca-718e10dd8200","resolution":{"observed_at":"2026-08-11T00:47:52.398127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12119","last_updated":"2022-07-20T15:47:22Z","snapshot_observed_at":"2026-08-10T12:45:24.532998Z","submitted_at":"2022-03-23T01:17:16Z","title":"Visual Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12119","snapshot_observed_at":"2026-08-11T00:47:52.402265Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.402265Z"},"links":{"cited_paper":"/paper/2203.12119","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:0a3ddcd153b7c6cf3f2ab8554b491a7a46e98b38b227486bb468688e9ac5bfca","observation_id":"68cfa15d-5001-412c-8014-6bba038e47b0","resolution":{"observed_at":"2026-08-11T00:47:52.402265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08734","last_updated":"2017-02-28T10:42:31Z","snapshot_observed_at":"2026-07-06T05:31:42.551086Z","submitted_at":"2017-02-28T10:42:31Z","title":"Billion-scale similarity search with GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.08734","snapshot_observed_at":"2026-08-11T00:47:52.406187Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.406187Z"},"links":{"cited_paper":"/paper/1702.08734","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:4253b56e88e341b3843fefcb9b79c851d2345211e23b434008b3de6d8ddb1aa8","observation_id":"f6844831-ca97-454d-923c-9795e2a6a256","resolution":{"observed_at":"2026-08-11T00:47:52.406187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.2306","last_updated":"2015-04-14T05:02:53Z","snapshot_observed_at":"2026-07-06T04:02:50.341299Z","submitted_at":"2014-12-07T02:36:07Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.2306","snapshot_observed_at":"2026-08-11T00:47:52.410230Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.410230Z"},"links":{"cited_paper":"/paper/1412.2306","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:339401575e5355915cd323115cc9d8e167c9bcf62bd80574399ba38a528cf2da","observation_id":"fbf6f1ea-74aa-4474-9dad-76ac4b4f5126","resolution":{"observed_at":"2026-08-11T00:47:52.410230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T00:47:52.414573Z","title":"P.; and Welling, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.414573Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:21f16889250beff8ce7322d8b36704c1d3fb9d77dfa63e8f18ad5d28719f68eb","observation_id":"2e8b41ff-a450-4e9c-af0d-c5631d105fa0","resolution":{"observed_at":"2026-08-11T00:47:52.414573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-11T00:47:52.418671Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.418671Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:1c8b567bc14523349a1335a6358d9ea6454330c857d9e2532d8eee3d316030bb","observation_id":"778da2bf-ee88-4ffc-a9d5-3a556e13dc02","resolution":{"observed_at":"2026-08-11T00:47:52.418671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T00:47:52.422712Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.422712Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:8f90e501c3fc864c404570a793d29e65c9a950aaa089f3dc86e0904b736daedc","observation_id":"59ca8558-0ed1-43ae-bf88-aa1a3ad6f4a5","resolution":{"observed_at":"2026-08-11T00:47:52.422712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15879","last_updated":"2024-04-07T14:43:38Z","snapshot_observed_at":"2026-08-10T18:22:51.844391Z","submitted_at":"2023-11-27T14:51:37Z","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15879","snapshot_observed_at":"2026-08-11T00:47:52.426766Z","title":"M.; Sugimoto, A.; and Nakayama, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.426766Z"},"links":{"cited_paper":"/paper/2311.15879","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e8937f980fd4b0a6e505199c9561312b3b1fc8edeb8044f28a7789ccdfdbac76","observation_id":"230e9ed6-070d-49f1-8d6d-6f975a8b0aa3","resolution":{"observed_at":"2026-08-11T00:47:52.426766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.037789Z","title":null,"venue":null,"work_id":"698ddc26-2136-4714-a7dd-6c3d11ed202f","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.430620Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e47d65dc3d8883e0eeda1fd697cc186bbc034b2784f4629600efafc78c006622","observation_id":"a9f4eac5-2562-4f10-b109-2dda3ee40556","resolution":{"observed_at":"2026-08-11T00:47:53.041629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.06165","last_updated":"2020-07-26T00:46:46Z","snapshot_observed_at":"2026-08-09T03:42:28.505858Z","submitted_at":"2020-04-13T19:18:10Z","title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.06165","snapshot_observed_at":"2026-08-11T00:47:52.434115Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.434115Z"},"links":{"cited_paper":"/paper/2004.06165","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:7188c80e5ec03f509288d64a58c591c2993139d09676f588639adfe2e59e62d8","observation_id":"fd13970e-17f6-4ac2-becd-daad3b68fff5","resolution":{"observed_at":"2026-08-11T00:47:52.434115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-11T00:47:52.437835Z","title":"L.; and Liang, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.437835Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:f1c1d4a1a2f8013ddb24dcd53fa85296fa2ff918080a4f36da96b9328ecfb2b1","observation_id":"0395bd76-e967-4b2f-b5fd-f7a6b66007e1","resolution":{"observed_at":"2026-08-11T00:47:52.437835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-11T00:47:52.441953Z","title":"L.; and Dollár, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.441953Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:45a1f12d9f04c8d972a93fb863027fe93a45d5b15e99ec61595934e2eca2cca0","observation_id":"434cd9d7-14b2-4a18-83bf-708115380476","resolution":{"observed_at":"2026-08-11T00:47:52.441953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10668","last_updated":"2022-11-10T07:01:42Z","snapshot_observed_at":"2026-08-10T00:44:42.640325Z","submitted_at":"2021-12-20T16:52:35Z","title":"Few-shot Learning with Multilingual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10668","snapshot_observed_at":"2026-08-11T00:47:52.446185Z","title":"V.; Mihaylov, T.; Artetxe, M.; Wang, T.; Chen, S.; Simig, D.; Ott, M.; Goyal, N.; Bhosale, S.; Du, J.; Pasunuru, R.; Shleifer, S.; Koura, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.446185Z"},"links":{"cited_paper":"/paper/2112.10668","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:f1ab62ca37c31bdbb69727ca07667cf07cff92928de5c335e84747bf24678b0f","observation_id":"2f665086-7745-455f-ac61-ae254c66e6c2","resolution":{"observed_at":"2026-08-11T00:47:52.446185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T00:47:52.450290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.450290Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:53b04dd02e68d9076c3ac8b710ee458b6dabb6b2db4a2c6627861ca2fa239282","observation_id":"93255380-34c1-443d-88a2-11ec4e3a7bee","resolution":{"observed_at":"2026-08-11T00:47:52.450290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06574","last_updated":"2023-03-13T05:51:27Z","snapshot_observed_at":"2026-07-06T12:37:25.512398Z","submitted_at":"2022-02-14T09:36:50Z","title":"I-Tuning: Tuning Frozen Language Models with Image for Lightweight Image Captioning","version":3},"cited_work":{"arxiv_id":"2202.06574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.06574","snapshot_observed_at":"2026-08-11T00:47:52.723546Z","title":"I-Tuning: Tuning Frozen Language Models with Image for Lightweight Image Captioning","venue":"cs.CL","work_id":"9d4a5452-6277-4a4b-9f11-bc08e729c51d","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.454181Z"},"links":{"cited_paper":"/paper/2202.06574","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ddc47c3b60e6f3a48458225e5a5379125af2d39e2ac3a8d13e75ea86fe09ee7c","observation_id":"226c086b-add0-4e3f-839c-d969a4be0fc6","resolution":{"observed_at":"2026-08-11T00:47:52.727828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07179","last_updated":"2023-03-15T00:02:06Z","snapshot_observed_at":"2026-07-06T14:04:51.277045Z","submitted_at":"2022-10-13T17:02:23Z","title":"MAPL: Parameter-Efficient Adaptation of Unimodal Pre-Trained Models for Vision-Language Few-Shot Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07179","snapshot_observed_at":"2026-08-11T00:47:52.458002Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.458002Z"},"links":{"cited_paper":"/paper/2210.07179","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:03d8c096bd8d3c48e052d3647af8690a0245608adc479c74a98a84bb3b9c7dfb","observation_id":"230a2993-3479-4c04-8728-416ccb573566","resolution":{"observed_at":"2026-08-11T00:47:52.458002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-11T17:44:55.630525Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-11T00:47:52.461697Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.461697Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:948633a8057aa88f5cdfc7f4ab202bd4187ca22a78baa24fb0f6cdd88748c377","observation_id":"6f40e8af-c06c-4d64-87db-5b4eb3febfb7","resolution":{"observed_at":"2026-08-11T00:47:52.461697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.026774Z","title":null,"venue":null,"work_id":"6674b3e6-b26b-46d9-9654-022cce7a42c4","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.465468Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:efc03bfa6fefd32246e035bcc32c0a7ab6b546cf25596e50bd0c9bdd46184d84","observation_id":"e739e8bb-f0fe-4bc1-b724-fd797411b8b6","resolution":{"observed_at":"2026-08-11T00:47:53.030299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.014693Z","title":null,"venue":null,"work_id":"2ad714c4-4657-42b0-a0d8-3a20dfe2b0d0","year":2002},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.468715Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:77a64b9351100a2a177dfb8ab32d980d1069cbdb0ca97d71eb1b30f193cb32cf","observation_id":"e56161bb-1edb-48aa-b691-edaf369245f4","resolution":{"observed_at":"2026-08-11T00:47:53.018872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-10T10:15:15.424631Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-08-11T00:47:52.472320Z","title":"A.; Wang, L.; Cervantes, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.472320Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e648886642ba8ee1908fe1222c79be6fc41d3bbb8d7e96ae75be523ed8995a41","observation_id":"5841e810-0639-45f3-bec8-1f34f573c01e","resolution":{"observed_at":"2026-08-11T00:47:52.472320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-11T00:47:52.476285Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.476285Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:9ca553bbde3c8c82bd756d70ca3a298d480a03cd76e1a236fa4f15cfcd90df25","observation_id":"afa7388d-2396-49cc-b606-d7566f664077","resolution":{"observed_at":"2026-08-11T00:47:52.476285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:53.003299Z","title":null,"venue":null,"work_id":"9d0c1a2e-1a99-4291-b67e-2e9ff224c3d6","year":2018},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.480296Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:5fdc55d24c80a09dcacfa5cb20017e67390e9c0488c95dc7422e90bcd7b4dc23","observation_id":"982a31ea-aaee-44bb-8600-1f34d2273480","resolution":{"observed_at":"2026-08-11T00:47:53.007004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19821","last_updated":"2023-05-31T13:03:17Z","snapshot_observed_at":"2026-08-10T01:27:59.938985Z","submitted_at":"2023-05-31T13:03:17Z","title":"LMCap: Few-shot Multilingual Image Captioning by Retrieval Augmented Language Model Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19821","snapshot_observed_at":"2026-08-11T00:47:52.483794Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.483794Z"},"links":{"cited_paper":"/paper/2305.19821","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:fa6e65d902bb631a454c6b42f92db63346c216baca272c34591512510c27566b","observation_id":"3ea24812-6756-427b-9c9a-6a89fb70bec9","resolution":{"observed_at":"2026-08-11T00:47:52.483794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15323","last_updated":"2023-03-28T12:04:49Z","snapshot_observed_at":"2026-08-13T00:30:45.824752Z","submitted_at":"2022-09-30T09:03:22Z","title":"SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation","version":2},"cited_work":{"arxiv_id":"2209.15323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.15323","snapshot_observed_at":"2026-08-11T00:47:52.656358Z","title":"SmallCap: Lightweight Image Captioning Prompted with Retrieval Augmentation","venue":"cs.CV","work_id":"e5815b3d-77e0-4132-a6b6-f6b0f2309b6c","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.487763Z"},"links":{"cited_paper":"/paper/2209.15323","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:e9843650af6ef24fa9a54622dc40d3e32ce0594a49362baddf0aaaa03f71f00a","observation_id":"a5fbff30-4ddb-4018-9f30-1e344aa2a986","resolution":{"observed_at":"2026-08-11T00:47:52.660913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.992574Z","title":"P.; Elliott, D.; and Martins, B","venue":null,"work_id":"6b42e871-dec0-48e7-b7a6-acdc0de539e6","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.491626Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ff2cb97539b2f223e129f44554ab4df6d2ea48283795277a71172caeeb185d2a","observation_id":"658f9a71-d444-4e33-b749-0caa9763f830","resolution":{"observed_at":"2026-08-11T00:47:52.996295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-11T00:47:52.495100Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.495100Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:5d45d326b967c4471b1db3c90b031c30d6be3112cb02be77969bd74f2d0c81ec","observation_id":"54b2ca25-4afb-4bff-91d4-045daf8eb7ad","resolution":{"observed_at":"2026-08-11T00:47:52.495100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.981274Z","title":"L.; and Parikh, D","venue":null,"work_id":"d05499f8-cf47-4e85-8124-c3dfec3ca91d","year":2014},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.498807Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:80a365d5e421a1d0509b56e0ce2191c8cc713bf926138a0d5c4e0a6b0a232ce1","observation_id":"99d81053-2031-459e-a814-9b90d8503bfb","resolution":{"observed_at":"2026-08-11T00:47:52.985218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.970708Z","title":null,"venue":null,"work_id":"c555cf2f-ef52-42b5-906e-6c3800f4cea2","year":2021},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.502607Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:83909fd65213b29bb53a9385ad6ffb40e45f5b61d046a42e1a8c5a2d40cfb87a","observation_id":"049e45b1-06fd-41c7-9935-b80f1758c45c","resolution":{"observed_at":"2026-08-11T00:47:52.974325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T00:47:52.959923Z","title":null,"venue":null,"work_id":"40f0d9b6-4118-4a01-a704-8754eb011a49","year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.506044Z"},"links":{"citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:ca85911ffe9aefb716508046602f65c77de4a1123ea80f1a9739c51e7611dc7f","observation_id":"cda9c693-6e3a-4b49-84b7-35ea6863a103","resolution":{"observed_at":"2026-08-11T00:47:52.963583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T00:47:52.509718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.509718Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:a760f19b98ec5396244222ceb391397eb6420827631efec7aec25ec210ca92e0","observation_id":"e4514247-2ebd-4ed2-bc74-e7053b154cfd","resolution":{"observed_at":"2026-08-11T00:47:52.509718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-11T00:47:52.513342Z","title":"W.; Dai, Z.; Tsvetkov, Y.; and Cao, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.513342Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:9ae12f160e1fbc1cd1997c2bc9bd230da5b0dd662693fc5472c3a06a6e1bf202","observation_id":"d03c0505-7d79-4c8e-a6d6-0fb2112b0a24","resolution":{"observed_at":"2026-08-11T00:47:52.513342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.04799","last_updated":"2022-08-05T11:26:06Z","snapshot_observed_at":"2026-08-11T20:23:09.080946Z","submitted_at":"2022-04-10T23:36:55Z","title":"DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning","version":2},"cited_work":{"arxiv_id":"2204.04799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.04799","snapshot_observed_at":"2026-08-11T00:47:52.611019Z","title":"DualPrompt: Complementary Prompting for Rehearsal-free Continual Learning","venue":"cs.LG","work_id":"a6a0507b-90b5-4637-8d67-b77c79380cb5","year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.517018Z"},"links":{"cited_paper":"/paper/2204.04799","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:1d1396ee72e7b541228312a807350d60237c3666a623cfec16a6fff45e8ca178","observation_id":"9268e79b-dd81-410f-803d-edb3aa4c880f","resolution":{"observed_at":"2026-08-11T00:47:52.615222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04858","last_updated":"2023-10-22T04:18:00Z","snapshot_observed_at":"2026-08-05T03:12:41.655229Z","submitted_at":"2023-02-09T18:57:56Z","title":"Re-ViLM: Retrieval-Augmented Visual Language Model for Zero and Few-Shot Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04858","snapshot_observed_at":"2026-08-11T00:47:52.520772Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.520772Z"},"links":{"cited_paper":"/paper/2302.04858","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:b65004b3523deed719dd28d786b2fd65993e0f89651a1fed54729389168c17f1","observation_id":"91256ac0-9dd6-41e1-9938-660fafd9122c","resolution":{"observed_at":"2026-08-11T00:47:52.520772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03715","last_updated":"2024-03-06T14:00:31Z","snapshot_observed_at":"2026-08-13T04:02:15.514893Z","submitted_at":"2024-03-06T14:00:31Z","title":"MeaCap: Memory-Augmented Zero-shot Image Captioning","version":1},"cited_work":{"arxiv_id":"2403.03715","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.03715","snapshot_observed_at":"2026-08-11T00:47:52.583947Z","title":"MeaCap: Memory-Augmented Zero-shot Image Captioning","venue":"cs.CV","work_id":"4edb6add-d99f-4263-914f-61f8060a968c","year":2024},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.524701Z"},"links":{"cited_paper":"/paper/2403.03715","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:96f02de7ca934a82448042f0c6b82dd74244439ece1c9f7c1cda08efb3f661fa","observation_id":"c8eb9d5e-d19c-4e4b-bd0c-15a77cdf443e","resolution":{"observed_at":"2026-08-11T00:47:52.590167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T00:47:52.528543Z","title":"V.; Mihaylov, T.; Ott, M.; Shleifer, S.; Shuster, K.; Simig, D.; Koura, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.528543Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:17d2b07960eb04ef2553e826a7e6f97a19225db391425b536fa29f3eb4121af7","observation_id":"a85aaa13-e464-4ee1-90cf-551ff68e6e21","resolution":{"observed_at":"2026-08-11T00:47:52.528543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T00:47:52.532503Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T00:47:52.532503Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.19289"},"observation_digest":"sha256:bfa7cdaa3134f7de777ee0074030d9e33f924c75e1d9911a485908100a197fbc","observation_id":"a0fcaac9-22ea-4392-b6f1-fb1b67373a17","resolution":{"observed_at":"2026-08-11T00:47:52.532503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.19289","last_updated":"2025-01-24T16:16:52Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T01:45:20.152144Z","submitted_at":"2024-12-26T17:29:38Z","title":"ViPCap: Retrieval Text-Based Visual Prompts for Lightweight Image Captioning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2412.19289."}