{"as_of":"2026-08-07T19:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f289961536a95e6842a2eb6177e27e733053ab3d7570301dc4cdcba752ef1cb","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:18.994193Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:09:44.426723Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T09:50:00.546571Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2204.00598"},"observation_digest":"sha256:5893e9513b907043de8da5fc7f7c5a1d70a84499f7426c68fc63810794e9540e","observation_id":"9e39cb2a-dfe9-4514-bac3-8f235c4f40e0","resolution":{"observed_at":"2026-05-16T09:50:00.718168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:9d7bff8590bc65f7b4c2205392183edb97447c486e958974485b71e77c1a59df","observation_id":"8cfeab8e-d3b3-4a90-9f76-16506dde437b","resolution":{"observed_at":"2026-05-12T04:22:30.476566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:dfefbbbca045562d3c8a1b69a9a4a92f2b147c2708353aa9d512fa97aa3ec430","observation_id":"7f11e737-20da-46c7-9a1c-c8852ac93363","resolution":{"observed_at":"2026-05-13T14:22:17.333000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-06T06:36:02.994951Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:d2f72990500f5f0f869a5ac6894adb3f3887af9de692d5ba0754075712ebe6b4","observation_id":"1ef5c014-1562-48d7-b252-38993a4e3396","resolution":{"observed_at":"2026-05-14T23:07:42.528525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T08:41:04.743886Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2304.15010"},"observation_digest":"sha256:708fc108b1fea59f363d842b20453b21a05e199fe3c98e637f4add6ca4cc1cc8","observation_id":"f7f1d37a-c0ba-42f8-a149-1b8b39a8f713","resolution":{"observed_at":"2026-05-15T08:41:04.887711Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2309.08532","last_updated":"2025-05-01T11:56:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-15T16:50:09Z","title":"EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers","version":3},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-16T06:11:49.475825Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2309.08532"},"observation_digest":"sha256:a65e991d0daa1fec794d3d287019b8b717e0466b80d4c7c6295f9dc14db1be7a","observation_id":"c9e2d1eb-3be7-4be7-96fe-9b7e798c957e","resolution":{"observed_at":"2026-05-16T06:11:49.649827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T15:36:18.994193Z","title":"arXiv preprint arXiv:2111.09734 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14499","last_updated":"2025-05-24T01:55:28Z","snapshot_observed_at":"2026-08-07T15:31:01.444589Z","submitted_at":"2025-05-20T15:28:26Z","title":"Enhanced Multimodal Aspect-Based Sentiment Analysis by LLM-Generated Rationales","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:18.994193Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.14499"},"observation_digest":"sha256:feac597ada9e75d4561f9a56285dd0000531413e3f5175a0f3c8a85c315bbc7d","observation_id":"b33833fc-4b2a-4ccf-82ac-1e8cdf30cc3c","resolution":{"observed_at":"2026-08-07T15:36:18.994193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T13:40:19.824796Z","title":"Mokady, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21304","last_updated":"2025-05-27T15:06:04Z","snapshot_observed_at":"2026-08-07T13:28:11.259893Z","submitted_at":"2025-05-27T15:06:04Z","title":"Optimizing fMRI Data Acquisition for Decoding Natural Speech with Limited Participants","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:40:19.824796Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.21304"},"observation_digest":"sha256:544615c90ec82e8f3b923e678adab7c3e00bd31c16bf9988e265bd22d77719a8","observation_id":"c22dbbde-1000-446b-a047-623d6876de8c","resolution":{"observed_at":"2026-08-07T13:40:19.824796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T12:52:44.090056Z","title":"Mokady, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-07T12:45:25.731445Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.090056Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:df0e7213e971f63bfe89448a856030fc436016587fe8ee2a38179a18c3d43373","observation_id":"ab95742f-af91-4837-a8be-418c7492f131","resolution":{"observed_at":"2026-08-07T12:52:44.090056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T12:35:36.351321Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24227","last_updated":"2025-05-30T05:30:02Z","snapshot_observed_at":"2026-08-07T12:26:37.666691Z","submitted_at":"2025-05-30T05:30:02Z","title":"Light as Deception: GPT-driven Natural Relighting Against Vision-Language Pre-training Models","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T12:35:36.351321Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.24227"},"observation_digest":"sha256:46e2dcc2717372d26b0793c91c8543e5b204824f5f3226fa7d4e27586f4ab73c","observation_id":"22bc1e94-042a-402c-aa38-1f117cddb53e","resolution":{"observed_at":"2026-08-07T12:35:36.351321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T12:02:10.602373Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00806","last_updated":"2025-06-01T03:15:29Z","snapshot_observed_at":"2026-08-07T11:55:15.725512Z","submitted_at":"2025-06-01T03:15:29Z","title":"Fast or Slow? Integrating Fast Intuition and Deliberate Thinking for Enhancing Visual Question Answering","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:10.602373Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.00806"},"observation_digest":"sha256:f2fd43660257cd7b62be83d8efea541b12e9a163dacc3915ee746048d013d803","observation_id":"01ceb64c-abd4-4229-8c0d-a17cd390032c","resolution":{"observed_at":"2026-08-07T12:02:10.602373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T10:59:18.927640Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03933","last_updated":"2026-06-10T10:07:38Z","snapshot_observed_at":"2026-08-07T16:57:10.610923Z","submitted_at":"2025-06-04T13:26:33Z","title":"Diffusion-based Cumulative Adversarial Purification for Vision Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:59:18.927640Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.03933"},"observation_digest":"sha256:8aed347f717ddb42e8742d6aa948fc8338271828deb83a89f499ac68823d1ffc","observation_id":"fe79f438-6836-4404-9e98-d2e7b2503694","resolution":{"observed_at":"2026-08-07T10:59:18.927640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T04:54:15.589604Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:15.589604Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:3d633b5aff1920b320d6bfb948d9c4143f1509f416483de45ec591dccef2302c","observation_id":"f8c28283-b524-4c6a-bf1d-4adbcaf03595","resolution":{"observed_at":"2026-08-07T04:54:15.589604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T00:58:07.909306Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12411","last_updated":"2025-06-14T09:08:34Z","snapshot_observed_at":"2026-08-07T08:55:39.513232Z","submitted_at":"2025-06-14T09:08:34Z","title":"InverTune: Removing Backdoors from Multimodal Contrastive Learning Models via Trigger Inversion and Activation Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:58:07.909306Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.12411"},"observation_digest":"sha256:278e34c3ed8e45ba570f20a4bb5f817aeefe56dbe68cf4f5da6681e941ecba4d","observation_id":"cf1e06e5-7ae9-47e5-bee9-f8ce5f3120ed","resolution":{"observed_at":"2026-08-07T00:58:07.909306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T00:56:01.612867Z","title":"ClipCap: CLIP prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12447","last_updated":"2025-07-30T12:01:35Z","snapshot_observed_at":"2026-08-07T00:47:31.701313Z","submitted_at":"2025-06-14T10:59:00Z","title":"CLIP-HandID: Vision-Language Model for Hand-Based Person Identification","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:56:01.612867Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.12447"},"observation_digest":"sha256:defcedfe3d94f5226a842252d4fe8e3aaaad8ba5757a552bdf08467c7f224e7c","observation_id":"3bb5433a-a261-423b-a2dc-691adfbaa877","resolution":{"observed_at":"2026-08-07T00:56:01.612867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T23:41:41.828926Z","title":"[Mokady and Hertz, 2021] Ron Mokady and Amir Hertz","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.828926Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:fe626f5ad010e00def0b3c3e9604b94356460ae6adda6466326df97ce76c8a5b","observation_id":"59700003-ea25-4573-9220-5fa415e5f49c","resolution":{"observed_at":"2026-08-06T23:41:41.828926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T21:51:55.557921Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-06T21:44:47.288817Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.557921Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:6b4e8a7e39c59d7d68c4590a482f56b08bf797b7c923ae9d59e9fb3099efc4ac","observation_id":"46177889-2581-457d-bd97-0e86f0a016ed","resolution":{"observed_at":"2026-08-06T21:51:55.557921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T20:11:51.511161Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-07T14:21:56.806927Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.511161Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:89b05099011a786ca7635d9c3532428f0efc3a68dbbeec842c7ddcfaebce83c5","observation_id":"ca8ccce3-3a66-418b-96d1-4e4cd7f48a02","resolution":{"observed_at":"2026-08-06T20:11:51.511161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T16:37:21.189934Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13089","last_updated":"2025-07-17T12:58:15Z","snapshot_observed_at":"2026-08-06T16:28:24.176563Z","submitted_at":"2025-07-17T12:58:15Z","title":"GLAD: Generalizable Tuning for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:21.189934Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.13089"},"observation_digest":"sha256:cdb7bfd2e6bbc4ff5a0654d1efc0274f823f9b4cc30d6b8a8c57ddfdd1b0e884","observation_id":"5772af9d-23eb-449e-94e4-c3813760953a","resolution":{"observed_at":"2026-08-06T16:37:21.189934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T16:32:42.735751Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13318","last_updated":"2025-07-17T17:37:24Z","snapshot_observed_at":"2026-08-06T16:23:14.574743Z","submitted_at":"2025-07-17T17:37:24Z","title":"HapticCap: A Multimodal Dataset and Task for Understanding User Experience of Vibration Haptic Signals","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:32:42.735751Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.13318"},"observation_digest":"sha256:c38db86741cf2089232bf07cad4311dbadbc0be74c6cf11c4a21d48c88caf064","observation_id":"bc89fd79-83dc-4729-b9f0-7d938b076d9e","resolution":{"observed_at":"2026-08-06T16:32:42.735751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T15:02:08.416252Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17080","last_updated":"2025-07-22T23:45:43Z","snapshot_observed_at":"2026-08-06T14:54:51.848171Z","submitted_at":"2025-07-22T23:45:43Z","title":"VL-CLIP: Enhancing Multimodal Recommendations via Visual Grounding and LLM-Augmented CLIP Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:08.416252Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.17080"},"observation_digest":"sha256:12a94da8d2e95d704036c7cc7dac0d0fa5bda84ec3c19238b83ddedd6957813f","observation_id":"31ab0b8a-1df3-43a3-a031-d3671c0d56f2","resolution":{"observed_at":"2026-08-06T15:02:08.416252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T05:51:16.018283Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-07T10:22:34.344208Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:16.018283Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:ed4bb610e82b0a71307b6d2c413953419ccba71bbb4f53e77a08831af207d11e","observation_id":"e640f75c-908b-4092-86a0-39c9f77051fa","resolution":{"observed_at":"2026-08-06T05:51:16.018283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T01:04:10.551418Z","title":"Clip- cap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.03967","last_updated":"2025-08-05T23:10:56Z","snapshot_observed_at":"2026-08-06T17:47:06.040364Z","submitted_at":"2025-08-05T23:10:56Z","title":"RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T01:04:10.551418Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2508.03967"},"observation_digest":"sha256:a7743535f486157e6506ae237b9a75a82968d73d8bcf598e4538674cfab13b95","observation_id":"6ce12810-cef8-4ad1-84c7-e4a6e8381ad2","resolution":{"observed_at":"2026-08-06T01:04:10.551418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T10:27:39.338214Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14045","last_updated":"2025-07-31T16:44:23Z","snapshot_observed_at":"2026-08-06T23:21:03.442673Z","submitted_at":"2025-07-31T16:44:23Z","title":"From Image Captioning to Visual Storytelling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:39.338214Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2508.14045"},"observation_digest":"sha256:e823e0b488fbcf11ca7d635ad934d803248e6b121e01d15f092580ffce32b23e","observation_id":"37b79eda-e591-486e-aa15-4fabec394308","resolution":{"observed_at":"2026-08-06T10:27:39.338214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-05T17:25:01.008591Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16707","last_updated":"2025-08-22T13:25:58Z","snapshot_observed_at":"2026-08-06T02:09:57.615441Z","submitted_at":"2025-08-22T13:25:58Z","title":"Sparse and Dense Retrievers Learn Better Together: Joint Sparse-Dense Optimization for Text-Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:25:01.008591Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2508.16707"},"observation_digest":"sha256:c5f463b7f16ca268d35e229442b5d8410950ccf8ab1a5b1ca2374d17936a8230","observation_id":"572e5683-939d-454a-90ad-ac72b0abbdc5","resolution":{"observed_at":"2026-08-05T17:25:01.008591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-05T06:00:27.509894Z","title":"Clipcap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.04606","last_updated":"2025-09-04T18:41:59Z","snapshot_observed_at":"2026-08-05T06:00:25.885677Z","submitted_at":"2025-09-04T18:41:59Z","title":"Sample-efficient Integration of New Modalities into Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T06:00:27.509894Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2509.04606"},"observation_digest":"sha256:781ce42cccf19b131db287f377cb7e14a07eb4d7b06ce146e8a6f044f64fd434","observation_id":"5d63d557-c52c-4e6c-9495-328a74914cf5","resolution":{"observed_at":"2026-08-05T06:00:27.509894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-05T04:53:40.077127Z","title":"Clip- cap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-05T04:53:36.655356Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:40.077127Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:a99df999f496ead07e208a8b366d2e4331e08355be30c149998d76a724c2372c","observation_id":"cdb27136-dcf8-43a4-98ed-2f7bc45059c5","resolution":{"observed_at":"2026-08-05T04:53:40.077127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-04T10:26:22.120641Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.09935","last_updated":"2026-08-01T19:12:06Z","snapshot_observed_at":"2026-08-06T23:10:38.898273Z","submitted_at":"2025-10-11T00:25:27Z","title":"Unpacking Hateful Memes: Presupposed Context and False Claims","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T10:26:22.120641Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2510.09935"},"observation_digest":"sha256:3df0b552b7c877feba52e5ea39e7bd3506afe272bf3e856f12c05e91281e7c85","observation_id":"2b145175-6648-4219-93e1-146d1a146dd3","resolution":{"observed_at":"2026-08-04T10:26:22.120641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-03T18:25:04.998120Z","title":"Clip- cap: Clip prefix for image captioning.arXiv preprint arXiv:2111.09734, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.05530","last_updated":"2026-06-02T03:33:30Z","snapshot_observed_at":"2026-08-07T14:28:27.717799Z","submitted_at":"2025-12-05T08:41:44Z","title":"MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:25:04.998120Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2512.05530"},"observation_digest":"sha256:a9040cae5919f3651a6f32065920b5301523edd07a9d1e92b70de90225fc8f11","observation_id":"b975f0e4-ca19-4fb7-8c9c-0fd08cb67a97","resolution":{"observed_at":"2026-08-03T18:25:04.998120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2601.09298","last_updated":"2026-05-07T06:40:25Z","snapshot_observed_at":"2026-08-07T01:21:01.981841Z","submitted_at":"2026-01-14T09:01:46Z","title":"Multi-Modal LLM based Image Captioning in ICT: Bridging the Gap Between General and Industry Domain","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T14:26:08.188950Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2601.09298"},"observation_digest":"sha256:ac26f7bfa130f115e7ab7af3e46b5713cf845b0383a261ff79e9c71ebf379260","observation_id":"c1124a2e-2683-494b-8f0b-106e84704a6b","resolution":{"observed_at":"2026-05-16T14:27:59.324632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-03T06:06:52.217522Z","title":"Mokady, R., Hertz, A., and Bermano, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.00462","last_updated":"2026-07-22T15:20:17Z","snapshot_observed_at":"2026-08-03T09:39:30.314678Z","submitted_at":"2026-01-31T02:33:07Z","title":"LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:52.217522Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2602.00462"},"observation_digest":"sha256:94d160edf899ec9c852502d9f36a8d555e44cdc61accc5f8b7e8787a3f987dff","observation_id":"b0ce17dd-d1ad-4f4c-bd35-81170c9a0278","resolution":{"observed_at":"2026-08-03T06:06:52.217522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2604.04473","last_updated":"2026-04-06T06:48:32Z","snapshot_observed_at":"2026-08-02T18:27:59.544984Z","submitted_at":"2026-04-06T06:48:32Z","title":"Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:42.128350Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2604.04473"},"observation_digest":"sha256:a1386ceb1efe36292f05bb432786261212b18f64233ceba27eca1cf35285857c","observation_id":"9df69bec-bde3-4b33-8a69-849040417ee2","resolution":{"observed_at":"2026-05-10T21:55:52.655740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2604.04608","last_updated":"2026-04-06T11:50:29Z","snapshot_observed_at":"2026-08-06T06:14:55.966523Z","submitted_at":"2026-04-06T11:50:29Z","title":"Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:34.752473Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2604.04608"},"observation_digest":"sha256:4fc82193eb3382b273afb0cd8af1fc4a16e6189ae964eb725fc98ce19610c7bf","observation_id":"5f07988e-3ad6-4978-80fe-4f081982dca2","resolution":{"observed_at":"2026-05-10T23:45:53.240217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2604.05583","last_updated":"2026-04-07T08:23:39Z","snapshot_observed_at":"2026-07-30T03:36:30.860630Z","submitted_at":"2026-04-07T08:23:39Z","title":"WRF4CIR: Weight-Regularized Fine-Tuning Network for Composed Image Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T19:31:53.371412Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2604.05583"},"observation_digest":"sha256:a2d903a2d9d96f8bf4bac7f5567fada282d60f218602b6ccce5e28fb36cd8019","observation_id":"71069924-22ff-4aa0-9434-e119450329e7","resolution":{"observed_at":"2026-05-10T22:50:50.060959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:5813cfd1f288aa8fd943b6d7b7844a53ed823afcf30b6d0ce279e2eec969c904","observation_id":"7220993c-f54f-4276-a5d2-fa3928c388d9","resolution":{"observed_at":"2026-05-11T07:00:59.421777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2604.10132","last_updated":"2026-04-11T09:53:09Z","snapshot_observed_at":"2026-07-06T22:58:51.931478Z","submitted_at":"2026-04-11T09:53:09Z","title":"Semantic Manipulation Localization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:30.345594Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2604.10132"},"observation_digest":"sha256:27fce9d642ad446946c3a0393e178c632889d9934b2230ebe847a95ee1d0d39f","observation_id":"8baee550-4afd-4f0e-93bb-73d6a391dc69","resolution":{"observed_at":"2026-05-11T10:21:01.497760Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2605.09902","last_updated":"2026-05-11T02:45:48Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:45:48Z","title":"Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:19:31.570783Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2605.09902"},"observation_digest":"sha256:31aeba3fa1bfd19c711edf6c2d987ef1e9d0b92369420c7a939b00b9f8781ddc","observation_id":"0f5c2bc7-85a8-4cc2-9b2d-d5129afbf14b","resolution":{"observed_at":"2026-05-12T06:21:27.865530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-02T12:36:41.415898Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:c8da5f9c40fd9ff2056618ce633dfd8335c96b78e266ac4db2d1329960111d09","observation_id":"6448c78a-b35d-4ece-9770-8503072ef485","resolution":{"observed_at":"2026-05-14T20:22:56.290381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2605.29836","last_updated":"2026-05-28T12:16:41Z","snapshot_observed_at":"2026-08-04T17:02:42.545515Z","submitted_at":"2026-05-28T12:16:41Z","title":"CB-SLICE: Concept-Based Interpretable Error Slice Discovery","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T08:24:05.284777Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2605.29836"},"observation_digest":"sha256:1651b374bd521fe9baa4983dc666c0ef75352c40e184744f8fd8f2997720aee6","observation_id":"c8556bc0-b861-478f-a3f6-fd1aa2d5a44e","resolution":{"observed_at":"2026-06-29T08:33:15.862374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2605.31246","last_updated":"2026-05-29T12:46:15Z","snapshot_observed_at":"2026-07-06T23:40:27.543522Z","submitted_at":"2026-05-29T12:46:15Z","title":"BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T21:52:23.150188Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2605.31246"},"observation_digest":"sha256:c465fdca245b642e542f8ffb2be0f2ded5efafd7c294c65686efb211be7054d9","observation_id":"7d56f8ed-0f49-49f4-9f85-a227732d0549","resolution":{"observed_at":"2026-07-01T19:56:11.285729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2606.11074","last_updated":"2026-06-10T03:48:53Z","snapshot_observed_at":"2026-08-02T04:11:10.383026Z","submitted_at":"2026-06-09T16:34:37Z","title":"Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-27T13:04:14.886733Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2606.11074"},"observation_digest":"sha256:ebf534d679315b9a7a5d85d9e57e35c046e4d1ccfe17d129b889a82124a9e4fc","observation_id":"f8dcd612-4f0c-4991-9f92-1439fb961543","resolution":{"observed_at":"2026-07-03T05:47:41.791066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2606.11853","last_updated":"2026-06-10T09:30:25Z","snapshot_observed_at":"2026-08-02T20:07:37.622537Z","submitted_at":"2026-06-10T09:30:25Z","title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:11.440915Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2606.11853"},"observation_digest":"sha256:7ccfa52cfeb5a141dc7d708a147a5710808e3dea06e964cce1a9ff1004ae4e5a","observation_id":"654c879a-756d-4bd0-8cac-797032805010","resolution":{"observed_at":"2026-07-03T09:07:48.402050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2606.13288","last_updated":"2026-06-11T12:45:25Z","snapshot_observed_at":"2026-07-06T23:52:04.574604Z","submitted_at":"2026-06-11T12:45:25Z","title":"Cross-Modal Masked Compositional Concept Modeling for Enhancing Visio-Linguistic Compositionality","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T07:03:50.311891Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2606.13288"},"observation_digest":"sha256:272c3b7f99562762a59f78d372724613a150ef47dbabc607e7a4f6c0b3d1e346","observation_id":"a362ee84-0f95-42af-9045-4b243e1564fa","resolution":{"observed_at":"2026-07-03T14:28:31.474526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2606.17213","last_updated":"2026-06-15T18:51:31Z","snapshot_observed_at":"2026-08-02T10:09:29.451711Z","submitted_at":"2026-06-15T18:51:31Z","title":"Revisiting LLM Adaptation for 3D CT Report Generation: A Study of Scaling and Diagnostic Priors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T03:21:31.374575Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2606.17213"},"observation_digest":"sha256:b5501854ac5a9c76f2a7bcb7d54b77d5e6d33a4434dc5b11629582f5762dd41d","observation_id":"0d8381db-8362-4d59-a50f-42218480667e","resolution":{"observed_at":"2026-07-03T18:08:45.673868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":"2111.09734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-04T10:09:44.426723Z","title":"arXiv preprint arXiv: 2111.09734 (2021)","venue":null,"work_id":"6cf76e0a-4411-443c-b127-57f0f3574f41","year":2021},"citing_paper":{"arxiv_id":"2606.22766","last_updated":"2026-06-22T02:05:38Z","snapshot_observed_at":"2026-08-02T06:47:45.939401Z","submitted_at":"2026-06-22T02:05:38Z","title":"READ More than What You See: Reinforcement Learning for Accurate and Coherent Audio Description Generations","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T09:09:23.918802Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2606.22766"},"observation_digest":"sha256:488162493a202b23b6924a2eae7423ac8ea49c518912a8033d9ba31552c6b0ff","observation_id":"bafcd518-7a9b-4e9f-bb70-5fe86f8df660","resolution":{"observed_at":"2026-07-04T10:09:44.428197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-07-14T12:36:44.253836Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10329","last_updated":"2026-07-11T14:13:10Z","snapshot_observed_at":"2026-08-06T18:15:05.904038Z","submitted_at":"2026-07-11T14:13:10Z","title":"Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T12:36:44.253836Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2607.10329"},"observation_digest":"sha256:9ef5045d90bcd86a3fc575d390dbd3c1af021fdbd1639795f7396344a0e2cc67","observation_id":"a5b94a51-91e3-4fd7-a8e7-d2225fc2f004","resolution":{"observed_at":"2026-07-14T12:36:44.253836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-01T04:11:19.003885Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24845","last_updated":"2026-07-30T11:45:04Z","snapshot_observed_at":"2026-08-06T16:38:50.427863Z","submitted_at":"2026-07-24T22:45:33Z","title":"REPREC: Representation Driven Parameter-Efficient Recommendation System","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T04:11:19.003885Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2607.24845"},"observation_digest":"sha256:0ea222d294c74567e98f0a2600a2b8cf194cf0836298fbfb8d2891496dd88b2c","observation_id":"8a086778-493c-4d97-8136-8dd41944fa15","resolution":{"observed_at":"2026-08-01T04:11:19.003885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-03T15:58:39.520616Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-06T05:41:12.263610Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:39.520616Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:72911fabe3c17936ec822f3da42df7cc51ca1283cf3a73c70af8ea0173bd4aac","observation_id":"5627ffab-96fe-4073-beb5-8f53e77b3fa6","resolution":{"observed_at":"2026-08-03T15:58:39.520616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2111.09734/citation-record","integrity":"/paper/2111.09734/integrity","json":"/paper/2111.09734/citation-record.json","paper":"/paper/2111.09734"},"outbound":[],"paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2111.09734."}