{"as_of":"2026-08-07T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de8176497bdec0b2308636c3875bc4a6237cd3e66a8b124497276d5f69194aa3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:53:46.451945Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:07:53.330969Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:712388e83b5e655d5dd35bc87806db0c75315bbf3da9a1ed1ec0005d292b6a1d","observation_id":"7589c8ec-0140-4b7f-81b2-ff07c748df29","resolution":{"observed_at":"2026-05-16T09:38:09.582884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:9aa1a64be19fe8fa1f3ba565c9746b10506b5f7aa71f80c0212c99b3dedf9d78","observation_id":"5f7e8f8d-54ba-487d-829a-68adacc53d8b","resolution":{"observed_at":"2026-05-12T04:22:30.453088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:677f36571e980a2820abae14fe36b183cec3bc4e0cce39e937d8235570328e3f","observation_id":"2adb3506-7cbf-4907-86c4-9ca1be6fd63b","resolution":{"observed_at":"2026-05-15T10:53:08.484747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2208.14649","last_updated":"2026-04-22T00:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-31T06:18:10Z","title":"DetailCLIP: Injecting Image Details into CLIP's Feature Space","version":7},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T11:08:20.298043Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2208.14649"},"observation_digest":"sha256:b53d036938a63eaa2e55ff4dc0a2b3ad3e0219f738b45c46b7398e927738f17d","observation_id":"e8122669-16c3-4e8f-8f51-891e7666a1e8","resolution":{"observed_at":"2026-05-24T11:09:22.391885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:0e5d763767dfc829635b691564e0dc3692e03d8bd80e48dab40c2ac97c7833b9","observation_id":"394409b5-09ee-46ff-b7a7-49f06cd927e2","resolution":{"observed_at":"2026-05-17T00:36:53.293435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:ef77b25c096b3e520d72bd837a4fdb75ba1073202ebd0fb8d3dab2f61ad6e4b3","observation_id":"25df6251-3b0c-4dbc-8297-b07522936587","resolution":{"observed_at":"2026-05-13T23:30:00.687974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:775cc04824ed7628801c40f7b05688aa56dab695b39a3001987a0897b1c17b90","observation_id":"0674e91f-b242-4d8b-aa76-cbcaa4141965","resolution":{"observed_at":"2026-05-15T06:30:22.575279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2410.10247","last_updated":"2026-05-11T10:40:10Z","snapshot_observed_at":"2026-07-06T19:32:51.287674Z","submitted_at":"2024-10-14T08:06:21Z","title":"LPT: Less-overfitting Prompt Tuning for Vision-Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T19:03:25.106193Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2410.10247"},"observation_digest":"sha256:b4dad248ca922ecd3f7649d10427ef85a4fc2845554fec323ad8b9887be2d589","observation_id":"b7e3e877-1b7e-4f8f-9dab-1f673822d2e1","resolution":{"observed_at":"2026-05-23T19:05:47.187508Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2505.13777","last_updated":"2026-04-11T05:01:03Z","snapshot_observed_at":"2026-07-06T21:26:40.118249Z","submitted_at":"2025-05-19T23:36:04Z","title":"Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T13:38:17.640841Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2505.13777"},"observation_digest":"sha256:69e976de0abd66e9611c07fbbe1fc00222aa5687831a7bb8cc80f8367128eca3","observation_id":"636e17f1-91bf-48be-b23d-60c25914a9b4","resolution":{"observed_at":"2026-05-22T13:41:36.652595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-07T05:53:46.451945Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06884","last_updated":"2025-06-07T18:26:58Z","snapshot_observed_at":"2026-08-07T05:44:38.165901Z","submitted_at":"2025-06-07T18:26:58Z","title":"FREE: Fast and Robust Vision Language Models with Early Exits","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T05:53:46.451945Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2506.06884"},"observation_digest":"sha256:9acf118cd3c34eb1e5837618be40d3bd5533b2e68be26917d59722f6002f6a4f","observation_id":"91644c81-a5f5-4f68-a16d-b45b1a3b89c3","resolution":{"observed_at":"2026-08-07T05:53:46.451945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-07T00:47:50.404759Z","title":"M3ae: Multi-modal model pre- training with masked autoencoders","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12724","last_updated":"2025-06-15T05:15:52Z","snapshot_observed_at":"2026-08-07T00:41:20.866557Z","submitted_at":"2025-06-15T05:15:52Z","title":"Dynamic Modality Scheduling for Multimodal Large Models via Confidence, Uncertainty, and Semantic Consistency","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:47:50.404759Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2506.12724"},"observation_digest":"sha256:0b6a3ac65b4e6f0e46e6a2ee68fe1d079b50fd3bb843973749049dfd273f4703","observation_id":"8b568bdd-c956-4ff0-8550-f4dff723ec8e","resolution":{"observed_at":"2026-08-07T00:47:50.404759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T23:28:12.914424Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.18072","last_updated":"2025-09-03T16:04:55Z","snapshot_observed_at":"2026-08-06T23:21:00.198107Z","submitted_at":"2025-06-22T15:39:25Z","title":"Multimodal Medical Image Binding via Shared Text Embeddings","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:12.914424Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2506.18072"},"observation_digest":"sha256:3d9270744bec2a9d29e4d0638e5b028ae685de04cdb19dc6b69fa962a24eb3d5","observation_id":"e18e71dd-2079-4c9d-97c5-8feaabc0f774","resolution":{"observed_at":"2026-08-06T23:28:12.914424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T22:33:35.382549Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21476","last_updated":"2025-06-26T17:05:06Z","snapshot_observed_at":"2026-08-06T22:22:07.574344Z","submitted_at":"2025-06-26T17:05:06Z","title":"Global and Local Entailment Learning for Natural World Imagery","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:33:35.382549Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2506.21476"},"observation_digest":"sha256:9d2648b0e041b776dcdd29ce39656034d5ada4b641c0ae8d4b36fae8b53d1f21","observation_id":"aeff4d42-cf50-4119-b915-40f1fc14ae37","resolution":{"observed_at":"2026-08-06T22:33:35.382549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T20:11:51.667082Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03683","last_updated":"2025-07-04T16:03:31Z","snapshot_observed_at":"2026-08-06T20:02:05.494842Z","submitted_at":"2025-07-04T16:03:31Z","title":"On the rankability of visual embeddings","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:11:51.667082Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.03683"},"observation_digest":"sha256:e33527345f0f2682838014ab6b5aa3b0bc8f2154e558b80800610157b06ea2ea","observation_id":"2dd22aa8-820d-4c84-b04a-02be321730dd","resolution":{"observed_at":"2026-08-06T20:11:51.667082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T17:47:56.156463Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10095","last_updated":"2025-07-29T02:40:10Z","snapshot_observed_at":"2026-08-06T17:37:17.850345Z","submitted_at":"2025-07-14T09:31:34Z","title":"FIX-CLIP: Dual-Branch Hierarchical Contrastive Learning via Synthetic Captions for Better Understanding of Long Text","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:56.156463Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.10095"},"observation_digest":"sha256:0d98b61b96b7625596375b8e121ac04dcd8941942f82c38c0aaa5f400a3bb5aa","observation_id":"bc37e39e-0277-4cf0-8044-0384f944813d","resolution":{"observed_at":"2026-08-06T17:47:56.156463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T12:26:42.549669Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21786","last_updated":"2025-07-29T13:15:09Z","snapshot_observed_at":"2026-08-06T12:26:41.676463Z","submitted_at":"2025-07-29T13:15:09Z","title":"MSGCoOp: Multiple Semantic-Guided Context Optimization for Few-Shot Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:42.549669Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.21786"},"observation_digest":"sha256:525f1ddae54722778c6836d7bece12509214eef120c523cf2066daa75b45e80f","observation_id":"1f619dc8-8c22-41ad-9e55-a49108b73bb6","resolution":{"observed_at":"2026-08-06T12:26:42.549669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T11:20:07.035625Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22791","last_updated":"2026-06-11T08:47:41Z","snapshot_observed_at":"2026-08-06T11:20:00.457736Z","submitted_at":"2025-07-30T15:56:36Z","title":"Modality-Aware Feature Matching in Visual and Vision-Language Applications: A Comprehensive Survey","version":2},"reference_index":226,"source":"pdf_text","source_observed_at":"2026-08-06T11:20:07.035625Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2507.22791"},"observation_digest":"sha256:be5d125850137a7362420b836f482bfb2f4db2c2efc4165433795f860b0e05bb","observation_id":"69b7ccce-4d7c-41f6-b11a-f4bcb7231546","resolution":{"observed_at":"2026-08-06T11:20:07.035625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-05T23:17:05.859329Z","title":"Filip: Fine-grained interactive language-image pre-training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-06T15:48:30.505708Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:05.859329Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:0f8d2df3ec031375a59c832bed87915b1d95c004438cbc648bbe36df0d4b221e","observation_id":"e716f882-24dc-4ea4-b2f4-4fc56b7832f5","resolution":{"observed_at":"2026-08-05T23:17:05.859329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-05T04:50:31.087108Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05949","last_updated":"2025-09-07T07:07:59Z","snapshot_observed_at":"2026-08-06T23:32:10.538067Z","submitted_at":"2025-09-07T07:07:59Z","title":"AttriPrompt: Dynamic Prompt Composition Learning for CLIP","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T04:50:31.087108Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2509.05949"},"observation_digest":"sha256:5ef38c6a38886d35b051d8745e847e680ee7d33d6f632263d08b53bd215898cd","observation_id":"7e870abf-54be-4205-ab3e-7161bff43bc1","resolution":{"observed_at":"2026-08-05T04:50:31.087108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2510.16335","last_updated":"2026-05-22T11:52:39Z","snapshot_observed_at":"2026-07-06T22:33:28.866887Z","submitted_at":"2025-10-18T03:48:01Z","title":"On the Provable Importance of Gradients for Language-Assisted Image Clustering","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T07:30:36.437935Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2510.16335"},"observation_digest":"sha256:7cbdea85432c73ff25daf8ef959e3fbe300c1c0fb58484b717fc5121ee569b5d","observation_id":"ca5c6c14-8e03-4eeb-ad10-4c9d3e4ce9cb","resolution":{"observed_at":"2026-05-25T07:35:29.635355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2511.13415","last_updated":"2026-05-09T06:27:59Z","snapshot_observed_at":"2026-07-06T22:36:00.635873Z","submitted_at":"2025-11-17T14:28:41Z","title":"Attention Grounded Enhancement for Visual Document Retrieval","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T20:53:15.920563Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2511.13415"},"observation_digest":"sha256:5e9f505d201a9c3a8068d56c8097bcda79497e3e1f418ee72c6e01d375dcd899","observation_id":"dfddfc6e-3ae2-4001-9e1f-44a32fa27263","resolution":{"observed_at":"2026-05-17T20:55:15.314742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-02T19:41:35.073555Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-07T01:05:21.877289Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:35.073555Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:72c2c3172a88c1e206b3d117be1b39a0c2a070edc03c6bffea664c729e6ee3ee","observation_id":"bf755d44-5954-44b6-a8a1-e62993e965a3","resolution":{"observed_at":"2026-08-02T19:41:35.073555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T13:11:54.384284Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:46f783add988462e3354f242e80ec206037575b82dbae06ad043d818ac1aeec9","observation_id":"a7f74b3d-5bc3-4bf8-926b-8b40bd2cf6d7","resolution":{"observed_at":"2026-05-15T13:15:50.577358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-14T23:55:24.006436Z","title":"Filip: Fine-grained interactive language-image pre-training.ArXiv, abs/2111.07783, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T23:55:24.006436Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:5abea0b269de5c4703629935a175ed13260ee58066fa6835be0abbd5a2556ab0","observation_id":"1fa4fc50-24b3-4829-ad7b-5031b6650632","resolution":{"observed_at":"2026-07-14T23:55:24.006436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2604.11496","last_updated":"2026-04-16T10:51:43Z","snapshot_observed_at":"2026-08-03T05:45:05.795046Z","submitted_at":"2026-04-13T14:03:18Z","title":"Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:00.522094Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2604.11496"},"observation_digest":"sha256:7f84f5c896e42c5a57869322a9fe0dbfb855e37d8b88e1c4f3a62f1a22701e83","observation_id":"d292c2d8-336a-43b3-80d5-44e76beb8772","resolution":{"observed_at":"2026-05-11T08:26:01.808588Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2604.13970","last_updated":"2026-04-15T15:19:54Z","snapshot_observed_at":"2026-07-06T23:01:50.745555Z","submitted_at":"2026-04-15T15:19:54Z","title":"MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:33:02.946839Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2604.13970"},"observation_digest":"sha256:ce9e371eb465cacb7e6defaf30086138ffd5add4a9fe75617861248a9683b622","observation_id":"ffa69be8-970c-43ce-b060-40900efc81b8","resolution":{"observed_at":"2026-05-10T13:35:26.375166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2604.14710","last_updated":"2026-04-16T07:21:21Z","snapshot_observed_at":"2026-08-02T04:52:09.393312Z","submitted_at":"2026-04-16T07:21:21Z","title":"G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T11:50:00.850857Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2604.14710"},"observation_digest":"sha256:9a7ea771011900a1fe821b1edd1898cde77c4fb4a88ecdc1429535316fa85e43","observation_id":"e47a07f3-5fe6-4557-860a-1b6f3f1911fe","resolution":{"observed_at":"2026-05-10T11:50:19.936226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.04425","last_updated":"2026-05-06T02:38:59Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:38:59Z","title":"Joint Semantic Token Selection and Prompt Optimization for Interpretable Prompt Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T17:41:05.464502Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.04425"},"observation_digest":"sha256:0d5855144ff987b0d06164fca34fad834bfc06eb045948aee79b4375da889eb7","observation_id":"51116604-23c3-45d9-9f87-95a5e3786c6f","resolution":{"observed_at":"2026-05-11T17:21:08.369925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.06229","last_updated":"2026-05-07T13:21:11Z","snapshot_observed_at":"2026-07-06T23:18:46.145104Z","submitted_at":"2026-05-07T13:21:11Z","title":"Look Beyond Saliency: Low-Attention Guided Dual Encoding for Video Semantic Search","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T13:39:20.777029Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.06229"},"observation_digest":"sha256:fde5827ec5611af141dc2883de1be00890750093c9cbd4897b12dc5c8721471d","observation_id":"8a8a828c-4b96-4f39-9789-f04baf8c659c","resolution":{"observed_at":"2026-05-11T18:51:07.806567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.08814","last_updated":"2026-05-09T09:05:59Z","snapshot_observed_at":"2026-08-04T19:41:55.383488Z","submitted_at":"2026-05-09T09:05:59Z","title":"Zero-Shot Chinese Character Recognition via Global-Local Dual-Branch Alignment and Hierarchical Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T02:35:05.535416Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.08814"},"observation_digest":"sha256:8a9babfb25df7204af7faa6652310a4bc03ecd40e4e90b814bc3956f9f9be9eb","observation_id":"81dc42ca-f89f-4d22-9fc7-e63ce45a8ce6","resolution":{"observed_at":"2026-05-12T07:31:27.287942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.10130","last_updated":"2026-05-11T07:41:37Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:41:37Z","title":"Thermal-Det: Language-Guided Cross-Modal Distillation for Open-Vocabulary Thermal Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:13.709254Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.10130"},"observation_digest":"sha256:e6829c3e634f25a18bb4d90b57e7842ccca43be277b4c9c3c6d963cf72dcaabc","observation_id":"7764adf1-8b35-47b7-850b-823adbea6315","resolution":{"observed_at":"2026-05-12T03:26:19.251633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.11939","last_updated":"2026-05-12T10:50:43Z","snapshot_observed_at":"2026-08-06T06:51:52.292771Z","submitted_at":"2026-05-12T10:50:43Z","title":"Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T05:56:31.648428Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.11939"},"observation_digest":"sha256:847798053ce8c544badcd1aa9b70770e12ab638fa52cb6bc24c19660ced2de52","observation_id":"2555d6d5-57f1-4b73-bb1a-4715cd7b8f65","resolution":{"observed_at":"2026-05-13T05:57:22.557394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.15615","last_updated":"2026-05-15T04:54:08Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:54:08Z","title":"Neutral-Reference Prompting for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T19:15:54.152498Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.15615"},"observation_digest":"sha256:1be82cb49b8f3d7d2c5b14be15a175a88637aa60fb742280ebc5dfedf37450f0","observation_id":"434480b4-1d01-4c68-a1c3-c492c53ada42","resolution":{"observed_at":"2026-05-20T19:18:54.570655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.18018","last_updated":"2026-05-18T08:09:37Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:09:37Z","title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-20T12:10:54.874012Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.18018"},"observation_digest":"sha256:602d4015d503f1f0240b71c54963a6f637ab9a5b0c63367ec8d65ee0c250eeec","observation_id":"e4d049c0-dbf6-4f4b-966f-21c2cd4be757","resolution":{"observed_at":"2026-05-20T12:13:16.219272Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2605.25922","last_updated":"2026-05-25T15:00:07Z","snapshot_observed_at":"2026-08-02T01:29:33.033813Z","submitted_at":"2026-05-25T15:00:07Z","title":"Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:26.803098Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2605.25922"},"observation_digest":"sha256:6f4841e700669429a776e5e70c6a2b0ebe1e9814ce6c3deeb0a0bb3ac8becd2f","observation_id":"33708721-13b5-468a-8a68-4aed6827ca90","resolution":{"observed_at":"2026-06-29T22:44:01.418341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2606.18885","last_updated":"2026-06-17T10:00:33Z","snapshot_observed_at":"2026-08-04T13:33:45.473188Z","submitted_at":"2026-06-17T10:00:33Z","title":"LARE: Low-Attention Region Encoding for Text-Image Retrieval","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:12.373068Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2606.18885"},"observation_digest":"sha256:f6e338625e8ebb3a33ff13ef911f26b57bb5a7de36308b4a2c46667150918506","observation_id":"30cbd54a-dd56-4b46-8408-ea7436258751","resolution":{"observed_at":"2026-07-04T00:09:15.213914Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2606.23475","last_updated":"2026-06-22T15:22:05Z","snapshot_observed_at":"2026-08-06T19:33:42.775295Z","submitted_at":"2026-06-22T15:22:05Z","title":"Multi-Vector Embeddings are Provably More Expressive than Single Vector Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T06:16:51.174659Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2606.23475"},"observation_digest":"sha256:119cb2b6cba4625ae9b0cfd4e1412a3d811c39f0b1f57e23ac96ed911b8e4331","observation_id":"e0994651-052d-49b9-90dc-93bc2c9e2906","resolution":{"observed_at":"2026-07-04T12:39:49.797760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:3d3127d3e6fa09fc329bc4cf718cfab19f08868100770c817fdfbc9f816269ca","observation_id":"8a4cf79a-e396-4fed-ab52-d5483a6b56f3","resolution":{"observed_at":"2026-07-03T14:48:32.418042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2607.05727","last_updated":"2026-07-07T01:21:33Z","snapshot_observed_at":"2026-08-02T07:38:06.721210Z","submitted_at":"2026-07-07T01:21:33Z","title":"SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T02:59:38.193627Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2607.05727"},"observation_digest":"sha256:0c01edaed5166fe432ad5dbf8ab13f98fd75801e285d1625f53f82e7f7051d48","observation_id":"7172ae34-e34a-4300-b63a-66b73dd6694c","resolution":{"observed_at":"2026-07-11T03:07:53.355970Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2607.07907","last_updated":"2026-07-08T20:42:46Z","snapshot_observed_at":"2026-08-07T04:49:20.628249Z","submitted_at":"2026-07-08T20:42:46Z","title":"Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-10T15:38:58.361411Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2607.07907"},"observation_digest":"sha256:73dbd6cf2b4f37cc411ecbc113802d8031ec099620fa251cb00385aae65b3cc3","observation_id":"89035cf7-a9c1-43be-81c4-a70c68d4366d","resolution":{"observed_at":"2026-07-10T15:47:23.353134Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-06T00:18:11.969697Z","title":"Filip: Fine-grained interactive language-image pre-training.arXiv preprint arXiv:2111.07783, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01392","last_updated":"2026-08-02T17:16:25Z","snapshot_observed_at":"2026-08-06T23:26:20.775698Z","submitted_at":"2026-08-02T17:16:25Z","title":"FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:18:11.969697Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2608.01392"},"observation_digest":"sha256:13148476af2de19bdfd1b52807c0c5473a0586509dba68d516179058177a779f","observation_id":"f8392932-71c2-4c4c-acea-841098fe600c","resolution":{"observed_at":"2026-08-06T00:18:11.969697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2111.07783/citation-record","integrity":"/paper/2111.07783/integrity","json":"/paper/2111.07783/citation-record.json","paper":"/paper/2111.07783"},"outbound":[],"paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 41 inbound Pith citation observations for arXiv:2111.07783."}