{"as_of":"2026-08-05T06:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41fdf1fd376973879321d0b1b3e70104e6e6fec1a0bb40042d89c58edd933f10","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T09:38:09.427509Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:50:31.091650Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T20:00:08.247992Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-04T22:53:41.491205Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T19:53:25.499901Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2203.03605"},"observation_digest":"sha256:7e632a80cc4215fc9e7db7535e41d5a868217f8306db02d444e4109c3b7fba02","observation_id":"2606703f-208d-4c54-b173-15f0bc8717ff","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:e0180c2f1f08d0dd9a0423435eadd176d792b583f6390153618c9ae0afb81f98","observation_id":"6cb1ad25-4b62-4acd-b798-5e84af0ca8e4","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:6595fda3aef0c3f1e48734fb35e3b1b680502936b011d0cf9775e12cdab1446d","observation_id":"b40b5527-813c-4b27-a16f-ddeaf2dd9cbd","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T20:54:07.572136Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2205.14100"},"observation_digest":"sha256:b5edb64a41fccaf00db6a8ec7ea8acb5fbc4a044ce4e70136f6da3236108e6db","observation_id":"475ecc57-76ba-4766-9cee-d2ca7480e9af","resolution":{"observed_at":"2026-05-16T20:54:07.609457Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2208.14649","last_updated":"2026-04-22T00:33:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-31T06:18:10Z","title":"DetailCLIP: Injecting Image Details into CLIP's Feature Space","version":7},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T11:08:20.298043Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2208.14649"},"observation_digest":"sha256:4afb0dfa3fe62037d7de9c3982b741169cc212da32c03be500a31b50a53e78a5","observation_id":"d23bfd48-e92b-49ec-9cb4-7a41a944438e","resolution":{"observed_at":"2026-05-24T11:09:22.346952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:7a94ebdfed43e252b8f8324bdd234551dad96fd103c8bc0997037a04834a2b81","observation_id":"68086a93-8ac9-4b82-af55-9ed2e72b5cd9","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f6262a85769ffee65960b46b48f4d0787d881ac070c028a6fb909f500fb1e3ec","observation_id":"109f2a8e-3b42-4a52-a230-15d8417d5650","resolution":{"observed_at":"2026-05-17T00:36:53.308902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T00:10:48.610351Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2301.12597"},"observation_digest":"sha256:f8dab6a3fd519c9d610ada9d8cdcf273e697fd04dd988f082a0217699f45dad7","observation_id":"062bf9a8-dc32-4144-b7b8-d670d279f8ae","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T01:17:58.678036Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2303.11381"},"observation_digest":"sha256:df7da4a7954010ec0c14b569f6614d1bce074f1c7c8dd8a0f0b8daffe87de7d8","observation_id":"3cf475cc-c32a-409d-bf65-ba2d85ad209f","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T13:05:36.460932Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2303.15343"},"observation_digest":"sha256:ca5d877a3194a828a401e804b8bd8abad6af48e7bc63363f1f1998f559f09e65","observation_id":"aba21aa4-6968-4a88-96a4-b0b78cbc870f","resolution":{"observed_at":"2026-05-16T13:05:36.548899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:e003ac7cf6a942cb063bc276fc582a6e561828248dee3f14a95c984ae4caa238","observation_id":"5f31541d-d06c-400f-bf8b-1c820c1cfb8e","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:8431738b7b04e2e3a401859a696fe92d9016c741e3de229c1992cd9686fc60d0","observation_id":"33860558-ca6c-4577-a7c3-470807f3a221","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T09:55:35.452649Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2305.07895"},"observation_digest":"sha256:9e9f845ea8d72add57fd12627e541c14f4af4f249cd0afc07016a14ba73fe6fc","observation_id":"57929d05-82c6-4922-bb9c-552f9b78c597","resolution":{"observed_at":"2026-05-17T09:55:35.544307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:2f29c21c9ce5bacb8b66cad5fd1cb89a8f2197b794d09c63eab9d87afe8d5c9e","observation_id":"a20c6a98-1483-4d79-9f9a-7c562805434f","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:eeb771c2697c9940eff518db0a73173a81eb52558d2366edcb5fdeaaf08b00c9","observation_id":"370c499d-c546-4fe6-a5be-2eeb257b052f","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:a427a1ee400807c2e0d33eaa60d58c26ae58c466275ee5f3c13c5ac922ccdcd4","observation_id":"3f589d9b-43fd-44f4-b4d8-c27517ce5713","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-05T04:50:31.091650Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05949","last_updated":"2025-09-07T07:07:59Z","snapshot_observed_at":"2026-08-05T04:50:26.759461Z","submitted_at":"2025-09-07T07:07:59Z","title":"AttriPrompt: Dynamic Prompt Composition Learning for CLIP","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:50:31.091650Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2509.05949"},"observation_digest":"sha256:afb7e723beb92081f421531c59f2ab5906430fe4b1d358350c8112c16127d3da","observation_id":"dbffd231-df87-41f7-a0cc-c35aa2210fc7","resolution":{"observed_at":"2026-08-05T04:50:31.091650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-04T22:10:25.147011Z","title":"Florence: A new computer vision foundation model for visual understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.07488","last_updated":"2025-09-09T08:08:35Z","snapshot_observed_at":"2026-08-04T22:10:17.534720Z","submitted_at":"2025-09-09T08:08:35Z","title":"Fine-Tuning Vision-Language Models for Visual Navigation Assistance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T22:10:25.147011Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2509.07488"},"observation_digest":"sha256:31f8aad63b91b6bcb7750f6dd6ed74fd39aa9a22f022628094993266110a1e2f","observation_id":"6e974bc3-301f-45fe-8092-b999aaf428ef","resolution":{"observed_at":"2026-08-04T22:10:25.147011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-04T22:55:28.609601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08852","last_updated":"2025-09-08T17:52:08Z","snapshot_observed_at":"2026-08-04T22:55:25.765934Z","submitted_at":"2025-09-08T17:52:08Z","title":"Safe and Certifiable AI Systems: Concepts, Challenges, and Lessons Learned","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T22:55:28.609601Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2509.08852"},"observation_digest":"sha256:936f024a9443781880257ff58f7fe938e5d34ec7566e2b65eeb377ff7cd8cae8","observation_id":"2d97ef82-b5d0-431e-8c67-30b093533288","resolution":{"observed_at":"2026-08-04T22:55:28.609601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2509.24250","last_updated":"2026-04-10T06:01:12Z","snapshot_observed_at":"2026-07-06T22:31:00.843452Z","submitted_at":"2025-09-29T03:44:05Z","title":"Interactive Program Synthesis for Modeling Collaborative Physical Activities from Narrated Demonstrations","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T13:27:58.472422Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2509.24250"},"observation_digest":"sha256:520b3d564acb7d6073ce9f2547504374318e55e65316697b4113f4b7836c7abc","observation_id":"51d341cc-7c45-4066-bc65-32020cc8e307","resolution":{"observed_at":"2026-05-18T13:31:25.162680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-03T22:15:39.116775Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.11421","last_updated":"2026-06-23T16:56:06Z","snapshot_observed_at":"2026-08-04T01:24:31.124754Z","submitted_at":"2025-11-14T15:51:40Z","title":"BOFA: Bridge-Layer Orthogonal Low-Rank Fusion for CLIP-Based Class-Incremental Learning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T22:15:39.116775Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2511.11421"},"observation_digest":"sha256:170da33c500f2d32f9246b792233acc5ebce8759899ca5501f0188a57ef9622d","observation_id":"465ef22e-5fa9-40d3-912c-24d9960e4c24","resolution":{"observed_at":"2026-08-03T22:15:39.116775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-03T22:05:17.860103Z","title":"Florence: A new foundation model for computer vision.arXiv preprint arXiv:2111.11432, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-03T22:05:14.026360Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.860103Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:481a31c6318c0c1b47d05d137edc4f8436653f6b079b436ae2f755063ea721bc","observation_id":"cdfc8ab6-21f0-4117-b4f9-373cb95d0849","resolution":{"observed_at":"2026-08-03T22:05:17.860103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2511.22125","last_updated":"2026-04-27T14:33:42Z","snapshot_observed_at":"2026-08-02T03:20:47.604944Z","submitted_at":"2025-11-27T05:36:47Z","title":"GA2-CLIP: Generic Attribute Anchor for Efficient Prompt Tuningin Video-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T05:16:47.253028Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2511.22125"},"observation_digest":"sha256:2f5f233f35df1f793f0602f761f90afb990b6d383c5543592edd3318d8e18f71","observation_id":"f6ba6292-fb13-46e6-ada7-9f657d7f01cc","resolution":{"observed_at":"2026-05-17T05:19:04.924758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:a0ea1d4e579e1870e38bf18ac207ed1b5b0a1484b0d0b40c2d7fabdf91945eb8","observation_id":"b6b04895-2c6a-4c50-93b5-db3ac162f866","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T13:11:54.384284Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:f8ea36b9218e76981414695519a696a5f9d3b974544dda526d8453e4ee54fd38","observation_id":"0dc396d5-ad68-4320-860c-2d05b2ccebba","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-14T23:55:24.006436Z","title":"Florence: A new foundation model for computer vision.arXiv preprint arXiv:2111.11432, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T23:55:24.006436Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:4caae2fbb129b652e1d0820925537c36a487c23d8ca7bb1cad6cd55c7a479d75","observation_id":"78ed5de2-c5bb-408d-b333-1c9d14c3adc7","resolution":{"observed_at":"2026-07-14T23:55:24.006436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2603.29258","last_updated":"2026-05-04T03:13:15Z","snapshot_observed_at":"2026-07-06T22:51:13.690351Z","submitted_at":"2026-03-31T04:48:52Z","title":"Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T23:48:14.217344Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2603.29258"},"observation_digest":"sha256:f9885a9f669e008fd2e8671b3b54216faaec8b303d44bf16a6e3b0484dc5c246","observation_id":"735e340d-7e27-4998-806f-c5c5bfd6f444","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2604.02711","last_updated":"2026-04-08T23:13:03Z","snapshot_observed_at":"2026-08-04T09:42:48.573822Z","submitted_at":"2026-04-03T04:09:47Z","title":"Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook","version":2},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-13T18:48:40.813486Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2604.02711"},"observation_digest":"sha256:8b27997d473fee840a224833244ccd9bff984e76f59aabef0c67743ed6fc46f3","observation_id":"494ca35b-4f19-495e-9ede-23a4ea699821","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2604.21786","last_updated":"2026-04-23T15:44:14Z","snapshot_observed_at":"2026-08-02T05:18:17.302508Z","submitted_at":"2026-04-23T15:44:14Z","title":"From Codebooks to VLMs: Evaluating Automated Visual Discourse Analysis for Climate Change on Social Media","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T22:55:33.247678Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2604.21786"},"observation_digest":"sha256:7c0c2c11880e4571b3ff5930d475d3492997b5e89f5bfa0f12f14ff9c21e0103","observation_id":"245f6a2a-1b77-49ec-a9b1-12293709a5f8","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.00970","last_updated":"2026-05-01T16:44:33Z","snapshot_observed_at":"2026-07-06T23:14:15.780028Z","submitted_at":"2026-05-01T16:44:33Z","title":"Split and Aggregation Learning for Foundation Models Over Mobile Embodied AI Network (MEAN): A Comprehensive Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T18:42:17.140663Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.00970"},"observation_digest":"sha256:abf56c124dee38541bd6a48db335d2be706184c4c0b54dcd4a0f1c2efdb530f8","observation_id":"d481afe7-dc6b-4d57-b5aa-7bb4d851c42a","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.04425","last_updated":"2026-05-06T02:38:59Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:38:59Z","title":"Joint Semantic Token Selection and Prompt Optimization for Interpretable Prompt Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:41:05.464502Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.04425"},"observation_digest":"sha256:bdc16371945114876900f91e378c1d3cf7de41b06bc3a002fb7d192729b39242","observation_id":"78cb5385-fa9d-4ff1-8ab6-5f8dae6f858e","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.11939","last_updated":"2026-05-12T10:50:43Z","snapshot_observed_at":"2026-08-02T23:20:18.397762Z","submitted_at":"2026-05-12T10:50:43Z","title":"Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T05:56:31.648428Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.11939"},"observation_digest":"sha256:f89ae17a7614da96afe59a3125d2c78d89e5d921d857e4df04730d9ae8abf2c0","observation_id":"3f055904-4c87-41ea-9649-f978570c8775","resolution":{"observed_at":"2026-05-16T09:38:09.598269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.17366","last_updated":"2026-05-17T10:20:23Z","snapshot_observed_at":"2026-08-03T19:41:11.634772Z","submitted_at":"2026-05-17T10:20:23Z","title":"Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T23:08:33.010725Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.17366"},"observation_digest":"sha256:6a648bfe7b30af05190b080ca6585d5015af358d730695c86822e2af6cb40485","observation_id":"01b8d51e-c4b3-4d69-879b-73002cb13525","resolution":{"observed_at":"2026-05-19T23:12:51.739910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.20640","last_updated":"2026-05-20T02:55:28Z","snapshot_observed_at":"2026-07-06T23:31:13.042581Z","submitted_at":"2026-05-20T02:55:28Z","title":"Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T06:08:38.141168Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.20640"},"observation_digest":"sha256:3c23a622e7ca6bf986c4faa276803bc488950ce9d4cad462c8f485cb6fae20aa","observation_id":"6bc691eb-3df3-4163-8746-341d33544a0c","resolution":{"observed_at":"2026-05-21T06:09:41.366588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.26415","last_updated":"2026-05-26T00:45:46Z","snapshot_observed_at":"2026-08-02T12:01:23.848120Z","submitted_at":"2026-05-26T00:45:46Z","title":"The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T18:56:02.724596Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.26415"},"observation_digest":"sha256:02d3d6cb956bde14c4f6224dbb3d9113905284615fbd7a0db9e8c678a8fb88c5","observation_id":"44aecb47-efe3-43b2-a692-70290b73dddd","resolution":{"observed_at":"2026-06-29T19:03:51.394137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.29602","last_updated":"2026-05-28T08:40:34Z","snapshot_observed_at":"2026-07-31T08:03:40.151420Z","submitted_at":"2026-05-28T08:40:34Z","title":"CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-29T08:14:20.558527Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.29602"},"observation_digest":"sha256:1f0b7b22677f2c1f7db1c5e064a69a30eacb0265a5d67abb24831c38f7a45931","observation_id":"22079198-aca6-4773-9ec7-dcefec27487f","resolution":{"observed_at":"2026-06-29T08:23:15.723904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2605.30846","last_updated":"2026-05-29T05:08:31Z","snapshot_observed_at":"2026-07-06T23:40:07.833692Z","submitted_at":"2026-05-29T05:08:31Z","title":"Count Anything","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:02:05.250519Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2605.30846"},"observation_digest":"sha256:61528776b89d9c3b8e948aac966dfc1d58bf1e3c1e38e13f84a6f4bc925bd9b4","observation_id":"4ea42d82-df68-432a-891f-ff8252dc7af2","resolution":{"observed_at":"2026-06-28T23:02:46.008216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:e00f4ff7bee4dd308fdd9fa3e25657abe1055d58b10c9d7fa60940d8ec868db5","observation_id":"7cfe39c1-2707-4331-bd1f-3d7f280fa569","resolution":{"observed_at":"2026-07-03T17:18:43.940174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2606.25478","last_updated":"2026-06-29T04:17:52Z","snapshot_observed_at":"2026-08-04T07:34:36.354834Z","submitted_at":"2026-06-24T07:06:12Z","title":"TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-25T20:54:39.254414Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2606.25478"},"observation_digest":"sha256:d5a50f18e54ab5dafb029e28933e72fe3220711a63ffb275ff743e05075abd21","observation_id":"1cc72dca-4e34-4c94-afef-9e6e13e073ee","resolution":{"observed_at":"2026-07-04T20:00:08.249440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2606.25478","last_updated":"2026-06-29T04:17:52Z","snapshot_observed_at":"2026-08-04T07:34:36.354834Z","submitted_at":"2026-06-24T07:06:12Z","title":"TACO: Towards Task-Consistent Open-Vocabulary Adaptation in Video Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T09:39:12.683562Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2606.25478"},"observation_digest":"sha256:76e197d6378ccb4a36269306d57766d921a7c89bdfd7f0bf449bd19143aae31f","observation_id":"95064b9b-dde1-49b7-a9fb-5cb1b877550f","resolution":{"observed_at":"2026-06-30T09:44:37.691007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-14T07:41:50.384310Z","title":"Florence: A new foundation model for computer vision.arXiv preprint arXiv:2111.11432, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.11008","last_updated":"2026-07-13T02:16:17Z","snapshot_observed_at":"2026-07-16T23:19:08.683121Z","submitted_at":"2026-07-13T02:16:17Z","title":"SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T07:41:50.384310Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2607.11008"},"observation_digest":"sha256:56e0c62be848c135b76c98d55f83875409eec391cf3310630c0fd1400b67674c","observation_id":"783b0d80-4a18-44a1-aec5-1681b6494703","resolution":{"observed_at":"2026-07-14T07:41:50.384310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2111.11432 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-02T08:52:21.513313Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":157,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:2d9373a74613617f4ad88d0217ff2e37384ea27c39946b7d0811478d968c4dc5","observation_id":"4db37b18-b123-4b86-9e1c-c85f333921a7","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-01T06:48:48.410511Z","title":"Florence:","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-05T04:38:14.706947Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":219,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:48.410511Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:dd39c289f89becafd82d688de5876bc24680aeabd42c64b6b87aac8dca1d0068","observation_id":"b7a7e214-2868-47c6-b13b-c8886085bde8","resolution":{"observed_at":"2026-08-01T06:48:48.410511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-02T11:49:43.960495Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22591","last_updated":"2026-06-10T14:00:33Z","snapshot_observed_at":"2026-08-05T04:10:04.232826Z","submitted_at":"2026-06-10T14:00:33Z","title":"Lexical discovery in unknown environments orchestrated by Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T11:49:43.960495Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2607.22591"},"observation_digest":"sha256:3cfbb653d102307b1d76fb56877fadb85bb19faae2e24a65a221d6927876b212","observation_id":"8ee77af0-edae-4a26-98d3-02c0a9cae49b","resolution":{"observed_at":"2026-08-02T11:49:43.960495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2111.11432/citation-record","integrity":"/paper/2111.11432/integrity","json":"/paper/2111.11432/citation-record.json","paper":"/paper/2111.11432"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., Alexander, M","venue":null,"work_id":"87448d35-f56c-45c8-bf0f-ba7658ed8a92","year":2014},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:2d20acffb2d96699f5960379ab023fdde17637ded28a7edabb0f0f6368cc1c7d","observation_id":"646eacc5-fe24-4a40-8e45-d12ed178fc53","resolution":{"observed_at":"2026-05-16T09:38:09.597220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:3af7d9516bc97744ab013471e472612a87af404d2903960ec765552fe686ec90","observation_id":"9ee358cf-341d-4271-81d1-4e8c34f83c33","resolution":{"observed_at":"2026-05-16T09:38:09.513167Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:ef0a8bffa42443b117ee565eead69cedc2ffe4f44d9018fe582f28839662f979","observation_id":"e7085aab-de62-453a-943b-9d4594c94276","resolution":{"observed_at":"2026-05-16T09:38:09.470223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04305","last_updated":"2021-07-06T14:22:26Z","snapshot_observed_at":"2026-08-05T03:03:28.976664Z","submitted_at":"2020-11-09T10:22:35Z","title":"Learning the Best Pooling Strategy for Visual Semantic Embedding","version":5},"cited_work":{"arxiv_id":"2011.04305","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.04305","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the best pooling strategy for visual semantic embedding","venue":null,"work_id":"bd434e69-b4cc-4f87-b065-4514e012198d","year":2011},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2011.04305","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:9a5753acba27a2892380ceb86d05323ac4901e89bbe82478c39562d6bcbd7990","observation_id":"98282352-255a-416f-9d0a-266912a68955","resolution":{"observed_at":"2026-05-16T09:38:09.480193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04803","last_updated":"2021-09-15T06:05:13Z","snapshot_observed_at":"2026-07-06T11:17:24.552353Z","submitted_at":"2021-06-09T04:35:31Z","title":"CoAtNet: Marrying Convolution and Attention for All Data Sizes","version":2},"cited_work":{"arxiv_id":"2106.04803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04803","snapshot_observed_at":"2026-07-05T11:41:02.799655Z","title":"Coatnet: Marrying convolution and attention for all data sizes","venue":"cs.CV","work_id":"08de913e-bf2d-4981-af29-094eb833d77d","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.04803","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:29822ab6c595d34d14e5c486b86e73dcc8338971c28d5937d7352e45b18ac2bf","observation_id":"bd6b2b45-d640-41e6-972f-b6f4603c7867","resolution":{"observed_at":"2026-05-16T09:38:09.485888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:904942b97f8961cc943948b26564e7ba694cb804f693da547466583d7ad43c42","observation_id":"0742c473-51f0-4d0d-8fe9-b1fb1ae8318e","resolution":{"observed_at":"2026-05-16T09:38:09.491716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00652","last_updated":"2022-01-09T05:49:30Z","snapshot_observed_at":"2026-08-04T23:06:17.448062Z","submitted_at":"2021-07-01T17:59:56Z","title":"CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows","version":3},"cited_work":{"arxiv_id":"2107.00652","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.00652","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cswin transformer: A general vision transformer backbone with cross-shaped windows","venue":null,"work_id":"1abad5ae-4855-4eb3-b817-1b097f40df89","year":null},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2107.00652","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:7bdc73eeb7d6887a3d475b3931ea54f6ce2e1e28ee3564e2ddb79beba554ea74","observation_id":"0159993e-eb37-427d-b09a-5c9a47231907","resolution":{"observed_at":"2026-05-16T09:38:09.497112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:fa20254339bde842d3ae2becaecda69d5f719d18034d12c4b48c559f52e3abc9","observation_id":"744b6ce5-f4c4-44e9-afb1-9ddf3d261a1c","resolution":{"observed_at":"2026-05-16T09:38:09.502654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06983","last_updated":"2021-06-14T16:37:28Z","snapshot_observed_at":"2026-07-06T10:33:23.581843Z","submitted_at":"2021-01-18T10:42:34Z","title":"Scaling Deep Contrastive Learning Batch Size under Memory Limited Setup","version":2},"cited_work":{"arxiv_id":"2101.06983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.06983","snapshot_observed_at":"2026-06-30T14:14:45.815660Z","title":"Scaling deep contrastive learning batch size under memory limited setup","venue":null,"work_id":"37e2302e-810d-4cd8-943a-afa5f0979e6c","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2101.06983","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:3f7cc887da1da52a0f433e4f5785bce5ad237a5127d78352ad82c0b954565fb4","observation_id":"883c8e61-3f00-46d1-972a-caa11b411eb8","resolution":{"observed_at":"2026-05-16T09:38:09.508211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rich fea- ture hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":"ab258ff2-53ed-4639-829a-63b07687f657","year":2014},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:488b7f2b975b5bfaef80acd690f04304f78b1a88948f13551b48317766c0fb56","observation_id":"12135bce-d502-4a78-a3c0-60d960fac5d8","resolution":{"observed_at":"2026-05-16T09:38:09.593184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-07-06T10:40:28.145954Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":"2102.05918","doi":"10.48550/arxiv.2102.05918","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":"arXiv (Cornell University)","work_id":"d28390f3-8b21-4b2a-a523-473a16c2e43a","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:55099ead0fa67b075786a3111cad0c58c2870af6d0bf33f0e038c316aaaf798f","observation_id":"6085eebd-ed68-41ce-b8dc-6c865a7e665b","resolution":{"observed_at":"2026-05-16T09:38:09.518303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.11370","last_updated":"2020-05-05T20:48:23Z","snapshot_observed_at":"2026-07-06T08:46:48.591230Z","submitted_at":"2019-12-24T14:04:11Z","title":"Big Transfer (BiT): General Visual Representation Learning","version":3},"cited_work":{"arxiv_id":"1912.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.11370","snapshot_observed_at":"2026-07-04T20:30:07.800049Z","title":"Big Transfer (BiT): General Visual Repre- sentation Learning","venue":null,"work_id":"0d62b564-db3e-437b-9d0a-97ef4552b504","year":1912},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/1912.11370","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:06e30168c495215e97d4546c40216273eaba665a331dbd666489b31b4fd4505f","observation_id":"8378e823-52a4-41e8-ae91-90238dadc7c4","resolution":{"observed_at":"2026-05-16T09:38:09.523670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-07-06T04:47:08.658688Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":"1602.07332","doi":"10.1109/cvpr52733.2024.02652","metadata_source":"pith","pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","venue":"cs.CV","work_id":"4f3d98c0-f165-408f-9600-63da89600b09","year":2016},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:f841d6078f9529324ce00be81404de5146d4682292136ef48f02092091888f6a","observation_id":"94108b8c-708d-40b2-bddb-67f32fdfbe15","resolution":{"observed_at":"2026-05-16T09:38:09.528447Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.13230","last_updated":"2021-06-24T17:59:46Z","snapshot_observed_at":"2026-07-06T11:22:38.453675Z","submitted_at":"2021-06-24T17:59:46Z","title":"Video Swin Transformer","version":1},"cited_work":{"arxiv_id":"2106.13230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.13230","snapshot_observed_at":"2026-07-03T19:08:49.804199Z","title":"In European Conference on Computer Vision, pages 413–430","venue":null,"work_id":"4eab6a90-c0e0-4827-9c27-5744f88b5eac","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.13230","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:52433b003eb036acf24580036a225307e26ee152a7c6fc838772ae3d731d963d","observation_id":"f9c80622-dd4a-4296-8644-c964521a19a2","resolution":{"observed_at":"2026-05-16T09:38:09.533761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04870","last_updated":"2016-09-19T20:20:42Z","snapshot_observed_at":"2026-08-03T10:48:50.688044Z","submitted_at":"2015-05-19T04:46:03Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","version":4},"cited_work":{"arxiv_id":"1505.04870","doi":null,"metadata_source":"pith","pith_arxiv_id":"1505.04870","snapshot_observed_at":"2026-07-04T16:29:57.874633Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models","venue":"cs.CV","work_id":"7b107a59-1658-40dc-9893-3297124c3ed9","year":2015},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/1505.04870","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:1660c23502be69ece0d8522edd602a0f48221643bee5000be53e18507d009784","observation_id":"634c8446-581f-4fc9-a4e7-62490b733990","resolution":{"observed_at":"2026-05-16T09:38:09.538355Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07966","last_updated":"2020-01-23T08:03:27Z","snapshot_observed_at":"2026-08-02T15:54:34.699328Z","submitted_at":"2020-01-22T11:35:58Z","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","version":2},"cited_work":{"arxiv_id":"2001.07966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.07966","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebert: Cross-modal pre-training with large- scale weak-supervised image-text data","venue":null,"work_id":"6367ffe4-a985-4269-93f3-889538c25401","year":2001},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2001.07966","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:67c6079e83bd5b2461741756e4ed6e6cb471602d741189504603f94b7b143dfc","observation_id":"a244ce7a-635c-43e8-a289-496097e726dc","resolution":{"observed_at":"2026-05-16T09:38:09.543090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2103.00020","doi":"10.1021/acs.jcim.0c00174","metadata_source":"pith","pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Transferable Visual Models From Natural Language Supervision","venue":"cs.CV","work_id":"6de86bb5-27bd-4d5c-8b89-967ebfc52659","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:6aac29de71d8297ac17a9850cd1915d0352d60468f6762607a4778f6583f9a1b","observation_id":"cc8e0c78-d932-4e80-8598-c0117f88e847","resolution":{"observed_at":"2026-05-16T09:38:09.547810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:175fbd38aa6f036fb330b9e2f970398e6186f86e55c6802a1132610476f15957","observation_id":"f8fccb61-5695-4904-b2a8-14516ad85837","resolution":{"observed_at":"2026-05-16T09:38:09.553108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:a5dc622e11ed932d1b696a00702772b7e8795c8b7282f8a565211a9df7eee07d","observation_id":"f5d6fb1a-b50a-43e6-b7e3-d0504daab814","resolution":{"observed_at":"2026-05-16T09:38:09.558580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06946","last_updated":"2021-08-09T20:06:03Z","snapshot_observed_at":"2026-07-06T10:23:49.697086Z","submitted_at":"2020-12-13T03:02:06Z","title":"MiniVLM: A Smaller and Faster Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2012.06946","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.06946","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minivlm: A smaller and faster vision- language model","venue":null,"work_id":"732854d1-1291-48ae-8ca6-9ff939e6055a","year":2012},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2012.06946","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:a9138ddba6c31058fea6697e0493126831d76dae66db7caf5eef54402d1af948","observation_id":"1f6e3149-64d8-4ff5-a89f-371d32ac1f14","resolution":{"observed_at":"2026-05-16T09:38:09.563854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02315","last_updated":"2017-12-14T19:35:31Z","snapshot_observed_at":"2026-07-06T05:41:30.478760Z","submitted_at":"2017-05-05T17:31:12Z","title":"ChestX-ray8: Hospital-scale Chest X-ray Database and Benchmarks on Weakly-Supervised Classification and Localization of Common Thorax Diseases","version":5},"cited_work":{"arxiv_id":"1705.02315","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.02315","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ChestX-ray8: Hospital-scale Chest X-ray Database and Benchmarks on Weakly-Supervised Classification and Localization of Common Thorax Diseases","venue":"cs.CV","work_id":"096d32d9-f77c-4077-b6ba-d882bc56fc99","year":2017},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/1705.02315","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:6faedd42d3ea995799d73d4cb49eb92994d5e93bfaf4910bdb99493420e8b01e","observation_id":"c3d75b6a-ad9f-4644-8aa6-e8b6db3a6a98","resolution":{"observed_at":"2026-05-16T09:38:09.568592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-04T08:29:29.515687Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":"2108.10904","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-07-04T19:10:05.334285Z","title":"arXiv preprint arXiv:2108.10904 , year=","venue":null,"work_id":"d5ac0780-1f7e-430f-84e4-c505e2b1edfb","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:c553cb355769cc933a9e40d08a552092fcc45030d384769600fcbdabfec5e094","observation_id":"c79ce03d-e652-4e1a-9612-2a20441e7ebf","resolution":{"observed_at":"2026-05-16T09:38:09.573674Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00641","last_updated":"2021-07-01T17:56:09Z","snapshot_observed_at":"2026-07-06T11:25:08.518949Z","submitted_at":"2021-07-01T17:56:09Z","title":"Focal Self-attention for Local-Global Interactions in Vision Transformers","version":1},"cited_work":{"arxiv_id":"2107.00641","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.00641","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Focal self-attention for local-global interactions in vision transformers","venue":null,"work_id":"19e140e5-cf2a-4c16-be73-c7f41804ac2a","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2107.00641","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:559ce272981ab8b2915fa31028dabb8c6bbc8c1bc9cd6ce55de48159a1441948","observation_id":"c368a540-f6e6-4f13-b914-96d9a1d803bd","resolution":{"observed_at":"2026-05-16T09:38:09.578306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:ad88d68ee114a943e7573c89782e73bf96f96c8e50176872a56c83e5c25bc65c","observation_id":"7589c8ec-0140-4b7f-81b2-ff07c748df29","resolution":{"observed_at":"2026-05-16T09:38:09.582884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16934","last_updated":"2021-03-19T05:17:32Z","snapshot_observed_at":"2026-07-06T09:34:09.418067Z","submitted_at":"2020-06-30T16:03:12Z","title":"ERNIE-ViL: Knowledge Enhanced Vision-Language Representations Through Scene Graph","version":3},"cited_work":{"arxiv_id":"2006.16934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.16934","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ernie-vil: Knowledge enhanced vision- language representations through scene graph","venue":null,"work_id":"06dfe17f-3e2f-41e6-8714-0eb711a742af","year":2006},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2006.16934","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:bfd54397ea531a8c33317703e02df06e9fd14bc25c066d8803511b28160bd4ce","observation_id":"a535edb2-3427-45e4-b3af-0912d9ddb31d","resolution":{"observed_at":"2026-05-16T09:38:09.586722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04560","last_updated":"2022-06-20T09:13:51Z","snapshot_observed_at":"2026-08-04T23:08:49.433171Z","submitted_at":"2021-06-08T17:47:39Z","title":"Scaling Vision Transformers","version":2},"cited_work":{"arxiv_id":"2106.04560","doi":"10.48550/arxiv.2106.04560","metadata_source":"arxiv_reference","pith_arxiv_id":"2106.04560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling vision transform- ers, 6 2021","venue":"arXiv (Cornell University)","work_id":"bed1e12d-8db3-4995-a609-386387c6cb86","year":2022},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2106.04560","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:3283d64124359e152b67d51ca6e0914a86bf9e83da6c6e3a7204c3675f476028","observation_id":"e0b35262-610b-473b-b275-7e8eaa5a55e4","resolution":{"observed_at":"2026-05-16T09:38:09.454541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.13086","last_updated":"2022-04-25T21:22:16Z","snapshot_observed_at":"2026-07-06T10:44:44.451935Z","submitted_at":"2021-02-25T18:55:58Z","title":"Simple multi-dataset detection","version":2},"cited_work":{"arxiv_id":"2102.13086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.13086","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple multi-dataset detection","venue":null,"work_id":"9a921eb0-6c27-48b9-8a3e-dc601c66b9dc","year":2021},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"cited_paper":"/paper/2102.13086","citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:65e0926a7913c7f11a888dc2b93608deb88fd0ba92d3b509a4d9501e16dc770f","observation_id":"7b409af3-6a61-4058-8f32-c7eae8f533be","resolution":{"observed_at":"2026-05-16T09:38:09.463892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D., and Le, Q","venue":null,"work_id":"630f3b64-db8e-4944-81ae-46da182bcf72","year":2020},"citing_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T09:38:09.427509Z"},"links":{"citing_paper":"/paper/2111.11432"},"observation_digest":"sha256:be838705b6b955a55718f5c8ca373480f6324498ef3b95813280500da265aeda","observation_id":"c16ad677-20fd-41bd-936e-294af517c9d2","resolution":{"observed_at":"2026-05-16T09:38:09.589750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":3},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 44 inbound Pith citation observations for arXiv:2111.11432."}