{"as_of":"2026-08-13T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffaf1bd56d31e355ccc108a26bc6a3d5042b08158fca7e429a1cea90f62edf04","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:38:19.066615Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:20:50.578691Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11927","snapshot_observed_at":"2026-08-03T04:20:50.578691Z","title":"Flame: Frozen large language models enable data-efficient language-image pre-training.arXiv:2411.11927, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-08T17:38:17.395786Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:50.578691Z"},"links":{"cited_paper":"/paper/2411.11927","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:93e83fb1a355ab54b5a14958b30c02f9e61a0d917b47a4b301a8e21e6a9a0053","observation_id":"dccbc202-eb71-431c-a90a-e929ada7b54e","resolution":{"observed_at":"2026-08-03T04:20:50.578691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.11927/citation-record","integrity":"/paper/2411.11927/integrity","json":"/paper/2411.11927/citation-record.json","paper":"/paper/2411.11927"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T18:38:18.787439Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.787439Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8566c96e3dbd1d806784ad65cea929d13a58817c9b1a47d7809da6cab9004e3e","observation_id":"5fc2996f-d8e4-4fdc-8e1c-b26acbc91c16","resolution":{"observed_at":"2026-08-12T18:38:18.787439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T18:38:18.792629Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.792629Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d61a096553ae67ace08182f6a015f0742dfcdc2aae23f1480f25b73753ad0ae8","observation_id":"771fe683-689f-441d-b6e9-682a5f800c57","resolution":{"observed_at":"2026-08-12T18:38:18.792629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T18:38:18.797615Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.797615Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:af273d5607b5ce7ecc5e110dca1ba1e446592f60fd8ea46ee77a14290ee8a2c5","observation_id":"660777d5-cb9c-4b98-b151-3a197f179d4e","resolution":{"observed_at":"2026-08-12T18:38:18.797615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18361","last_updated":"2024-05-28T16:57:44Z","snapshot_observed_at":"2026-08-12T23:55:56.455828Z","submitted_at":"2024-05-28T16:57:44Z","title":"Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18361","snapshot_observed_at":"2026-08-12T18:38:18.802194Z","title":"Is a 3d-tokenized llm the key to reliable autonomous driving? arXiv preprint arXiv:2405.18361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.802194Z"},"links":{"cited_paper":"/paper/2405.18361","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:71ad5d8dc3df459f2471b6099231ec324f1287dd4e1c5173c01fa71a875e69f2","observation_id":"ffdf892f-bd6e-4a73-abd7-c55e88b008fd","resolution":{"observed_at":"2026-08-12T18:38:18.802194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.988165Z","title":"Ar- trackv2: Prompting autoregressive tracker where to look and how to describe","venue":null,"work_id":"a361b1fe-2554-4206-b473-093da5a1b36c","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.806733Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:66acb9d6faff2570c5d53088bc84d94ab9c3073a2f1c438ee62793c048781529","observation_id":"4c869d3f-597c-4e61-92cc-3786a74a9fb0","resolution":{"observed_at":"2026-08-12T18:38:19.991922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05961","last_updated":"2024-08-21T22:46:05Z","snapshot_observed_at":"2026-08-13T00:34:33.528585Z","submitted_at":"2024-04-09T02:51:05Z","title":"LLM2Vec: Large Language Models Are Secretly Powerful Text Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05961","snapshot_observed_at":"2026-08-12T18:38:18.810790Z","title":"Llm2vec: Large language models are secretly powerful text encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.810790Z"},"links":{"cited_paper":"/paper/2404.05961","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8bf99f8e40aa470964244380eaaa25fe358f953784fafd4a5305f57604544bbd","observation_id":"c4c56f93-3de8-484b-a1ad-86a340e98125","resolution":{"observed_at":"2026-08-12T18:38:18.810790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.976932Z","title":"Language models are few-shot learners","venue":null,"work_id":"e9aba53e-a3cd-400f-bc9c-a66564a2df69","year":2020},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.815209Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:a40ebe6533eb22f1bc42ddae17c57b5c935ad47dcccb2bc2072eb1a32185a8b2","observation_id":"5e25dad2-cdbc-4c67-a9af-08fa36885ddf","resolution":{"observed_at":"2026-08-12T18:38:19.981028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.964128Z","title":"Cross-lingual and multilingual clip","venue":null,"work_id":"906cf581-8005-48df-a6f6-feedec1c3d87","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.819267Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:89c360b049cf353a328bca392b395c47488f9b37037809603bad6b0c14bd6c02","observation_id":"0c0df006-4258-4b48-ba93-2aa5bcbf47b9","resolution":{"observed_at":"2026-08-12T18:38:19.968846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T18:38:18.823234Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.823234Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:575db86c2e8f7157dee885e2da4e8648ce5427bfc49c0eb9a4ff80a8b59eca05","observation_id":"f2176700-0419-4c48-b9f3-f506a023749c","resolution":{"observed_at":"2026-08-12T18:38:18.823234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.949929Z","title":"Pali: A jointly- scaled multilingual language-image model","venue":null,"work_id":"fb44cb47-34c9-4b63-9706-37938755fae4","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.827882Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:1a94b48a2b24457da581582f6d969437c268e18eb5cbc6fd042d2f5c573c751f","observation_id":"99a2709e-9a1a-4d99-890b-3cf78d420f12","resolution":{"observed_at":"2026-08-12T18:38:19.954196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.936697Z","title":"Altclip: Altering the language encoder in clip for extended language capabilities","venue":null,"work_id":"b6d6631f-9612-4dd2-bf56-726b7d48cd82","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.833993Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:2fb017473e221c5bf0c3f3533f4aca273d4721136ee5a1e82fbb0b9652605ef1","observation_id":"d1b03554-275a-471a-bd59-81be51e97053","resolution":{"observed_at":"2026-08-12T18:38:19.941293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.922194Z","title":"Maskclip: Masked self-distillation advances contrastive language-image pretraining","venue":null,"work_id":"69e7da17-ad4e-459f-b9ea-b530e35cb16e","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.840322Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:269f827db095b8d97a4ddf7ba1db584b2733aa3d94baec39d19cf0de2f26ffb2","observation_id":"818f101b-df01-47cb-9ef8-8d580dbea403","resolution":{"observed_at":"2026-08-12T18:38:19.927385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.900667Z","title":"An image is worth 16x16 words: Transform- ers for image recognition at scale","venue":null,"work_id":"871a2f88-6f0e-4698-b9c1-cbff7ba82782","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.845096Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:54e38602e313c4f6c50998372079eb02106836cc5585bcc667d0487128c7aa8b","observation_id":"d7465e84-03ff-4c58-ba74-e7446b4560ab","resolution":{"observed_at":"2026-08-12T18:38:19.906995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.887953Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"1781a834-70cd-47e0-acb8-3ce3ab377849","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.849417Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:2d06a8db4439e99e2a63d7ae7eca0a00d022b7d76617b4f8c27c2e2e34a5ecc0","observation_id":"10bec2c1-eddb-469a-9391-df7cae57fefa","resolution":{"observed_at":"2026-08-12T18:38:19.891952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:18.853452Z","title":"Pyramidclip: Hierarchical feature alignment for vision-language model pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.853452Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:a9c4646306be278e00b9ee707062371154e5c085c46e46078b0d221c0faaad31","observation_id":"2dc147cf-df78-40ce-8f07-695493844f6b","resolution":{"observed_at":"2026-08-12T18:38:18.853452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.869404Z","title":"Softclip: Softer cross-modal alignment makes clip stronger","venue":null,"work_id":"11436a05-001e-4967-8036-2474a8aec2e3","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.857225Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:da03a3317d3d3e7710d90552f6b1ad8ba93e5450219f9eca87b5fd7b9190790d","observation_id":"f562151e-0523-4909-994a-422254de4be5","resolution":{"observed_at":"2026-08-12T18:38:19.873648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.857573Z","title":"Hiclip: Contrastive language-image pre- training with hierarchy-aware attention","venue":null,"work_id":"b9ff0bc6-520d-455b-83f1-9ec4d7eccdfd","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.861394Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:c249ff92b2d89f7ef164adc9508a9445b6c03187a106322154392b6770eae049","observation_id":"a44e35a2-0ca5-42d9-9767-00719897ee77","resolution":{"observed_at":"2026-08-12T18:38:19.861679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.845853Z","title":"Sugarcrepe: Fixing hack- able benchmarks for vision-language compositionality","venue":null,"work_id":"5727b92c-5d88-4464-aeda-720324187615","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.865235Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8662208735439b207f434d85c15edc46a556e30bc9030ceb200ccb5237ea8749","observation_id":"f8b962ac-6dc7-4488-a66d-56777c37f4a0","resolution":{"observed_at":"2026-08-12T18:38:19.849945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.832477Z","title":"Openclip, 2021","venue":null,"work_id":"98795cb0-5bdb-44e4-831e-4ba38d42748f","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.869235Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:11712302ee7101458471d3953d8f62a8ff84cd5a44d32acff799186139e3eadc","observation_id":"8a850156-b50c-410f-a52f-a7e55f11e682","resolution":{"observed_at":"2026-08-12T18:38:19.837127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.820407Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"10e17752-bab1-4ec9-9ba8-099d77b57b57","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.873432Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f7ed3a8f2996707468eb00f221fcada41ea009c9e0ec07dc4e62e8b44faaf029","observation_id":"cd64749d-6852-4338-bceb-c524d5dfda4c","resolution":{"observed_at":"2026-08-12T18:38:19.824649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T18:38:18.878448Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.878448Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:2717b094826e06753045f1f976c9fd78f4e3b5f647ad2d3757994c87e25879e3","observation_id":"00cb0a3b-3899-409a-b0e7-2a1a893c0f8f","resolution":{"observed_at":"2026-08-12T18:38:18.878448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16645","last_updated":"2023-07-31T13:26:03Z","snapshot_observed_at":"2026-08-13T10:44:09.820718Z","submitted_at":"2023-07-31T13:26:03Z","title":"Scaling Sentence Embeddings with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16645","snapshot_observed_at":"2026-08-12T18:38:18.882734Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.882734Z"},"links":{"cited_paper":"/paper/2307.16645","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:c78fa7c8aa62d6ddbf4cd44f612de691ab8f0dadeeb5ce0b7427e13fff70e254","observation_id":"8d033562-e4e6-40c2-97d8-eb4b9b788d4f","resolution":{"observed_at":"2026-08-12T18:38:18.882734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.808380Z","title":"Misalign, contrast then distill: Rethinking misalign- ments in language-image pre-training","venue":null,"work_id":"3aa4b48d-7df1-463e-8535-511c9b9753cb","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.886495Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:7327790cab9f76f9ce90dc2f62d5a00dc8302079c75314e57f3ac70b8e1eb0fe","observation_id":"9523231a-5fe3-433f-b323-a0f5e73eb07c","resolution":{"observed_at":"2026-08-12T18:38:19.812134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-08-12T23:54:01.626288Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-12T18:38:18.890177Z","title":"Jina clip: Your clip model is also your text retriever","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.890177Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:022c87e3f3226d16c53f1df8458e2d3cfbcabc739386cf8b210bf8ed9027767a","observation_id":"03a6eaf3-1f33-47d8-b5fd-cbadd5602711","resolution":{"observed_at":"2026-08-12T18:38:18.890177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-08-13T05:51:56.999684Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-12T18:38:18.894281Z","title":"From scarcity to efficiency: Improving clip training via visual-enriched captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.894281Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d3d693f136d8122979c3fd9fdebf5a299716c47f6a31926d43ffdb45e3da585c","observation_id":"df8046fa-aa08-4e92-9781-8bcb8859ac51","resolution":{"observed_at":"2026-08-12T18:38:18.894281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.796426Z","title":"Uni- clip: Unified framework for contrastive language-image pre- training","venue":null,"work_id":"389d8605-68c7-404f-8c37-dbb2b621bd14","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.898476Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:470f921f226ebccbe0fdae602711d4cf2961af9bfb6900adf4b4f86e0172926b","observation_id":"e468e0e3-9f0b-4f11-9434-debbc4ba3d07","resolution":{"observed_at":"2026-08-12T18:38:19.800689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20327","last_updated":"2024-03-29T17:56:40Z","snapshot_observed_at":"2026-08-13T00:41:52.368105Z","submitted_at":"2024-03-29T17:56:40Z","title":"Gecko: Versatile Text Embeddings Distilled from Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20327","snapshot_observed_at":"2026-08-12T18:38:18.902333Z","title":"Gecko: Versatile text embed- dings distilled from large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.902333Z"},"links":{"cited_paper":"/paper/2403.20327","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:14964dc40a7f559dda216bf7a5e52a4ac6c7f2feb38e885e6a90f34c20a3c482","observation_id":"e9c16874-4ff8-4c72-9d0b-036dbe818bdc","resolution":{"observed_at":"2026-08-12T18:38:18.902333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.784158Z","title":"Meta-task prompting elicits embedding from large language models","venue":null,"work_id":"6612a673-97bc-44d0-bf12-c8e792ebc5b0","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.906723Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:248d8bc519ee6c63eb062e203fc8ccc199967a996ff7977d3af0e2bb422258b2","observation_id":"10ee5516-cff1-45b8-be52-193017adfe4b","resolution":{"observed_at":"2026-08-12T18:38:19.788710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.771871Z","title":"Scene graph generation: A comprehensive survey","venue":null,"work_id":"694564f4-19c9-4637-9cb4-3090263dd6a0","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.910853Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:5284b91f3d79c736a56094787a1c49615edff1bd671e7179af29564776480b9c","observation_id":"6eccc694-931a-4ab0-8990-fbe6fecc8037","resolution":{"observed_at":"2026-08-12T18:38:19.775909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.760158Z","title":"Grounded language- image pre-training","venue":null,"work_id":"507b75b4-a71d-4e07-b99a-92ac8913a1c0","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.914822Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:6f390e18fa433cfb8f30fd20d22dd8754e907109e08056bcb42838def4027ece","observation_id":"16d083a4-7b19-4f7e-861f-e3aa071eb484","resolution":{"observed_at":"2026-08-12T18:38:19.764217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.748574Z","title":"An inverse scaling law for clip training","venue":null,"work_id":"22afc593-c2cd-482f-9bd1-8a5f4f77f29d","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.919615Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:b84a9ee2d213148d5b4a7ddfbd83e6b726a23a49d22eb495d8df4f6f4e267e14","observation_id":"c291c074-5c93-4778-b7b3-73303cae886f","resolution":{"observed_at":"2026-08-12T18:38:19.752353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.737636Z","title":"Scene graph generation from objects, phrases and region captions","venue":null,"work_id":"d240da04-20a5-43a3-8a17-4c97b7d0ddea","year":2017},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.923463Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:097f195db337cead6e2988e7543e5070a4ec970b66b3fde59249229283a796aa","observation_id":"ad7acedf-ad08-4128-aa9b-576f699a806f","resolution":{"observed_at":"2026-08-12T18:38:19.741521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.725650Z","title":"Supervi- sion exists everywhere: A data efficient contrastive language- image pre-training paradigm","venue":null,"work_id":"3646dd21-51ce-4d5e-9a61-d07c55661b23","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.927328Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:ff6c73260ee73aa0ac5f704b0b44effa7dc3b130d5a7f1b4d8a07f5e7730f8b5","observation_id":"a00fbd1f-04a6-4e30-bb3a-28cd27b1015b","resolution":{"observed_at":"2026-08-12T18:38:19.729879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:18.931234Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.931234Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:efd2bc9f087e3014f99a4861d0b93db64b3af8898cc19a911aa9957097351b39","observation_id":"27244eb8-92a5-4a14-9c51-e2409d99e880","resolution":{"observed_at":"2026-08-12T18:38:18.931234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.705723Z","title":"Language quantized autoencoders: Towards unsupervised text-image alignment","venue":null,"work_id":"143e46de-d3b4-403a-aab8-acb3acff45c9","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.935183Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:72ebe60a0d8e71ed6bffc32fc7903e5dfdd63d3ddbbae4e331c74d44cebd945c","observation_id":"7358f3c8-a38c-4ecc-ac23-1f39083baa42","resolution":{"observed_at":"2026-08-12T18:38:19.709761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18765","last_updated":"2024-03-13T08:47:32Z","snapshot_observed_at":"2026-08-13T05:13:02.978242Z","submitted_at":"2023-11-30T18:05:52Z","title":"MLLMs-Augmented Visual-Language Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18765","snapshot_observed_at":"2026-08-12T18:38:18.940013Z","title":"Mllms- augmented visual-language representation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.940013Z"},"links":{"cited_paper":"/paper/2311.18765","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f15ca62d1411ffef04eeb7c910becfeea2f31f63ccf34acd604d4dbddd97f3af","observation_id":"07d857dd-9ef6-473b-aeff-8efc72d12d18","resolution":{"observed_at":"2026-08-12T18:38:18.940013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T18:38:18.944402Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.944402Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:253e2be3780c949f4100998279039851f974a51b52b805a26dfae1d66a9ed9ac","observation_id":"eb291ae4-5fcb-422f-bd0d-46559506bd91","resolution":{"observed_at":"2026-08-12T18:38:18.944402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.692117Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"704f0328-f76f-4028-9512-f94fde11221b","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.948730Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:7af9ee2e5ff9d2e08cfad0483d95a6f05f93ebcb31dc52ab2ef0243ca7ecdb96","observation_id":"0686173c-cdf0-4d4b-b1df-3615ec2ce85e","resolution":{"observed_at":"2026-08-12T18:38:19.696620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09906","last_updated":"2025-03-03T04:28:49Z","snapshot_observed_at":"2026-08-13T04:18:23.781512Z","submitted_at":"2024-02-15T12:12:19Z","title":"Generative Representational Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09906","snapshot_observed_at":"2026-08-12T18:38:18.952619Z","title":"Gen- erative representational instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.952619Z"},"links":{"cited_paper":"/paper/2402.09906","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:36f285bc00f0201d91414a536eafb3a09d27364746be1e36186947c2294f8f30","observation_id":"ecf32336-bbed-4254-bbdc-e17cb97b2bcf","resolution":{"observed_at":"2026-08-12T18:38:18.952619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.679519Z","title":"Docci: De- scriptions of connected and contrasting images","venue":null,"work_id":"61aeb964-f610-4f91-ab97-ae2564f8f57f","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.956758Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:951b17defac69c5e92d424cf27ece6cb646822b2d88ae4e31ca8ac0cf5416bec","observation_id":"e9fcf66c-1c73-49af-a6c7-910c486ad503","resolution":{"observed_at":"2026-08-12T18:38:19.683887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.666761Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"c5dea3ef-11f3-47b1-8efd-d4087b94210f","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.960633Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:461c7eb280d6ccae5716b2375fd683609459ae88ac8357814834fe940c8b3fa3","observation_id":"37cbdc5f-e82c-4926-8245-1520109e40ca","resolution":{"observed_at":"2026-08-12T18:38:19.670928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:18.964348Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.964348Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:6f421c6c72e7b4eb22f17461d18b5d3788a440bc475e11d38e7b5291b396f3ba","observation_id":"5d1b15dd-82f4-4705-b955-ae8943f16fcc","resolution":{"observed_at":"2026-08-12T18:38:18.964348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.644408Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"af5d2055-0a6a-47fc-a953-16339177654f","year":2018},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.968709Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d2ca3e2e9d387c4d2b54f2cc9770eb633807ce029349b3cfe6943e91ea529969","observation_id":"00ea4c14-7c8a-47b0-b0eb-3be3273f8e55","resolution":{"observed_at":"2026-08-12T18:38:19.648904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-13T04:11:58.141409Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-12T18:38:18.973434Z","title":"Repetition improves lan- guage model embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.973434Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:3f4acd40bad6e5c8423fff3bc091a80d6f12c0a61a16fd232ff4c3386e267ee2","observation_id":"b94bf483-407b-4f26-b040-3338f133aeb3","resolution":{"observed_at":"2026-08-12T18:38:18.973434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-12T18:38:18.979973Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.979973Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:1698c7afff964d65b473f16ec68a19d5930269bfdf7d4d32701b72eaad6c9e8a","observation_id":"1b1a5244-7d1c-4258-b856-f9a6ca575b3c","resolution":{"observed_at":"2026-08-12T18:38:18.979973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.629030Z","title":"Crossmodal-3600: A massively multilingual multi- modal evaluation dataset","venue":null,"work_id":"c6a013da-6a00-48af-b86b-413c0fc0463b","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.985183Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:fa7e1a71a17a2fe3db204a17091e65cc53953f317db1b8b65b67d0cfd4260393","observation_id":"64e4cd87-453e-4e07-aac4-042fc769be0f","resolution":{"observed_at":"2026-08-12T18:38:19.635017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.616141Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"5408f0a6-4107-4895-9efa-c1fb7fae574f","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.989037Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:c22b414219a431129091d7fffd601f4ab8d329cbb2e8ee3b87e7f68d5cbdc90d","observation_id":"a603a36f-318c-49e6-9fb0-e34cf50d15a4","resolution":{"observed_at":"2026-08-12T18:38:19.620165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.603825Z","title":"Stablerep: Synthetic images from text-to- image models make strong visual representation learners","venue":null,"work_id":"14b6e95e-e16f-438f-aa34-1ec2c35b15c2","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.992900Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:180e352ad2eb00dbd834593780e2e3691cf07389f62cfbeec78826e445ca7cfe","observation_id":"49222733-a491-46c9-accc-61f176f490a4","resolution":{"observed_at":"2026-08-12T18:38:19.608271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T18:38:18.997000Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:18.997000Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:d3458c6838d69e6423d3723f93a4498eb9556093a755ba87c665b674b8a91a43","observation_id":"3d212d76-ad4e-4472-a9a6-86c71f9e7b44","resolution":{"observed_at":"2026-08-12T18:38:18.997000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.591953Z","title":"Multimodal few-shot learning with frozen language models","venue":null,"work_id":"137b9b3e-6138-494e-81e1-2a10f28f088d","year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.001300Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:94bf877a65b4add6572d6df7fffc8e09eef2921ae059fe1c8a44f21ed45d23e6","observation_id":"181ea0ff-5cca-4aec-aaee-a07ffa20816e","resolution":{"observed_at":"2026-08-12T18:38:19.596000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01859","last_updated":"2023-11-01T18:43:34Z","snapshot_observed_at":"2026-08-13T10:20:30.002068Z","submitted_at":"2023-09-04T23:26:11Z","title":"NLLB-CLIP -- train performant multilingual image retrieval model on a budget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01859","snapshot_observed_at":"2026-08-12T18:38:19.006394Z","title":"Nllb-clip–train performant multilin- gual image retrieval model on a budget","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.006394Z"},"links":{"cited_paper":"/paper/2309.01859","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:ca64aa85111ee06ba9b53f1663f8ef6b7f6ca9e302619cc97cee45f78e5ae74d","observation_id":"ee888382-854d-4e60-8872-239e223ef6e8","resolution":{"observed_at":"2026-08-12T18:38:19.006394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00368","last_updated":"2024-05-31T07:22:01Z","snapshot_observed_at":"2026-08-13T04:50:57.181092Z","submitted_at":"2023-12-31T02:13:18Z","title":"Improving Text Embeddings with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00368","snapshot_observed_at":"2026-08-12T18:38:19.011691Z","title":"Improving text embeddings with large language models.arXiv preprint arXiv:2401.00368,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.011691Z"},"links":{"cited_paper":"/paper/2401.00368","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8d4c4acbb9b35695a1f438dc3963129b3147998662dfc7dde00be8d8a4f64f9c","observation_id":"b07fbd1e-0b69-4a54-bc5e-52af05dbb357","resolution":{"observed_at":"2026-08-12T18:38:19.011691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.580094Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"82e93f5c-a4af-4a4b-892b-2e5b6934a1b5","year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.017503Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:e8687155772d248cac781054ead390ef89b9667654c6ea89cb56d2dcb98c766a","observation_id":"ef407a48-25e3-4da7-8ac7-cbc02f5c9153","resolution":{"observed_at":"2026-08-12T18:38:19.584093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-13T15:06:41.829074Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-12T18:38:19.021241Z","title":"Chinese clip: Con- trastive vision-language pretraining in chinese","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.021241Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:45be59d4204c32526a986027cf4c7009ba916c27c914251b6bfa3762fe90d30c","observation_id":"5ba97f96-d30f-4d48-8a22-a1c68accd075","resolution":{"observed_at":"2026-08-12T18:38:19.021241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.567878Z","title":"Alip: Adaptive language-image pre-training with synthetic caption","venue":null,"work_id":"c8311049-d35a-48cb-8d1b-435f3b7c8e14","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.025421Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:b862ce0a904d25650cbfa732af35d7b731f97043eb9bb650e5bf5ddf8b9fc2d8","observation_id":"0d6bbb8b-f28e-4df6-b230-c09b5f4bffa4","resolution":{"observed_at":"2026-08-12T18:38:19.572338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-13T15:16:57.345726Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-12T18:38:19.029722Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.029722Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:4df521214eb0478805f5cd35bba888e63460efbbd99b282bc1b48186055bb99e","observation_id":"08a0c0fb-f71e-41cd-9394-4ac6a690eb78","resolution":{"observed_at":"2026-08-12T18:38:19.029722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-12T18:38:19.034360Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.034360Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:576de026db7d103c93bce03cabf701f61b2b07d6f7b5a3def2cae973ce9cbf58","observation_id":"b9688f0f-3c42-4e1c-8b41-f20410f578c1","resolution":{"observed_at":"2026-08-12T18:38:19.034360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.453050Z","title":"Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"599699d8-58f5-4ebc-a542-97570ba993bf","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.038843Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:f760e4d8dd117cce950bd0322cec5f1fff9863ecda8dedbd8cf14645c8f48f23","observation_id":"6700abaa-d14e-4096-b8d4-80892ca4f79f","resolution":{"observed_at":"2026-08-12T18:38:19.456970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.442052Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"2c07b239-0c81-4d9c-aa31-6de889dfee84","year":null},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.042838Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:a7cb03232dbcbc4e50a1c8099ab7a0d2352ee26bf03b3dfb9a268478ba50d160","observation_id":"46fbb959-e44a-465c-a66f-4232af836c81","resolution":{"observed_at":"2026-08-12T18:38:19.445829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.428622Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"222f955f-f47b-4d82-9af0-2df5c7e4ed37","year":2023},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.046846Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:1cf5dd7681fd609a623124ac8fccf5212677a11b14bad399f8584a02b2b9da9e","observation_id":"24684c16-7b27-4655-9deb-003400c7547c","resolution":{"observed_at":"2026-08-12T18:38:19.433717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.415384Z","title":"Simple techniques for enhancing sentence embeddings in generative language models","venue":null,"work_id":"2bdb12d0-899e-49ab-8e69-bcce3dae11e4","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.051036Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:8e392469efeb24c963cb9387cd1ed6f432137bdf8fe7157bc340e19c0474fb46","observation_id":"0a8f4552-a5fc-4809-bdf8-9683dbfab0d1","resolution":{"observed_at":"2026-08-12T18:38:19.420132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.402789Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"464ba178-0000-4033-90fe-d40672135900","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.054747Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:28e8fb5fd962de9e93c2aaf9555a96744bf4bb24f1cb04dbed48f11d8b78d5e6","observation_id":"688377fb-d2d8-4516-b32b-70dc64e34dc9","resolution":{"observed_at":"2026-08-12T18:38:19.406652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.391018Z","title":"Dreamlip: Language- image pre-training with long captions","venue":null,"work_id":"b6c73986-6d65-4385-bb9e-ea366fe30bea","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.058927Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:45859ff6e29d142ed063e6debf1088dfe5b802e6f2251a23f5863241e60e5fe9","observation_id":"d5678b42-79b4-4865-aee6-2f0a69950a5f","resolution":{"observed_at":"2026-08-12T18:38:19.394875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.378811Z","title":"Beyond text: Frozen large language models in visual signal comprehension","venue":null,"work_id":"12f1136c-5829-4b25-afb5-c57ed1d08480","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.062778Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:1f668db5835ac77fcb414254a6b4eb9551d6b45a3751b49a8adf5073d07aeee1","observation_id":"31db733f-781e-4cc3-a199-1dcc8e19c9c8","resolution":{"observed_at":"2026-08-12T18:38:19.382821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:38:19.364051Z","title":"yi”. After thinking step by step, the category of the main object in this image means in just one word:","venue":null,"work_id":"ec0dc157-e530-4842-a7ab-cfa4ed84563b","year":2024},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.066615Z"},"links":{"citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:42e4f06ac1916cbbfa75d99cabbb474aeedb62895fad1000e5bb85741a5a593c","observation_id":"bbb638db-a5df-4c67-a476-1f77e401f0d7","resolution":{"observed_at":"2026-08-12T18:38:19.370466Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2411.11927."}