{"as_of":"2026-08-13T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44820bac0e87701079d174b9896beefe742ffaba146b460c43af6725b3d5c55e","coverage":[{"denominator":113,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:37:57.214117Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:24:43.443062Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T19:24:44.625903Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"cited_work":{"arxiv_id":"2411.15099","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15099","snapshot_observed_at":"2026-08-11T19:24:44.625903Z","title":"Context-Aware Multimodal Pretraining","venue":"cs.CV","work_id":"1340e34c-2bfb-43bf-867b-3fbafef77d6a","year":2024},"citing_paper":{"arxiv_id":"2412.06712","last_updated":"2024-12-09T18:01:13Z","snapshot_observed_at":"2026-08-11T19:16:30.108712Z","submitted_at":"2024-12-09T18:01:13Z","title":"How to Merge Your Multimodal Models Over Time?","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:24:43.443062Z"},"links":{"cited_paper":"/paper/2411.15099","citing_paper":"/paper/2412.06712"},"observation_digest":"sha256:6b1049f19ad14ea8cf2f3fdaffae304dd1c15f0686c164ec2162aaf65f6fc0ed","observation_id":"b9b8c456-4792-410d-b998-f07c992c7b0e","resolution":{"observed_at":"2026-08-11T19:24:44.634180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15099/citation-record","integrity":"/paper/2411.15099/integrity","json":"/paper/2411.15099/citation-record.json","paper":"/paper/2411.15099"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.805098Z","title":"Towards in-context scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.805098Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7a29b609a5552fc63fddf7e281d3f6e3bcfd24682775e9522819bf2cbd9529e9","observation_id":"70c765bd-bb09-4136-8981-ce3cf2be048d","resolution":{"observed_at":"2026-08-12T14:37:56.805098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.810558Z","title":"Food-101 – mining discriminative components with ran- dom forests","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.810558Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a0518e104f809c2935c1b28ad652104499acb710c82af621fe56115690a5d197","observation_id":"c0e9a56c-d66c-4990-8c39-9eac67e6e79a","resolution":{"observed_at":"2026-08-12T14:37:56.810558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.814909Z","title":"JAX: composable transformations of Python+NumPy programs, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.814909Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d761fda299183276dd746e55f1d648be19237bc0297b3feb671593189777ae1d","observation_id":"77018c0c-9f9a-4993-8ebe-d7d729fea3ab","resolution":{"observed_at":"2026-08-12T14:37:56.814909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.818931Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.818931Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:83149c61ce3dac70c1ce4fbb575bb1e78a4b5f7648c32bc5d1f044bf7b4bdc62","observation_id":"45091425-3262-43a2-9787-d4ab8e48c3f3","resolution":{"observed_at":"2026-08-12T14:37:56.818931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.823242Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.823242Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a9ead17634e739edca3e9360ed7ff584adf3ca43ebbff3d27916720d0da2cc83","observation_id":"203c6aed-dd69-44da-872c-2cc3c2938ed6","resolution":{"observed_at":"2026-08-12T14:37:56.823242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.827291Z","title":"PaLI: A jointly- scaled multilingual language-image model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.827291Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:46cefa41dd9ae4c87f6dff1d7e0f6869893c09d3dc285f8039274bc3e1f1d2d0","observation_id":"002d7e9c-d335-436e-8bfe-d192d5a83437","resolution":{"observed_at":"2026-08-12T14:37:56.827291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.831414Z","title":"Meta-baseline: Exploring simple meta- learning for few-shot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.831414Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3a4f2b0964056f3babc36392b8a8d1f4e4f6ef930b415165c3116d4860df5607","observation_id":"1983bc03-c6d4-4a5c-868e-40201bee3ca5","resolution":{"observed_at":"2026-08-12T14:37:56.831414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.835669Z","title":"Remote sens- ing image scene classification: Benchmark and state of the art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.835669Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b0d2925df711781191f7add2c46b2e3022330e014e2fcb2b8e47c409651a0f07","observation_id":"efd77a6e-def5-4984-8e05-27718a21572b","resolution":{"observed_at":"2026-08-12T14:37:56.835669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.839717Z","title":"Cimpoi, S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.839717Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:1ee7501fe3b3e76789760221a48aeaf5a7b3aef69bac616da9c464bcf312fe73","observation_id":"7cf14394-847a-4cfa-b7e4-d329de04a286","resolution":{"observed_at":"2026-08-12T14:37:56.839717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.843837Z","title":"Embedding arithmetic of multi- modal queries for image retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.843837Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7ffdb94073af06d9316b69b9a07a0304d4f939de60712588ba611299ad89bc6e","observation_id":"caa77555-f1f3-4b56-a4f5-c5308f884a12","resolution":{"observed_at":"2026-08-12T14:37:56.843837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.847839Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.847839Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:86a040894ee671f2278882a484f65c8879384e32867e10496eb9c4dab4284e1c","observation_id":"0aeefcd9-4f7b-48a5-8438-b8a75a987473","resolution":{"observed_at":"2026-08-12T14:37:56.847839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08895","last_updated":"2024-10-11T15:12:30Z","snapshot_observed_at":"2026-08-12T22:25:21.465563Z","submitted_at":"2024-10-11T15:12:30Z","title":"Calibrated Cache Model for Few-Shot Vision-Language Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08895","snapshot_observed_at":"2026-08-12T14:37:56.851770Z","title":"Calibrated cache model for few- shot vision-language model adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.851770Z"},"links":{"cited_paper":"/paper/2410.08895","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:520d23f06770f408e394e059ace22a47e3ac72b794f60c1e37adb71fd0ee6e1e","observation_id":"be71853a-f6b3-41e6-ac97-e522472987fa","resolution":{"observed_at":"2026-08-12T14:37:56.851770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.856394Z","title":"An im- age is worth 16x16 words: Transformers for image recog- nition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.856394Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:49ae03adebe14b11fc7f2869923d30a0ef2a5654b109d0c72fcd187c89f4f280","observation_id":"48e47d30-883a-4748-a93a-f4daee470184","resolution":{"observed_at":"2026-08-12T14:37:56.856394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.860414Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of vi- sual representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.860414Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:743bbb90b81e44dff850fac2336dbcb72bac57a07e3b96d557a6c4807796038e","observation_id":"791e29dc-2e3a-4abd-88d3-8197b9bbf257","resolution":{"observed_at":"2026-08-12T14:37:56.860414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05328","last_updated":"2024-10-16T11:43:27Z","snapshot_observed_at":"2026-08-13T05:06:59.404913Z","submitted_at":"2023-12-08T19:26:13Z","title":"Bad Students Make Great Teachers: Active Learning Accelerates Large-Scale Visual Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05328","snapshot_observed_at":"2026-08-12T14:37:56.864270Z","title":"Bad students make great teachers: Active learning acceler- ates large-scale visual understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.864270Z"},"links":{"cited_paper":"/paper/2312.05328","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:e04a41d6f0338b2d5e371c8adac7edb22f70f925e5e454e7a08050734ac37b38","observation_id":"b1ab9afa-8d8e-4ce1-a16f-17109cceba86","resolution":{"observed_at":"2026-08-12T14:37:56.864270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17711","last_updated":"2024-06-25T16:52:37Z","snapshot_observed_at":"2026-08-12T23:35:06.399024Z","submitted_at":"2024-06-25T16:52:37Z","title":"Data curation via joint example selection further accelerates multimodal learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17711","snapshot_observed_at":"2026-08-12T14:37:56.868240Z","title":"Data curation via joint example selec- tion further accelerates multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.868240Z"},"links":{"cited_paper":"/paper/2406.17711","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3f98eacfe558ed0c893b74b8892f94c1592482a2b118a56820b0563623529a57","observation_id":"76b9f8e3-6223-46ff-b754-0bbe8ed0982f","resolution":{"observed_at":"2026-08-12T14:37:56.868240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.872532Z","title":"Data determines distributional robustness in contrastive lan- guage image pre-training (clip)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.872532Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:44199628cc743bc0447997b197789f6934a2737b260d3a0bafefef145b516a83","observation_id":"1eebf32f-e751-4382-9dac-0216922ce997","resolution":{"observed_at":"2026-08-12T14:37:56.872532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07396","last_updated":"2022-12-08T14:28:09Z","snapshot_observed_at":"2026-08-13T07:55:01.633275Z","submitted_at":"2022-10-13T22:29:10Z","title":"Caption supervision enables robust learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07396","snapshot_observed_at":"2026-08-12T14:37:56.876708Z","title":"Cap- tion supervision enables robust learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.876708Z"},"links":{"cited_paper":"/paper/2210.07396","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:534ef756f9bc298919422ee47e084d28cd2cd816e81aa317be8baeb1c88dec5c","observation_id":"3f82e4a1-ddc8-48d1-a892-5ea3aecd3922","resolution":{"observed_at":"2026-08-12T14:37:56.876708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.881328Z","title":"Context-aware meta-learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.881328Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a1720b8f3d5e10f3efc6e7f6f83a07c705f9ff5b0d7c34b40ee9ae7d2d8f1450","observation_id":"3344ca7d-cb0b-4469-958f-9d0f9eb12bf9","resolution":{"observed_at":"2026-08-12T14:37:56.881328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.885032Z","title":"Model- agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.885032Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b6b3f5f7d3d9fb111f267d6a203da56d2bc1314c2d5accb52e0d72be052fbdef","observation_id":"3ecec771-1e71-44f9-9788-8068b4d7989e","resolution":{"observed_at":"2026-08-12T14:37:56.885032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.889441Z","title":"Clip-adapter: Better vision-language models with feature adapters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.889441Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:9c5a92ea79b5d43893c068ca6e4eee30e1098f6b6fdc7605f4298dc08bdefc42","observation_id":"4ce5867a-c163-46ac-90e3-90ae46b03a87","resolution":{"observed_at":"2026-08-12T14:37:56.889441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08172","last_updated":"2025-08-13T13:35:19Z","snapshot_observed_at":"2026-08-12T23:03:08.116395Z","submitted_at":"2024-08-15T14:19:13Z","title":"Towards flexible perception with visual memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08172","snapshot_observed_at":"2026-08-12T14:37:56.893039Z","title":"Towards flexible perception with visual memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.893039Z"},"links":{"cited_paper":"/paper/2408.08172","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:93416c3259067b07edf07fed8269c0a05ad1155f075db0838be118843dbcaafe","observation_id":"ea69ba92-37d5-4ba2-ae99-f7e68baa6f06","resolution":{"observed_at":"2026-08-12T14:37:56.893039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.896970Z","title":"Cyclip: Cyclic con- trastive language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.896970Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:fe889ea04a7c89ea7428c12f2708a574f9efc2b1f7ea298ef410a167f2db6997","observation_id":"c1af1f92-3eac-4a0b-91d9-ba0b27715a8d","resolution":{"observed_at":"2026-08-12T14:37:56.896970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.900622Z","title":"kNN-CLIP: Retrieval enables training-free segmenta- tion on continually expanding large vocabularies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.900622Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:516b9be8d385f5eb81e208817986f6ee9e69952c5615ee96e5f686e5cf74feb8","observation_id":"9b34ef7e-5e95-4083-9bcb-6d08c7968367","resolution":{"observed_at":"2026-08-12T14:37:56.900622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.904118Z","title":"Calip: zero-shot enhancement of clip with parameter-free attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.904118Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:23b14764741f8e0ac9f3ce705ea1f5131f245b02e0079363aba5cb18fb4464aa","observation_id":"72718a6f-1246-4ebd-941a-9664a307b1c3","resolution":{"observed_at":"2026-08-12T14:37:56.904118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.907731Z","title":"Anchor-based robust finetuning of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.907731Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:16fb192423542acc10870574e96afe41a92fc4bee9b0a65d7cd5bb231c9a760a","observation_id":"c3d15297-de6e-461b-895b-ae9edcc6fb1e","resolution":{"observed_at":"2026-08-12T14:37:56.907731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.911882Z","title":"Dota: Dis- tributional test-time adaptation of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.911882Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cd578b44ba21cbbde2039a14eeb8228bccec61530d2c18e1c59f2a8ac791c1e8","observation_id":"73352938-bd53-4430-858a-da6a8b60f17d","resolution":{"observed_at":"2026-08-12T14:37:56.911882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05722","last_updated":"2020-03-23T18:36:55Z","snapshot_observed_at":"2026-07-06T08:36:48.869880Z","submitted_at":"2019-11-13T18:53:26Z","title":"Momentum Contrast for Unsupervised Visual Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05722","snapshot_observed_at":"2026-08-12T14:37:56.915601Z","title":"Momentum contrast for unsu- pervised visual representation learning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.915601Z"},"links":{"cited_paper":"/paper/1911.05722","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:54cf5669a268c6161ff7b968be23ae1cfbd953c084911d4f92201983962220d8","observation_id":"31521a41-7721-487b-b3dc-687f24777925","resolution":{"observed_at":"2026-08-12T14:37:56.915601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.919978Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.919978Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:458081ee4d29dd1c9652dd36b560978340c99d0df9cc2d5509f54d9cb1a429c3","observation_id":"04fa7485-abd6-4db2-843f-8b06ca16ce79","resolution":{"observed_at":"2026-08-12T14:37:56.919978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.923750Z","title":"Ross, and Alireza Fathi","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.923750Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:96a816a96677f4bd46abd1cbfda89fc535a58f7c82be0f4c7d0f1e66be2990d1","observation_id":"0f11c2db-bca9-4a8d-a902-59f97392e053","resolution":{"observed_at":"2026-08-12T14:37:56.923750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.08060","last_updated":"2016-04-12T01:26:18Z","snapshot_observed_at":"2026-07-06T04:37:45.149058Z","submitted_at":"2015-11-25T13:51:29Z","title":"An open access repository of images on plant health to enable the development of mobile disease diagnostics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.08060","snapshot_observed_at":"2026-08-12T14:37:56.927566Z","title":"Hughes and Marcel Salath ´e","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.927566Z"},"links":{"cited_paper":"/paper/1511.08060","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b37d2bc301e957b460f6c67ced74415b2b0efab66b4fe2709ba6504c911cbcab","observation_id":"712c3c31-e308-433f-b43e-98f09a666d95","resolution":{"observed_at":"2026-08-12T14:37:56.927566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.932485Z","title":"Retrieval-enhanced contrastive vision-text mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.932485Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:443a50d75ecd1c2056b8b8dd5bfc06d03d92295ad7fb7413c7675ce4731ad24c","observation_id":"65be5d2f-e5e3-4871-8b7c-c4c697f0b0cc","resolution":{"observed_at":"2026-08-12T14:37:56.932485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.936218Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.936218Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a39574380bd701833fe47c2dbe71ff77bafa00b92d6130acc2304dc6fbb68474","observation_id":"630f52a3-f4d3-4bba-bc2c-aabb5916cdb2","resolution":{"observed_at":"2026-08-12T14:37:56.936218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.939932Z","title":"Billion- scale similarity search with gpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.939932Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:bc7c02318b51849fbd040978c69eaa16b59370a15e89b2be87d204e21dfd25f3","observation_id":"301c0320-f0e9-4ad3-927e-e8c3da1ea784","resolution":{"observed_at":"2026-08-12T14:37:56.939932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.943995Z","title":"Multi-class texture analysis in colorectal cancer histology","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.943995Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:9cbebdc65a1f1d2a0acff17e3913764b1a7491741db35cc7568bbc36081ea2f1","observation_id":"4e7093eb-6566-4511-bab5-8903fb954295","resolution":{"observed_at":"2026-08-12T14:37:56.943995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.948744Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.948744Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:eb71254bbcd342609c5ffdf36d36b3f3d06ed68fc5764ea1113cde8ec9f38b02","observation_id":"a12c991e-ddef-4b57-b744-3b4c493c9bdd","resolution":{"observed_at":"2026-08-12T14:37:56.948744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.953882Z","title":"Self-regulating prompts: Foundational model adaptation without forgetting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.953882Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c07bfa8541dc31727bbcac60e4decee4f72f94d9483bc06e94c620d7da980741","observation_id":"3f0178d9-5fb9-4878-9322-7773ebf4b246","resolution":{"observed_at":"2026-08-12T14:37:56.953882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.958180Z","title":"Datadream: Few-shot guided dataset generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.958180Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:105b8f1475337a248f0bfb1efcf5e48fdc4ce36884ce62483271beaed278bd81","observation_id":"40bbfb34-0c1b-4bb5-9f79-d237c8071b8b","resolution":{"observed_at":"2026-08-12T14:37:56.958180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.961933Z","title":"Kirchhof, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.961933Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:32a975eb70624b3f9c553439967e6562cce4c7054a727bd50925ac70cd94a7c5","observation_id":"8083119b-cd98-48a2-8670-f63045aa784d","resolution":{"observed_at":"2026-08-12T14:37:56.961933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.965448Z","title":"Wilds: A benchmark of in-the-wild distri- bution shifts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.965448Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7b33da87da09d7c3cb28fcd66ac88b56da92cf1f98f677b629272d8fc5f48ea5","observation_id":"21f16633-77be-402c-b7ee-a9f2837d006b","resolution":{"observed_at":"2026-08-12T14:37:56.965448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:56.969771Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.969771Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:666d823a45cc31cd7e0b4ef82a5534b89f760973b1192fc169acc3da496ee7bb","observation_id":"52bea425-8108-4dfb-bd98-0a052fa4d840","resolution":{"observed_at":"2026-08-12T14:37:56.969771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.342205Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"6066137a-43c2-456b-91f8-e2cd203fe0b7","year":2009},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.973726Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:03a1a376fb3680a78a244fa18fe346ea4017cdee7b7f6d4a661d122b97135c78","observation_id":"a56237f0-2a9a-4d2b-b657-7fa37b0660a4","resolution":{"observed_at":"2026-08-12T14:37:58.346155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.331030Z","title":"SentencePiece: A sim- ple and language independent subword tokenizer and deto- kenizer for neural text processing","venue":null,"work_id":"02caab7e-6b84-42b8-927d-99b1713ec59b","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.977722Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a0ca4ed9c81e4a85a1d635fe142d5d335cf22e3ce31dd384c36a93108c02f217","observation_id":"b070a9d6-f5af-4f61-91b8-64f339a3df6e","resolution":{"observed_at":"2026-08-12T14:37:58.335232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.319061Z","title":"Meta-learning with differentiable con- vex optimization","venue":null,"work_id":"45860b97-85fc-4ed8-9b1b-a121a5f4916c","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.981678Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:44afabda41caa6a34d42af961fed2c056eeadc64ab99f3335ce218c03ab27ba3","observation_id":"84fac99f-09e7-4b1c-99ad-abc348ab5315","resolution":{"observed_at":"2026-08-12T14:37:58.323606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.306887Z","title":"Universal representation learning from multiple domains for few- shot classification","venue":null,"work_id":"0d9d25f6-f7dd-4eaa-a5fd-691dc409c32a","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.986973Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:0a30246b76357c26a9ac9148a7b35c23b459aba53f1a6b93d7c54c5e246ca8e2","observation_id":"05d17675-4868-4313-be29-a586dc535122","resolution":{"observed_at":"2026-08-12T14:37:58.310950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09778","last_updated":"2024-04-19T02:19:19Z","snapshot_observed_at":"2026-08-13T03:03:25.184240Z","submitted_at":"2024-04-15T13:30:34Z","title":"The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning","version":2},"cited_work":{"arxiv_id":"2404.09778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09778","snapshot_observed_at":"2026-08-12T14:37:57.456297Z","title":"The Devil is in the Few Shots: Iterative Visual Knowledge Completion for Few-shot Learning","venue":"cs.CV","work_id":"b3b3c7d3-446d-47bd-86eb-a4387c583415","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.991378Z"},"links":{"cited_paper":"/paper/2404.09778","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d563f47e57993c2bf04462fb6903b6571ec97b557b579a812280cb740e40fafe","observation_id":"cc5f9c01-79bb-4ce3-b473-f5a0519ef951","resolution":{"observed_at":"2026-08-12T14:37:57.462781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.295416Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"e7769ff4-b73e-4ebf-a926-647347fa967b","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.995575Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b243249fe412cb37403498615b1a8ad89d34566fa22caf0555d65472d78f84a7","observation_id":"100e03d1-66a3-4846-938d-ae726ac4617d","resolution":{"observed_at":"2026-08-12T14:37:58.299402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.283516Z","title":"A closer look at few-shot classification again","venue":null,"work_id":"9b51338b-6a10-49d0-99e7-1f935fb113bc","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:56.999335Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3a9a620a116a378492583856352bcacdd9042022c8441dedba3cffb67ac4ba96","observation_id":"64fc52eb-12c5-477a-8321-317b216e4e17","resolution":{"observed_at":"2026-08-12T14:37:58.287880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.270767Z","title":"Efficient and ro- bust approximate nearest neighbor search using hierarchi- cal navigable small world graphs","venue":null,"work_id":"ee454eaf-d185-42c4-b258-3011b3f291ab","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.004285Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:67b2f83b91489a890fa56f59104ee1e4030b81c89bbd2383bec2211d084fa3ff","observation_id":"66be19f4-ae75-41fa-a267-c0469a025420","resolution":{"observed_at":"2026-08-12T14:37:58.274989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.258372Z","title":"Visual classification via description from large language models","venue":null,"work_id":"3d8aeccd-c043-43d6-839e-6c607012a5f1","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.008287Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:bbccb47a1b63484e61232f93e62fc8e2114e514506e1f4b533be431277d185b4","observation_id":"4c316190-2606-4644-8e32-d02c12dc136c","resolution":{"observed_at":"2026-08-12T14:37:58.262648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.246141Z","title":"Understanding retrieval- augmented task adaptation for vision-language models","venue":null,"work_id":"22ff1b05-52d5-46b1-98e6-601df29cd738","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.012415Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:81a6ebd4c2122f1382f49c3d54399971f4f47d788d892cd24bf0aafbc078cf8a","observation_id":"1c6ae813-cfd4-497c-915c-53081821f268","resolution":{"observed_at":"2026-08-12T14:37:58.249862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.234935Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"fe31f2c1-4409-4b56-ba5e-f0a700026a95","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.016068Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:371c32d9fa8df2b734090f43017e5f04b7f0d4dccb5d0bc816438dca72e6c910","observation_id":"64f891d0-f16e-4700-9fda-89deececb47a","resolution":{"observed_at":"2026-08-12T14:37:58.238857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02900","last_updated":"2019-12-24T00:21:51Z","snapshot_observed_at":"2026-08-09T10:17:43.490831Z","submitted_at":"2019-08-08T01:43:24Z","title":"iCassava 2019 Fine-Grained Visual Categorization Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02900","snapshot_observed_at":"2026-08-12T14:37:57.019995Z","title":"icassava 2019 fine- grained visual categorization challenge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.019995Z"},"links":{"cited_paper":"/paper/1908.02900","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:563a57b3e18814159911aec874dceb0e89f64e485d4448c827f647238ff73a86","observation_id":"34267b4b-0cd9-4537-88cb-0d25cf3faaee","resolution":{"observed_at":"2026-08-12T14:37:57.019995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.222337Z","title":"Revisiting knn- based image classification system with high-capacity stor- age","venue":null,"work_id":"70fa2b8c-b77d-421b-aaec-688b406b8ea4","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.023854Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cadd9b4009a81052975ce0fa80b2883478dbbfc6014ae93b096fb4c5a6088296","observation_id":"6a6f778a-d042-4d47-b99e-0728aea139c9","resolution":{"observed_at":"2026-08-12T14:37:58.227426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02999","last_updated":"2018-10-22T16:11:14Z","snapshot_observed_at":"2026-08-05T12:53:31.632675Z","submitted_at":"2018-03-08T08:29:38Z","title":"On First-Order Meta-Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02999","snapshot_observed_at":"2026-08-12T14:37:57.031237Z","title":"On first-order meta-learning algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.031237Z"},"links":{"cited_paper":"/paper/1803.02999","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3b58f270cc9da863eef598a3531f1a349ba8d63b31fe426bdb4ec22193d0f986","observation_id":"a4ba33e8-925d-4752-8028-e3c9221f3ba8","resolution":{"observed_at":"2026-08-12T14:37:57.031237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.198615Z","title":"CHiLS: Zero-shot image classifica- tion with hierarchical label sets","venue":null,"work_id":"aeb67762-ce44-49a4-b800-a84f185ce1b5","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.035558Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:094bf586865c621533d632670328b9d652bb0c358d50dd4e0415ef31df311d88","observation_id":"a516c8b1-56ff-49db-ac39-ed9e9667bbbc","resolution":{"observed_at":"2026-08-12T14:37:58.202661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-12T14:37:57.039478Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.039478Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:f4afbb5200d66f280f5924c0c7c240ea20b7ba6fbddb7a4ba98776905414d457","observation_id":"ffc3d409-feb7-4a51-9ff2-9f8763f5a71b","resolution":{"observed_at":"2026-08-12T14:37:57.039478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.187010Z","title":null,"venue":null,"work_id":"7f732f5d-80a1-4b51-8ba9-bdb7d67a8d32","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.043705Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a4eb32e1c66622cae431818c41e4d5a182770419aff6c882388f80cb83e29020","observation_id":"442b0a8e-c71a-4a6a-91e7-640c56d7afa1","resolution":{"observed_at":"2026-08-12T14:37:58.191074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.175053Z","title":"Svl-adapter: Self-supervised adapter for vision-language pretrained models","venue":null,"work_id":"dbe23dc0-3b47-4eb1-9a36-b49614ee7da8","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.047926Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3bc4c48f34e0f6ef5db0341137f1b9477e98574d53cbba5e3f4083fb38418024","observation_id":"b27edba5-7226-4014-bcc7-df36401432a1","resolution":{"observed_at":"2026-08-12T14:37:58.179609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.162934Z","title":null,"venue":null,"work_id":"8eb6ba91-532d-423d-a0c5-e0acb5e5e381","year":2012},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.051654Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d8616c206ced5964c714f4d285537662c2fe2a282dc578c57a2de9fc6bfa74a8","observation_id":"aad77fb2-7711-4292-a136-f79e59bc68a7","resolution":{"observed_at":"2026-08-12T14:37:58.167209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.149945Z","title":"Moment matching for multi-source domain adaptation","venue":null,"work_id":"414218a6-55f9-4c9c-a518-d1f92a4ffa10","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.056471Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:1662f3f24711a709c276c118fe026a7e6bbd3663ff5ac9c1e7324ecb27688e32","observation_id":"fb1fd241-37be-4acc-b86f-2b62a2cce57a","resolution":{"observed_at":"2026-08-12T14:37:58.154247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.139295Z","title":null,"venue":null,"work_id":"b3184cf0-250f-452a-8d5f-163c67b7eb17","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.060344Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:22bbaeb2bc532191844b535acf9aa089b5b2857eb922ed1852890b4e7d7ece83","observation_id":"711b7eb8-5a14-40ff-825d-1fee0f1c1dbc","resolution":{"observed_at":"2026-08-12T14:37:58.142966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09253","last_updated":"2023-11-02T06:06:50Z","snapshot_observed_at":"2026-08-12T13:32:31.971893Z","submitted_at":"2023-05-16T08:03:07Z","title":"Online Continual Learning Without the Storage Constraint","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09253","snapshot_observed_at":"2026-08-12T14:37:57.064283Z","title":"Online contin- ual learning without the storage constraint","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.064283Z"},"links":{"cited_paper":"/paper/2305.09253","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:161cef0b77de8472a6470d94b3f1f4dd9dfae28f4ad593fe0f41835e49e8e07c","observation_id":"a5a555e5-f8dc-4cf2-9f8a-6f8744cc603f","resolution":{"observed_at":"2026-08-12T14:37:57.064283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.127182Z","title":"What does a platypus look like? generating customized prompts for zero-shot image classification","venue":null,"work_id":"32549daf-84c9-4b32-9928-208f80c04494","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.068671Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cd74d9ed91cc06d36ab1f6c3e9a29371f409bcf391b6f72f9c0e31bee45120e7","observation_id":"e006fed8-7986-4efa-a2df-edc5dbae5f72","resolution":{"observed_at":"2026-08-12T14:37:58.131420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.115571Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"742135d8-1dba-40e4-a63a-a3e88f3cb402","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.072389Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:b786870a74f0de7f8b92018b7e21147030b5dce72965f0c21ec75d57ce31db53","observation_id":"9a24563c-aeb9-4cdb-9f12-218f0817d7ea","resolution":{"observed_at":"2026-08-12T14:37:58.119743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.104574Z","title":null,"venue":null,"work_id":"36dfbf5f-5d39-45e9-ae5e-226a12810154","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.076389Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:1ca1360e1a03b8149e4834ca3b0c0911cb82d26fe789d4cb21864fbaa6ecfaee","observation_id":"17366306-0fec-4a1c-bb20-4dd743293929","resolution":{"observed_at":"2026-08-12T14:37:58.108238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.093063Z","title":"Meta-learning with implicit gradients","venue":null,"work_id":"8d161cd8-b3eb-4171-8080-5c35d96ecd45","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.080772Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:7adf62e46ad0424c7e268093568329642726e9b72b6da0e9c524fe675cd983a1","observation_id":"11a6dafd-f568-480b-8ea3-4b1e87e4bfd6","resolution":{"observed_at":"2026-08-12T14:37:58.097235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.082355Z","title":"Towards to- tal recall in industrial anomaly detection","venue":null,"work_id":"e14c5288-aee8-4a61-b00c-916a00ce238e","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.084489Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ffceb0981537000f99fa0e39127771447a09e5a61814a45cd14dd8438a0588fe","observation_id":"5a3eec50-6345-4d87-9c7a-e59d352db629","resolution":{"observed_at":"2026-08-12T14:37:58.086217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.071261Z","title":"Sophia Koepke, Oriol Vinyals, Cordelia Schmid, and Zeynep Akata","venue":null,"work_id":"dd3f3d9a-42c3-4729-ae2a-1e15fe522388","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.088022Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:422436f17bb0c8d0620bcdd045763505e67d1f8559059cda24816982845b581c","observation_id":"f5547801-b058-45c5-b9aa-41767054ec72","resolution":{"observed_at":"2026-08-12T14:37:58.075211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14471","last_updated":"2024-12-06T18:22:32Z","snapshot_observed_at":"2026-08-12T22:57:11.410535Z","submitted_at":"2024-08-26T17:59:01Z","title":"A Practitioner's Guide to Continual Multimodal Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14471","snapshot_observed_at":"2026-08-12T14:37:57.092746Z","title":"A practitioner’s guide to continual multimodal pre- training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.092746Z"},"links":{"cited_paper":"/paper/2408.14471","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:71dd5962e413c9b24eaa100b236bde895ca28654641c9739c97e27594c78544a","observation_id":"e2ce42b8-6507-4191-bd56-8497b31970a0","resolution":{"observed_at":"2026-08-12T14:37:57.092746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.060094Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"9ca2c5e1-95d5-4251-a2c0-f59b93e22b5a","year":2015},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.097341Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:6a364b9206fe7b4dbef367a340b875ded5e1ef3ea2b6ce2aca08f16feee01e5f","observation_id":"03000239-5940-4e84-a6ab-09e07e705872","resolution":{"observed_at":"2026-08-12T14:37:58.063806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.048127Z","title":"Rusu, Dushyant Rao, Jakub Sygnowski, Oriol Vinyals, Razvan Pascanu, Simon Osindero, and Raia Had- sell","venue":null,"work_id":"5ff54f05-12c3-4058-89d3-60639f2c66ad","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.100964Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8eda0e7999d571848c99cd367f29a532863d063eb5c61e40c927a70def892d6c","observation_id":"d6ecb8b8-8445-4d45-9567-e9ac8637df2e","resolution":{"observed_at":"2026-08-12T14:37:58.052211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.037215Z","title":"Is a caption worth a thou- sand images? a study on representation learning","venue":null,"work_id":"061b5a4f-a9c6-4598-9484-82751a5ec9f1","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.104716Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:e98f6ff91864b0ea14a9d221ee03883d35a7b5de8fb16c4ef68f54e92dbe3bef","observation_id":"f2d45028-895b-4b9e-93e3-9e2990279037","resolution":{"observed_at":"2026-08-12T14:37:58.041055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.026227Z","title":"Scott, Andrew C","venue":null,"work_id":"1ffea03c-ef9f-4a82-9251-98b239f89e2b","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.109119Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cec13ea28cc65b4414ea1421241ddf3555775e9b23627f9e40ae286d2f4aaf0c","observation_id":"d93cf45e-2090-402e-95ef-4a92bd597ee6","resolution":{"observed_at":"2026-08-12T14:37:58.030097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:58.007828Z","title":"statsmodels: Econo- metric and statistical modeling with python","venue":null,"work_id":"69b51e8d-40af-4966-b673-db44cb647a88","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.113383Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:6dc58171d56b5036788e9e82a6e647b43fbc1e4634df9fbbbad3ff63c2b73486","observation_id":"c9b90e25-f56c-4b06-9818-850fc62b1c62","resolution":{"observed_at":"2026-08-12T14:37:58.012305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.995118Z","title":"Prototyp- ical networks for few-shot learning","venue":null,"work_id":"8ead0ffd-ea62-489e-a9d7-20f7efbeacd9","year":null},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.117264Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:09486321d87177085509edc0e8669b80a8090e40ec95641c6766158e82bcdafe","observation_id":"81001eac-2be7-4ef4-a53c-7430a15c25a1","resolution":{"observed_at":"2026-08-12T14:37:57.999678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.971814Z","title":"CLIP models are few-shot learners: Empirical stud- ies on VQA and visual entailment","venue":null,"work_id":"fa9af4f2-dfa8-4a4b-ad83-256337135630","year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.124616Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:9fd502bc58fa881aa65553be65ab9bb5485a72218ee7d1a0ebb597ef429b005c","observation_id":"b477796c-5448-4111-9aaf-d90044714688","resolution":{"observed_at":"2026-08-12T14:37:57.976059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03186","last_updated":"2022-11-06T17:41:39Z","snapshot_observed_at":"2026-07-06T14:15:01.843565Z","submitted_at":"2022-11-06T17:41:39Z","title":"Momentum-based Weight Interpolation of Strong Zero-Shot Models for Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03186","snapshot_observed_at":"2026-08-12T14:37:57.128358Z","title":"Momentum-based weight interpolation of strong zero- shot models for continual learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.128358Z"},"links":{"cited_paper":"/paper/2211.03186","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:c5d81acaaa57068e27b44a9ace794fbaf5b27adfcd91c868f4bb45f08726a939","observation_id":"736c5b70-6251-4dd3-aa01-ad1ea67a5694","resolution":{"observed_at":"2026-08-12T14:37:57.128358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.960442Z","title":"Torr, and Timothy M","venue":null,"work_id":"f86409f3-1ecc-48e0-8626-1cb0bbb4ac4e","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.132369Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:3ce2a61eec1e9e5e4c9ac1f1107efa39d6246e40d37856cac7697eafbbb36d5c","observation_id":"007a8fe0-30bc-4ac9-9eae-401bb59f09b5","resolution":{"observed_at":"2026-08-12T14:37:57.964324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13884","last_updated":"2022-01-06T00:55:00Z","snapshot_observed_at":"2026-08-09T12:28:57.878906Z","submitted_at":"2021-12-27T20:02:10Z","title":"A Fistful of Words: Learning Transferable Visual Models from Bag-of-Words Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13884","snapshot_observed_at":"2026-08-12T14:37:57.136457Z","title":"A fistful of words: Learning transferable visual models from bag-of-words supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.136457Z"},"links":{"cited_paper":"/paper/2112.13884","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:bb3953aa2c7b8d282b61903c353753df914fbb4da6752e4bca208721d09bd3ee","observation_id":"95c8b417-a95c-409d-8def-04ac52074166","resolution":{"observed_at":"2026-08-12T14:37:57.136457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.140969Z","title":"Reflecting on the state of rehearsal-free continual learning with pretrained models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.140969Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:2c081bc8c3b139324462240743956c20b255561a2ff34b7d8637b55489c75175","observation_id":"dc99c10a-e7c6-494d-817a-f680068153a7","resolution":{"observed_at":"2026-08-12T14:37:57.140969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.948434Z","title":"Tenenbaum, and Phillip Isola","venue":null,"work_id":"9edd335d-c168-4916-8e3a-54effa2bea79","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.145029Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:205ba1444d83001bbcaca7f05c128f44742786480fbbd461645f0d6594810b25","observation_id":"2f283015-664d-4491-be18-b0dd2ff33416","resolution":{"observed_at":"2026-08-12T14:37:57.952387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.935596Z","title":"Learning a universal template for few-shot dataset generalization","venue":null,"work_id":"1a18d24b-202d-43c3-a8f2-ab8e43472827","year":2021},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.149162Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:9cd26a1b0e0bcb7ef25e39dda41fe68b7acacaf276ad453a8bd431998d121bbd","observation_id":"723165a3-c8b8-48bf-90e5-3e7bd85928a8","resolution":{"observed_at":"2026-08-12T14:37:57.939953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.922851Z","title":"Sus-x: Training-free name-only transfer of vision-language models","venue":null,"work_id":"e5c79ab0-4b52-498e-bc2d-5a55bb4d088b","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.152895Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:fead12a67e895546776a1f2fefc8f06c3b184cbc7454fee7b50c2409ed4c09d6","observation_id":"3ab390aa-eb50-4dae-a438-3083e747ee7e","resolution":{"observed_at":"2026-08-12T14:37:57.926951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.910859Z","title":"No ”zero-shot” without exponential data: Pretraining concept frequency determines multimodal model performance","venue":null,"work_id":"7675c8dd-a497-4a2e-97c4-a33ccef4dd7e","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.156538Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a38736252ea2728471a78b45c2f9a53676c5a6e3ada4f0ea49e566129df3b014","observation_id":"dea92e67-8c29-41a8-877e-579c86f2bb22","resolution":{"observed_at":"2026-08-12T14:37:57.914761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.898931Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"010cebf6-ad2a-4262-a307-b33b74c46f74","year":2017},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.160216Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:8408a3e85e04a795a9d611985007aa01a236b5d7b75cbca7779ed0f2e1e3623b","observation_id":"82c60407-9136-4ee8-bcb4-085c2e53757a","resolution":{"observed_at":"2026-08-12T14:37:57.903118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.887578Z","title":"Matching networks for one shot learning","venue":null,"work_id":"40be0970-d941-45b2-987b-5f6544718b06","year":2016},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.164036Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:1e8ba8f17cbe10d9ce7dbb465535b51aaa880265d374b4b2613fb394f252f63b","observation_id":"9d0d702b-5736-4283-8759-998f518144f6","resolution":{"observed_at":"2026-08-12T14:37:57.891598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.875063Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":"49b53194-458b-464c-bf7a-0822da6fbc55","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.167806Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:d597988ce4a2c46696871aa921a50559a85f5cfa533df2adb1f43a8362742c97","observation_id":"79ea8769-f9a9-4ad6-932c-235425f2753b","resolution":{"observed_at":"2026-08-12T14:37:57.879394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.04623","last_updated":"2019-11-16T00:35:54Z","snapshot_observed_at":"2026-08-11T17:03:10.222098Z","submitted_at":"2019-11-12T00:44:10Z","title":"SimpleShot: Revisiting Nearest-Neighbor Classification for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.04623","snapshot_observed_at":"2026-08-12T14:37:57.172045Z","title":"Simpleshot: Revisiting nearest- neighbor classification for few-shot learning.arXiv preprint arXiv:1911.04623, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.172045Z"},"links":{"cited_paper":"/paper/1911.04623","citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:23950884b473ddd9f3f282fb147461d9a568423adda2372908f052ecd8854440","observation_id":"58d52a3f-8c90-4eb9-ba33-21098263e4b3","resolution":{"observed_at":"2026-08-12T14:37:57.172045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.864178Z","title":"A hard-to-beat baseline for training- free CLIP-based adaptation","venue":null,"work_id":"052b3945-d49b-433a-a342-333a50e6580a","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.175826Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:cc1cac5aa8c0f4aac9bc87999aa4a7965194a753bbf8512024f3b8a895b2d368","observation_id":"51f8e675-7350-412a-94a5-0b679013241e","resolution":{"observed_at":"2026-08-12T14:37:57.868102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.853289Z","title":"Welinder, S","venue":null,"work_id":"ad5848a5-d447-4b14-9a1e-b44ba84cc8c3","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.179462Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:85e20e881c0ddd564dadf65addd013fd7d7db905cb31df3b7c2fb4d368430cf3","observation_id":"181e1fb5-0c3b-47f4-b543-a17c2dd03b85","resolution":{"observed_at":"2026-08-12T14:37:57.857105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.841984Z","title":"Cascade prompt learning for vision-language model adaptation","venue":null,"work_id":"9096f8ba-09b9-4c29-889d-ee73b262caac","year":2024},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.183149Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ea4ccd535e6e775493314b3ebbb8acf9a99e02e1d3f58d81f5a942a302e2075c","observation_id":"c99e5433-c297-4b5d-ba9b-e6f829b23660","resolution":{"observed_at":"2026-08-12T14:37:57.846173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.831184Z","title":"Yu, and Dahua Lin","venue":null,"work_id":"6e2ffefb-0dd7-4871-81ca-187170b49db7","year":2018},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.186746Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:a3b5f970e6d1af73650fab20f69a6a25205e69afb99853f4f5c375449180dd28","observation_id":"2ef29238-f14e-4282-954b-6baa244b04ed","resolution":{"observed_at":"2026-08-12T14:37:57.835015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.820239Z","title":null,"venue":null,"work_id":"6e40a2f2-d7a7-419c-b357-3305c0b73f9a","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.190332Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:69fc1b46a5ea37ee52b9b4da3c4ceb708f52bf78261f93297f33abeccc58afe3","observation_id":"deb49dfa-4408-4827-811a-446eb5d7debb","resolution":{"observed_at":"2026-08-12T14:37:57.824058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.808805Z","title":"Ra-clip: Retrieval augmented contrastive language-image pre-training","venue":null,"work_id":"d103213e-25ae-4840-aabb-d3e65a6239b1","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.193803Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:08cc9959fe689a1fd0a004fa2a415dacdc219c34c41e6b41d339ab51c035ec9b","observation_id":"575cea0f-38ef-425c-a187-745270fb36a0","resolution":{"observed_at":"2026-08-12T14:37:57.812976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.797713Z","title":"MetaFun: Meta-learning with itera- tive functional updates","venue":null,"work_id":"7e4ef9fd-6ac8-459b-9085-0cda9f06f1be","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.197717Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:ff3393f81f96e63c44f833ae9d6005d9aa2db6c3e2b30ad7a3cf44809004149b","observation_id":"e67708da-7c0d-4613-a188-06e4cdf8e229","resolution":{"observed_at":"2026-08-12T14:37:57.801712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.786246Z","title":"Bag-of-visual-words and spatial extensions for land-use classification","venue":null,"work_id":"39168bf2-3100-4164-825e-65c439f8c662","year":2010},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.201604Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:0f10d6e6b14d575cb648fa04f6deaacaa352971011576f9e33de472424aae376","observation_id":"6127758c-8ad4-44f4-9215-885eb7169f91","resolution":{"observed_at":"2026-08-12T14:37:57.790291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.772846Z","title":"TapNet: Neural network augmented with task-adaptive projection for few-shot learning","venue":null,"work_id":"88781c3e-1f64-4947-b4d7-4400e94a7fb5","year":2019},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.205556Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:92b75d7ad6f27a7a6970905c69ee932ff0512b4708c454720f3680c2593458c3","observation_id":"1b7a84d9-5cdd-41d1-9862-cf12abb957c2","resolution":{"observed_at":"2026-08-12T14:37:57.777850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.760878Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cce9a7d2-e9e0-4eb4-aa69-1f10122dd1f3","year":2023},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.210229Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:092b73c7ac0107a2eee6ef8abeff4eec97cffb03cc02408d41b421f7f5a27382","observation_id":"df4d8c5c-6d8b-41b0-a767-f9c6521dc099","resolution":{"observed_at":"2026-08-12T14:37:57.765024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:37:57.748856Z","title":"Deepemd: Few-shot image classification with differen- tiable earth mover’s distance and structured classifiers","venue":null,"work_id":"693ac5e8-1510-4c50-9b64-f5927aabfbea","year":2020},"citing_paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T14:37:57.214117Z"},"links":{"citing_paper":"/paper/2411.15099"},"observation_digest":"sha256:aee68e3fda4ae4ff18f49c3b07c37b861d09ee693b1d259c2305efc7b11ced7e","observation_id":"e6204512-50f0-4d9c-b946-a3f74601fde8","resolution":{"observed_at":"2026-08-12T14:37:57.753232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15099","last_updated":"2024-11-22T17:55:39Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:27:36.883696Z","submitted_at":"2024-11-22T17:55:39Z","title":"Context-Aware Multimodal Pretraining"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":44},"total_outbound_references":113},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 113 outbound references and 1 inbound Pith citation observation for arXiv:2411.15099."}