{"as_of":"2026-08-12T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd7cc8a4aaa330e0e221908035d7b6662cfa82c84114a9c69d0120b6ad87a9d0","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:22:55.635316Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:54:09.796839Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:54:12.830432Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"cited_work":{"arxiv_id":"2412.06774","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06774","snapshot_observed_at":"2026-08-06T18:54:12.830432Z","title":"Visual Lexicon: Rich Image Features in Language Space","venue":"cs.CV","work_id":"301c2883-8571-438a-930c-d16df23ac732","year":2024},"citing_paper":{"arxiv_id":"2507.07104","last_updated":"2025-07-11T03:43:50Z","snapshot_observed_at":"2026-08-08T17:01:07.284698Z","submitted_at":"2025-07-09T17:59:04Z","title":"Vision-Language-Vision Auto-Encoder: Scalable Knowledge Distillation from Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:54:09.796839Z"},"links":{"cited_paper":"/paper/2412.06774","citing_paper":"/paper/2507.07104"},"observation_digest":"sha256:ea84c22fa83ce6615295121642f4e3a4f65fc076417234f480c805a509186290","observation_id":"e599697c-7bea-411d-b4f2-60dcfa7a302b","resolution":{"observed_at":"2026-08-06T18:54:12.941828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06774/citation-record","integrity":"/paper/2412.06774/integrity","json":"/paper/2412.06774/citation-record.json","paper":"/paper/2412.06774"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T19:22:54.902029Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.902029Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6cab5fcd87d8fccb42d94593a312106541b1e2a0a2f95a5bb555800c23f55f3e","observation_id":"fa53fbcf-cfba-451d-b919-ac685e9b21d2","resolution":{"observed_at":"2026-08-11T19:22:54.902029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.911285Z","title":"BEit: BERT pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.911285Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e021698d8be1fe7932b0ba54da674b3564aa5ad387f92715b579b429c354c6a6","observation_id":"df5898d1-f414-46de-844d-3616b039a90c","resolution":{"observed_at":"2026-08-11T19:22:54.911285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.918280Z","title":"Label-efficient se- mantic segmentation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.918280Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:bf312b0141b91ff4716f792779f36bf7260f4d5a037192d7584e2c714abd6f0d","observation_id":"8110e71e-2571-433c-812b-960dd4e6a763","resolution":{"observed_at":"2026-08-11T19:22:54.918280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.925181Z","title":"Generalized denoising auto-encoders as generative models","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.925181Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e1390ec91ae8a73db6abc58f605411fbf6d6a57c3b9f99da52c9203290592154","observation_id":"11a12ab5-d0aa-4f21-b0e2-42b25e537971","resolution":{"observed_at":"2026-08-11T19:22:54.925181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.931763Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.931763Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:9c2fa9e755cb54ef852b0de1b2a16b48e821046072dd62a02b65d788f34eb715","observation_id":"2bf1a14f-f047-4925-b72f-44ddb677ce87","resolution":{"observed_at":"2026-08-11T19:22:54.931763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T19:22:54.939829Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.939829Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3218bb37a02d2d43566b39ab74be32d57f08900ebfeeabfcbe6a59cddd232d65","observation_id":"187cf068-12cc-4afb-89fd-f1b572370631","resolution":{"observed_at":"2026-08-11T19:22:54.939829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T19:22:54.949489Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.949489Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:619b03322f96a51705347cd349c9ae0f36e31ab8583de06561173e2d0bd3222e","observation_id":"a7233933-ab07-44fb-91cf-bdef1edd0a01","resolution":{"observed_at":"2026-08-11T19:22:54.949489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.957417Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.957417Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ad66e57999e28a1403f0a58fe56798ce4e069a60e21c88fd9dff56dabd1c1f56","observation_id":"34f3191c-b220-4d09-b037-40fae470963c","resolution":{"observed_at":"2026-08-11T19:22:54.957417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:54.966657Z","title":"Generative pre- training from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.966657Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:d0c1a9c1ce7439874a21fee3fc612daddf5151c11bc4c1e1f34d39985718b019","observation_id":"1cf3a614-1b2c-4dd0-b362-f39cbf9c9fa8","resolution":{"observed_at":"2026-08-11T19:22:54.966657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T19:22:54.975741Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.975741Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3a352852e17fd343713d603f4808d05abed1a936e505ea2dd086e23acac0b678","observation_id":"ed4090ed-fc6a-48d9-acaf-358c37ae14e3","resolution":{"observed_at":"2026-08-11T19:22:54.975741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-11T19:22:54.983804Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.983804Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f3e9d90c010a025fa8fb2498c528c70dbca7e3e0a99ae8732e43695affaa452f","observation_id":"4471d54f-f548-4395-83ad-6a7ecc68b03c","resolution":{"observed_at":"2026-08-11T19:22:54.983804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14404","last_updated":"2024-01-25T18:59:57Z","snapshot_observed_at":"2026-08-06T14:37:40.501908Z","submitted_at":"2024-01-25T18:59:57Z","title":"Deconstructing Denoising Diffusion Models for Self-Supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14404","snapshot_observed_at":"2026-08-11T19:22:54.993646Z","title":"De- constructing denoising diffusion models for self-supervised learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:54.993646Z"},"links":{"cited_paper":"/paper/2401.14404","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:0c72ffeb1a397281cb5a5b9d6936b0ce0d05aaf77da258d54e8d13c8f38419a6","observation_id":"5ed146b8-028f-4577-a6e2-05d74d7da021","resolution":{"observed_at":"2026-08-11T19:22:54.993646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.003755Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.003755Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:75e040ba97336997ceb2dc971d0903a819d6a5d755687a3bb1eddbe5414b3713","observation_id":"7541b5ae-c73c-49bb-853f-026e0c757138","resolution":{"observed_at":"2026-08-11T19:22:55.003755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.010841Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.010841Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:816ba6b901c6f6b1d4ee1116e5bc61fd3bd22596add4b66ff7042bb42a81930a","observation_id":"5f2108ee-e53b-4aaa-9503-3a674420d1c9","resolution":{"observed_at":"2026-08-11T19:22:55.010841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.017006Z","title":"Large scale adversarial representation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.017006Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ff71b5ab7446e1f5984ea16c03f974ce8ba40cde1f8683e07270912cecf44742","observation_id":"03c98d72-164b-46e9-8f91-76a18d6c12ef","resolution":{"observed_at":"2026-08-11T19:22:55.017006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.023580Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.023580Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:5dd103d35f3076e9dd78149ffcba4b315c3494a35224ec2be37363a0b90c0f8e","observation_id":"dfbf0931-9762-45ec-a0db-b6e1c13dcffa","resolution":{"observed_at":"2026-08-11T19:22:55.023580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.404184Z","title":"A new algorithm for data compression","venue":null,"work_id":"ed6f771f-85c8-472e-8e6e-d055f3b8512c","year":1994},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.029405Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:87aec734019678691683ff70269427c28f90a53e3a68f35ffe4ad24ec8e484f0","observation_id":"6ccb5774-6814-46c8-833f-2be2bdda1bf9","resolution":{"observed_at":"2026-08-11T19:22:57.410098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.372961Z","title":"An image is worth one word: Personalizing text-to-image gen- eration using textual inversion","venue":null,"work_id":"591734c1-4083-48c6-a36d-bff650f725ba","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.034815Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:4ef723445e19bf9e4c3b8ed8354556d8a934abac8a95e47cd2b9d4fb2af461d8","observation_id":"af91a1d3-e1e5-4ffb-918d-634b705575b9","resolution":{"observed_at":"2026-08-11T19:22:57.383161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.346912Z","title":"Instructcv: Instruction- tuned text-to-image diffusion models as vision generalists","venue":null,"work_id":"3bec327f-bca3-48dd-847b-d3c40e7694a6","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.046351Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f2bd25e8d5d12e872aec09290c315c3521d0662749d4b431930e340b47afbcb4","observation_id":"1d414d07-28c6-4f8d-89ae-da66703c8d72","resolution":{"observed_at":"2026-08-11T19:22:57.352919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.056655Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.056655Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3b98f26c8ca734c6737ca94e3d9e8346bb67c38768887113c0134bf37d525edd","observation_id":"9ebe5898-7155-478e-9f7c-984e83ac06bf","resolution":{"observed_at":"2026-08-11T19:22:55.056655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.307334Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"5bc332fd-9b46-414e-bb19-ba7b4b40b462","year":2017},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.065525Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6779f91689d2487a344752314dfd266e4888995ce01b45b22234ae1c4d74e716","observation_id":"8fcdbec4-24b4-4a5d-9cd8-4672cdd60922","resolution":{"observed_at":"2026-08-11T19:22:57.313708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.072741Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.072741Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ebaa5d3b2cc275b24343ad21f8cb85073753acfe25abdeb02cadc6b0a32dcefd","observation_id":"3d9bdb7a-b3b2-4aba-8c93-62428a98577e","resolution":{"observed_at":"2026-08-11T19:22:55.072741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.274455Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"4af1a185-fa92-41ad-abf0-ffaa626dbf57","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.078927Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6ee872ae78a014d8af184b288c5946a3cc6f58080dbdded771eaed80b12271f7","observation_id":"dfda47b2-9d57-4352-bc29-30acf26db66c","resolution":{"observed_at":"2026-08-11T19:22:57.281433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.089100Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.089100Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:149a42c5c4d8c7a39013d0abfc8326be8d61aa12c1b0d1844886b746e2b3c591","observation_id":"7bc44f81-38ce-4805-bc07-4364fc897ec9","resolution":{"observed_at":"2026-08-11T19:22:55.089100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.243947Z","title":"Autoencoders, mini- mum description length and helmholtz free energy.Advances in neural information processing systems, 6, 1993","venue":null,"work_id":"772a30df-9540-4465-b9e3-afa7bb31e022","year":1993},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.098671Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:b5207eb290a3ca837639bc94b51d34e9383babfc5acd009483fecefc698009aa","observation_id":"ec23e6a0-1c94-4aab-a2a6-dc8159441e07","resolution":{"observed_at":"2026-08-11T19:22:57.250336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.108679Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.108679Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:bf8802d587d85800ca3fe1250b7ddb343cf070951fd3e893eb6134f74a1ec4af","observation_id":"f8c2c37b-6659-46f5-b568-2aeafbbc2a9a","resolution":{"observed_at":"2026-08-11T19:22:55.108679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.115996Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.115996Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:9b17a5d4b377d931208277a6a9587a7b5139a6358666e11ccadbff1c9df8d6dd","observation_id":"38770467-6fb6-47fe-a205-3d69acc679aa","resolution":{"observed_at":"2026-08-11T19:22:55.115996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.11624","last_updated":"2021-10-25T04:37:30Z","snapshot_observed_at":"2026-08-09T21:29:09.841868Z","submitted_at":"2021-10-22T07:10:41Z","title":"SciCap: Generating Captions for Scientific Figures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.11624","snapshot_observed_at":"2026-08-11T19:22:55.125210Z","title":"Scicap: Generating captions for scientific figures","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.125210Z"},"links":{"cited_paper":"/paper/2110.11624","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8ad0f4eda1915330f29767116359b902e7a3fc731b277a52e8e34054aa193f37","observation_id":"bd3f989b-bf23-49db-b91e-65274e5f4643","resolution":{"observed_at":"2026-08-11T19:22:55.125210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T19:22:55.132713Z","title":"Lora: Low-rank adaptation of large language mod- els","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.132713Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:655996d0c6712eb219f0d8e171892448c2456295ffa130237deaf291b6595060","observation_id":"77acda40-70fd-45e1-8a62-9ffb034197ec","resolution":{"observed_at":"2026-08-11T19:22:55.132713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.199820Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"6c8a20e4-dc60-4af9-be35-87310dac16fb","year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.140234Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:208fec5a6a8127ee54d2d27cde66004cfd035cef83373df1b5b9508061a450fb","observation_id":"820a3d38-192c-4903-8b28-2b68487e3ded","resolution":{"observed_at":"2026-08-11T19:22:57.205052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.181650Z","title":"Soda: Bottleneck diffusion models for representation learning","venue":null,"work_id":"736f8163-ea16-439d-91fd-940baa7fbeca","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.153036Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:3aa31a27ec29d5cc73c029a2ca175ee5c7b1d7f144482807f8f1029ea489cb0d","observation_id":"214ad2ed-739b-401b-a78e-4a7e7ceb5abb","resolution":{"observed_at":"2026-08-11T19:22:57.187455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.161598Z","title":"Open- clip, 2021","venue":null,"work_id":"9faaf5a4-5014-4432-80f5-364a33aee074","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.163968Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:0a25481286398d1a4dd7fa097ee069d85878eedb02e1817bb267a35130effa8c","observation_id":"d048583f-2d3a-4248-995e-33dbe42e710a","resolution":{"observed_at":"2026-08-11T19:22:57.168440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.138852Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"beee715e-c8bb-44ee-9609-2932f6bf5034","year":2014},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.171855Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:7a14a87130aed419a6334692b1cd410ff5e4d128164d835894c387a0d106c7f7","observation_id":"cbb5b517-af0f-4458-aca6-fa74ef836242","resolution":{"observed_at":"2026-08-11T19:22:57.145340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T19:22:55.180039Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.180039Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:1a43ac0dccc437cea5ce78b71f70d09b8e47153cbd3c3b32edca105139af8e5a","observation_id":"48d02701-c186-4f6d-a14f-6b27347adc43","resolution":{"observed_at":"2026-08-11T19:22:55.180039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.189781Z","title":"Your diffusion model is secretly a zero-shot classifier","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.189781Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:dc64fdfd5bbbdc9cfe037d812dac36da4af1e1d8651f9cb86efb4777613ab5d6","observation_id":"5722e5a2-58b1-469f-8f16-4016ff76d8ee","resolution":{"observed_at":"2026-08-11T19:22:55.189781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T19:22:55.196482Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.196482Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8c648068bd1a65728927338cedb7bc85291495a93aa38a13f3b4fffa2da8c1e1","observation_id":"60760f2a-1876-4691-81ba-2bfdefc76522","resolution":{"observed_at":"2026-08-11T19:22:55.196482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.102016Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"fbe19393-936d-4bc2-91f0-06eda6bdfc05","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.203918Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:dda264ffa5c6778abf3ab59e0f9ce50496b1139a85933a7425538bcf70f2a539","observation_id":"0f506868-c561-40dd-ba55-39aa22e4f875","resolution":{"observed_at":"2026-08-11T19:22:57.108917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01756","last_updated":"2024-12-03T20:32:52Z","snapshot_observed_at":"2026-08-12T22:32:20.078181Z","submitted_at":"2024-10-02T17:06:39Z","title":"ImageFolder: Autoregressive Image Generation with Folded Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01756","snapshot_observed_at":"2026-08-11T19:22:55.217594Z","title":"Imagefolder: Autoregressive im- age generation with folded tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.217594Z"},"links":{"cited_paper":"/paper/2410.01756","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e133c2ff4afdd55733bbf866d3e39a61a64b1e06f28d27143a96da49243a4f17","observation_id":"2881563e-06ee-46ce-a4d5-84293a2247eb","resolution":{"observed_at":"2026-08-11T19:22:55.217594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.084843Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"957ac239-8368-4199-9dc8-c0704bfeeab8","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.226402Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:7e99543996fbebc4457ec91f6b46bd3296cf48e27ad89f7081a3be67c40efc28","observation_id":"4234095f-c9a6-412e-920f-8b00f32cbcad","resolution":{"observed_at":"2026-08-11T19:22:57.090493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.066025Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"b702a170-5011-4344-9970-c76806446555","year":2014},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.231979Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e75960dc1480d234c7c8769a69c839e7d70acf6ff6f7c03a096afc475eb3103a","observation_id":"51f159c9-6975-4607-9083-ce26e41d3649","resolution":{"observed_at":"2026-08-11T19:22:57.071696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.237076Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.237076Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:1fd4092fdb0de181e720c84910a4c4f4ce51d028c122f93ecb153132c64b6ea8","observation_id":"31ef5b21-af4d-4adb-af7c-7cf765f11b39","resolution":{"observed_at":"2026-08-11T19:22:55.237076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:57.032562Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"37120dcd-a6a4-4150-a326-571182084fa4","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.244513Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:99a63124887534582061e50b18f1d75e984d10c9b5c23815d969eb2c0c590fb7","observation_id":"73a78549-8fda-415f-b5fd-31b0fe850442","resolution":{"observed_at":"2026-08-11T19:22:57.038651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.251306Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.251306Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:268350e284330ebabad6e4e4ab500eb769a8a789fd3699234835889aead30545","observation_id":"16f3383e-3957-4fb6-87bd-f7260ef7f4b9","resolution":{"observed_at":"2026-08-11T19:22:55.251306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.998119Z","title":"Prompting hard or hardly prompting: Prompt inversion for text-to-image diffusion models","venue":null,"work_id":"b0b49b2d-5d26-43d6-b836-9c7877101530","year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.256987Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:1b5d80b214384a546830cd5ac88f0ae329d144fdc3b9fd2e4df87d7eeee456c3","observation_id":"e9a4194e-ccde-4b59-b7a6-20b105456862","resolution":{"observed_at":"2026-08-11T19:22:57.004154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.979519Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"af72d000-0c66-4412-925c-4dda356e0c27","year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.265281Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:df1d3e9166d45773c191849cc8d137037615ac9dbef473de7247345893efaac9","observation_id":"2c298753-c6e2-42fc-aa86-fc2884543f2c","resolution":{"observed_at":"2026-08-11T19:22:56.985685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.960108Z","title":"Ok-vqa: A visual question answering 10 benchmark requiring external knowledge","venue":null,"work_id":"70ae8d36-ab96-47bb-9997-d2e7910bd056","year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.273236Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6d4637e0aa4f009a1d2a08e4c92a75c9c5449fa86b0e0a30ed5a0b7ba7e22968","observation_id":"11192204-bfe0-41cd-99de-3e2e4013ef88","resolution":{"observed_at":"2026-08-11T19:22:56.966163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.942286Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":"670698ec-0fec-4f3d-9ee7-cd9bda1d1eb8","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.282252Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:a081b0541b06eea4b8a4ea63a07296f9d566fc66f94e47d90edc14b21825af74","observation_id":"343df608-9cd4-4d54-8b63-dabefd91fb01","resolution":{"observed_at":"2026-08-11T19:22:56.947678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.288368Z","title":"Null-text inversion for editing real im- ages using guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.288368Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f68a1eda379246f7c41986062aa0a51d453cb03fad5065947b5fc272a70b0e6e","observation_id":"7e9a96d0-4db1-4a8f-85d1-d0e9c6846b71","resolution":{"observed_at":"2026-08-11T19:22:55.288368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.911479Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":"ba7a46cf-c739-40f8-982f-bebe34641016","year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.297128Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ee4312cebe203340f9f5b00328d07dc3d98fd4a3f0701ceb7abb59f65d642ef3","observation_id":"25210b1e-3cda-4333-a301-8ae368bff820","resolution":{"observed_at":"2026-08-11T19:22:56.917686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T19:22:55.305714Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.305714Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:82bcb79b8c14f85439394b846750a7bf734019da6bbd74bbdf9c91f1f25e4575","observation_id":"c3683f6d-6730-4d9f-b0d9-bcad9a0e70ad","resolution":{"observed_at":"2026-08-11T19:22:55.305714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.314781Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.314781Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8b50ca522b51e3c504d3b2cd08d0ba2004d362dba557789364dcf80528c722ad","observation_id":"780337ba-4573-47fb-973f-c07c08df00a6","resolution":{"observed_at":"2026-08-11T19:22:55.314781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.877188Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"cb43328b-29d2-42d7-8be4-01fe57ffddb7","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.329481Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:706596201003817d007d6bba2393ad98b464d01e537e9fd424f5dfb393f9ace7","observation_id":"6972a36d-6ad5-4e07-979e-bd5d9eae5668","resolution":{"observed_at":"2026-08-11T19:22:56.883818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.857387Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"da8ff107-7e1e-4bad-a99f-34c6badbb1d5","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.346679Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:457c0a243f6899b7b4fb444fdd920f9f758d209f56cd1f28fa7211b8217d68cb","observation_id":"3526c95c-494c-45a0-9b7d-392445279843","resolution":{"observed_at":"2026-08-11T19:22:56.863188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.833701Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"8484ad49-0568-4254-9720-c5de280f226e","year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.352693Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:8160b102070a283fd83ae1cb9c2a3efa6930d3106c21de91a07151ac16fe4afe","observation_id":"07ccb4c7-7fe7-4226-9664-470eb4c50e37","resolution":{"observed_at":"2026-08-11T19:22:56.839149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T19:22:55.360946Z","title":"Hierarchical text-conditional image gen- eration with clip latents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.360946Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:9660728a755cecf7d63d92a8830f6c168576de244fe71a4a315d753944cba7a7","observation_id":"97de4469-4aca-463b-ac3c-1f848dbc3502","resolution":{"observed_at":"2026-08-11T19:22:55.360946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.812524Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"14df24fd-9785-402f-be51-b942d5ca273f","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.367294Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:81a7b6f41def42ec6565979d74a4aa3b3e99cc490b7854b90a8bf1de3e656711","observation_id":"08351e34-873d-4549-b142-3807ea059427","resolution":{"observed_at":"2026-08-11T19:22:56.819093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.789799Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"edf4b794-1afe-46ac-8de2-d2a7ba960a97","year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.375945Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:9238b3f832a27c5863e827ccff4c12ec3d5eebeba5099868f5be91db85065893","observation_id":"1741204b-4a84-47fc-8dc5-cca29e09855f","resolution":{"observed_at":"2026-08-11T19:22:56.799309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.766282Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"df0996ba-aab0-4da4-812d-096d7f32237e","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.383169Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:be438a83f54430e2097d95d51f1ae9d6e8201bcf60ebbfb801c27b2301cdcd38","observation_id":"e9180746-7448-4671-93cd-2e7235e8e822","resolution":{"observed_at":"2026-08-11T19:22:56.772700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.745038Z","title":"Hyperdreambooth: Hypernetworks for fast personalization of text-to-image models","venue":null,"work_id":"e6018bc0-a7d4-44a8-9cf4-421bf99a071a","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.390493Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:d0fb0f65883797a00e72c0b17ac4b5226c3e7ace40a18e2d60af1fc8b3c09ab8","observation_id":"726ffdd5-ad93-4285-875c-1b79fdb9ee05","resolution":{"observed_at":"2026-08-11T19:22:56.751649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.724462Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"471b025d-0bea-49ef-869e-12c70ea1ad90","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.398079Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:388333fae8a4d96c1bc3175d7fb20a7aa7c2be081c37dc07bdf352e68a8071f4","observation_id":"b21586a3-038e-4654-ad79-7db984e8432f","resolution":{"observed_at":"2026-08-11T19:22:56.730199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.705996Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":"0168036e-8b1b-4fa7-9ee5-fd5da65f8fa5","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.405021Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:cc6fdc060036d740bc6025d10f5644cb6514eb44293b2312050e523e04615d8f","observation_id":"9cb61f0b-e9c7-4677-80ee-4c886789ddef","resolution":{"observed_at":"2026-08-11T19:22:56.711979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-11T19:22:55.415902Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.415902Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:2a549f58a5be0befda533cabe98b4a3fa7f1291088fdba34bee3c4fd72cb27a6","observation_id":"e1062836-6fdf-430a-b5fe-b1e2ceafd75c","resolution":{"observed_at":"2026-08-11T19:22:55.415902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.683227Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":"88134d94-3fc9-4130-a264-98c6ff422aef","year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.423417Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:282cc85adc9f079bee5fe130553ffca1c02c84c2a74d5108980ef3df86cbdeda","observation_id":"dbb4e182-7d1f-47d6-aba4-56cd33b86dd6","resolution":{"observed_at":"2026-08-11T19:22:56.690894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.432155Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.432155Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:32ae2a483bf5cc59f876d7b6083135ca850fe021d71395487505066721a5f36c","observation_id":"98c570c5-8c58-4703-9090-7ceb5fd670a4","resolution":{"observed_at":"2026-08-11T19:22:55.432155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.442633Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.442633Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:ac04b1a46c5edb2e466ed35297353a703bd3ec2a22b311dd7f1196c25c15ee27","observation_id":"6a0cd468-0675-418e-adb7-e63546c0b297","resolution":{"observed_at":"2026-08-11T19:22:55.442633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.631774Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"cec5a590-d7d1-4ffc-a8a0-9c1b554119c0","year":2015},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.455532Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:9ec52623e5b054252f4ac117eb49d0dbdfde4f037bb315219c95a4b91809d4c0","observation_id":"40168739-51f3-494d-82b2-52916c5d5d37","resolution":{"observed_at":"2026-08-11T19:22:56.638259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.610772Z","title":"Generative modeling by esti- mating gradients of the data distribution","venue":null,"work_id":"8aae07dc-f520-447d-ba88-70a17c55ee14","year":2019},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.465049Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:15bd3477536669bfb3c4f53f2eee12d62917000ed3ce8f1768063e97eb6a6baa","observation_id":"9d5d67f3-4ce2-4d40-8d65-5b72cb5ddac6","resolution":{"observed_at":"2026-08-11T19:22:56.617318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.471866Z","title":"Rethinking the inception archi- tecture for computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.471866Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:5b4c6015e71db42bd7571a928d47ee43a4ed3b4e6f6beea0496b14c3df322d65","observation_id":"c0291128-0b6e-4d13-b777-f912c63b328c","resolution":{"observed_at":"2026-08-11T19:22:55.471866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T19:22:55.481135Z","title":"Gemma: Open models based on gemini research and tech- nology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.481135Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:06559016ac804cfdd75876e9b63fb6cd4fcdc6ef27ee476768a3b7a971ef4d6a","observation_id":"92366efc-2d27-4d38-a7f1-4ad0d2a9d062","resolution":{"observed_at":"2026-08-11T19:22:55.481135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12522","last_updated":"2022-10-10T10:39:10Z","snapshot_observed_at":"2026-08-11T03:37:16.987536Z","submitted_at":"2022-05-25T06:30:19Z","title":"Crossmodal-3600: A Massively Multilingual Multimodal Evaluation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12522","snapshot_observed_at":"2026-08-11T19:22:55.487818Z","title":"Crossmodal-3600: A massively multilingual multi- modal evaluation dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.487818Z"},"links":{"cited_paper":"/paper/2205.12522","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:719fcff246b84784a3aaa335dcc19dd78a456217da8dbf7bfb7bd1a08e0f6e9f","observation_id":"72cfda0f-2a18-454e-90c0-ee95e2dbf7d5","resolution":{"observed_at":"2026-08-11T19:22:55.487818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.571885Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"8c7977fe-82b8-4f70-9c75-ed49d112454e","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.493448Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:89f95ae90e1b6686abd21e5ea9bb09fb09b24ba33fce4b8a6f8e00d5cf878ffc","observation_id":"b6ef4604-a898-4f20-9585-20a277c9e7ea","resolution":{"observed_at":"2026-08-11T19:22:56.579690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.549391Z","title":"Con- trastive multiview coding","venue":null,"work_id":"fef7c1f2-62d1-4e62-8040-9a1bf3cac0ad","year":2020},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.498748Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:361a91c4c7e6d223cbe14389bb99a45d96098d4bc3e7c0a4b861313832eb9a82","observation_id":"3617e7a4-14ec-4c25-9ab0-df3055614c94","resolution":{"observed_at":"2026-08-11T19:22:56.554902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.529431Z","title":"Extracting and composing robust features with denoising autoencoders","venue":null,"work_id":"cd5b6da9-7d38-42ed-9871-3de91680b1e0","year":2008},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.506084Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f7f6932742ac887bf2d4929df709ebe480ba8231b6df05a0fe3116fcc53ac053","observation_id":"787f805e-c67a-4a2f-b217-0d5cea682b99","resolution":{"observed_at":"2026-08-11T19:22:56.535837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20171","last_updated":"2024-08-24T03:55:36Z","snapshot_observed_at":"2026-08-12T23:12:40.280328Z","submitted_at":"2024-07-29T17:00:09Z","title":"Diffusion Feedback Helps CLIP See Better","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20171","snapshot_observed_at":"2026-08-11T19:22:55.515775Z","title":"Diffusion feedback helps clip see better","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.515775Z"},"links":{"cited_paper":"/paper/2407.20171","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:85b4da0c191bc91c7118dad0559b1d6f35b5993fda7bc4dfde5da5f26a3f19ba","observation_id":"bed01bb0-dc17-4af1-a093-924f36bfa87c","resolution":{"observed_at":"2026-08-11T19:22:55.515775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.498657Z","title":"Unsupervised feature learning by cross-level instance-group discrimina- tion","venue":null,"work_id":"62ef40bb-8a62-46cf-921a-a39681dbf069","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.525424Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e9657dfd7c94f851f5777918a2aa9cacd84e7916c5f84b00d7f9550230623c4b","observation_id":"7ca3aeca-eb7a-4e63-b017-670a2fa7dc70","resolution":{"observed_at":"2026-08-11T19:22:56.508284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.470478Z","title":"De-diffusion makes text a strong cross- modal interface","venue":null,"work_id":"0c1d6524-6335-4d4e-a713-87c665ba4c01","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.535074Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:5eae59a98e599ba30ec68a9916bc28731d29aef943aac71aadf8338115141131","observation_id":"cefa8917-1ddc-48fc-8ebb-d62875f10f97","resolution":{"observed_at":"2026-08-11T19:22:56.477684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.441221Z","title":"Unsupervised feature learning via non-parametric instance discrimination","venue":null,"work_id":"c38535f0-861a-4c08-88b1-d698d9959d89","year":2018},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.544008Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:2d6d66ba616ab3de64c8ed2ae157ea699182c35704216949fcc26342426422e4","observation_id":"d6b9ab6d-99e3-45f6-abac-85d7c6cd926e","resolution":{"observed_at":"2026-08-11T19:22:56.450250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.421604Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"61424f5f-bad8-49c4-b0a7-4e5d37e31aea","year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.553657Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:1cee05144a9ff6638c25c24ab3882e5b737752e0d552ac2e781c2e6b831c8c3c","observation_id":"ea83b458-1ff4-4fb3-aa0f-d4a9ebc34188","resolution":{"observed_at":"2026-08-11T19:22:56.427896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.392726Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"9a3ce0e8-4de7-4c9e-acea-a75e66bd9b53","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.559898Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f3ef9752f4b684c713c0ebdd7a87e3583e1ee67ee365716c67b1ba1fa8086b25","observation_id":"c8af8a4d-ca0b-4740-8d1b-0dc86c4cc6d6","resolution":{"observed_at":"2026-08-11T19:22:56.401306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.362002Z","title":"Diffusion model as repre- sentation learner","venue":null,"work_id":"6dad00bf-f3ac-4e05-af0c-afebb8fb3d38","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.569386Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:33d33eac88ea9322b7ccf898c573d4d74881167b5f9df8fc350d8a7caf71ed0c","observation_id":"13b41e26-cd54-491f-a928-9d7d24d32d7a","resolution":{"observed_at":"2026-08-11T19:22:56.371408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.336599Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":"2ee7afa2-fb2c-460e-9975-5a57b6003033","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.579225Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e3fd92b40e7cec0290152cd5280520b9b00b70b58f97d2f00a926249e15e7149","observation_id":"8ef7244e-c05c-46dc-8b6c-94b0e5886f8e","resolution":{"observed_at":"2026-08-11T19:22:56.343354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.314350Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"3d4b54ae-783a-4267-8b65-9e8a5c880f28","year":2022},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.592159Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:b92d92dd954b9951d37f58ae9e069babc1f20c876ccc116f1fcdd73029ba054b","observation_id":"cfc5324d-733c-4bbe-9044-d46b3037695a","resolution":{"observed_at":"2026-08-11T19:22:56.320682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.290828Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"8d401c93-e2ce-49d7-8f12-45b9291016cc","year":2016},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.598680Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:4dac56820456035d23267958d1fa49f8be20964a998ecfe51e0f7911250f16c7","observation_id":"17770810-7065-4cf0-9f7f-97014c3b3370","resolution":{"observed_at":"2026-08-11T19:22:56.298202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.265291Z","title":"Spae: Semantic pyramid autoencoder for multimodal generation with frozen llms","venue":null,"work_id":"d9f9dea7-ccf9-4942-a13c-f892fb29b277","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.605122Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:6be9352eba785bc6e907432faf6ad11440ba322331b730dccbb4aa71fe09cf72","observation_id":"cf55616b-e5eb-4651-afb4-d0794ba586d7","resolution":{"observed_at":"2026-08-11T19:22:56.273396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:55.612012Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.612012Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:b342fd5a365e2881c00d9ccde59cca2e2afd021498195cebbdf784e06fe107e6","observation_id":"e45783fa-396d-4806-9a3c-bc9e234330df","resolution":{"observed_at":"2026-08-11T19:22:55.612012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.225868Z","title":"An image is worth 32 tokens for reconstruction and generation","venue":null,"work_id":"2c766f95-304c-4dd6-a614-b2a8e30d00a1","year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.618321Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:195297bc2724b9284b90980dc91bf645923fdbad5b32d43e93079fbb073e013c","observation_id":"fbda5d99-2584-4952-9df4-2b260fc56b0d","resolution":{"observed_at":"2026-08-11T19:22:56.232376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.200607Z","title":"Soundstream: An end- to-end neural audio codec","venue":null,"work_id":"bd1b56f5-4f74-44df-a507-ba20c7c7c1d0","year":2021},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.624640Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:e6c246fad208b3a1dcf312ff57a9b479035a777ef5b8eabb57d4acf173fcab4b","observation_id":"9cfe70ec-22c6-428e-8c94-9b9fd7270e0a","resolution":{"observed_at":"2026-08-11T19:22:56.207434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T19:22:56.174405Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"1c04ccbf-1773-4dc1-b86e-3e27eddbd4f3","year":2023},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.629661Z"},"links":{"citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:58a663a9849c764246405a61a07e149111bca2942faddf8b61c71517e2104c41","observation_id":"69467f88-3b85-4b8c-ba8d-eb8f8942aaf0","resolution":{"observed_at":"2026-08-11T19:22:56.185620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07548","last_updated":"2024-06-11T17:59:53Z","snapshot_observed_at":"2026-08-05T21:17:06.014910Z","submitted_at":"2024-06-11T17:59:53Z","title":"Image and Video Tokenization with Binary Spherical Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07548","snapshot_observed_at":"2026-08-11T19:22:55.635316Z","title":"Method A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T19:22:55.635316Z"},"links":{"cited_paper":"/paper/2406.07548","citing_paper":"/paper/2412.06774"},"observation_digest":"sha256:f8895c26fc7d0065f2adb88fad0fb018863fb3f16a70167455a89045efb05791","observation_id":"2e2c4c98-8c3b-434a-857d-ddd25aef3edd","resolution":{"observed_at":"2026-08-11T19:22:55.635316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06774","last_updated":"2024-12-09T18:57:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T19:16:15.219812Z","submitted_at":"2024-12-09T18:57:24Z","title":"Visual Lexicon: Rich Image Features in Language Space"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 1 inbound Pith citation observation for arXiv:2412.06774."}