{"as_of":"2026-08-13T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f855efc29def2b0619ff456c4a023f47b12f4bcd1058ad98846e4e06de970fcd","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:36:31.289564Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16096/citation-record","integrity":"/paper/2411.16096/integrity","json":"/paper/2411.16096/citation-record.json","paper":"/paper/2411.16096"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.600916Z","title":null,"venue":null,"work_id":"19dca2e5-ce56-4bf2-82e3-a5b65d854c0a","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.204302Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:377c8bba191aa632e743b0ccf88de1d9169f492e767802e4585532bec084ebe2","observation_id":"2e685331-7066-4a3b-8cf4-6ab60c403645","resolution":{"observed_at":"2026-08-12T13:36:31.605326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.586396Z","title":"L., & Parikh, D","venue":null,"work_id":"61335213-aa9f-444c-b893-e753f5afde45","year":2015},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.209588Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:6dbc87071e62b81568c0336dcac4602c661b6460decf24f4b0f8356aa013520d","observation_id":"f5fa784c-993f-4628-ac60-286748c46294","resolution":{"observed_at":"2026-08-12T13:36:31.590838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.573031Z","title":"K., Hossain, M","venue":null,"work_id":"b1d2fe6e-1b61-443d-b258-c27f4bce8c34","year":2010},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.215189Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:135c42569c2fbf610400a98a7854b1c5e4b099440b977f570520c147b038fc92","observation_id":"1ea99098-f609-4e93-860a-59784d59a18f","resolution":{"observed_at":"2026-08-12T13:36:31.576790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.559283Z","title":null,"venue":null,"work_id":"62dcb10d-2a03-430c-8057-cc278e3f7ca4","year":2017},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.219882Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:d7ac5b58fb3d5e62e9426529e7f61247e85b71192aaeea2973e776fa9e0d9488","observation_id":"ab7d3878-ccc2-4f63-9fd3-4904ae56d06b","resolution":{"observed_at":"2026-08-12T13:36:31.563342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.546455Z","title":"J., Attanasio, G., Bianchi, F., Terragni, S., Magalhães, A","venue":null,"work_id":"69b12115-3b57-42fe-ae5f-7b971f3e8d99","year":2022},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.224788Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:2a24ae3e9db82cf7973fc2cda13635f69c03aa8bcc1b7b6218e2b04ef1f3fa91","observation_id":"39818b5d-8258-4246-8f10-06ac1cfa79c3","resolution":{"observed_at":"2026-08-12T13:36:31.550526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02473","last_updated":"2022-04-11T16:34:06Z","snapshot_observed_at":"2026-08-06T11:51:41.894301Z","submitted_at":"2022-04-05T20:15:23Z","title":"\"Does it come in black?\" CLIP-like models are zero-shot recommenders","version":2},"cited_work":{"arxiv_id":"2204.02473","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02473","snapshot_observed_at":"2026-08-12T13:36:31.418104Z","title":"\"Does it come in black?\" CLIP-like models are zero-shot recommenders","venue":"cs.IR","work_id":"f21dbb94-45fd-470b-b992-15b7e2dbec05","year":2022},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.229725Z"},"links":{"cited_paper":"/paper/2204.02473","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:92f3a9a2976d1c20e5ce42277b0fb8d40bfe676f0bfb6be418eadda47ea6ab10","observation_id":"de609c51-a0c8-487f-8710-5b818c3a415a","resolution":{"observed_at":"2026-08-12T13:36:31.422986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.531960Z","title":null,"venue":null,"work_id":"205b0c30-3b1b-434d-9d50-8dd954b0878a","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.235358Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:b5a4dfc0b9da9429f0162c9a6aebc860edc0f47103522e38ab9774353e0be33d","observation_id":"60aba286-61f6-439c-a798-8279288b78f7","resolution":{"observed_at":"2026-08-12T13:36:31.535931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.518364Z","title":null,"venue":null,"work_id":"37140463-7d9d-4b0c-aa9e-5ca8a948eecd","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.239767Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:fb64d4ffb363fb714bdda1bd83146030d3fa844be4ad84c6175f206d801d5434","observation_id":"8c5e55a3-e7b9-4768-92b5-e9032ece4751","resolution":{"observed_at":"2026-08-12T13:36:31.522817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T13:36:31.243869Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.243869Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:5c0cf6463d783f11ff15ab15cf5bd8e55c03f0ee32b9ec16428a90710239c5e9","observation_id":"9910f583-69f7-409a-98f9-9ee0800d2196","resolution":{"observed_at":"2026-08-12T13:36:31.243869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T13:36:31.248017Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.248017Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:1102e08e1c5d5bc0ffd34639f9700b8d9479acb6b438664bab8ca51efc00696e","observation_id":"d1fc6ce1-7678-42f2-bfcd-c3de2a382401","resolution":{"observed_at":"2026-08-12T13:36:31.248017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.504512Z","title":"C., Xu, Y","venue":null,"work_id":"ded4a9e4-4325-47e4-85c2-5ae10db6526a","year":2008},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.253064Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:779b4e3f51a3ede5ada4cd65f783bc5f25bfb4b9856343b6b085b334a19786ed","observation_id":"3ab640a7-3c5b-46cc-97db-ac55af986912","resolution":{"observed_at":"2026-08-12T13:36:31.509099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/su12072809","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.328568Z","title":null,"venue":null,"work_id":"9ac3cd1b-5851-467a-8508-d2bf94281ebc","year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.256951Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:2acc8c4668c7fbd3d528d9b04bd89749498a20506b15d42f44e30211f57eefd5","observation_id":"cb7cdf11-bf3b-4a57-8bf9-4b81de5f59a0","resolution":{"observed_at":"2026-08-12T13:36:31.332725Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.490043Z","title":null,"venue":null,"work_id":"28cc4b77-d480-4666-afd0-c1401e212547","year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.261572Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:4cf6ce1cce769fac4e91b18474456716a5c0ca98048a4c7ae59c4597278221e9","observation_id":"56320bbd-2ef0-45b3-bd0c-50213a9e189a","resolution":{"observed_at":"2026-08-12T13:36:31.494799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/2954930","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.313621Z","title":null,"venue":null,"work_id":"88eab36c-9db6-4553-9b39-3b7e673a1487","year":2017},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.264967Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:88eaa22a046328faac2f73b3e57a6db8e862ada9fdf79653fa24a52935b32353","observation_id":"791f3717-8637-41a7-b3b4-3fa1aa85da03","resolution":{"observed_at":"2026-08-12T13:36:31.318926Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.476692Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., & Sastry, G","venue":null,"work_id":"25e4d4d7-0d73-4254-99d4-383fd4b61f7b","year":2021},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.268946Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:741a869e2483adcdbc1e6f799d5e51538531afa6147a5038db85a25fde9804c1","observation_id":"c283ea03-9bd9-48e4-8781-7ebabe876048","resolution":{"observed_at":"2026-08-12T13:36:31.480604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.463125Z","title":null,"venue":null,"work_id":"940520b7-4fc5-4338-a887-7a92cb32a3fd","year":2023},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.272535Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:c9d286a8a0ec495d234d20b1160a091f4c28adb8bcfd9bff2ce39a9e2e6f14b2","observation_id":"dec98f9e-95cc-4c87-9fb6-9e279b23b09f","resolution":{"observed_at":"2026-08-12T13:36:31.467670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12033","last_updated":"2022-07-25T10:15:56Z","snapshot_observed_at":"2026-07-06T13:34:52.227041Z","submitted_at":"2022-07-25T10:15:56Z","title":"Contrastive Learning for Interactive Recommendation in Fashion","version":1},"cited_work":{"arxiv_id":"2207.12033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.12033","snapshot_observed_at":"2026-08-12T13:36:31.368924Z","title":"Contrastive Learning for Interactive Recommendation in Fashion","venue":"cs.IR","work_id":"6a83906f-11ef-4cda-bea2-607715ad9b8c","year":2022},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.276133Z"},"links":{"cited_paper":"/paper/2207.12033","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:67003dbc2b38a91e1d877dcee567697a35c1042fabc620b3d70ef08997417c32","observation_id":"41a5d6d3-41fa-4746-a97b-827b9fe896ef","resolution":{"observed_at":"2026-08-12T13:36:31.374066Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.448973Z","title":"P., Brocki, Ł., & Marasek, K","venue":null,"work_id":"a7de5ccc-a733-47df-bd51-e1e114737029","year":2019},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.280725Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:f562301fed3031110c2d689fb88789902ab8c31ec7da8f9d5f0f3ff5121bbd8c","observation_id":"8753ce72-0091-48fc-a7fb-cdafd9f55e08","resolution":{"observed_at":"2026-08-12T13:36:31.453129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06620","last_updated":"2019-06-15T21:50:31Z","snapshot_observed_at":"2026-08-09T18:03:03.709580Z","submitted_at":"2019-06-15T21:50:31Z","title":"Joint Visual-Textual Embedding for Multimodal Style Search","version":1},"cited_work":{"arxiv_id":"1906.06620","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.06620","snapshot_observed_at":"2026-08-12T13:36:31.346977Z","title":"Joint Visual-Textual Embedding for Multimodal Style Search","venue":"cs.LG","work_id":"14d1a61d-b1b3-479b-b759-2817a43c61dd","year":2019},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.284753Z"},"links":{"cited_paper":"/paper/1906.06620","citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:6df797c96851f8b9afa4c8b6b673ff31558b9ef93d00be5c0ffec7e3af3fc62d","observation_id":"d9c3690f-8a12-4c09-8b85-89df4d741509","resolution":{"observed_at":"2026-08-12T13:36:31.353138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:36:31.433522Z","title":"M., Saputra, D., & Oswari, L","venue":null,"work_id":"f0c44a15-89b2-4575-a3ad-a3c29e7771ef","year":2020},"citing_paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T13:36:31.289564Z"},"links":{"citing_paper":"/paper/2411.16096"},"observation_digest":"sha256:d863ffc3939bdf12ef929aa138fa0f99625b90cb7c6ab8a190611ff74b74f8c6","observation_id":"77d36c33-86a7-45ec-9f24-366316693c72","resolution":{"observed_at":"2026-08-12T13:36:31.438668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16096","last_updated":"2024-11-25T05:15:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:30:59.719948Z","submitted_at":"2024-11-25T05:15:38Z","title":"ENCLIP: Ensembling and Clustering-Based Contrastive Language-Image Pretraining for Fashion Multimodal Search with Limited Data and Low-Quality Images"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":5,"verified_fuzzy":7},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2411.16096."}