{"as_of":"2026-08-23T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1527d91b8b05c099430516dd890fce32a2195460ff685f9a7892d9b952aa9ba7","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:43:47.791790Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.19997/citation-record","integrity":"/paper/2412.19997/integrity","json":"/paper/2412.19997/citation-record.json","paper":"/paper/2412.19997"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-21T07:39:47.921468Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-10T23:43:47.679099Z","title":"Visualbert: A simple and performant baseline for vision and language,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.679099Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:e2b000ce8566b852fd40a7ab341aad52db6483405cab78ea7e1648d6e9bfd091","observation_id":"271d822e-5f7e-4d90-96c0-c01a9efb836d","resolution":{"observed_at":"2026-08-10T23:43:47.679099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.221410Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations,","venue":null,"work_id":"08f2e06c-2469-4c27-89f9-388668f62b2a","year":2020},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.685686Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:f3d2a0f8d79a538fe7ccc704f4f739e8d7e17a0ebc174d98b7313d96ddeb0acd","observation_id":"84196178-abc1-4a18-af50-b40547dc5e9d","resolution":{"observed_at":"2026-08-10T23:43:48.227240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.202968Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks,","venue":null,"work_id":"5c07309b-6b55-4c5a-a911-a234c5579684","year":2020},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.691441Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:4924211e904bcf6a232d5228046d49b590cc8645025c4866c8122271235293ae","observation_id":"50083edc-7a03-4a81-88c1-9d16d088e523","resolution":{"observed_at":"2026-08-10T23:43:48.208643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.186753Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":"434b1a52-8927-40a3-9a43-f30ee78bc59f","year":2021},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.696588Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:a2679f6af781471d97b975eb5bbb6fdda972c7b2182494e681102f36ea6997f8","observation_id":"a24a72c2-37e8-4397-ae85-02a35a4cc823","resolution":{"observed_at":"2026-08-10T23:43:48.192041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.168843Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":"47c71576-1131-46c2-a322-cb00d77f06c2","year":2019},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.702281Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:14ff238b796034946e667dda3b87705802ec84a55e248ae453c87161f5174394","observation_id":"db1da44e-93f7-4d37-878d-b1f1f9a19176","resolution":{"observed_at":"2026-08-10T23:43:48.175575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.148764Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":"284f5b0c-0023-4b57-88a6-f5ffc5bcba0a","year":2021},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.707376Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:1acfb9edd4fb578ae9971e953fb9d2273cc6b5f9b47e0927c9817e479479dced","observation_id":"2bf928b7-c73c-4027-8c32-048e63917beb","resolution":{"observed_at":"2026-08-10T23:43:48.155998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.128942Z","title":"Self-distilled dynamic fusion network for language-based fashion retrieval,","venue":null,"work_id":"76c8b807-cbce-4d73-83a4-7d696c763101","year":2024},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.713183Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:8ab55d208cfe9ebe38d06fa26368fbf8e83a24caa02b0baa8cc021dd0e7fcac2","observation_id":"7d98765a-5b95-4bca-9f8a-200cefcec455","resolution":{"observed_at":"2026-08-10T23:43:48.134694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.111674Z","title":"Fashionvil: Fashion-focused vision-and-language representation learning,","venue":null,"work_id":"69b3f392-8248-42f9-a932-cf202b392cf7","year":2022},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.718192Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:ca11b5f1573151b8a2577cf52c92695a6c43bbd2d14889621782c9e855df1020","observation_id":"801820f7-f940-4f7d-8545-f4e0ffbf88a4","resolution":{"observed_at":"2026-08-10T23:43:48.116953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.095728Z","title":"Fash- ionsap: Symbols and attributes prompt for fine-grained fashion vision- language pre-training,","venue":null,"work_id":"64c568bc-ecd2-4aba-8aa6-54340581e2c7","year":2023},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.722798Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:c0e5547fcb2be96890bb0da2959386bd54ee086a4050c1404605966b0f4652d8","observation_id":"e8665559-d64f-4865-859c-3dd2f6c8e402","resolution":{"observed_at":"2026-08-10T23:43:48.100411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.079472Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"f2391619-383a-475a-8225-2e3ae6c60742","year":2021},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.727838Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:78fead54d02f74d97604e50bb17bf67e454bff0fc34e40e1605e9a847363a8c8","observation_id":"4337c9df-c258-418b-b96d-522d6a6510c0","resolution":{"observed_at":"2026-08-10T23:43:48.084629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.061799Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"f40f2cc5-29e4-4805-a595-264aa5648cfe","year":2019},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.732922Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:0157f5f89be0cc9884aec93ae2b569e7f9d8c188240d69e6fe84a881b26049a7","observation_id":"580fb0c4-045d-406b-a96f-cece8fadede6","resolution":{"observed_at":"2026-08-10T23:43:48.067234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08317","last_updated":"2018-07-30T16:12:32Z","snapshot_observed_at":"2026-08-14T19:00:53.415199Z","submitted_at":"2018-06-21T16:53:02Z","title":"Fashion-Gen: The Generative Fashion Dataset and Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08317","snapshot_observed_at":"2026-08-10T23:43:47.738356Z","title":"Fashion-gen: The generative fashion dataset and challenge,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.738356Z"},"links":{"cited_paper":"/paper/1806.08317","citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:52c877fd94eb4f53580a4f6d5004a5fcc4e37b7fcf63787e4e7c185dcb78bf0d","observation_id":"00009df5-9eda-4b04-9ea9-94b08822592b","resolution":{"observed_at":"2026-08-10T23:43:47.738356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.041670Z","title":"Mmf: A multimodal framework for vision and language research,","venue":null,"work_id":"997b15c3-f46b-4a9a-a69b-f00fc4f11261","year":2020},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.743766Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:c94df2192f6ec5b190f576302bbdddd8778f466632f28c2690ee11405194c546","observation_id":"c084c952-1b71-4d6c-9b99-256d95f9be59","resolution":{"observed_at":"2026-08-10T23:43:48.047908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.748097Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.748097Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:8475c9db03dd9f40b0306f62da4d383a4f40ee9afdf7809f7ff0c203fa4f1267","observation_id":"09303349-15de-459c-be10-03f04ed19acc","resolution":{"observed_at":"2026-08-10T23:43:47.748097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:48.012211Z","title":"Fashionbert: Text and image matching with adaptive loss for cross- modal retrieval,","venue":null,"work_id":"0a85b34d-1202-46be-9a37-e9ecfe28b752","year":2020},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.752286Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:32b369130181e08ab4adeb767a5fc29c4a77b8109ef7af76cea76a867b77c211","observation_id":"f1cb5497-9af9-45ba-9bde-2c75b574168d","resolution":{"observed_at":"2026-08-10T23:43:48.018928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.991963Z","title":"Kaleido-bert: Vision-language pre-training on fashion domain,","venue":null,"work_id":"502fa3d1-f2a2-4766-88f1-5edd8762ab14","year":2021},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.756655Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:a046d84670b42f3dd928d6c767b41a105da57d1367080448a81c0d0ca6f93791","observation_id":"32ae1a74-f30d-435b-9a2e-7bcd1c3b16b4","resolution":{"observed_at":"2026-08-10T23:43:47.998159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.972187Z","title":"Commercemm: Large-scale commerce multimodal represen- tation learning with omni retrieval,","venue":null,"work_id":"e55c9a1d-52a8-4b2f-8ccb-9f5d4b6ac6c6","year":2022},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.761690Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:f0e11210652acb757a85a5493af369cf6a2eb35a5fa050f47b4e901ae936fd11","observation_id":"dfcc346e-bbbb-451f-a195-94e2431bfce0","resolution":{"observed_at":"2026-08-10T23:43:47.978398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.953305Z","title":"Ei-clip: Entity-aware interventional contrastive learning for e-commerce cross-modal retrieval,","venue":null,"work_id":"2bd0bb7a-ae97-4f83-91f9-5b674b8b05f2","year":2022},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.766440Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:005ac090c6662c2e5fa38271d6330ba5fceac5bda53d2ff07fc8c80a3c3a0d21","observation_id":"32b8c058-5e14-450c-a943-8c19cbdb8816","resolution":{"observed_at":"2026-08-10T23:43:47.959384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.934674Z","title":"Masked vision-language transformer in fashion,","venue":null,"work_id":"02c1ffad-6ea4-45b9-b510-2614c957c39e","year":2023},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.771060Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:e7a8596349b33cf9245be040edad89ed2bdfb08e14c8f3de9f75e69c5b9d2244","observation_id":"7dcb3607-e542-459c-8687-249d6d16986e","resolution":{"observed_at":"2026-08-10T23:43:47.939754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.918216Z","title":"Fashionklip: Enhancing e-commerce image-text retrieval with fashion multi-modal conceptual knowledge graph,","venue":null,"work_id":"6722f03c-9b04-469d-a506-2270834e1758","year":2023},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.775476Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:cda90cf8d0be9f45645a52815d8e507cda6ad0b616f502cdcdbe64f88b34e22e","observation_id":"1b27ed18-7edd-4a84-bf01-f8dab45fa7a0","resolution":{"observed_at":"2026-08-10T23:43:47.923492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.900924Z","title":"Fad-vlp: Fashion vision-and-language pre-training towards unified retrieval and captioning,","venue":null,"work_id":"d48065ba-2aa8-4636-9fb9-c353c4ce1ae7","year":2022},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.781379Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:31b004f61784e1235e655d85678da045abcbba69b26eaddb8d7011929be85395","observation_id":"2ef245f4-9280-4682-b13d-f3a30b9924fb","resolution":{"observed_at":"2026-08-10T23:43:47.906818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.883167Z","title":"Fame-vil: Multi-tasking vision-language model for heterogeneous fashion tasks,","venue":null,"work_id":"fd30bb38-d5ce-44d9-9eb4-7ba41503f925","year":2023},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.786069Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:da6169ab1f73f1b3983a6b796aadd7a3ba4c5b0174ebaf8b963a70638d11e42c","observation_id":"db0a5a0f-3224-4349-a82b-59db8bff87b7","resolution":{"observed_at":"2026-08-10T23:43:47.888796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:43:47.861683Z","title":"Syncmask: Synchronized attentional masking for fashion-centric vision-language pretraining,","venue":null,"work_id":"f045e0a8-def6-43cc-84ea-afd960eabd59","year":2024},"citing_paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:43:47.791790Z"},"links":{"citing_paper":"/paper/2412.19997"},"observation_digest":"sha256:5e226ec09f392c4fdd75f0d312a85438845811d77489dbac64c83ce836af6527","observation_id":"26506c2f-03b7-4cb1-ade7-90472856ca40","resolution":{"observed_at":"2026-08-10T23:43:47.869989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.19997","last_updated":"2025-01-12T07:27:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:07:25.970798Z","submitted_at":"2024-12-28T03:45:49Z","title":"FashionFAE: Fine-grained Attributes Enhanced Fashion Vision-Language Pre-training"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2412.19997."}