{"as_of":"2026-08-22T11:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c8f17918f9b2b4f0881ca41a1cb74f40ed2dfe36fa851245ef4f786d7a58a9d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:54:43.528354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.901557Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:5e4f6fc2bb4b726e84fbeccb34a43a75e462dad8cd9cbe9409932674bb65fcce","observation_id":"454367fc-f584-4108-83db-4f056ff99b3c","resolution":{"observed_at":"2026-05-13T22:46:10.193007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-12T18:39:38.888167Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11370","last_updated":"2025-05-11T13:09:23Z","snapshot_observed_at":"2026-08-20T23:59:11.933425Z","submitted_at":"2024-11-18T08:32:51Z","title":"Transmission Line Defect Detection Based on UAV Patrol Images and Vision-language Pretraining","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:39:38.888167Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2411.11370"},"observation_digest":"sha256:c2c718a55b4eace852202dfadb250bbe107b85e4adbf02eda9a4c703b899ba48","observation_id":"3a5c388e-90f1-4a6b-8046-aee4026ec6ed","resolution":{"observed_at":"2026-08-12T18:39:38.888167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-12T18:38:19.021241Z","title":"Chinese clip: Con- trastive vision-language pretraining in chinese","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11927","last_updated":"2025-04-26T15:33:50Z","snapshot_observed_at":"2026-08-13T04:17:28.513272Z","submitted_at":"2024-11-18T09:19:30Z","title":"FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:38:19.021241Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2411.11927"},"observation_digest":"sha256:c8aeaecdaafbecf23ff4dce3f52ebc1e6b7d69e5456dd276f4e76642934cad59","observation_id":"5ba97f96-d30f-4d48-8a22-a1c68accd075","resolution":{"observed_at":"2026-08-12T18:38:19.021241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-11T17:10:14.553825Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.09276","last_updated":"2024-12-12T13:40:59Z","snapshot_observed_at":"2026-08-18T09:57:36.077562Z","submitted_at":"2024-12-12T13:40:59Z","title":"Text-Video Multi-Grained Integration for Video Moment Montage","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:10:14.553825Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2412.09276"},"observation_digest":"sha256:c4e68210d0d6596e3ab57daf99d0825a8686327b04c9275dbbc57254844173ae","observation_id":"4e6af795-fd8d-4a68-98da-5fce212198a5","resolution":{"observed_at":"2026-08-11T17:10:14.553825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-11T14:34:00.771229Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11892","last_updated":"2024-12-17T04:38:28Z","snapshot_observed_at":"2026-08-16T11:47:03.302832Z","submitted_at":"2024-12-16T15:41:14Z","title":"From 2D CAD Drawings to 3D Parametric Models: A Vision-Language Approach","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:34:00.771229Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2412.11892"},"observation_digest":"sha256:43994dd9582221843d64da6036d60951f9e4fb1ceed9ecdd69526d684983a56c","observation_id":"b656fe77-a02f-4db8-9d53-252efc70b473","resolution":{"observed_at":"2026-08-11T14:34:00.771229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-09T10:18:03.703357Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03498","last_updated":"2025-06-03T02:10:18Z","snapshot_observed_at":"2026-08-16T07:40:19.359996Z","submitted_at":"2025-02-05T09:06:39Z","title":"Controllable Satellite-to-Street-View Synthesis with Precise Pose Alignment and Zero-Shot Environmental Control","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T10:18:03.703357Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2502.03498"},"observation_digest":"sha256:7ccffabf38358b9def09e2caf39e63b9ee5d8bd1ba591a95b01bb52865d957c3","observation_id":"7e4a0350-2dad-43fd-aa68-10c8dfa1f7db","resolution":{"observed_at":"2026-08-09T10:18:03.703357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-08T12:10:43.441199Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07628","last_updated":"2025-02-12T14:08:50Z","snapshot_observed_at":"2026-08-15T09:00:41.092277Z","submitted_at":"2025-02-11T15:16:58Z","title":"HarmonyCut: Supporting Creative Chinese Paper-cutting Design with Form and Connotation Harmony","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T12:10:43.441199Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2502.07628"},"observation_digest":"sha256:029a3fbc2063568b46f41e9306f9f582e0dd4f72e90744462dcf2939f7d99edc","observation_id":"af9a374b-3e77-49e9-8fbb-38a8765a354c","resolution":{"observed_at":"2026-08-08T12:10:43.441199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":279,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:456795e9c3e3b436213fdebadbec299d7f9141f2fa2c34ee8ab30e6293c88c5c","observation_id":"49c3e5ec-8fcb-444f-808a-65b31d513bdd","resolution":{"observed_at":"2026-05-19T08:02:23.863149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-16T11:54:43.528354Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14321","last_updated":"2025-05-19T12:47:06Z","snapshot_observed_at":"2026-08-20T00:24:07.211342Z","submitted_at":"2025-04-19T15:15:59Z","title":"Multimodal Coreference Resolution for Chinese Social Media Dialogues: Dataset and Benchmark Approach","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:54:43.528354Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2504.14321"},"observation_digest":"sha256:6a86218c5105a58a21d7d767f27a9a1290f25f5f58b4a1666410a178fb6a65ac","observation_id":"ea8302fd-67df-4bee-8e33-90af132e764c","resolution":{"observed_at":"2026-08-16T11:54:43.528354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-16T11:41:25.763712Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14904","last_updated":"2025-04-21T07:20:19Z","snapshot_observed_at":"2026-08-19T20:04:14.178921Z","submitted_at":"2025-04-21T07:20:19Z","title":"VLM as Policy: Common-Law Content Moderation Framework for Short Video Platform","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:41:25.763712Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2504.14904"},"observation_digest":"sha256:df1d25309c49c6537ff218f2e764ff8cf3c56a3c3029fe459ef2ac219a327c66","observation_id":"9013c745-1044-4219-b1c2-e7133c872756","resolution":{"observed_at":"2026-08-16T11:41:25.763712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-16T05:09:15.208095Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.21435","last_updated":"2025-05-13T08:06:19Z","snapshot_observed_at":"2026-08-20T00:24:09.141122Z","submitted_at":"2025-04-30T08:48:21Z","title":"SeriesBench: A Benchmark for Narrative-Driven Drama Series Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T05:09:15.208095Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2504.21435"},"observation_digest":"sha256:66a180d0ef18ec65ed8630d0cae939f92606f3dc50c22c1b82261b8c09f708e7","observation_id":"24299011-d4e0-4667-84dc-87a2483404eb","resolution":{"observed_at":"2026-08-16T05:09:15.208095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-15T21:04:46.265412Z","title":"arXiv preprint arXiv:2211.01335 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10921","last_updated":"2025-07-19T04:40:24Z","snapshot_observed_at":"2026-08-20T00:24:07.868870Z","submitted_at":"2025-05-16T06:52:46Z","title":"Towards Cross-modal Retrieval in Chinese Cultural Heritage Documents: Dataset and Solution","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:04:46.265412Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2505.10921"},"observation_digest":"sha256:d1d47968e00a75d3a244788302a6bc7b8091c9735d24f27c5ccffc8de41cc37a","observation_id":"810a1e1e-88ba-404a-8d59-e2005a2c0637","resolution":{"observed_at":"2026-08-15T21:04:46.265412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-07T10:34:01.936414Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04999","last_updated":"2025-06-05T13:10:17Z","snapshot_observed_at":"2026-08-13T09:31:27.493050Z","submitted_at":"2025-06-05T13:10:17Z","title":"Beyond Cropped Regions: New Benchmark and Corresponding Baseline for Chinese Scene Text Retrieval in Diverse Layouts","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:01.936414Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2506.04999"},"observation_digest":"sha256:39b48a5b8fffd47b99915a5948ee6bc6e048c4a0b71262b5b0aa1e518612ccbc","observation_id":"f1967491-8899-4f2d-85a9-d16e43bfea0e","resolution":{"observed_at":"2026-08-07T10:34:01.936414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-04T15:17:07.637024Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20904","last_updated":"2026-05-27T18:07:26Z","snapshot_observed_at":"2026-08-14T13:45:01.472518Z","submitted_at":"2025-09-25T08:44:22Z","title":"FORGE: Forming Semantic Identifiers for Generative Retrieval in Industrial Datasets","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:07.637024Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2509.20904"},"observation_digest":"sha256:73677fce2b447c04aadc89b2624fd089c54921aa06021b2328a0b401982c5705","observation_id":"a473fc8a-db33-45b0-9760-cc662ae9c057","resolution":{"observed_at":"2026-08-04T15:17:07.637024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-04T10:18:44.449566Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10921","last_updated":"2026-05-25T02:35:42Z","snapshot_observed_at":"2026-08-16T17:56:07.811735Z","submitted_at":"2025-10-13T02:32:07Z","title":"FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:18:44.449566Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2510.10921"},"observation_digest":"sha256:221048674b0bd8de6bf9062c05586b14d802bbea14b0b39d0b2c288dc5cba688","observation_id":"1be1cad4-722c-4c1d-acf1-a614c9c91e91","resolution":{"observed_at":"2026-08-04T10:18:44.449566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-21T19:37:26.080420Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T14:08:36.801359Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:536aa38b58bd824fa345731e73f7562b2128fbd64a91f6518a8b1e393d343dbe","observation_id":"d2f3e6d3-f9ab-4560-bdf4-bc1cbad7a8e4","resolution":{"observed_at":"2026-05-11T14:08:37.245140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-03T19:47:32.923852Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-21T19:37:26.080420Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T19:47:32.923852Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2511.22699"},"observation_digest":"sha256:17227e1638a0dbded71257fd9ec0c145f5916907c14765fe22a20d9bca15f719","observation_id":"9313398e-7389-40e6-9162-02bc5618da1d","resolution":{"observed_at":"2026-08-03T19:47:32.923852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2512.20670","last_updated":"2026-05-04T05:59:52Z","snapshot_observed_at":"2026-08-20T10:10:41.029620Z","submitted_at":"2025-12-19T10:20:32Z","title":"Disentangling Fact from Sentiment: A Dynamic Conflict-Consensus Framework for Multimodal Fake News Detection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T21:00:09.342056Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2512.20670"},"observation_digest":"sha256:02ffb1f6e0c30c6795e768f6d43e9cd28fd8ae915f06f7fc22ff4ecf31414a75","observation_id":"aa561e56-aabf-4b11-825c-c256c14093d0","resolution":{"observed_at":"2026-05-16T21:01:16.140672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2602.12941","last_updated":"2026-05-07T10:12:01Z","snapshot_observed_at":"2026-08-18T00:12:14.519607Z","submitted_at":"2026-02-13T13:57:45Z","title":"JARVIS: An Evidence-Grounded Retrieval System for Interpretable Deceptive Reviews Adjudication","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T22:31:09.746554Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2602.12941"},"observation_digest":"sha256:24e219d605930e5a6f4b37e68d2f118c4b3379e52d8a871167cc53da490a3d5c","observation_id":"36fda9db-7c75-4e95-a259-dc1a30d28b6f","resolution":{"observed_at":"2026-05-15T22:31:43.750186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-14T23:48:38.098404Z","title":"arXiv preprint arXiv:2211.01335 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.19294","last_updated":"2026-07-01T07:54:53Z","snapshot_observed_at":"2026-08-13T22:38:21.803721Z","submitted_at":"2026-03-10T21:00:05Z","title":"Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T23:48:38.098404Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2603.19294"},"observation_digest":"sha256:cacea587b416ba0dd4192c6fff73d4ea59f53520e3690493a732d05fdf15139f","observation_id":"14ec2737-114e-4706-9913-3eb083145973","resolution":{"observed_at":"2026-07-14T23:48:38.098404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2604.13797","last_updated":"2026-04-15T12:34:46Z","snapshot_observed_at":"2026-08-17T06:00:06.180263Z","submitted_at":"2026-04-15T12:34:46Z","title":"DRG-Font: Dynamic Reference-Guided Few-shot Font Generation via Contrastive Style-Content Disentanglement","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T13:13:30.596448Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2604.13797"},"observation_digest":"sha256:861039cfde5a348f2e7ca295f091a1397fa678053edee2199ced3d84ff5d2fcf","observation_id":"6002349a-9720-4901-b60c-02f1d9a9b57f","resolution":{"observed_at":"2026-05-10T13:20:26.321381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2605.17366","last_updated":"2026-05-17T10:20:23Z","snapshot_observed_at":"2026-08-15T01:20:01.700495Z","submitted_at":"2026-05-17T10:20:23Z","title":"Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T23:08:33.010725Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2605.17366"},"observation_digest":"sha256:6ae25d64f7677b1757300e29939c79080cccf6a005cf20bf5ab586a2051c5b18","observation_id":"aaf75cb8-8dac-4480-ae00-d935c580e1fb","resolution":{"observed_at":"2026-05-19T23:12:51.744658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2605.18434","last_updated":"2026-05-18T14:07:20Z","snapshot_observed_at":"2026-08-03T18:04:01.369059Z","submitted_at":"2026-05-18T14:07:20Z","title":"TIGER-FG: Text-Guided Implicit Fine-Grained Grounding for E-commerce Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T23:54:32.646978Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2605.18434"},"observation_digest":"sha256:d55bb50d3849a1694f785d0b46d273f28fdb48705f3b6dff9aedd551d46ef668","observation_id":"92ed66d7-e17b-4c95-90da-fd86a351e428","resolution":{"observed_at":"2026-05-19T23:57:53.206645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2605.24523","last_updated":"2026-05-23T11:23:21Z","snapshot_observed_at":"2026-08-17T21:33:40.333535Z","submitted_at":"2026-05-23T11:23:21Z","title":"MindAlign: Bridging EEG, Vision, and Language for Zero-Shot Visual Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-30T14:52:47.828027Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2605.24523"},"observation_digest":"sha256:ef166778cbf93ee37ae80b92af08dd3160c26e6c0f65dda031960de3b1bfd9a8","observation_id":"f6f026c4-33d4-4b6c-984c-94d026951ae6","resolution":{"observed_at":"2026-06-30T14:54:45.382242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2605.29287","last_updated":"2026-06-01T03:21:43Z","snapshot_observed_at":"2026-08-14T14:35:47.937279Z","submitted_at":"2026-05-28T03:11:54Z","title":"UniNote: A Unified Embedding Model for Multimodal Representation and Ranking","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:55:04.367186Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2605.29287"},"observation_digest":"sha256:e983c45be9804c5a795ba7fa9702591972d01b297e0c238634f6b84208198580","observation_id":"556cfd5d-0b4a-4bf6-92c8-72a3b1e2a459","resolution":{"observed_at":"2026-06-29T06:03:08.836179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2606.00174","last_updated":"2026-05-29T13:47:00Z","snapshot_observed_at":"2026-08-06T07:43:11.842599Z","submitted_at":"2026-05-29T13:47:00Z","title":"MyoSem: Aligning Electromyography to Natural-Language Action Semantics for Hand Action Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:40:49.525450Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2606.00174"},"observation_digest":"sha256:e9eb68f07f0204040a1a629a757f5d53fe9acec3641f88bc47fd9cdde650f618","observation_id":"b05e1a17-c547-46a2-9f51-c82999cb66b6","resolution":{"observed_at":"2026-06-28T22:42:46.338904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2606.04591","last_updated":"2026-06-03T08:29:43Z","snapshot_observed_at":"2026-08-10T04:54:54.116200Z","submitted_at":"2026-06-03T08:29:43Z","title":"Fine-grained Fragment Retrieval in Multi-modal Long-form Dialogues","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T06:04:28.939248Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2606.04591"},"observation_digest":"sha256:097786744d7b9c797dbe88bf8beeb53911f9a3212490970d0e7342094b0a740a","observation_id":"2f3030fa-5072-48f1-a2d1-6265c12946d6","resolution":{"observed_at":"2026-07-02T08:26:48.009848Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-18T14:57:25.186447Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:828a47e35c1b9003821dfd00a873138ac8072a1456612651fc223c632224f1a2","observation_id":"558e0d6c-e320-4ea9-8f42-4e557a03d566","resolution":{"observed_at":"2026-07-03T17:18:43.902902Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2606.28421","last_updated":"2026-07-08T14:55:43Z","snapshot_observed_at":"2026-07-12T11:46:49.191265Z","submitted_at":"2026-06-25T17:14:03Z","title":"JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T01:02:20.024793Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2606.28421"},"observation_digest":"sha256:c00a11f8e6d5bad04927ae62ba3a5c781c3ec18464d82e6ae0efb2eb8b2895e9","observation_id":"2888c23e-cc9c-4cee-a36c-e1716aece263","resolution":{"observed_at":"2026-07-01T15:45:48.760240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-12T11:46:50.520083Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.28421","last_updated":"2026-07-08T14:55:43Z","snapshot_observed_at":"2026-07-12T11:46:49.191265Z","submitted_at":"2026-06-25T17:14:03Z","title":"JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T11:46:50.520083Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2606.28421"},"observation_digest":"sha256:ac6fbf5170340617e0e458053b3cd5bacab3f3053cd13ce48cbecb455fa7308a","observation_id":"8e187e19-ec37-44f5-819f-2758a2a1621a","resolution":{"observed_at":"2026-07-12T11:46:50.520083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":"2211.01335","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-03T17:18:43.901557Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335","venue":null,"work_id":"a6248e2d-b242-4b7f-8f36-eea5777bc183","year":2022},"citing_paper":{"arxiv_id":"2607.02259","last_updated":"2026-07-02T14:46:54Z","snapshot_observed_at":"2026-08-08T11:08:41.828671Z","submitted_at":"2026-07-02T14:46:54Z","title":"BamiBERT: A New BERT-based Language Model for Vietnamese","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-03T14:29:14.923528Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2607.02259"},"observation_digest":"sha256:99b0e1f263c5b438903dd0411a1184bb4098515ec42cc22dfdad009d0ddf8b51","observation_id":"2e24fe46-9617-4181-b2e5-3317bb8beb13","resolution":{"observed_at":"2026-07-03T14:38:28.770089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2211.01335 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-14T13:23:30.029952Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:20496e2a7d4e28e345e1a3f53a34708d772ab0677eb2141adda6f470686e44cb","observation_id":"101c3f87-480f-4fd5-bad1-0d7c46ca2163","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-01T22:57:25.745539Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15591","last_updated":"2026-07-24T12:46:50Z","snapshot_observed_at":"2026-08-14T22:01:57.524320Z","submitted_at":"2026-07-17T03:25:43Z","title":"RecGPT-V3 Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T22:57:25.745539Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2607.15591"},"observation_digest":"sha256:157fbd45a1138a963723ad8c8a0a1447de283dba8b731c4bcbf77982d806a630","observation_id":"98c1a34a-e216-4b65-a4c7-475005d12a3a","resolution":{"observed_at":"2026-08-01T22:57:25.745539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-02T12:43:35.458231Z","title":"arXiv preprint arXiv:2211.01335 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24760","last_updated":"2026-05-30T06:59:33Z","snapshot_observed_at":"2026-08-20T00:24:07.092335Z","submitted_at":"2026-05-30T06:59:33Z","title":"CHaystack: Benchmarking Chinese Document Retrieval and VQA","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:43:35.458231Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2607.24760"},"observation_digest":"sha256:85c5009eab739c996505f2c4ee4f7f794fc56013e5a458e0caa313161d4c3cdb","observation_id":"cc146426-2b52-4402-b2f1-41c5f4ee38dc","resolution":{"observed_at":"2026-08-02T12:43:35.458231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-03T11:34:16.740780Z","title":"Chinese CLIP: contrastive vision-language pretraining in chinese,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29213","last_updated":"2026-07-31T09:32:01Z","snapshot_observed_at":"2026-08-21T02:25:04.777023Z","submitted_at":"2026-07-31T09:32:01Z","title":"GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T11:34:16.740780Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2607.29213"},"observation_digest":"sha256:2d000efbbe63b6b896912cef21cc29fe9cbb7143d2f2bf1e5d66e66702cda126","observation_id":"01b51685-1e22-4bc2-9f44-da41d03d2333","resolution":{"observed_at":"2026-08-03T11:34:16.740780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01335","snapshot_observed_at":"2026-08-04T20:43:17.339889Z","title":"Chinese clip: Contrastive vision-language pretraining in chinese.arXiv preprint arXiv:2211.01335, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-16T01:32:07.095599Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:17.339889Z"},"links":{"cited_paper":"/paper/2211.01335","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:45459f4a41e0aa1e495343e26849057e190881784f93f0c7bccdfa3e79c637b4","observation_id":"87e9efb2-e9f0-4622-8961-558d1fdb1567","resolution":{"observed_at":"2026-08-04T20:43:17.339889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2211.01335/citation-record","integrity":"/paper/2211.01335/integrity","json":"/paper/2211.01335/citation-record.json","paper":"/paper/2211.01335"},"outbound":[],"paper":{"arxiv_id":"2211.01335","last_updated":"2023-05-23T01:28:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T00:23:40.229447Z","submitted_at":"2022-11-02T17:47:23Z","title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2211.01335."}