{"as_of":"2026-08-17T20:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99bed6d8dd9a025261f5093362653b3f18da6747cff76c1bdac81ab4b070b9b3","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:05:13.732515Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08259/citation-record","integrity":"/paper/2412.08259/integrity","json":"/paper/2412.08259/citation-record.json","paper":"/paper/2412.08259"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.303561Z","title":null,"venue":null,"work_id":"78c88a41-9d9d-4d55-9123-4e3a5b7f1947","year":2021},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.306070Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:733a18c9ec7b018eaf42a7b0c461fed8e0a155fb53fce3490c03b5c12e6dacff","observation_id":"79c5c3e4-6b63-4d3b-b782-35608c87b3b4","resolution":{"observed_at":"2026-08-11T18:05:15.315223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.314063Z","title":"W.; Fidler, S.; and Kreis, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.314063Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:70c9f75a0ebc2092a24b8bf902cba66fdf73f12e5cbf7f33561ce3c48cc6b759","observation_id":"82539e37-b44a-4ec7-9709-0f2ddba53aea","resolution":{"observed_at":"2026-08-11T18:05:13.314063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.265920Z","title":null,"venue":null,"work_id":"6bfd3eeb-4e6a-493c-b40f-5de28b540faa","year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.320109Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:0facada63fd8812e7f793fdc69c9348967b2b80a46de2bf6d529a5d30d97b178","observation_id":"4cdaff0b-aeac-435f-bc9c-263941199e24","resolution":{"observed_at":"2026-08-11T18:05:15.272703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.326876Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.326876Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:d0910edf17e9b895abbcd86c258c4b97896b5d7a6ad3c918b158f7b1ca4d2d86","observation_id":"22e2223d-f340-4390-be54-77f182793c3f","resolution":{"observed_at":"2026-08-11T18:05:13.326876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-08-17T14:49:36.972548Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-11T18:05:13.333706Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.333706Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:c4f01eec2c0227bceac0ada13a28eed27455a7289fbbea9a6f50640796eca2e8","observation_id":"2559d893-6ce4-46ea-98e9-f1cbb5a4a32b","resolution":{"observed_at":"2026-08-11T18:05:13.333706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01839","last_updated":"2021-09-04T10:39:52Z","snapshot_observed_at":"2026-08-16T23:43:04.859295Z","submitted_at":"2021-09-04T10:39:52Z","title":"Towards Expressive Communication with Internet Memes: A New Multimodal Conversation Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01839","snapshot_observed_at":"2026-08-11T18:05:13.340758Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.340758Z"},"links":{"cited_paper":"/paper/2109.01839","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:b37755760c7f55d0ca2738dcc4f0414763a86c6b60713f59a161c92c53ed7b09","observation_id":"5dd59835-7482-4052-ae80-f7bcc701c165","resolution":{"observed_at":"2026-08-11T18:05:13.340758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.211933Z","title":null,"venue":null,"work_id":"73205611-bae5-43f5-b424-670070a22d17","year":2020},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.348718Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:1e5909329aa0b2391231fe39d3eb9667adbb324d28fd173c3b4f00f1a92239ea","observation_id":"42417600-914c-425a-bb94-82cf03f996d1","resolution":{"observed_at":"2026-08-11T18:05:15.221341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.357393Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.357393Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:7c1ed7df1a2523a8d8272918e46c421406b3289c3f3bf162b3ea4266f6dfdc8d","observation_id":"0afb9cf1-96ab-419d-a141-6fde8fe02aba","resolution":{"observed_at":"2026-08-11T18:05:13.357393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06940","last_updated":"2023-07-13T17:57:13Z","snapshot_observed_at":"2026-08-17T09:14:04.566795Z","submitted_at":"2023-07-13T17:57:13Z","title":"Animate-A-Story: Storytelling with Retrieval-Augmented Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06940","snapshot_observed_at":"2026-08-11T18:05:13.364752Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.364752Z"},"links":{"cited_paper":"/paper/2307.06940","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:cdbc75525154e1944d8701e5d876a47838c58c87df6d148d157c34cd04ec62e8","observation_id":"4b7cab7d-6831-4883-a652-5ff7f166481f","resolution":{"observed_at":"2026-08-11T18:05:13.364752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T18:05:13.372471Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.372471Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:9a90ad785c645461753fadc648a0b7858234ff5184af10fc7b91e2cdd7c17f3a","observation_id":"6bce6305-c955-4e42-9763-d75c21be7f16","resolution":{"observed_at":"2026-08-11T18:05:13.372471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.162609Z","title":null,"venue":null,"work_id":"6b29dfe2-770f-48f4-b80f-87529d071765","year":2017},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.380643Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:5b8bca9ea5a467df19ab9d97484475288a5961938b0b0d12f4f823846933b1a6","observation_id":"c3c3d260-91b2-4834-8bf8-fa544ea837cb","resolution":{"observed_at":"2026-08-11T18:05:15.171497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.136551Z","title":null,"venue":null,"work_id":"71198e03-4906-4370-8989-05e3ecf66901","year":2024},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.387955Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:f1aeb2cd32ddce250de570a00ea3292db477cc63e9871e883bcea5c6d655bed5","observation_id":"720248a3-88cb-49d7-ba6a-4ff7bc009379","resolution":{"observed_at":"2026-08-11T18:05:15.144517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.109957Z","title":null,"venue":null,"work_id":"b0ddf4eb-14e8-4f30-943c-496d7d09f175","year":2021},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.395650Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:1fc06d61a07a2fdd7b5fdb64083030cf38ac355ca88e0d050e87d4641cb1bcca","observation_id":"c7aba3eb-7190-4b12-9e8a-d72e47eac37d","resolution":{"observed_at":"2026-08-11T18:05:15.118023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.401749Z","title":"A.; et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.401749Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:8b541891d33aebed253bce18ae30e02da2138499b12bb03b2f82a53b78c0d993","observation_id":"811f941a-0c4d-4976-8653-64601ac5f6af","resolution":{"observed_at":"2026-08-11T18:05:13.401749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.051137Z","title":null,"venue":null,"work_id":"b5fd8b7f-8407-464f-bc78-01f06d6aaf0f","year":2016},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.408013Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:d6e960d0c50edd904a624ec661d1a1217d13cfd9b58a1359e1a4dcfed03d79df","observation_id":"8a3a9230-0a91-4e7e-9ab3-73e507fa98c5","resolution":{"observed_at":"2026-08-11T18:05:15.061818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T18:05:13.413807Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.413807Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:44e80d3634f47122f184f6e24803e711813ffa6c6c03ca73524852f480393f6e","observation_id":"9ebbc6a1-0d3b-4a96-9e2d-061410f520f9","resolution":{"observed_at":"2026-08-11T18:05:13.413807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:15.024446Z","title":null,"venue":null,"work_id":"5bae97a3-5289-4a1f-8844-84fd80992aa6","year":2016},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.426081Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:2da68f152e31bd7e7a34c1889559fea5d4e83693f63c048998c9cd63ee8769ac","observation_id":"81f5138f-e152-4b17-be46-a1dab3a24d82","resolution":{"observed_at":"2026-08-11T18:05:15.032060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.433193Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.433193Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:ea46a2de9a218cacd7884644aa141954eff87d3c458e10b444dc326b24c85a01","observation_id":"7d777018-c03a-44f7-811a-c166e8bea33d","resolution":{"observed_at":"2026-08-11T18:05:13.433193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.963034Z","title":null,"venue":null,"work_id":"f6e349a5-2320-4e92-bb73-2cbe74608638","year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.440020Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:12ab0a73d9acd83462b0d3eec6167062e8758add1ad342aff02994169be73175","observation_id":"5c919640-4f31-43fa-ae73-c84224307328","resolution":{"observed_at":"2026-08-11T18:05:14.973552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.936385Z","title":null,"venue":null,"work_id":"642b4f1a-1cfe-4b9d-b219-ffcf8fa56db6","year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.447383Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:4809cbf6146edd92dd657a274f8fa617ec79909c46ef882adab496dff504f8c5","observation_id":"143cdedc-33f3-4e07-aa21-1483d0186d04","resolution":{"observed_at":"2026-08-11T18:05:14.943518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.911834Z","title":null,"venue":null,"work_id":"e89ce4b3-cc10-4a8f-8f94-22ab909c2ccb","year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.457131Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:78428088691f20d3d4d44108f779ca1efa70558db31fa2c82e30999749b6de78","observation_id":"f802aa70-8ca5-4a8d-a7a4-f411a6aebbec","resolution":{"observed_at":"2026-08-11T18:05:14.917915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T18:05:13.463866Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.463866Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:ae05bda82e1428f35ce9439b0e41200b5d7e63e29c68cfee046c0b469b70b7b3","observation_id":"8077bff0-de99-4f6c-9597-77b071d77a11","resolution":{"observed_at":"2026-08-11T18:05:13.463866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.470273Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.470273Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:77357ab923e31c05d153355ab605775df9e8304d794e4ce37b83bab3886cd86d","observation_id":"9e678553-10db-4aca-b5cc-7b53bbea300e","resolution":{"observed_at":"2026-08-11T18:05:13.470273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.872177Z","title":"X.; and Min, M","venue":null,"work_id":"3e8bd625-c715-47d2-a150-6afb26b9f4a4","year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.477206Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:c06a2fb96f1e95606a7c745662d161d1958984ea089271f980aaa68733497340","observation_id":"3f27a1e9-3c54-4abe-a3dd-001c25a3552e","resolution":{"observed_at":"2026-08-11T18:05:14.881062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.484233Z","title":"A.; Wang, L.; Cervantes, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.484233Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:b7fef7ab1fa832653f28e051160cbf6395e612bc41103e93f89e2a6ae6da8689","observation_id":"ff5b5a73-2589-41dc-b4ed-e2cf6094910d","resolution":{"observed_at":"2026-08-11T18:05:13.484233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-14T18:19:10.821318Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-11T18:05:13.492090Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.492090Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:87e1c014b5f1deb7b0879018014c6f05afceb561f4f69f92db1a12887792942c","observation_id":"5005b19b-13ce-4266-8976-4333e6c7a9ac","resolution":{"observed_at":"2026-08-11T18:05:13.492090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.830114Z","title":null,"venue":null,"work_id":"90bb1ee6-39ef-4679-adc4-87665b7cf4e4","year":2017},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.499878Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:90358830da0a74b8f1a5d330f2f3e4ed18d7f7df04f0f4dc696440f1a8af8ec7","observation_id":"21b185dd-9019-47e9-a615-9b52f33b50a6","resolution":{"observed_at":"2026-08-11T18:05:14.838228Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.506572Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.506572Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:740dd545916126223cd9319969e907217e97e429b7a525fd7847a54819836240","observation_id":"99a08d5e-c490-4f87-9776-c2e1fe23db39","resolution":{"observed_at":"2026-08-11T18:05:13.506572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-11T18:05:13.512709Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.512709Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:4a36a13d24672ce8b63559802a41c03d75b76ccf181b051a8d2b0a23cdc61087","observation_id":"29edc60e-de73-472f-b890-2a47a768ebf5","resolution":{"observed_at":"2026-08-11T18:05:13.512709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02849","last_updated":"2022-10-02T11:55:59Z","snapshot_observed_at":"2026-08-16T17:08:52.800738Z","submitted_at":"2022-04-06T14:13:35Z","title":"KNN-Diffusion: Image Generation via Large-Scale Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02849","snapshot_observed_at":"2026-08-11T18:05:13.520791Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.520791Z"},"links":{"cited_paper":"/paper/2204.02849","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:75e6095e96c5588e1dba9c42d4809fe88ee05bbbc82fb984b7841244f5a7da02","observation_id":"fc265edc-2d6a-4218-80e8-d6ae6004265e","resolution":{"observed_at":"2026-08-11T18:05:13.520791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.530030Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.530030Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:34d7ecd58ea303b4b68dd79806774264657e002412980e93a2f1397a2b0e82d8","observation_id":"1e95f571-c327-4d3e-b717-026b5005a65a","resolution":{"observed_at":"2026-08-11T18:05:13.530030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T18:05:13.536746Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.536746Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:8c8e4196e1b75a73fe558a3c768a02f8b52cc8d8427b7a694bd4b50501828b43","observation_id":"9619dc6e-9f5c-4020-a62a-c26cd4617a74","resolution":{"observed_at":"2026-08-11T18:05:13.536746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.767034Z","title":null,"venue":null,"work_id":"639ae707-b2d1-4a37-a416-f771c86b9142","year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.543542Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:e70a60b2a2de191cb9f1e28d7dd66ffa1e58ddf4010dfae68c0c8317f5f6eb4a","observation_id":"5adb4806-f174-4900-9b2d-11852ae3c975","resolution":{"observed_at":"2026-08-11T18:05:14.774060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.550734Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.550734Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:ca9326322628538ee1aba427c0bb64dc9997fd8fa1a169e5d50efd5671c22ee9","observation_id":"96f79b53-b0d4-4d38-af4b-7bdb49b047b6","resolution":{"observed_at":"2026-08-11T18:05:13.550734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T18:05:13.558948Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.558948Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:a6508731e672d19568b4bca85307af6c18ca8792d798a3167340961263a5b4cd","observation_id":"4e9b16f8-348f-47b8-aa7d-ad083dc0d2d2","resolution":{"observed_at":"2026-08-11T18:05:13.558948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-11T18:05:13.566395Z","title":"P.; Kumar, A.; Ermon, S.; and Poole, B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.566395Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:56ee3f4ef2385121051401554c7896cf3ec0c5970d924a36c623a82383d1afad","observation_id":"9ede53ab-144f-4ce2-b222-3f5684408ae4","resolution":{"observed_at":"2026-08-11T18:05:13.566395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.729600Z","title":null,"venue":null,"work_id":"079e4757-3e22-42f4-8a6e-14e67df146aa","year":2018},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.572591Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:dbe161a1ab99b75ca20cc95a58ad7377bf43a7ace0956e43c5bd08fddf633b38","observation_id":"258fa863-5324-437a-847c-3c648cc24479","resolution":{"observed_at":"2026-08-11T18:05:14.736132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T18:05:13.579130Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.579130Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:64e06f6e42db99269ead8d9a878b704badc4b3f63cbcfc60cc9fe81d390bc402","observation_id":"6a13ad1b-ce0e-448c-80ed-906e65058295","resolution":{"observed_at":"2026-08-11T18:05:13.579130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.585414Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.585414Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:fe48c3b0d12c58d900218945bcb523bbf35f57b6f127065ff17cfeb61d9400d7","observation_id":"88f0f9c2-55f3-4bed-8a06-82a0d87e1180","resolution":{"observed_at":"2026-08-11T18:05:13.585414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10874","last_updated":"2024-04-24T11:22:00Z","snapshot_observed_at":"2026-08-17T02:01:12.718988Z","submitted_at":"2023-05-18T11:06:15Z","title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10874","snapshot_observed_at":"2026-08-11T18:05:13.592846Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.592846Z"},"links":{"cited_paper":"/paper/2305.10874","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:8b22a5665823a2c3dde0e055056ff0f37fedca5477897d17e960b79e5fea07db","observation_id":"81e4186e-3df2-4fd5-bd42-aae55404c3c4","resolution":{"observed_at":"2026-08-11T18:05:13.592846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02018","last_updated":"2023-06-06T03:54:10Z","snapshot_observed_at":"2026-08-16T20:02:42.361058Z","submitted_at":"2023-06-03T06:29:02Z","title":"VideoComposer: Compositional Video Synthesis with Motion Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02018","snapshot_observed_at":"2026-08-11T18:05:13.599043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.599043Z"},"links":{"cited_paper":"/paper/2306.02018","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:63127f11900fee60e9a03e847d3ade9d90c1c427cc32ba2da343725538036dc6","observation_id":"b26df2c8-ad86-446b-a893-877c218e4cac","resolution":{"observed_at":"2026-08-11T18:05:13.599043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-16T18:27:58.328538Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T18:05:13.607809Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.607809Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:17a8c2f4f2e3bb3f8171e8709d39c048e77c9fa60b7168c8556aaa25d77e3c73","observation_id":"dc70ab91-409b-40ca-a6bb-d4b8ba381730","resolution":{"observed_at":"2026-08-11T18:05:13.607809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.684835Z","title":null,"venue":null,"work_id":"143ba3b0-3a52-418e-8f4a-064e2d12ef1e","year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.620412Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:adcb955f44d20ec7519564372e9d533335685e2bf7e185425b3db856546a2f10","observation_id":"fbc45108-7189-4ce1-890d-1c2519b3228d","resolution":{"observed_at":"2026-08-11T18:05:14.694070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.631121Z","title":"Z.; Ge, Y.; Wang, X.; Lei, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.631121Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:eeeb03cbda7d64f3f57458fa9c88f842e4fe72815a0cb1a55994ca1896170615","observation_id":"552703ce-3e89-41ab-b011-001acc2d78d3","resolution":{"observed_at":"2026-08-11T18:05:13.631121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.641629Z","title":null,"venue":null,"work_id":"b38e8a2e-f822-4742-bd5d-af121afd0418","year":2018},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.639548Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:6803b715f974938f6d039caa831d7b63e77efe394f4f6424bb3d5bcb2c19706b","observation_id":"d1bce80a-b382-489e-9496-71d13b9dfcd9","resolution":{"observed_at":"2026-08-11T18:05:14.648634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04003","last_updated":"2022-06-19T03:27:07Z","snapshot_observed_at":"2026-08-16T16:54:24.809910Z","submitted_at":"2022-06-08T16:29:59Z","title":"Patch-based Object-centric Transformers for Efficient Video Generation","version":2},"cited_work":{"arxiv_id":"2206.04003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.04003","snapshot_observed_at":"2026-08-11T18:05:13.978319Z","title":"Patch-based Object-centric Transformers for Efficient Video Generation","venue":"cs.CV","work_id":"d5b51125-7735-4c8f-8e33-14ab9580602c","year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.645949Z"},"links":{"cited_paper":"/paper/2206.04003","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:fd0cfbd2bc351ebc8442a9cf275884440f447178ccce4011b38079eb1768c090","observation_id":"a3a4b247-0834-419d-9299-516a767748c2","resolution":{"observed_at":"2026-08-11T18:05:13.988401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-11T18:05:13.652243Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.652243Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:85199b545f9976580d95a4e1d8a16e981a7cc1d674ec59b9ccd7ea6d1235e1f9","observation_id":"dfcc8d4d-978e-4f76-bb8e-5ed7a1f436f5","resolution":{"observed_at":"2026-08-11T18:05:13.652243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-11T18:05:13.660376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.660376Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:aa46371666674a5ffd63f8cae7068061eb01906aa5850f928f32421d4b70683b","observation_id":"011c24ec-3fb9-4025-ae1b-cf00cb0df18e","resolution":{"observed_at":"2026-08-11T18:05:13.660376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.617080Z","title":null,"venue":null,"work_id":"e96563f5-1a0e-41e0-96ce-85fc4763326b","year":2020},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.666692Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:dfbd21c4b06d4f80e0ae720b042ffa6808105219ed39353b72b42a7cd81a8d0f","observation_id":"8d1143f3-5244-47c6-bfd8-94827eef4d0c","resolution":{"observed_at":"2026-08-11T18:05:14.626912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09481","last_updated":"2022-12-08T01:18:55Z","snapshot_observed_at":"2026-08-16T17:14:13.000499Z","submitted_at":"2022-03-16T03:52:45Z","title":"Diffusion Probabilistic Modeling for Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09481","snapshot_observed_at":"2026-08-11T18:05:13.681507Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.681507Z"},"links":{"cited_paper":"/paper/2203.09481","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:94fd7d32a3606832b550dfc0bac78882477412c3ecd2e7c5bae2aaf938bbb8a1","observation_id":"5f625d45-85ad-4c12-a3aa-6dad7654df97","resolution":{"observed_at":"2026-08-11T18:05:13.681507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T18:05:13.690809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.690809Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:b1912a625abfb36c334c071777c2200d5ca551122124fc0e9e2aca42e7edd5df","observation_id":"5044ea72-5286-4849-8a56-b200fd6285ba","resolution":{"observed_at":"2026-08-11T18:05:13.690809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-11T18:05:13.697801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.697801Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:47d2821bc774418ac941e0553c65685a2c6aa529e2205e919ef72e33e83b7b2e","observation_id":"62992de8-fed9-4a43-b863-d77b964768f5","resolution":{"observed_at":"2026-08-11T18:05:13.697801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:14.593415Z","title":"D.; and Langlotz, C","venue":null,"work_id":"c9e3b2ab-219c-4486-b15a-377d79b65cb2","year":2022},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.704382Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:45158847f2cfe01ffb7312c83f01c0e4fa3849372c5f786687cbf01d0b189b08","observation_id":"390699fb-c509-4905-a397-2feab8fa2f1e","resolution":{"observed_at":"2026-08-11T18:05:14.600132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06870","last_updated":"2023-06-12T05:06:53Z","snapshot_observed_at":"2026-08-16T15:24:43.307640Z","submitted_at":"2023-06-12T05:06:53Z","title":"Sticker820K: Empowering Interactive Retrieval with Stickers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06870","snapshot_observed_at":"2026-08-11T18:05:13.711261Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.711261Z"},"links":{"cited_paper":"/paper/2306.06870","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:e329973f52e92811966f5d75cc0a95c51241b062f003d5ddd97e2a5a7afca490","observation_id":"fb5392fb-4538-4da6-a8c6-075ef8aa9073","resolution":{"observed_at":"2026-08-11T18:05:13.711261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T18:05:13.719926Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.719926Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:5d2c879e7b32245ab926f0c07ea6b81d17b12853110aaf4a9672b0a60a35986d","observation_id":"ed3b9ef7-465b-48ae-bf81-89e3e5202b1d","resolution":{"observed_at":"2026-08-11T18:05:13.719926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.726189Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.726189Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:0f36f03b720ca96d56d8bdf1b56024b1f644c72cead8fb7a9945564d2ff97a50","observation_id":"181a1b03-bc1d-44cf-8701-2699b379d9ca","resolution":{"observed_at":"2026-08-11T18:05:13.726189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:05:13.732515Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T18:05:13.732515Z"},"links":{"citing_paper":"/paper/2412.08259"},"observation_digest":"sha256:de1dac69946b3ed17d4dc72a738c76666a290626402a481dc63b4dad098d8fd7","observation_id":"96af181a-ad7e-4cd6-9951-caa4eea8f455","resolution":{"observed_at":"2026-08-11T18:05:13.732515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08259","last_updated":"2025-03-26T11:54:06Z","latest_version":2,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-17T09:15:19.176147Z","submitted_at":"2024-12-11T10:11:41Z","title":"VSD2M: A Large-scale Vision-language Sticker Dataset for Multi-frame Animated Sticker Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2412.08259."}