{"as_of":"2026-08-11T18:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:349c179da6c7fe9725eb0dd5a301601a6df5f1a66ecf9d55f845a776f401a47d","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:03:13.651954Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03006/citation-record","integrity":"/paper/2501.03006/integrity","json":"/paper/2501.03006/citation-record.json","paper":"/paper/2501.03006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.383790Z","title":"One transformer fits all distributions in multi-modal diffu- sion at scale","venue":null,"work_id":"97066091-94f5-4d68-8833-d0ea933cccf2","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.424433Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:ba95e6ab319b525cefebbcf4469c7ce1dd45c81b75c61688b953c17858297d48","observation_id":"802c79ed-11f4-4261-89c1-f9c40e8215a3","resolution":{"observed_at":"2026-08-10T22:03:14.388236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T22:03:13.428470Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.428470Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:20a807b6c279bd920efcfaeb877061125a681f52636fe4ab9584496e5ec16635","observation_id":"b7601d13-fbb2-4539-8cc5-fd1a613a5774","resolution":{"observed_at":"2026-08-10T22:03:13.428470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.432127Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.432127Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:bfa602cf333ed01f7b5beb537c867ef7bdec0e48b7a1f2406b81b43fc6fa6fa2","observation_id":"629939d6-0a1d-4c3e-8059-093ec09859ee","resolution":{"observed_at":"2026-08-10T22:03:13.432127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.367755Z","title":"Magick: A large-scale captioned dataset from matting generated images using chroma keying","venue":null,"work_id":"4e8a62ab-c0a9-4caf-8acf-4d3aaeb03bed","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.435878Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:474a0e1fbc5963437578ac204d676ecfd87f36e3dad47a22c50efb45514bfd92","observation_id":"79175ade-57a9-4ab9-8336-9af812f98ec1","resolution":{"observed_at":"2026-08-10T22:03:14.371380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.358393Z","title":"zeroscope v2","venue":null,"work_id":"e641596c-8661-4196-acb2-f5b1adb822c4","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.439450Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:12dacf91c578513a419c428b3eccd60fa88677898dc072add05253009f2d319e","observation_id":"44460e55-b00b-4dc2-9814-7c50ce0f1c7e","resolution":{"observed_at":"2026-08-10T22:03:14.361772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09433","last_updated":"2022-04-20T12:54:06Z","snapshot_observed_at":"2026-08-08T03:09:44.614842Z","submitted_at":"2022-04-20T12:54:06Z","title":"PP-Matting: High-Accuracy Natural Image Matting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09433","snapshot_observed_at":"2026-08-10T22:03:13.443451Z","title":"Pp-matting: high-accuracy natural image matting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.443451Z"},"links":{"cited_paper":"/paper/2204.09433","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1fcad44121d93d6ff490d074c26e805300912637b3af0ecc68c6cbe1129adea9","observation_id":"53addafb-f405-455f-9d7c-2be7e37aeacd","resolution":{"observed_at":"2026-08-10T22:03:13.443451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-10T20:17:19.785772Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-10T22:03:13.447836Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.447836Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c674d359c91eb214dfcdf8de891d099541f24e5877aedd50a814687a8b75cde0","observation_id":"034e862b-e019-4f0a-88d4-7a587affd2c1","resolution":{"observed_at":"2026-08-10T22:03:13.447836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09047","last_updated":"2024-01-17T08:30:32Z","snapshot_observed_at":"2026-08-04T07:40:19.403363Z","submitted_at":"2024-01-17T08:30:32Z","title":"VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09047","snapshot_observed_at":"2026-08-10T22:03:13.452815Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.452815Z"},"links":{"cited_paper":"/paper/2401.09047","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:a2fa5700f0232d22f5689e47c336da4161f3c21470ca7c829cff18fd731047c4","observation_id":"7dd7c79c-d318-43fa-941a-28b93962ab1d","resolution":{"observed_at":"2026-08-10T22:03:13.452815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-10T22:03:13.457302Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.457302Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:2daa422731230067e696be9338eb5942838a36f4fb70efa8b2f17fa451ece955","observation_id":"58a51d4e-9345-4b65-b35a-6255df38eaac","resolution":{"observed_at":"2026-08-10T22:03:13.457302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-10T22:03:13.462730Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.462730Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:9bf0599ceefcb70a3fcbf2757ae5ff81c75ff5f38a7de38fb21a87bb255000ce","observation_id":"a30c5492-528c-4b5d-aaac-d095a551f953","resolution":{"observed_at":"2026-08-10T22:03:13.462730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13840","last_updated":"2024-08-12T08:30:05Z","snapshot_observed_at":"2026-07-06T15:31:13.189124Z","submitted_at":"2023-05-23T09:03:19Z","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13840","snapshot_observed_at":"2026-08-10T22:03:13.466003Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.466003Z"},"links":{"cited_paper":"/paper/2305.13840","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:bd564851946b0b54d1c461b8ee8b7af841c0ff5cf993b2a52f6aea4d5a61b2f9","observation_id":"6fceeca7-5cc1-4d81-8ac3-98cba82c8e3d","resolution":{"observed_at":"2026-08-10T22:03:13.466003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.348186Z","title":"Longnet: Scaling transformers to 1,000,000,000 tokens","venue":null,"work_id":"264ecc08-c08c-4f1f-9ef7-f81226039166","year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.468903Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7090eabd3591798753f3083ff8fd4b371b59da1581d9003a60c853cd832c3ac3","observation_id":"167a6211-dec9-4903-9357-17bd340a63dc","resolution":{"observed_at":"2026-08-10T22:03:14.351711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.338380Z","title":"Two-frame motion estimation based on polynomial expansion","venue":null,"work_id":"e5b791ee-7c93-46f4-94a2-f197b5791b2e","year":2003},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.475167Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:a7bc1ce6208608aa2601067f58016fa0c3d55580a59fed04181f3c332527ff9b","observation_id":"6e77cf48-e743-40b7-9195-4595c0c5f3c0","resolution":{"observed_at":"2026-08-10T22:03:14.341940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-10T22:03:13.477931Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.477931Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:95d0ba332a75239d798ad4311a215cc4a46edca66e7db172243e7807ef5165db","observation_id":"628f1105-f5b1-436c-81ff-6567d904b1cc","resolution":{"observed_at":"2026-08-10T22:03:13.477931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-10T22:03:13.481255Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.481255Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d4fbcdbd217626409d6241de48332896f7ea00b0d6880295e7c74cb4756a7f0b","observation_id":"fd197d53-291d-47a6-82d0-6fe9a6de6704","resolution":{"observed_at":"2026-08-10T22:03:13.481255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16693","last_updated":"2024-06-26T18:00:02Z","snapshot_observed_at":"2026-08-09T04:47:06.819497Z","submitted_at":"2023-12-27T19:11:50Z","title":"I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16693","snapshot_observed_at":"2026-08-10T22:03:13.484792Z","title":"I2v-adapter: A general image- to-video adapter for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.484792Z"},"links":{"cited_paper":"/paper/2312.16693","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4a78fc2f08a07558bc600c8224551ae79aa26ec891197abd11a2520c778618ba","observation_id":"14579c03-51cc-479a-80ad-a5641f5ab87d","resolution":{"observed_at":"2026-08-10T22:03:13.484792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T22:03:13.488150Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.488150Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4fe0b31b89be9b4073e292e35f767630fe13be337bb9770052b2e846dcd5cf88","observation_id":"88b1f8a7-6b39-4b6c-aed8-6c7887d3e3ff","resolution":{"observed_at":"2026-08-10T22:03:13.488150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.327891Z","title":"Lu- cidfusion: Generating 3d gaussians with arbitrary unposed images, 2024","venue":null,"work_id":"e8b4fd46-4f86-4b22-afa5-074da069e286","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.491488Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:a0fd83b7cf74fb602684675bde0b1fa18de4601c528b750d8a22a10f56e31d28","observation_id":"c3e8f7b8-b204-4140-832b-f58a943943ca","resolution":{"observed_at":"2026-08-10T22:03:14.332283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T22:03:13.494418Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.494418Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:e0e9d9077e6bec272b357899a888f4ec595b525acbf3b2c5b4588148c01d2167","observation_id":"7da24728-5fa5-4ac4-bb6c-4ed251ddbe54","resolution":{"observed_at":"2026-08-10T22:03:13.494418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-10T12:46:39.807482Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-10T22:03:13.497600Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.497600Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c35393932bf55897f76530db942ed3c2b001bd88497024904e1103f548040fea","observation_id":"3b0a4cdd-7e3a-4945-852c-cf785ee4056f","resolution":{"observed_at":"2026-08-10T22:03:13.497600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-10T00:51:42.114461Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T22:03:13.500825Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.500825Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6c24682a008330735203bfb1216ea4650923629461a678bb361a674cc62b7ef2","observation_id":"36563d41-0e49-4420-b8b2-1753fc1c840b","resolution":{"observed_at":"2026-08-10T22:03:13.500825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.503727Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.503727Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:db2a4e045924b37fd1047ce24f8d297300b67de7cb0ff886a2f0358aea517ad3","observation_id":"e818f96d-3bcd-4db9-95e1-3fe1ecaaf7f7","resolution":{"observed_at":"2026-08-10T22:03:13.503727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.311913Z","title":"Determining opti- cal flow","venue":null,"work_id":"d9a801f2-a1fc-47c2-9908-782c48060747","year":1981},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.506571Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:e682775ea036434d819a3e6b00e590bbd4d0ee2de1aa39b616bc60e62fe9346b","observation_id":"a02183b4-8321-4586-9b97-7f256fc0ae9f","resolution":{"observed_at":"2026-08-10T22:03:14.315439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T22:03:13.509331Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.509331Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:9f224aa557ad6a0c8ef652decf00fc92de15ebe0041ea73de2f75cfb31f458dc","observation_id":"452ce017-7d37-4721-be4e-4459bfacf3a1","resolution":{"observed_at":"2026-08-10T22:03:13.509331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12002","last_updated":"2024-07-15T13:34:29Z","snapshot_observed_at":"2026-08-10T06:53:33.600898Z","submitted_at":"2024-03-18T17:38:53Z","title":"DreamMotion: Space-Time Self-Similar Score Distillation for Zero-Shot Video Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12002","snapshot_observed_at":"2026-08-10T22:03:13.512595Z","title":"Dreammotion: Space-time self-similarity score distillation for zero-shot video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.512595Z"},"links":{"cited_paper":"/paper/2403.12002","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:214c5fbc49c85367445f45f604b7d13f4c9bf375b5ebc3b723a3c4d8bfde0fa9","observation_id":"38dd361e-257e-4160-adad-5bf8905f4452","resolution":{"observed_at":"2026-08-10T22:03:13.512595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.515644Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.515644Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:70a16ec2bec9c8276404b4a32fc10d2e8b17d68d80d02dfca5024a8ac1191a17","observation_id":"038d4fee-4f6c-4919-8394-f41e2f340969","resolution":{"observed_at":"2026-08-10T22:03:13.515644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.295030Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"6828f647-fc9c-40d8-a167-3360c8459046","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.518388Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:435f117927883a54507a25754f7f777cd3a11f1af91b2d0436eba247c8937988","observation_id":"f188966a-a10f-48d0-b405-4de32e1ee50a","resolution":{"observed_at":"2026-08-10T22:03:14.298555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.283702Z","title":"Matting anything","venue":null,"work_id":"dd67dee5-a532-4fb7-81e9-e49a149dea2f","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.521329Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c97f1bc7a91386f83d4aa4f16f54126596761a23bb04141db68c545c7444c29d","observation_id":"5327516c-8149-4c04-9c1a-a909ba28ef4b","resolution":{"observed_at":"2026-08-10T22:03:14.287705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.270116Z","title":"Omnimat- terf: Robust omnimatte with 3d background modeling","venue":null,"work_id":"668defbc-5628-439c-8f29-2217f60deb8b","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.524446Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:76b10fc2f1ee0e65fb31345cecdd67374ed52ea681c5062c9ddbde4aae67b54f","observation_id":"45d6a804-9eaf-44b9-9a22-2a894a107d0a","resolution":{"observed_at":"2026-08-10T22:03:14.274367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.259220Z","title":"Real-time high-resolution background matting","venue":null,"work_id":"d26771e8-ea45-4271-a13b-c3466c2e9414","year":2021},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.527761Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b312ef12d8e0117bb84c0c28492f67a33b33688d4c886e61c5157c873c16e7d8","observation_id":"69ad9895-e05f-4f2c-91a8-11653903f275","resolution":{"observed_at":"2026-08-10T22:03:14.262900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.247522Z","title":"Robust high-resolution video matting with tempo- ral guidance","venue":null,"work_id":"aeb70584-0813-4f49-a333-d8fbacb99a91","year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.530996Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c90d4fd57e36e5793a750a812d56332d86172e481797df622083c7d8f212b230","observation_id":"edb28094-cde5-4fbe-98ba-ef51ca91fd3b","resolution":{"observed_at":"2026-08-10T22:03:14.251951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05338","last_updated":"2024-10-22T04:22:16Z","snapshot_observed_at":"2026-08-10T10:00:09.423104Z","submitted_at":"2024-06-08T03:44:25Z","title":"MotionClone: Training-Free Motion Cloning for Controllable Video Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05338","snapshot_observed_at":"2026-08-10T22:03:13.534345Z","title":"Motionclone: Training-free motion cloning for controllable video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.534345Z"},"links":{"cited_paper":"/paper/2406.05338","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:a384ea27d32c9f6420f06afdc5aa14454e0a105bf4408d3e8e4286bad95b2e64","observation_id":"5c92ac8d-3490-4e9f-8c4d-5a4a67a64fdc","resolution":{"observed_at":"2026-08-10T22:03:13.534345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.537985Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.537985Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:0d50a5b67ce17069470a4c403420e1ea2d7c00dfdea64c89443eb6f55e41d18e","observation_id":"e77631c0-2b1c-41d1-8c84-1fe7be37657e","resolution":{"observed_at":"2026-08-10T22:03:13.537985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-10T22:03:13.540995Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.540995Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:477dfbaf9e2f808cc8b8543e4f24c7725dc76f4557fccfd2607dbf02f155422c","observation_id":"73b3bc10-07f2-49b6-b63d-0d20087e970a","resolution":{"observed_at":"2026-08-10T22:03:13.540995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.230786Z","title":"Wonder3d: Sin- gle image to 3d using cross-domain diffusion","venue":null,"work_id":"50ca43d9-5117-46fa-a35a-2a9226c04d78","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.544546Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d9b60846f8b0160d292568b1b902dc646f663e1975b323f8938446fd4de0f8fd","observation_id":"1f20a71a-6e2e-49a3-aa33-8673cf478c84","resolution":{"observed_at":"2026-08-10T22:03:14.234487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.219796Z","title":"Intrinsicdiffusion: Joint in- trinsic layers from latent diffusion models","venue":null,"work_id":"45652c49-398b-4a70-8b1e-d37f81ece011","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.548015Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1eb49fafb044b89c741555594f968936f1d5547bd0f0fafdca3e70d45cdbedc4","observation_id":"6a6090dc-e376-45f9-936f-03ad39ddaaab","resolution":{"observed_at":"2026-08-10T22:03:14.223573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00896","last_updated":"2024-04-08T18:40:31Z","snapshot_observed_at":"2026-08-06T12:11:11.088129Z","submitted_at":"2023-12-31T10:51:52Z","title":"TrailBlazer: Trajectory Control for Diffusion-Based Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00896","snapshot_observed_at":"2026-08-10T22:03:13.551286Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.551286Z"},"links":{"cited_paper":"/paper/2401.00896","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:8303aabe6959799d66093cb9127ea0f01724862d4e90d4f88cf319b3006fafe7","observation_id":"4b1f40ac-4964-4c72-a75e-24dde494b1ef","resolution":{"observed_at":"2026-08-10T22:03:13.551286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T22:03:13.554678Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.554678Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:8d564fbe5a1c625e14c8a8aaf7c8e6d17a2ada7c2c6d45e80238f7a582987923","observation_id":"3db71a60-8289-4f83-91d0-680777d1e82d","resolution":{"observed_at":"2026-08-10T22:03:13.554678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20222","last_updated":"2024-07-11T16:26:03Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:22:22Z","title":"MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20222","snapshot_observed_at":"2026-08-10T22:03:13.557527Z","title":"Mofa-video: Control- lable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.557527Z"},"links":{"cited_paper":"/paper/2405.20222","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1d77f662a5d6ee40b9f23510c8da2eb75cb92b9967f74c68923cbf6f176e54c3","observation_id":"0eaac291-299e-412f-9c83-c30b48190e0c","resolution":{"observed_at":"2026-08-10T22:03:13.557527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.560797Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.560797Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:2e2c6255ac17a1e2df5e0ff30d958a1215ac5c98fc2e167b3af163107604d6b1","observation_id":"72746aa4-5145-4be5-907d-f8a76d3a14b6","resolution":{"observed_at":"2026-08-10T22:03:13.560797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.202374Z","title":"Bimatting: Efficient video matting via binarization","venue":null,"work_id":"41269c42-c1c5-4612-af52-50d5b59f358a","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.564688Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6a958e716696536e5c874ea0e05f79bd78dead50dd217e945f6273e0993b7b9e","observation_id":"db742f99-9932-407b-8807-fe12c9932609","resolution":{"observed_at":"2026-08-10T22:03:14.206501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-10T22:03:13.567677Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.567677Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:495b8e35981d05a40d63c60c782b4d34af9ae985ffe69693f9fef158f3d53980","observation_id":"64eed75c-bf0c-4969-83bb-40aaea962e3b","resolution":{"observed_at":"2026-08-10T22:03:13.567677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.571367Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.571367Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7d33fa75867ba680caca483fc32f5a8ab691b554f61649045a812bf4b5f9851c","observation_id":"b109daf2-2980-4743-958d-42f79c300e2f","resolution":{"observed_at":"2026-08-10T22:03:13.571367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.574514Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.574514Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:8a81e95a48ccb0bed03713806761b0f976a5e05c178ccaac1dd799c74e3dc994","observation_id":"6b771ff2-5635-44b5-8a17-01c9229c72bc","resolution":{"observed_at":"2026-08-10T22:03:13.574514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.178339Z","title":"Mochi, 2024","venue":null,"work_id":"77953b45-e3e8-49b9-aa69-7bc2ca3a3eef","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.578026Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:5b3623740764bc887c4de1a0f70dc2673b32b885a21b5a6e51bc1c25f579d537","observation_id":"4b887705-b724-4b4f-9706-5f674216886e","resolution":{"observed_at":"2026-08-10T22:03:14.182265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.167464Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"c98818b2-dea3-4803-84a8-df5ff7c69f88","year":2019},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.581084Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:f83499790eb2b276a9cb839bf1efab3f4ca74827602dbe4d674ca6f3ce92b34d","observation_id":"2f6809d9-415c-4d7f-b01e-54c197622cf9","resolution":{"observed_at":"2026-08-10T22:03:14.171286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05919","last_updated":"2024-08-23T12:19:54Z","snapshot_observed_at":"2026-08-06T10:04:59.261044Z","submitted_at":"2024-02-08T18:53:21Z","title":"Collaborative Control for Geometry-Conditioned PBR Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05919","snapshot_observed_at":"2026-08-10T22:03:13.584320Z","title":"Collaborative control for geometry-conditioned pbr image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.584320Z"},"links":{"cited_paper":"/paper/2402.05919","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1e20c4935673a7f697f932d25ca072c6265e7c6323c9a872e57b2e99b5a6aa45","observation_id":"c2980faf-133d-4ffa-b348-550d351a2b2b","resolution":{"observed_at":"2026-08-10T22:03:13.584320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-10T22:03:13.587944Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.587944Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:3cdd8214ed60db99aa811b9d65c13eb38a2c916fbb27462b8fcb45b7483e077a","observation_id":"6a872c3a-1c30-4301-8639-4cb92218b276","resolution":{"observed_at":"2026-08-10T22:03:13.587944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20193","last_updated":"2024-10-16T18:35:31Z","snapshot_observed_at":"2026-08-06T01:11:00.872917Z","submitted_at":"2024-03-29T14:14:22Z","title":"Motion Inversion for Video Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20193","snapshot_observed_at":"2026-08-10T22:03:13.591248Z","title":"Motion inversion for video customization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.591248Z"},"links":{"cited_paper":"/paper/2403.20193","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6b899e0b680c802102bbccaba24943dc874c5b84474fa799f543a330b47f650f","observation_id":"6b3dcc44-6f3f-4e3c-8ee4-888028d8e35b","resolution":{"observed_at":"2026-08-10T22:03:13.591248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-10T22:03:13.594637Z","title":"Linformer: Self-attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.594637Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:424e4ba976c98a77398724d90fda79c694a903f9e1071020a7de4830c864ab34","observation_id":"512d08bd-f631-41c7-9d90-58751db2b9c7","resolution":{"observed_at":"2026-08-10T22:03:13.594637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.154943Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"9d310ca8-8b3f-4d10-a32f-cef2b094ac8e","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.598510Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:c853a771bc2039e49f88a8b671b629f0436f5823db927d80c1864aef19075b5a","observation_id":"63c5cdd1-33ff-4cf2-8e4e-c9a19f0aeeb0","resolution":{"observed_at":"2026-08-10T22:03:14.159682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.141847Z","title":"Matting by gen- eration","venue":null,"work_id":"f8f48722-f83b-49db-9fe9-596261faa49f","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.601790Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:b247b5d549e998a5b6e013adc47f4fabcbf16eee3be09f30e589c75d01746b19","observation_id":"b6b97726-9a36-4c7b-a5d5-2d35ee45692c","resolution":{"observed_at":"2026-08-10T22:03:14.146550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.128250Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"167cf42f-35b1-483e-8cbd-aa0a4f876305","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.604754Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:76d6f832cc105e9a4f496208d23edda535f2bde02c22ead1360f26a5a590eea5","observation_id":"6ad6d65a-c755-4999-8fd4-84eb1afd773d","resolution":{"observed_at":"2026-08-10T22:03:14.133403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.607961Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.607961Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:e7fd63eaf9960ccbfad01a6a873154b4f095454c7f2dfc585f34fad2515553a0","observation_id":"a2292f6f-e30b-407e-8475-aac7795b01d5","resolution":{"observed_at":"2026-08-10T22:03:13.607961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:13.611264Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.611264Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4cf701dffb6c46825fa028962a2b432bf75e97adbd2685f643fc5f528dfa7b4a","observation_id":"cb7266e3-3d5a-4b73-be7b-5e68cfddd3a5","resolution":{"observed_at":"2026-08-10T22:03:13.611264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.092866Z","title":"Defect spectrum: A granular look of large-scale defect datasets with rich semantics, 2023","venue":null,"work_id":"e5907c5b-9fb9-4ae9-b39f-1bfbd2ea2327","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.614284Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:e3fc971d439ebc1dae7e34c2efd5338c14a26bea2e240506cfbee65413b1b37b","observation_id":"4d5867ce-f8bf-4556-886f-e54222dece11","resolution":{"observed_at":"2026-08-10T22:03:14.097866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.077463Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"2a4c48aa-c0f9-488a-923a-053e3ac6033a","year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.617986Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:0d6b6d71c4472eee64541847b8fc5a666052545231c03cc43b42a7658edf0a73","observation_id":"17a399d5-c3b3-4574-90ae-9e87fe0a46b0","resolution":{"observed_at":"2026-08-10T22:03:14.082993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-10T22:03:13.621400Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.621400Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:1fb5dc018da7f7e81af1862eb857b1b46c46adcf2b1821d566e9ae0f6aed73be","observation_id":"076a4e8c-9e4f-4c45-a651-b7bb78e3a649","resolution":{"observed_at":"2026-08-10T22:03:13.621400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.063793Z","title":"Vitmatte: Boosting image matting with pre- trained plain vision transformers","venue":null,"work_id":"db90ed7d-b266-4d14-95bf-2c2e2ea42773","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.625224Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:0c537089d32cc0818e7d13c6176e4a0fbfa508f78bc7ced291d26a245556a0f9","observation_id":"fa0a8843-2384-4d79-8045-fada524902e8","resolution":{"observed_at":"2026-08-10T22:03:14.068558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.047493Z","title":"Matte anything: Interactive natural image matting with seg- ment anything model","venue":null,"work_id":"858b5be3-2b49-4b06-96d1-3368b56b89f1","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.628305Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:7e9a9ae8f459421af2c73f4039bc7427f68a0753be69b5f9d02754e802f8d703","observation_id":"d579d974-74f6-4ba5-bc0f-7b745600b61c","resolution":{"observed_at":"2026-08-10T22:03:14.054262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-10T22:03:13.631543Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.631543Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:175d56e4f89c60c67c076ad3267c0c40a6099e8aa2ab5a0a116013ea58ddc9e8","observation_id":"85d6428e-d914-41d8-81b8-e38b830e588e","resolution":{"observed_at":"2026-08-10T22:03:13.631543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.034436Z","title":"Rgb ↔x: Image decomposition and synthesis using material-and lighting-aware diffusion models","venue":null,"work_id":"8460ebc7-c4d0-4705-be4b-bd257f984fec","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.635056Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:23874ef842bd400afc56889dd0a86be4aaad0f8247dbca6897a42dc9a9dbc1a9","observation_id":"1372ece5-a478-4521-9186-b3cd2980fe5c","resolution":{"observed_at":"2026-08-10T22:03:14.038519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-10T22:03:13.638542Z","title":"Show-1: Marrying pixel and latent dif- fusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.638542Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:13016898558192de68d59fc64dd8915199bcb1a8529756f7e4804a915e43bf79","observation_id":"0a911b25-bec6-4f3e-ae88-c69ad6e900f2","resolution":{"observed_at":"2026-08-10T22:03:13.638542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01827","last_updated":"2024-01-03T16:43:47Z","snapshot_observed_at":"2026-08-10T13:52:47.732203Z","submitted_at":"2024-01-03T16:43:47Z","title":"Moonshot: Towards Controllable Video Generation and Editing with Multimodal Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01827","snapshot_observed_at":"2026-08-10T22:03:13.641920Z","title":"Moonshot: To- wards controllable video generation and editing with multi- modal conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.641920Z"},"links":{"cited_paper":"/paper/2401.01827","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:6770431f69a2cccef2e2cc9bfdbd289c82854b764488fad201f39b988d1f10d0","observation_id":"51f06818-c4bc-4b66-a96d-abe6d9a07655","resolution":{"observed_at":"2026-08-10T22:03:13.641920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17113","last_updated":"2024-06-23T03:47:27Z","snapshot_observed_at":"2026-08-07T05:26:05.587260Z","submitted_at":"2024-02-27T01:19:53Z","title":"Transparent Image Layer Diffusion using Latent Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17113","snapshot_observed_at":"2026-08-10T22:03:13.645613Z","title":"Transparent image layer diffusion using latent transparency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.645613Z"},"links":{"cited_paper":"/paper/2402.17113","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:4441cf069da568acd3e781108306cc4223e4ad913546ec657a1f4ae485bc9424","observation_id":"4ea32c1b-ee0a-4ca0-94af-761e78d1a6d2","resolution":{"observed_at":"2026-08-10T22:03:13.645613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.020604Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"cfe9102d-48f4-4b39-ba91-24a77bbc0325","year":2024},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.648867Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:0c532ebf1112c5559b6103b077aac76af8fe106ee8e88e9825caec968b0008ad","observation_id":"d7f1cd08-dae3-42d8-b294-952a66ebaa54","resolution":{"observed_at":"2026-08-10T22:03:14.024905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:14.000513Z","title":"Long-short transformer: Efficient transformers for language and vision","venue":null,"work_id":"5f0ca751-2025-407b-914e-3e7845037981","year":2021},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.651954Z"},"links":{"citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:d7ed9583fc2d7f1831e8d2fcf19426b9e6ebe1a59cbafef6c78a578e3ae4c8dc","observation_id":"101c528c-8c6d-47fb-8c0a-7296197812fe","resolution":{"observed_at":"2026-08-10T22:03:14.007505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-05T18:04:01.030198Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-10T22:03:13.472136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:13.472136Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2501.03006"},"observation_digest":"sha256:f753ccb5cc3977523950045b4470a60b117c8851421e6a2a0583a3792315dc07","observation_id":"15c9ba3e-9780-4234-80b1-162c66cc75c6","resolution":{"observed_at":"2026-08-10T22:03:13.472136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.03006","last_updated":"2025-01-20T12:46:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:31:13.419151Z","submitted_at":"2025-01-06T13:32:16Z","title":"TransPixeler: Advancing Text-to-Video Generation with Transparency"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2501.03006."}