{"as_of":"2026-08-09T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d7faf181df80e51266027656037f79ad0ee46bbd84d635a487c1c5af38f2df2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:59:36.479084Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:49:42.422443Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T17:51:41.947939Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2504.17816"},"observation_digest":"sha256:1d5216c9e46bead3c0f7fe0ed3d3ddd9af0eff0ec02923acf2f6eba029067251","observation_id":"157cdf74-9c98-48e7-9520-9f6312c91447","resolution":{"observed_at":"2026-05-22T17:51:54.418911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T18:17:45.123690Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2505.20275"},"observation_digest":"sha256:1e51819bac425ad8b919e6781cc6f326fd6db37c78600e69b0ef713d65192583","observation_id":"a0f306ac-9e16-44a7-9521-3256679dafe1","resolution":{"observed_at":"2026-05-12T18:17:45.442169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-07T13:59:36.479084Z","title":"Identity-preserving text-to-video generation by frequency decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:36.479084Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2505.20292"},"observation_digest":"sha256:708f348b8e11d5e753736e4d1aa5aab71f8d4b5f22f701596ae473ce75bcebe5","observation_id":"ab3fa46f-dd86-49fc-afe4-7e1a6d1947b2","resolution":{"observed_at":"2026-08-07T13:59:36.479084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T17:34:26.951644Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.03147"},"observation_digest":"sha256:7b2e6a6ac7ea1bed40accce8b1d6cd6033f94ce8bf51421ceb7edd5f26990bf5","observation_id":"46a1ad32-721b-48e2-a3d0-d42d1fac1549","resolution":{"observed_at":"2026-05-12T17:34:27.070137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-07T10:51:42.872478Z","title":"Identity-preserving text-to-video generation by frequency decomposition.arXiv preprint arXiv:2411.17440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-08-08T15:17:23.629862Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:51:42.872478Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.04216"},"observation_digest":"sha256:b5ec88c268c9cb4208de3b73aba821f662634af3f2a3efbf67d1aeb9a2fd8ad2","observation_id":"aaadd1b3-ad36-4399-88df-ec3aae29cbb2","resolution":{"observed_at":"2026-08-07T10:51:42.872478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-07T10:43:26.982019Z","title":"Identity-preserving text-to-video generation by frequency decomposition.arXiv preprint arXiv:2411.17440, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04590","last_updated":"2025-06-05T03:11:48Z","snapshot_observed_at":"2026-08-08T12:28:30.144231Z","submitted_at":"2025-06-05T03:11:48Z","title":"Follow-Your-Creation: Empowering 4D Creation through Video Inpainting","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T10:43:26.982019Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.04590"},"observation_digest":"sha256:a7c956251a17663037db4136115e0b4344ad727cd43a0c4bfbc26f4247ece8b9","observation_id":"fef7acec-22d0-4247-bda7-769ee6ae4dbd","resolution":{"observed_at":"2026-08-07T10:43:26.982019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-07T05:30:33.052194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07848","last_updated":"2025-06-09T15:11:09Z","snapshot_observed_at":"2026-08-08T19:43:46.912375Z","submitted_at":"2025-06-09T15:11:09Z","title":"PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:30:33.052194Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.07848"},"observation_digest":"sha256:1888004c9bfd4549672cb8bd0426540fb027bde310b5cc869fde5791e40533e9","observation_id":"c3761732-b039-47c0-a26f-1e59f3b149d6","resolution":{"observed_at":"2026-08-07T05:30:33.052194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-07T04:27:39.711058Z","title":"Identity-preserving text-to-video genera- tion by frequency decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:39.711058Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.10568"},"observation_digest":"sha256:f161992cb4219855ecd3df00c08758e4129e4f675ace69c9f02f36e89a3c4513","observation_id":"241d36e5-0297-4afd-97b0-cd103d00fd43","resolution":{"observed_at":"2026-08-07T04:27:39.711058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-19T07:59:49.398271Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2506.23690"},"observation_digest":"sha256:acfd6f5e29c89e8b0be870aede651d6372348bd7f3daf69ed5f7727c89e54312","observation_id":"75be7455-bf0e-4288-ad58-2f692377874b","resolution":{"observed_at":"2026-05-19T08:02:10.514105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-06T19:19:32.838413Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05963","last_updated":"2025-07-09T07:01:34Z","snapshot_observed_at":"2026-08-08T15:17:23.406292Z","submitted_at":"2025-07-08T13:11:40Z","title":"Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:19:32.838413Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2507.05963"},"observation_digest":"sha256:5cf5c273e88d092f8c28db13f6cdcb661cf42040618c11989db53d3f47e1f4c4","observation_id":"9a45fe12-994c-4630-b9ce-94e3317f18ec","resolution":{"observed_at":"2026-08-06T19:19:32.838413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-08-06T04:44:59.127465Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03032","last_updated":"2025-08-05T03:18:04Z","snapshot_observed_at":"2026-08-09T09:40:34.807846Z","submitted_at":"2025-08-05T03:18:04Z","title":"A Summer Meridional Subsurface Temperature Dipole Mode in the South China Sea","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T04:44:59.127465Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2508.03032"},"observation_digest":"sha256:bbeb39a444adf5ea323658a50a3bb9adb7a07d01f30708f587e908f814f6caf0","observation_id":"368fc191-8da6-4ce5-9ed0-67e9b7be3445","resolution":{"observed_at":"2026-08-06T04:44:59.127465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":196,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:a56a37fcfcdeec9f37460a346fa797a9521ea3f2e514117a0c63c52043e43f3e","observation_id":"1d4434e8-b090-4277-b226-97d0e06fddcc","resolution":{"observed_at":"2026-05-11T00:05:51.584551Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:3ffc8f8df0ff89343f0ed97a55ec010e98376c895ee907f9718f7fd60e930d59","observation_id":"0975307d-bb4c-460d-ae3a-0e738b08c3fc","resolution":{"observed_at":"2026-05-11T11:11:03.483661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2605.13857","last_updated":"2026-04-08T15:42:16Z","snapshot_observed_at":"2026-08-02T10:03:28.923794Z","submitted_at":"2026-04-08T15:42:16Z","title":"MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T06:53:13.152677Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2605.13857"},"observation_digest":"sha256:9c458b5e00191782289f9fd7e24fce5f840ae357bba62f217a466fc0816509eb","observation_id":"609aa3f1-5b4b-42f1-a784-2f903f394879","resolution":{"observed_at":"2026-05-15T06:55:10.368181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2605.15684","last_updated":"2026-05-15T07:13:27Z","snapshot_observed_at":"2026-08-02T22:46:51.504070Z","submitted_at":"2026-05-15T07:13:27Z","title":"ElasticDiT: Efficient Diffusion Transformers via Elastic Architecture and Sparse Attention for High-Resolution Image Generation on Mobile Devices","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-20T20:00:27.987481Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2605.15684"},"observation_digest":"sha256:a3b6de7b62f50a850df0274c161cee098b89868a09eec2848fe7570ae63ff4c8","observation_id":"beaaa26e-a4a8-4af6-88e3-1f09932a983f","resolution":{"observed_at":"2026-05-20T20:03:43.795138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2606.06903","last_updated":"2026-06-05T04:39:46Z","snapshot_observed_at":"2026-07-31T19:00:00.712245Z","submitted_at":"2026-06-05T04:39:46Z","title":"Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T22:41:06.600948Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2606.06903"},"observation_digest":"sha256:429c2cda0669f96abac72be7b579487fc47a9997991054b4b72db7de2a828252","observation_id":"22a7e0d9-e635-464f-ba6d-a50f53319213","resolution":{"observed_at":"2026-07-02T16:27:09.308647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2606.11783","last_updated":"2026-06-10T08:15:52Z","snapshot_observed_at":"2026-07-06T23:50:49.040880Z","submitted_at":"2026-06-10T08:15:52Z","title":"A Comprehensive Ecosystem for Open-Domain Customized Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T10:06:33.572182Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2606.11783"},"observation_digest":"sha256:2e9a55bea049beb536b0b65f62d726dfe36c13494e6df4b92443e2f72a78781b","observation_id":"5a9005f6-bf64-40aa-a5a7-0e02b26ee519","resolution":{"observed_at":"2026-07-03T10:17:57.902889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:9d764c8ec6999acd7d8c77d510d4a631f661af0ab646d2e3b0a5f0f5c47ef14e","observation_id":"2819a73a-0c3c-428b-8e6b-a5cfa6e6ec2d","resolution":{"observed_at":"2026-07-04T08:49:42.423833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17440/citation-record","integrity":"/paper/2411.17440/integrity","json":"/paper/2411.17440/citation-record.json","paper":"/paper/2411.17440"},"outbound":[],"paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2411.17440."}