{"as_of":"2026-08-13T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd0794a5edfb4353b02d0c13510bda2ded9cbd1fb033984b3de832d6e1c07802","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:49:06.719292Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.16153/citation-record","integrity":"/paper/2412.16153/integrity","json":"/paper/2412.16153/citation-record.json","paper":"/paper/2412.16153"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-13T12:00:44.249968Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-11T10:49:06.451901Z","title":"Latent-shift: Latent diffu- sion with temporal shift for efficient text-to-video genera- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.451901Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:0e5238e517811446ad35b79fb83c64892985c4faf46eb3990f1fc56cb30980d6","observation_id":"5f8feaa9-cf3b-43e9-a30c-c2facc3da2bd","resolution":{"observed_at":"2026-08-11T10:49:06.451901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.458641Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.458641Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:a94f962f12a30f85a42a6f22c5863fd588bd76a52364cc699fd2d811468f2d85","observation_id":"da23cae8-7d2e-4b07-afec-6a12ae46f14f","resolution":{"observed_at":"2026-08-11T10:49:06.458641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T10:49:06.463622Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.463622Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:feed5df2e3148713651aa369695ebb0635d62454f2a97cba5b324b2154d7de30","observation_id":"74fbbf72-d4d4-4804-86e7-bebc7489e8c6","resolution":{"observed_at":"2026-08-11T10:49:06.463622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.469399Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.469399Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:409d2322e92078548a201b39ee0a4e4b03d7f42025360309ee8b97c17b51ba5c","observation_id":"b9e03d42-cbe0-4baf-a636-f1f8e651acf7","resolution":{"observed_at":"2026-08-11T10:49:06.469399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.474602Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.474602Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:1f6acb861577086bf25e3436554c3e26216c78da218ecafae75321912e7980a1","observation_id":"4bf75c4d-7f4b-4156-a00c-cea98946bcc6","resolution":{"observed_at":"2026-08-11T10:49:06.474602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.533398Z","title":"Animat- ing general image with large visual motion model","venue":null,"work_id":"84fadf92-be1b-4ad6-a4c5-7c0fc018956a","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.479805Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:d23c49b379a6e6b9593850283346178373f0d1963d987d06909c45442f05b2f5","observation_id":"bf199bd8-4545-4d3c-8709-440476e7bc59","resolution":{"observed_at":"2026-08-11T10:49:07.539067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-13T01:39:12.659510Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-11T10:49:06.484693Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.484693Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:635bac5f7278e3415b698e1c6ddff6d95ebd099b6e6c41a7b67d315d6a8e1a8a","observation_id":"32733eb9-4450-4ecb-b3f0-6df34be1be7f","resolution":{"observed_at":"2026-08-11T10:49:06.484693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.513982Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models, 2024","venue":null,"work_id":"0c46eeef-03cb-464e-b417-7148bcacae34","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.492435Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:ffee873472e766142286f2c57a1829b9b7468b1c15ee9c5db455fe4b0e9bfa8b","observation_id":"d54ab77c-b092-421e-a38a-7ca45abfbd3e","resolution":{"observed_at":"2026-08-11T10:49:07.519339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.486662Z","title":"Seine: Short-to-long video diffu- sion model for generative transition and prediction","venue":null,"work_id":"4713a428-9470-4b24-8346-b64bb9c37272","year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.497289Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:ab1ee8f7719ffd8fb40cc13ece1ad743088fd4dfcc5bd533a3145bfb1e9d975b","observation_id":"7bce2c6f-c0a6-4870-b07e-767fb72f33a2","resolution":{"observed_at":"2026-08-11T10:49:07.493575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.467042Z","title":"Livephoto: Real image animation with text-guided motion control","venue":null,"work_id":"221ba6e7-11b7-4daa-a4a8-8e0461aa6569","year":2025},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.503127Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:6d88789bd1859af16e83451646d59bbda316eacc268ecb2b7da2896b3076eb2f","observation_id":"17e117f3-301d-4a44-baff-cb78e7f84eef","resolution":{"observed_at":"2026-08-11T10:49:07.473555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-13T10:03:45.960823Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-11T10:49:06.508047Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.508047Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:3ea260b7deb07d28eee5a1be56c03ebc7a8135470304423bdf41dfa43cfe258a","observation_id":"f4ed73d5-72b2-471f-8811-223aa048cb00","resolution":{"observed_at":"2026-08-11T10:49:06.508047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.449810Z","title":"Animateanything: Fine- grained open domain image animation with motion guid- ance","venue":null,"work_id":"884a3e08-73f0-4927-a1f4-157a7f79f846","year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.513281Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:6ad3d3140ccb9a1b59e1e4661f3f432f07bfe3c6a2a766c4d056580ea4b34227","observation_id":"49397f0e-404f-4899-81a9-5da62a0eb0a4","resolution":{"observed_at":"2026-08-11T10:49:07.455046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01651","last_updated":"2024-01-23T15:31:17Z","snapshot_observed_at":"2026-08-13T04:49:40.865552Z","submitted_at":"2024-01-03T10:08:40Z","title":"AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01651","snapshot_observed_at":"2026-08-11T10:49:06.518012Z","title":"Aigcbench: Comprehensive evaluation of image-to-video content generated by ai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.518012Z"},"links":{"cited_paper":"/paper/2401.01651","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:4ff9e269e7e023716ea0da23761b613d1bb69f2100b61abd6ae65bf6f5ef21ad","observation_id":"0627cba8-ed4e-43c1-bd08-dc47d10d7ccb","resolution":{"observed_at":"2026-08-11T10:49:06.518012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.523213Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.523213Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:0734c800ba5c3702c8e0b6984790f87e029ca1725c8fcfa852a1f2629d0ebdac","observation_id":"88a32a85-c904-41fc-94e1-e40979e04783","resolution":{"observed_at":"2026-08-11T10:49:06.523213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.423371Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":"4a7c3427-09ec-4ff4-abd5-2263b849dea5","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.528000Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:35c5bd6d79bd2881ddb7ad3fd7a2191778d56fc8b55b21474c2a58eb297fb1b9","observation_id":"586eaac0-db1c-4445-b16a-69e6df17719f","resolution":{"observed_at":"2026-08-11T10:49:07.428994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.532316Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.532316Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:1ced31ff0525d517dbea7ccae20bbe754bc7694ee01b96616ac06be21d1f8390","observation_id":"7955499d-8107-4545-9870-6a393211c43b","resolution":{"observed_at":"2026-08-11T10:49:06.532316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.536820Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.536820Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:5200cbb39e7e5d01232625a90000a9a2519b3900b4d9688f889efcffc7b6e375","observation_id":"aa24b8f4-5bac-4bf0-8c80-dbabc9fbd52c","resolution":{"observed_at":"2026-08-11T10:49:06.536820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.541111Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.541111Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:14d43cc1dc84456e64316c7f8dfaebb3654263110c819b949048f23100ee5303","observation_id":"560fb056-dcc2-4556-998d-8a1405e52b7e","resolution":{"observed_at":"2026-08-11T10:49:06.541111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.369892Z","title":"Make it move: Controllable image-to-video generation with text descrip- tions","venue":null,"work_id":"859625cf-2aea-41ad-b93e-41b8548d6614","year":2022},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.545065Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:80c038e9d974a8287c98774728d605835b2dd772a1b1ab428e300a0d87408b68","observation_id":"d04e818a-69d6-49fa-9824-370b937f0d58","resolution":{"observed_at":"2026-08-11T10:49:07.375401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.352787Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"1c25b2cc-8fc3-4128-b0f1-21e7daeb7df7","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.549104Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:f11cc3abedc02bfe6c8a1368482a745817b75b70a4b6a9c0540657274808bcd3","observation_id":"12675c13-be6a-4cb3-bc47-a716c29613bf","resolution":{"observed_at":"2026-08-11T10:49:07.358045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.336452Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"5b294f97-d4a0-45a4-b24a-2dbf6bea3bb2","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.553667Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:ed35c974137c561ef632d041c6cedc4b81e0539303d65611a5e2c49ef45b9f31","observation_id":"198c63aa-93f9-469f-a78b-ad352445e59b","resolution":{"observed_at":"2026-08-11T10:49:07.341698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-08-13T10:22:42.616019Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-11T10:49:06.558534Z","title":"Videogen: A reference-guided latent diffusion ap- proach for high definition text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.558534Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:89616f2f1db269de5f0e8ecbab058fa08bac2f38353fae505b8472f49db010c1","observation_id":"c1e73ecd-7829-48da-bb5b-4573dde9b8d0","resolution":{"observed_at":"2026-08-11T10:49:06.558534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.319071Z","title":"Physgen: Rigid-body physics-grounded image- to-video generation","venue":null,"work_id":"4b78323f-c479-484e-850b-d60d0407f3c5","year":2025},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.563595Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:817b2d4eb01594ce312f7ec2da472c9ee7f0bf1ec55bce42eea059bee20da36e","observation_id":"343e7d14-1382-4eb7-a5b8-5cf077a2a8b9","resolution":{"observed_at":"2026-08-11T10:49:07.324414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.567962Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.567962Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:c6ffb8d50d0e7ce75486d2e482a384c8b7e50bba673be9974f431b8134d9205c","observation_id":"ffc46977-a43e-49ae-a806-a95416d3611a","resolution":{"observed_at":"2026-08-11T10:49:06.567962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15642","last_updated":"2024-07-23T01:35:07Z","snapshot_observed_at":"2026-08-12T23:17:19.128162Z","submitted_at":"2024-07-22T14:00:03Z","title":"Cinemo: Consistent and Controllable Image Animation with Motion Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15642","snapshot_observed_at":"2026-08-11T10:49:06.573171Z","title":"Cinemo: Consis- tent and controllable image animation with motion diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.573171Z"},"links":{"cited_paper":"/paper/2407.15642","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:41115e5497e655557293c45416693d3e77c412972eed7708d2992652bead1ed4","observation_id":"a7fca664-894b-4a25-8566-d6cff4a41ead","resolution":{"observed_at":"2026-08-11T10:49:06.573171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-08-13T00:55:30.008354Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-08-11T10:49:06.578398Z","title":"Follow-your-click: Open- domain regional image animation via short prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.578398Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:7027b6138d588dbcb6c54502b3a9145fc9b5699f6ad2fb5523d891886a7ab896","observation_id":"75213b1f-7a3a-41b8-b899-4ea7df769d5f","resolution":{"observed_at":"2026-08-11T10:49:06.578398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.290150Z","title":"Sync-draw: Automatic video generation using deep recurrent attentive architectures","venue":null,"work_id":"5cdee42f-5b38-4968-aa15-a4918cba5d1d","year":2017},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.583317Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:cbe84295829003e63ada1a2be0af54cc87bd70cac8ffdda23921a500ce4f4e08","observation_id":"5c4a0bb4-37e9-4cd9-b919-a87fdd65bcee","resolution":{"observed_at":"2026-08-11T10:49:07.295710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.272846Z","title":"Ti2v-zero: Zero-shot image condition- ing for text-to-video diffusion models","venue":null,"work_id":"7baaef5b-f178-4c68-ae72-e033c53e87c6","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.588321Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:10548a5abe80bd833534025c01dfc34f451548af338d01394e7d1cec6006fd33","observation_id":"ce76bf80-9736-453e-bc6a-cf06adfcfbb1","resolution":{"observed_at":"2026-08-11T10:49:07.277813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.593227Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.593227Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:2f2fe5a60544071115b129eae4d246aa403d13df6f91784f3edb7dff3c3d887c","observation_id":"1ee9b71f-6541-4f7d-b6e0-ea914530cfaf","resolution":{"observed_at":"2026-08-11T10:49:06.593227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-13T11:35:08.107504Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T10:49:06.598188Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.598188Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:a9c1b53c0c546aa70536acaaca0dec463a7c7d670709d9abfb8381bdcd42fcfc","observation_id":"3b34f342-e379-4337-8539-e45aa07638f1","resolution":{"observed_at":"2026-08-11T10:49:06.598188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.603898Z","title":"Hier- archical spatio-temporal decoupling for text-to-video gener- ation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.603898Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:32382593b7d4c8f65ca8d2ac74e19719d3c5885fb71f46ce79edd42aa560f667","observation_id":"0c3b48a3-4cec-4060-935e-db410c87f3c0","resolution":{"observed_at":"2026-08-11T10:49:06.603898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T10:49:06.609625Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.609625Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:b6e759aefc3d5473ed9ae10cd3cb9ed9b1e5da23ad776d2660c081579f90645b","observation_id":"456fba28-d5e7-40d7-a7c2-35b61bdecc12","resolution":{"observed_at":"2026-08-11T10:49:06.609625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-13T07:42:03.088843Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-11T10:49:06.615135Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.615135Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:8af660422d2b8d723c42118e5ab9a749407f3b380926a0213d445867a559cf63","observation_id":"1851ffcd-1ad3-4806-8e0e-b75bdf7dc961","resolution":{"observed_at":"2026-08-11T10:49:06.615135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.620722Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.620722Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:f678beb76631b1c8c76c287b65faafcda3c09275e4633bd36a1894eced407e1a","observation_id":"c855f6b7-85a3-4d4b-944e-4428cd9f4637","resolution":{"observed_at":"2026-08-11T10:49:06.620722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.625570Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.625570Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:f8aa74bba0bcea04e07f2603538932b5c1e62e6f08e9b0f1dd58fcaee429e63d","observation_id":"95ab1552-a16b-4c80-b701-d3549cbb9a92","resolution":{"observed_at":"2026-08-11T10:49:06.625570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-11T10:49:06.630409Z","title":"Progressive distillation for fast sampling of diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.630409Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:df53e66bf82f700d26bc02251c23634eecafb06e98b44cb706c338b65e4bc495","observation_id":"fb6607c7-825f-4d07-9c73-fb26afa6bdc2","resolution":{"observed_at":"2026-08-11T10:49:06.630409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T10:49:06.635388Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.635388Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:a1014a7649182dfb978846f2277b8afe83cbd6d9694d1a9fac99d86f46d88f9e","observation_id":"d27b60d5-83a2-431d-9a44-6b2ee793c7d2","resolution":{"observed_at":"2026-08-11T10:49:06.635388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.640425Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.640425Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:fccc4d57408ff5af09d5f64476a4236bfbf245d3f6594bbf8e183be780325f84","observation_id":"da056e74-be47-4220-b25d-961c3f577954","resolution":{"observed_at":"2026-08-11T10:49:06.640425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.645239Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.645239Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:77df645c931f5e4b9d88c971125828384de49d8747ff0a833a8d08927351bbcd","observation_id":"c621ec9d-17c4-485e-9852-666146dbef3d","resolution":{"observed_at":"2026-08-11T10:49:06.645239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-11T10:49:06.649998Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.649998Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:32396701d87dfbeac1ed16096b68ab8fd81090d19d1fb70c36250b38a9121ec6","observation_id":"5466c700-6529-41f7-b510-725dfd94d289","resolution":{"observed_at":"2026-08-11T10:49:06.649998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-12T17:34:19.526460Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-11T10:49:06.654412Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.654412Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:bb2ce43ce57caa1063082b2ebf53be362f5bccdf4cb0465ae0d4bb2c294c6a23","observation_id":"4618c896-8899-46b6-a223-673af3e2432e","resolution":{"observed_at":"2026-08-11T10:49:06.654412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.659181Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.659181Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:8fb834c9d96a059f3a682e534a6503a5f54359f7af9407557909c8aacda4af2d","observation_id":"9b8b7f74-b3ab-44d4-bd90-2016e500b1f2","resolution":{"observed_at":"2026-08-11T10:49:06.659181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.182443Z","title":"Microcinema: A divide-and- conquer approach for text-to-video generation","venue":null,"work_id":"2625b7c3-f4bf-4598-a04a-1d8e0be4b8af","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.663915Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:2495d9fa21dacd266224598f004de726cbcc3f00e2a02a2eacee5a438b117389","observation_id":"78a763d8-6539-4f4b-a808-3efc8e5682ad","resolution":{"observed_at":"2026-08-11T10:49:07.187114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.668128Z","title":"Dreamvideo: Composing your dream videos with customized subject and motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.668128Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:ecc0afe8e2e83edcab16e0852e20212643517b68a39173fc22361fb66c8e7845","observation_id":"44c9d339-6e15-4eaf-b087-3df805681924","resolution":{"observed_at":"2026-08-11T10:49:06.668128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:06.672568Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.672568Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:a1c5b5bc2b660afb7ccda8c74e5168e60a24bf1977ee8bbaeb803a54a6798a19","observation_id":"3f8302a7-dfa1-4c62-8f72-61e94fd9df06","resolution":{"observed_at":"2026-08-11T10:49:06.672568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.143884Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"41b4df08-2398-467b-888b-29674f145b37","year":2025},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.677016Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:17ccab1d6d5d2f8d2f88e4daa35f4d60a328e6e90af2211d3385ccf7d0090d46","observation_id":"0ceb8851-790f-4283-8b4a-c5c16195bb4b","resolution":{"observed_at":"2026-08-11T10:49:07.149060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.126377Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"d463461c-78e0-4aff-9d46-94cf60a7eecd","year":2016},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.681700Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:a90d35d2b38a19a60d174209d718f7ffd625693d22aedfc6020c7cb59ecb7c52","observation_id":"07a1458d-3778-4676-8bc7-48a26c7abdd2","resolution":{"observed_at":"2026-08-11T10:49:07.131692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18827","last_updated":"2023-11-30T18:59:06Z","snapshot_observed_at":"2026-08-13T05:12:58.834430Z","submitted_at":"2023-11-30T18:59:06Z","title":"Motion-Conditioned Image Animation for Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18827","snapshot_observed_at":"2026-08-11T10:49:06.686047Z","title":"Motion-conditioned image animation for video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.686047Z"},"links":{"cited_paper":"/paper/2311.18827","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:2f1f5fbe3b5e53fc37dee1da35bf850060dd25fc95552ae737d07bd930da6ad6","observation_id":"5cb96f43-0e99-4955-a58a-98b8842049d8","resolution":{"observed_at":"2026-08-11T10:49:06.686047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.107713Z","title":"Zero-shot controllable image-to-video animation via motion decomposition","venue":null,"work_id":"8ff7129b-b04d-4e2a-b355-2f0ef7c71d93","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.691065Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:d2ed4e6ee71eca02ef14efd66e2f8bd2eb3821eac2c6197210fc08aac55313a5","observation_id":"f3641f0b-fa18-4d10-9283-0702a1bc8f2c","resolution":{"observed_at":"2026-08-11T10:49:07.113704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-11T10:49:06.696189Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.696189Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:db9b399ae5d3d6bfe02f2be646aa9a9cd62674b4e918da2734b944801949f0dd","observation_id":"f28483e1-c41b-4d32-a134-fc6d89f71144","resolution":{"observed_at":"2026-08-11T10:49:06.696189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:07.088575Z","title":"Pia: Your personalized image animator via plug-and-play modules in text-to-image models","venue":null,"work_id":"745b3751-63f0-406c-94b4-53ea4bb31a2d","year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.701883Z"},"links":{"citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:ef793e9910abbf465b12c82f754633525ba2eb1230faf4955d16427304ad9547","observation_id":"168f8b80-745a-4b15-995b-140bdf2a3a62","resolution":{"observed_at":"2026-08-11T10:49:07.095893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21408","last_updated":"2024-12-26T03:21:00Z","snapshot_observed_at":"2026-08-12T23:11:25.018112Z","submitted_at":"2024-07-31T07:54:26Z","title":"Benchmarking Multi-dimensional AIGC Video Quality Assessment: A Dataset and Unified Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21408","snapshot_observed_at":"2026-08-11T10:49:06.709009Z","title":"Benchmarking aigc video quality as- sessment: A dataset and unified model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.709009Z"},"links":{"cited_paper":"/paper/2407.21408","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:fb0f3dfe412d472e1ce5c3454165883fcfb70dd7296c22fbf9421e9ca6723009","observation_id":"0f481d93-ab49-4145-9808-ea9fe352c893","resolution":{"observed_at":"2026-08-11T10:49:06.709009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15735","last_updated":"2024-11-06T03:53:13Z","snapshot_observed_at":"2026-08-13T06:36:13.419891Z","submitted_at":"2024-06-22T04:56:16Z","title":"Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15735","snapshot_observed_at":"2026-08-11T10:49:06.714131Z","title":"Identifying and solving con- ditional image leakage in image-to-video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.714131Z"},"links":{"cited_paper":"/paper/2406.15735","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:8562a64dd1ae9026b2fcef5b5f7e5669ab64958279a5d709673b43d3cacb377d","observation_id":"e25f6935-7bbd-4cc5-abc3-6af1b4c76252","resolution":{"observed_at":"2026-08-11T10:49:06.714131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T10:49:06.719292Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:06.719292Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.16153"},"observation_digest":"sha256:e1dddb2e70385b03f4adbe4c74849b05e0a1a28da48bf125d04cb244551a8e90","observation_id":"2672eec0-28a5-49b0-943f-c08c0e4192e4","resolution":{"observed_at":"2026-08-11T10:49:06.719292Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16153","last_updated":"2025-03-23T00:30:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:52:27.194201Z","submitted_at":"2024-12-20T18:57:06Z","title":"MotiF: Making Text Count in Image Animation with Motion Focal Loss"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2412.16153."}