{"as_of":"2026-08-16T14:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7e60bbe5b6695822b336b01fc798b322ea37ab6b25dcabac7cfc9a78e53a13f","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:01:57.121114Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:19:17.425943Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:05:51.755490Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03059","snapshot_observed_at":"2026-08-07T05:19:17.425943Z","title":"Yariv, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08279","last_updated":"2025-06-09T22:56:02Z","snapshot_observed_at":"2026-08-13T21:16:10.045588Z","submitted_at":"2025-06-09T22:56:02Z","title":"Seeing Voices: Generating A-Roll Video from Audio with Mirage","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:17.425943Z"},"links":{"cited_paper":"/paper/2501.03059","citing_paper":"/paper/2506.08279"},"observation_digest":"sha256:bd79aa0586c4de83647d9e16f01629cb4629bb2deac89030f84a2ac4336d3c35","observation_id":"988a81d2-fcf8-43f8-b760-b76e2c8df26f","resolution":{"observed_at":"2026-08-07T05:19:17.425943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2501.03059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03059","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Through-the-mask: Mask-based 23 motion trajectories for image-to-video generation","venue":null,"work_id":"8e4a2904-0b5f-48da-813e-9c5e4b409f1a","year":2025},"citing_paper":{"arxiv_id":"2604.06339","last_updated":"2026-04-07T18:17:05Z","snapshot_observed_at":"2026-08-16T06:51:21.904839Z","submitted_at":"2026-04-07T18:17:05Z","title":"Evolution of Video Generative Foundations","version":1},"reference_index":227,"source":"pdf_text","source_observed_at":"2026-05-10T18:41:38.616611Z"},"links":{"cited_paper":"/paper/2501.03059","citing_paper":"/paper/2604.06339"},"observation_digest":"sha256:4c0ae143d39c3f82ef2daf7a7920b2932a7970842d5be9a16eed50e581f5eb4c","observation_id":"22e46e91-26c5-42ff-a16e-a8bcfdf52b99","resolution":{"observed_at":"2026-05-11T00:05:51.761473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.03059/citation-record","integrity":"/paper/2501.03059/integrity","json":"/paper/2501.03059/citation-record.json","paper":"/paper/2501.03059"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-10T22:01:56.903581Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.903581Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:4c408d6b16990875e369d7396afadc178d9713e58251a72b023fb0be7428a616","observation_id":"a79eec42-9284-4ab7-b538-b06d8183c268","resolution":{"observed_at":"2026-08-10T22:01:56.903581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-16T13:42:39.824884Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-10T22:01:56.908137Z","title":"Latent-shift: Latent diffu- sion with temporal shift for efficient text-to-video genera- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.908137Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:8530330b634769d88183208e33c5dd9567a111fe3993a6eba7b3f567740be35d","observation_id":"53b577ea-56c4-4119-b4a2-dea4fddab751","resolution":{"observed_at":"2026-08-10T22:01:56.908137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.756588Z","title":"Spatext: Spatio-textual representation for con- trollable image generation","venue":null,"work_id":"7fa62b22-3a58-4734-b98f-243bdbeeceb8","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.912145Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:fad784f106eed6309d960a243da8047f30178c0e3b1bc07440b7c738321f8a56","observation_id":"026bdaca-e3e6-419f-bedd-d90ba08bcb12","resolution":{"observed_at":"2026-08-10T22:01:57.762151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.916116Z","title":"Improving image generation with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.916116Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:386c600d5726c07591d0664ec8f5329c49321559415cab9524186eed9601dd3f","observation_id":"6545e6c9-05f6-45cc-b5ff-d5e1d6aec3b7","resolution":{"observed_at":"2026-08-10T22:01:56.916116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.735409Z","title":"Understanding object dynamics for in- teractive image-to-video synthesis","venue":null,"work_id":"66811d07-8c93-4290-98dd-474798db9396","year":2021},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.919447Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:91da17699b012386b5b65bca1918e79f76b5da44e200a37c33d593921439f7fa","observation_id":"1e61b7d5-daca-40de-a087-2c92a7c4e001","resolution":{"observed_at":"2026-08-10T22:01:57.739754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.922872Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.922872Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:2e5b7512abe566ba99ab501c7e63c50cfcb945cea9cd004cf7ec52290ed7d744","observation_id":"3068459e-e59b-4a28-883a-7bf4ccd5a9f3","resolution":{"observed_at":"2026-08-10T22:01:56.922872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.926465Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.926465Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:f1b9d851f17c8ed0d3e12657a99aa622171fc311adbb4df72f3ecfd3132de805","observation_id":"bb540953-09a0-4a6d-9f82-963835373585","resolution":{"observed_at":"2026-08-10T22:01:56.926465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.705260Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"91f5d350-5358-4543-9c96-e4f53e6fb784","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.930307Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:36219152d4dd380fa217f5d4d0ccf56c56900bfe952b919c648903447d494b40","observation_id":"b4d8372c-59c9-43c0-89a9-54498e30b8bd","resolution":{"observed_at":"2026-08-10T22:01:57.710141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.691979Z","title":"Videocrafter1: Open diffusion models for high-quality video generation, 2023","venue":null,"work_id":"39de2090-7e26-4308-8d32-27033ab5067a","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.933896Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:ce6f1b988f2691fde76a69cc6eceb2760dd9fc65374a8f24f91bf816601206ce","observation_id":"d176fb41-f0cb-4dae-bb5b-44aed1de8e5c","resolution":{"observed_at":"2026-08-10T22:01:57.696417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.679009Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models","venue":null,"work_id":"99245d71-b7a7-4721-8888-9939ca0109a3","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.937556Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:81521d64473dedf3df667777ca434bc7d75e3f0c94e19af1dd70238f9a00866b","observation_id":"d4752850-775e-48dd-b57c-61b559bcec21","resolution":{"observed_at":"2026-08-10T22:01:57.683744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-15T07:12:45.000333Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-10T22:01:56.941099Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.941099Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:3a701c4ab7f3eb4ee4471d7f5c8ae9e042132b4b33036368af87fa745ac76ec9","observation_id":"59486bbc-3e52-4d5f-8ad1-798f0469ce3d","resolution":{"observed_at":"2026-08-10T22:01:56.941099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.658507Z","title":"Animateanything: Fine- grained open domain image animation with motion guid- ance, 2023","venue":null,"work_id":"a4f04313-8ac3-4f01-8a6f-e3b2dce0b1a1","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.944984Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:4ccd87f43f643830cdd70ac16098e19699fb815b249102f767e681dd50f3bb31","observation_id":"241d01f1-fc55-4112-b15e-f50fd3eb7c06","resolution":{"observed_at":"2026-08-10T22:01:57.667603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.648037Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"7b43b7a1-610e-4bec-a540-4e2b4b0d977f","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.948143Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:82c2fd1130a07628744da28573646018011b396bf491a1f38eb9b060c697f423","observation_id":"339b29cf-d819-4082-a1ad-ba821192fe25","resolution":{"observed_at":"2026-08-10T22:01:57.651638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.637219Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":"50784d3a-f4d5-4872-8194-0dc12b3f6f98","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.951413Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:e6eef1b7af0ece6cacf489df4bd3829a0bb6a45e912c56fe14ce9b53f7ac100e","observation_id":"cf8d510e-3057-4111-bc9d-7b91f7cf6eda","resolution":{"observed_at":"2026-08-10T22:01:57.641005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.954856Z","title":"Preserve your own correlation: A noise prior for video diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.954856Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:c5a9af7cb163e0bc204099317bc0a684f9a22389189ad727965193068daa1686","observation_id":"4e319397-44a7-4626-88ff-29f3d1e94af5","resolution":{"observed_at":"2026-08-10T22:01:56.954856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-13T05:22:58.925946Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-10T22:01:56.958288Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.958288Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:94886f64f7dc717d6c7bcd499136eb723a4e640f409832faea88c82be0e00196","observation_id":"f1465803-95ba-4758-900e-5490b1021b54","resolution":{"observed_at":"2026-08-10T22:01:56.958288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.618858Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning, 2024","venue":null,"work_id":"493cf22a-f601-43e4-923f-2db2785a7513","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.961966Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:2fb4548cd67ec553128df6d0209c90970ca7a79383167a1627b80f26c2f6b377","observation_id":"6f791340-10ec-4842-ab9f-a80fa5685c64","resolution":{"observed_at":"2026-08-10T22:01:57.623359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-10T22:01:56.965670Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.965670Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:5117b41cdd99ba36140e3cdfaa6a6b0350bb147f37c7d7cb4e8dd06e6b47797f","observation_id":"794d29f6-db4c-4e8d-b549-c34e33193d3d","resolution":{"observed_at":"2026-08-10T22:01:56.965670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T22:01:56.969711Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.969711Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:ad5a9ba530472ac3979d8306151e18a24ada4f684823d7a6ece15ac2af61e141","observation_id":"59eca75f-cf40-44da-8858-40a590a90645","resolution":{"observed_at":"2026-08-10T22:01:56.969711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.973238Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.973238Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:deee971952610b70134feae48f554a42040d21f6e7439fa02e22e2d24b912e89","observation_id":"43a9cf77-7e3b-4d9c-ae18-32865dfe6879","resolution":{"observed_at":"2026-08-10T22:01:56.973238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-10T22:01:56.976611Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.976611Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:3e69d30d3c9590d5386290d8be8f6e11d472c76d30b7ffc2f81712f9be2959b5","observation_id":"35d94a97-3fac-43a3-b083-25da50e759fe","resolution":{"observed_at":"2026-08-10T22:01:56.976611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.980424Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.980424Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:6c83ab0b66378d8352c9e98ca34e288fa5b9ddd57e356ca27081b168fe7c4b73","observation_id":"6bb44c0d-11ac-497a-b775-f095f605d541","resolution":{"observed_at":"2026-08-10T22:01:56.980424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-10T22:01:56.983661Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.983661Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:7da692f379a7bfa31c84db09cf056a70eb4074177772f500262e417c3068a54b","observation_id":"8bf0d250-e71a-4f02-91e9-a6dde78bcb7c","resolution":{"observed_at":"2026-08-10T22:01:56.983661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-08-15T08:09:50.412448Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-10T22:01:56.986615Z","title":"Videogen: A reference-guided latent diffusion ap- proach for high definition text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.986615Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:46d6447cd8b66465b79d03143234c8667504164585c98be29089ad804b2821bd","observation_id":"1e2dcf34-dc34-409c-9fd3-2beb71745ce1","resolution":{"observed_at":"2026-08-10T22:01:56.986615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.595494Z","title":"Gligen: Open-set grounded text-to-image generation, 2023","venue":null,"work_id":"747d02bd-f494-44fd-914b-bff7ba7dbb62","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.989461Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:9448593bebd919788c0ea23d7c1e971768e2e19cc1614d7bdff4cbb69e36d241","observation_id":"fd5142c5-1752-4337-8487-7e606761e9d2","resolution":{"observed_at":"2026-08-10T22:01:57.599310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.582499Z","title":"Common diffusion noise schedules and sample steps are flawed, 2024","venue":null,"work_id":"2b71e788-9daf-44b8-a1c9-7f5530e91a41","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.992375Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:d970b74a857ba938fbb688e3483f83ea327b2149570ea81407c90d7e335798c5","observation_id":"ba225d87-1e3a-4e6f-bf43-f36c23d0f811","resolution":{"observed_at":"2026-08-10T22:01:57.587743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:56.995450Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.995450Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:f4dda4d193b5bc4922fb60b9a8755e42f1ec3781a79075fbd7f0dd700a4c0a57","observation_id":"b4a4f9be-6999-4bef-8900-5f709a9707fd","resolution":{"observed_at":"2026-08-10T22:01:56.995450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14577","last_updated":"2022-09-29T06:37:26Z","snapshot_observed_at":"2026-08-14T20:34:51.960761Z","submitted_at":"2022-09-29T06:37:26Z","title":"Rectified Flow: A Marginal Preserving Approach to Optimal Transport","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14577","snapshot_observed_at":"2026-08-10T22:01:56.998298Z","title":"Rectified flow: A marginal preserving approach to optimal transport","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:56.998298Z"},"links":{"cited_paper":"/paper/2209.14577","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:b68dc3b563ad2debb2f67ef1dc6ff3d75c29e4e797d6c89d6a9b1acb61370fe1","observation_id":"465be81b-491b-4b76-a33d-52988a93c56e","resolution":{"observed_at":"2026-08-10T22:01:56.998298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.001678Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.001678Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:01c4c20d8ab81052e2f64585b79b72e49e77ec6c5d0293b9d407150a895bb236","observation_id":"26e1a02e-49a8-4d0f-a258-a86e57f40f0b","resolution":{"observed_at":"2026-08-10T22:01:57.001678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.559568Z","title":"Cinemo: Consis- tent and controllable image animation with motion diffusion models, 2024","venue":null,"work_id":"28ebce1b-2b13-402c-9e3c-7dfb9f34b9e4","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.004917Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:670c41d79b109d8d606d18553408dc0a1d250b878848560de2ab0b91462892cc","observation_id":"1c944c83-5a2c-4b2b-ba12-af961d62b9c7","resolution":{"observed_at":"2026-08-10T22:01:57.563305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-10T22:01:57.009271Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.009271Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:4450925ceed608f0b1772d83675c38208ec06edbbc9f68629f7579b9995582eb","observation_id":"2b2397d9-42a8-460d-a8d7-1570d3ddb895","resolution":{"observed_at":"2026-08-10T22:01:57.009271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.549135Z","title":"Snap video: Scaled spatiotemporal transformers for text-to-video synthesis","venue":null,"work_id":"c1d72579-b459-40ce-a8af-d21e902569e9","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.013032Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:685146171ff5fa0be71a8dcbe5122436bd670f93cc4e5b2df6571f15230d1f33","observation_id":"2e2167d8-cb15-4b8d-954a-04158ab401ab","resolution":{"observed_at":"2026-08-10T22:01:57.552663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.539158Z","title":"Compositional text-to-image gen- eration with dense blob representations, 2024","venue":null,"work_id":"897b713c-e35b-4bbb-b0c9-4ba3dea18c4f","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.016249Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:2f7211234f1d2faa36b163e4c72c1c93e04d1d1e9edbca1f4ff53642d14e7028","observation_id":"25e0d8ad-9146-4f52-8e0b-26e12dd0aa7d","resolution":{"observed_at":"2026-08-10T22:01:57.542735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.528106Z","title":"Video generation models as world simula- tors","venue":null,"work_id":"426e8171-46f6-4472-94b3-b12566ff78e4","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.019827Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:9d3863da9e6d6c2a544ef067383ca21f4a2f7836cc45ba4564549150eebea7fd","observation_id":"bbdd92b7-fdd3-4aad-b416-20b7ce96c201","resolution":{"observed_at":"2026-08-10T22:01:57.532320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.517126Z","title":"Video generation from sin- gle semantic label map","venue":null,"work_id":"222633d0-93d7-47d3-9d10-1fa1ae0297e7","year":2019},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.023517Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:b82d13855b83fb658675e9111342ff55951fd240b751f01ec31f5398b7252f9c","observation_id":"89497550-e4ca-4777-808e-45c596c84c8b","resolution":{"observed_at":"2026-08-10T22:01:57.521339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.026576Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.026576Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:6368fcc6c5f89e44b9722af5758a24726b4f83f6413f8e0997e292c11ec726e4","observation_id":"87207992-9770-43ec-9487-d23ab702bce9","resolution":{"observed_at":"2026-08-10T22:01:57.026576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T22:01:57.030059Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.030059Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:fb01529079fa1367fe6a4c90d55cce2f2d4c367e0ba530753d31f492513268e2","observation_id":"4a42d2a5-590c-46f4-beeb-241a526e16e5","resolution":{"observed_at":"2026-08-10T22:01:57.030059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.499383Z","title":"Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petro- vic, and Yuming Du","venue":null,"work_id":"54dadc0c-c653-40be-824d-a15d20b8fcba","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.033703Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:b63e96fc1aa586d580dc838c13c76c3fadd46ec18d20e5e2a9315426b2952fd2","observation_id":"7dd62e78-f0a7-4dc4-9b9e-005dbf124fe3","resolution":{"observed_at":"2026-08-10T22:01:57.503944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.036908Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.036908Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:51ed18250259b057536235fd29d2c63e246445c2762c6b49b669c49d4edfb5f5","observation_id":"f453eeed-d4f3-4658-be80-4da6ce43f96f","resolution":{"observed_at":"2026-08-10T22:01:57.036908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.040095Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.040095Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:6bd30929f61cf050d6151e09db9de9c184a9b30e52c2fda955b60e5dd1001efa","observation_id":"20d15cec-fdb4-4863-997d-6ba41dcf599b","resolution":{"observed_at":"2026-08-10T22:01:57.040095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.476708Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation, 2024","venue":null,"work_id":"97bbd74b-6e8c-4a94-8c86-8f4b96feb4c8","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.043751Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:a732a0c6333279ff0360bdfb3b1971706174c673187726f9e6eac8c82636d9ab","observation_id":"6a0e9035-f195-4696-ba21-d4e43d5c5ee0","resolution":{"observed_at":"2026-08-10T22:01:57.480654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.466969Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"6ed61f5e-d7fb-4ef1-8feb-5fcd7fb3efc4","year":2022},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.047344Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:e40307195abf9830b43c41643320250b5dad1939dc588002a3689ad3c7d7370a","observation_id":"e05b1915-93e3-4c75-9963-b40e97d5e580","resolution":{"observed_at":"2026-08-10T22:01:57.470475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.456501Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling, 2024","venue":null,"work_id":"e5c3c8f0-249d-4157-b1e0-f85cb6290184","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.051467Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:f0da94c238b3f9545c5fa25024026627a2e94bead11c36af952e0c3561642684","observation_id":"660f2410-fdf5-4973-b83a-6a28e00e162a","resolution":{"observed_at":"2026-08-10T22:01:57.460028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.446887Z","title":"Make-a-video: Text-to-video generation without text-video data, 2022","venue":null,"work_id":"f0340a8d-e0a1-415b-82e9-46720f425276","year":2022},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.054893Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:ac7ff97e42aa06611b5bb9fff96c47fd8c207d531af299815e22de982d0e3216","observation_id":"7c554da8-0fcd-4a0f-b428-c38a9cd680d0","resolution":{"observed_at":"2026-08-10T22:01:57.450239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T22:01:57.058078Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.058078Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:4b11a21b21111bba8b71b51f0a0df0202877820e45a15d526ea5f5959bb8f4c0","observation_id":"556750ab-c2a3-4f8c-91aa-0055e0b78c60","resolution":{"observed_at":"2026-08-10T22:01:57.058078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T22:01:57.061614Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.061614Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:5b691d062b5be35d6fa5721f3700a10e25978265d9cd4838177271627c4717b0","observation_id":"f0bf9f6c-004e-4650-9f91-47a4fd3ef298","resolution":{"observed_at":"2026-08-10T22:01:57.061614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.435771Z","title":"Raft: Recurrent all-pairs field transforms for optical flow, 2020","venue":null,"work_id":"20149718-04a7-43a7-9c53-5a5fe76d9718","year":2020},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.065341Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:816057579f80cd300e23587b445c1013da248598136501ced4e591216690d37e","observation_id":"fb07f7b0-7508-4810-994a-3049dd0e15da","resolution":{"observed_at":"2026-08-10T22:01:57.439948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.068199Z","title":"To- wards accurate generative models of video: A new metric & challenges, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.068199Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:14d8727cb1707ecbe9472c97ed7f176eea0eb4e5e9ccc22740a87962af06a348","observation_id":"979d90b6-12b3-4aa0-b422-001609b75440","resolution":{"observed_at":"2026-08-10T22:01:57.068199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-10T22:01:57.071166Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.071166Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:b18c87c94fe47d709a74980374ddb4b1974743db5788c51a4a790f7313bb98f0","observation_id":"152c2249-a9ce-4d79-8163-89c3773a278d","resolution":{"observed_at":"2026-08-10T22:01:57.071166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10874","last_updated":"2024-04-24T11:22:00Z","snapshot_observed_at":"2026-08-13T11:39:34.773518Z","submitted_at":"2023-05-18T11:06:15Z","title":"Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10874","snapshot_observed_at":"2026-08-10T22:01:57.074328Z","title":"Videofactory: Swap at- tention in spatiotemporal diffusions for text-to-video gener- ation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.074328Z"},"links":{"cited_paper":"/paper/2305.10874","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:54078aa6b022af0b603c92457acc92995399b178b5ef628c9938f715f3b15ec7","observation_id":"0060c327-9d8f-41d8-adbe-7add5337125d","resolution":{"observed_at":"2026-08-10T22:01:57.074328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-14T11:04:59.421484Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-10T22:01:57.078986Z","title":"Lavie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.078986Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:71cc0ffb31af19b387e2b0795ced86170a3628e6ebd577752d691b235cceadb7","observation_id":"e504a121-af29-4c76-9b00-cb055b0f80da","resolution":{"observed_at":"2026-08-10T22:01:57.078986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.419857Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation, 2024","venue":null,"work_id":"23b43f5f-c792-492d-9555-0bd4ddbcd659","year":2024},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.082626Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:98ccceaf84c349558bba7bc20630e03db378c39dc9171207e89eee2293a5db93","observation_id":"c74e4b38-fd33-4197-b3c8-0f0724d36a24","resolution":{"observed_at":"2026-08-10T22:01:57.423665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.086032Z","title":"Cvpr 2023 text guided video editing competition, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.086032Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:2f4e194ac2684b8be6401afa1d17578efd3847da1053f0f4def8599db443f861","observation_id":"a6138c38-078e-4e60-9570-b216a2aeeaea","resolution":{"observed_at":"2026-08-10T22:01:57.086032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.402786Z","title":"Dynamicrafter: Animating open-domain im- ages with video diffusion priors, 2023","venue":null,"work_id":"aecd4a76-b0ed-40c3-8d69-ed66981c912a","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.089488Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:776893ffe0ae1044b0e6e5a80c82a788aba0cad3a3aba308a89b285529a6446e","observation_id":"3e80e4cc-1dec-4c74-a97f-0de74b0da988","resolution":{"observed_at":"2026-08-10T22:01:57.407001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.392608Z","title":"I2vgen-xl: High-quality image-to-video synthe- sis via cascaded diffusion models, 2023","venue":null,"work_id":"d5244c8c-310b-48a4-9393-92f5443b3163","year":2023},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.092834Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:25b1ebf5c6075c2196de2b09cae480ad42981e3f57609236f4642a4a6d4842cd","observation_id":"ee53ac5c-e98f-45e2-81dc-a4a741fb77d6","resolution":{"observed_at":"2026-08-10T22:01:57.396106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-08-16T05:49:16.026825Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-10T22:01:57.096246Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.096246Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:e98e8181a82fc0d6934ec28289aa5f6a1b556928f4cca62c2cb67442e2463dbf","observation_id":"f2cdff7d-03cc-484b-98ba-aca83a4d4f89","resolution":{"observed_at":"2026-08-10T22:01:57.096246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.381682Z","title":"Qualitative Comparison of Masked Attention Mechanism Fig","venue":null,"work_id":"49a92d13-1813-4cfd-9ae8-aa8bdb588b69","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.100257Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:bfe66d03446183f113d82a89ae68dcb58d0d4cdf245365a7a3bc4c7b76f944c2","observation_id":"45863543-3017-4676-844a-782aeaa0ff15","resolution":{"observed_at":"2026-08-10T22:01:57.386219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.369817Z","title":"3.1, our pre-processing pipeline ex- tracts a motion-specific prompt, cmotion, from the input text c, using a pre-trained LLM","venue":null,"work_id":"f7dd5296-311c-483e-aa9b-fb2f6026e495","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.103605Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:2d20ab52d0228acde45ef06b55608d3250599bfd7f9f4d27601e45e66ca1b58d","observation_id":"2c53be84-e420-4376-9e28-fbfd94990343","resolution":{"observed_at":"2026-08-10T22:01:57.374870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.358467Z","title":"3.1, the pre-processing process be- gins with extracting motion-capable object prompts from the global prompt c","venue":null,"work_id":"427f4d96-8e7b-4242-92d4-595ff97ca82c","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.107151Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:27b15339459ecaef9b84ff950951f713f1a7dc3cfa1d83ec37bb86d24e7fc128","observation_id":"a1db1218-8197-43f9-ba37-0f12a174fafb","resolution":{"observed_at":"2026-08-10T22:01:57.362362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.347890Z","title":"First, the initial segmenta- tion s(0) is extracted from x(0) using SAM2 [40]","venue":null,"work_id":"da85049a-71f3-4412-b434-022592e062a2","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.110565Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:9359c12aba02e98bf3667dc2ab4f5ae50d5b376de0855264f3c37e449cdfcfcd","observation_id":"4ca3f9d3-c478-45b9-890a-0d95840fbab9","resolution":{"observed_at":"2026-08-10T22:01:57.351616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.338767Z","title":"The first is the U-Net architecture","venue":null,"work_id":"d5e1ea09-e66b-444a-9e98-ae5694722667","year":2000},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.113763Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:492e60f4ed934570e61dc81989ff79cada1e96778695057063cadd3135ace7db","observation_id":"9ed908a2-eb82-4c35-8cdd-cba69f8a898a","resolution":{"observed_at":"2026-08-10T22:01:57.341696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.326240Z","title":"The filtering of 128 videos, out of the full SA-V dataset, involved several steps","venue":null,"work_id":"addd489a-1ae0-43ef-8a94-f9289a7bdfac","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.117552Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:40150fcd1c946d3b72f1acfd90c3036cc39199ce6551af09f0bfba71cc7f66a7","observation_id":"b01e8fac-5167-4c7d-9b03-3d4a8a2b7c53","resolution":{"observed_at":"2026-08-10T22:01:57.331486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:01:57.313964Z","title":"description of overall motion","venue":null,"work_id":"12240d1b-3d6b-4a9e-b451-4f833b6292ac","year":null},"citing_paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:01:57.121114Z"},"links":{"citing_paper":"/paper/2501.03059"},"observation_digest":"sha256:8d9bf1370a91300e5fa159191ee52ea406cf4f942306c70329cc38afc9981b75","observation_id":"16d604f0-777d-47f1-8ccf-fb2d0fb1ceb4","resolution":{"observed_at":"2026-08-10T22:01:57.318405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03059","last_updated":"2025-01-06T14:49:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:10:04.045462Z","submitted_at":"2025-01-06T14:49:26Z","title":"Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 2 inbound Pith citation observations for arXiv:2501.03059."}