{"as_of":"2026-08-07T19:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:102ac3d87ea15766864125657c24512f59668bcb4e26162e4c9c9f05f279bdfa","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:44:03.931604Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T18:17:54.943863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T18:17:55.117028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"cited_work":{"arxiv_id":"2507.01945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01945","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longanimation: Long animation genera- tion with dynamic global-local memory","venue":null,"work_id":"20faf197-5d9f-4664-8ec1-11bbd71a8f52","year":2025},"citing_paper":{"arxiv_id":"2512.04678","last_updated":"2025-12-28T11:15:39Z","snapshot_observed_at":"2026-08-04T14:52:25.854038Z","submitted_at":"2025-12-04T11:12:13Z","title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T18:17:54.943863Z"},"links":{"cited_paper":"/paper/2507.01945","citing_paper":"/paper/2512.04678"},"observation_digest":"sha256:c6b0846d7dbc65f4759c11dc3cb08526decef095d739b9cd3f298e6cd1c75c7f","observation_id":"4a4d34ff-8602-4496-9c66-5c01e7acaa49","resolution":{"observed_at":"2026-05-16T18:17:55.118925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01945/citation-record","integrity":"/paper/2507.01945/integrity","json":"/paper/2507.01945/citation-record.json","paper":"/paper/2507.01945"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-01T15:43:51.739518Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-06T20:43:59.621124Z","title":"Training diffusion models with reinforce- ment learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.621124Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:11b4fefe4b3bb839174f56987029234b3f9f4a062ad983c9f68823becba8a591","observation_id":"00f25352-b54c-4f45-8439-ad9e254dafd7","resolution":{"observed_at":"2026-08-06T20:43:59.621124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18597","last_updated":"2025-03-26T09:05:41Z","snapshot_observed_at":"2026-08-05T17:03:47.891638Z","submitted_at":"2024-12-24T18:51:19Z","title":"DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18597","snapshot_observed_at":"2026-08-06T20:43:59.732717Z","title":"Ditctrl: Exploring attention control in multi-modal dif- fusion transformer for tuning-free multi-prompt longer video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.732717Z"},"links":{"cited_paper":"/paper/2412.18597","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:a041134429e628debc3b2ea8ade8cceb43ca158bc114b07439d50cde8d11bb90","observation_id":"c4eedb55-943f-46b7-9367-bc32b0de7f9e","resolution":{"observed_at":"2026-08-06T20:43:59.732717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.637760Z","title":"Learning to generate line drawings that convey geometry and semantics","venue":null,"work_id":"88692ee5-f681-4f0a-98de-1f13ea38e7ba","year":2022},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.846894Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:bf1805f8de59ddda10af86a93973d6a193e954e03593e080b767146b1da61a81","observation_id":"cc439907-a4b8-4d7d-9dcf-21fb86bdf8ea","resolution":{"observed_at":"2026-08-06T20:44:06.830589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-07-06T20:00:37.331726Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-06T20:43:59.901023Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:59.901023Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:9f9f19fa1be654270091e078befd6d5d551c9f483c9376b8e5efa627eecb4537","observation_id":"6f02e5a7-a4d0-4819-a23e-96ab81ce1ba8","resolution":{"observed_at":"2026-08-06T20:43:59.901023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.416047Z","title":"Re- inforcement learning for fine-tuning text-to-image diffusion models","venue":null,"work_id":"09610224-27ff-425b-a154-3cb1b66c0e2b","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.042250Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:6d825dc2918599f9e097485ebc20385412c17d5a71e0f3ac1908daf5628d5a96","observation_id":"36123fe9-f56c-49ea-bfad-ce3e346c98f4","resolution":{"observed_at":"2026-08-06T20:44:06.487219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14023","last_updated":"2024-08-26T05:27:14Z","snapshot_observed_at":"2026-08-07T05:22:51.503928Z","submitted_at":"2024-08-26T05:27:14Z","title":"Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14023","snapshot_observed_at":"2026-08-06T20:44:00.121528Z","title":"Video-ccam: Enhancing video-language un- derstanding with causal cross-attention masks for short and long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.121528Z"},"links":{"cited_paper":"/paper/2408.14023","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:c9584246c34c55817a65283082c1d313f3bb2768948f35de8997beb71bc82f96","observation_id":"bb93b653-36b1-4e29-a744-433a9651ab04","resolution":{"observed_at":"2026-08-06T20:44:00.121528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-06T20:44:00.249078Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.249078Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:412976e9ace2fa5bff67298ef01a480f29688e628a96abb49b4db60809f418a5","observation_id":"251df458-85a0-45fb-bdfe-64df25ec0872","resolution":{"observed_at":"2026-08-06T20:44:00.249078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-06T14:42:35.046089Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-06T20:44:00.321655Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.321655Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:f6584ce44845fb064b158ba911e7ad288880f025ac98c1742347b24473b83bcb","observation_id":"8b95a9da-a355-40f2-a6f9-9a23a96dd17c","resolution":{"observed_at":"2026-08-06T20:44:00.321655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:00.395146Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.395146Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:a418fc1ec800633d9a16b6f2a631ad51768b83a4390e85f6030dcd5cc67b7e59","observation_id":"4fa334b5-a214-4127-bb87-b88ee039f7b1","resolution":{"observed_at":"2026-08-06T20:44:00.395146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-06T20:44:00.477581Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.477581Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:eedd9e4546f002a0e9273e53c0059d80a0b071c86c316b3f977d8289ca3a37d7","observation_id":"cf4e2d1c-22da-461c-97af-ba5d821a63f1","resolution":{"observed_at":"2026-08-06T20:44:00.477581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23277","last_updated":"2024-10-31T18:03:51Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:55:52Z","title":"SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23277","snapshot_observed_at":"2026-08-06T20:44:00.572745Z","title":"Slowfast-vgen: Slow- fast learning for action-driven long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.572745Z"},"links":{"cited_paper":"/paper/2410.23277","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:d03c8dc58f3bf99f4de8665ea02b4977b24a944f5fc4158b1bc0bbedc5553f99","observation_id":"07da051e-fc5f-43b6-8cd7-41a0a3009c79","resolution":{"observed_at":"2026-08-06T20:44:00.572745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:00.669451Z","title":"Lvcd: reference-based lineart video colorization with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.669451Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e153e2822865a03654fcef18b52f1afe1cd1470a2fc7f79c924793fd3f1bf2dc","observation_id":"1ac5451d-c6a8-4109-ad23-047be7e6a172","resolution":{"observed_at":"2026-08-06T20:44:00.669451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.222862Z","title":"Dˆ 2it: Dynamic diffusion transformer for accurate image generation","venue":null,"work_id":"7265a960-0742-4717-a8b7-019309a44224","year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.738720Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:d705034415fc2ebd58ca209983bd1548c5df228ccf26b63b08ac2b820de929d3","observation_id":"d5644349-a2dd-44f8-bb8c-c175d3b0fbd4","resolution":{"observed_at":"2026-08-06T20:44:06.319724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T20:44:00.826789Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.826789Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:6126f367ffb2cbd064b45b0e4b66e6df22f60e52e81e1d97f572cdf345f8ca8d","observation_id":"34d52832-099f-4295-bdcd-744cd7b7b786","resolution":{"observed_at":"2026-08-06T20:44:00.826789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:06.075057Z","title":"Parrot: Pareto-optimal multi-reward reinforce- ment learning framework for text-to-image generation","venue":null,"work_id":"aac821da-2304-4d8e-bebb-4afd7b20a055","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.900950Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:79224ac23c638f4d8cab78f667e48890da06aeff20eb96d9672a59e0ee694df2","observation_id":"04f3d7b5-9bf9-4139-9457-a78c993db9f5","resolution":{"observed_at":"2026-08-06T20:44:06.124611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:00.992058Z","title":"Mvbench: A comprehensive multi-modal video understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:00.992058Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:8e54ec0dcfe7e2ddb6b26d269fed110f29bea67fccda8489fb45ba9949d0f9af","observation_id":"3b6e2d5a-4e97-497a-81dd-5d23077180f5","resolution":{"observed_at":"2026-08-06T20:44:00.992058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.830829Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"48b2fa90-2388-4234-8fc8-c628671ff17a","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.085013Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:558dadd1d4b20daee0918b90a71463b1cc025d73835bf647b57f84b1f7c89b2b","observation_id":"2fc64a55-c5f3-43f2-bf47-f1c1f02f1c50","resolution":{"observed_at":"2026-08-06T20:44:05.915619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T20:44:01.201211Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.201211Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:a7a94dc0f6a3069c98a70fb378129f8cc6d67b20f2cf515361724fc6b521d50d","observation_id":"3c9d6383-e9ec-4e90-bd01-65d812cad34d","resolution":{"observed_at":"2026-08-06T20:44:01.201211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10406","last_updated":"2025-07-20T08:44:35Z","snapshot_observed_at":"2026-08-07T17:06:58.996059Z","submitted_at":"2025-03-13T14:31:52Z","title":"RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10406","snapshot_observed_at":"2026-08-06T20:44:01.273125Z","title":"Realgeneral: Unifying visual generation via tempo- ral in-context learning with video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.273125Z"},"links":{"cited_paper":"/paper/2503.10406","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:efa11309861e78e7518c9a6046dfb8ffd23649cafd38529736a07907be830ebb","observation_id":"0c6ece53-9425-423a-b191-8fd2a77041cb","resolution":{"observed_at":"2026-08-06T20:44:01.273125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19918","last_updated":"2024-07-29T11:52:07Z","snapshot_observed_at":"2026-07-06T18:53:18.201717Z","submitted_at":"2024-07-29T11:52:07Z","title":"FreeLong: Training-Free Long Video Generation with SpectralBlend Temporal Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19918","snapshot_observed_at":"2026-08-06T20:44:01.344606Z","title":"Free- long: Training-free long video generation with spectralblend temporal attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.344606Z"},"links":{"cited_paper":"/paper/2407.19918","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:634cce06cbfc585d58d0874e4d656d18be1e560dfbb6fb77e12a31c031aa1122","observation_id":"d1f57265-4aea-479b-8832-6c41368a66d8","resolution":{"observed_at":"2026-08-06T20:44:01.344606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:01.415755Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.415755Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:7fd41529f370a2ec7dadfbda90f3d61d73e4e536126292de942ca11c96208d74","observation_id":"21bed869-f858-40dd-ab46-c6d897973bf6","resolution":{"observed_at":"2026-08-06T20:44:01.415755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.526119Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":"9860a788-8e72-4cae-92c6-d0dcde46717f","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.514050Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:5426c0deadadbc0c67754c1278884998c28bad3ce0c73c56e0e97855c6418446","observation_id":"79b816f9-bce3-4ebe-a27e-e1687aebbc0d","resolution":{"observed_at":"2026-08-06T20:44:05.670363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.220087Z","title":"Follow-your-click: Open-domain regional image animation via motion prompts","venue":null,"work_id":"8e203fcd-d754-4f6b-8bcc-0ef565761a7d","year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.650856Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e4fe4f3dc4d8ea5b7c053e6f12d9159887d6cd5556ad9468af35e7a1063972c3","observation_id":"a5b0eed3-9818-4bab-bb27-f37aa04c8f90","resolution":{"observed_at":"2026-08-06T20:44:05.354867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:01.737118Z","title":"Follow-your-motion: Video motion transfer via efficient spatial-temporal decoupled finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.737118Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:9326d4acd721d83ce0ccf7b9f4011a5c47e94c3b007ce54debf71a9fcf1be856","observation_id":"3733c586-6015-49dd-9fcb-2b1211d6072d","resolution":{"observed_at":"2026-08-06T20:44:01.737118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14173","last_updated":"2025-01-30T11:28:17Z","snapshot_observed_at":"2026-07-06T20:09:28.763595Z","submitted_at":"2024-12-18T18:59:59Z","title":"AniDoc: Animation Creation Made Easier","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14173","snapshot_observed_at":"2026-08-06T20:44:01.846272Z","title":"Anidoc: Animation creation made easier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.846272Z"},"links":{"cited_paper":"/paper/2412.14173","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:5d6c5b5e501494f75883edc9457645c23382de019171077a104f754deec1e487","observation_id":"9c37ea60-1d32-442c-b3b7-f199dc2c89a9","resolution":{"observed_at":"2026-08-06T20:44:01.846272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07425","last_updated":"2024-05-13T01:50:05Z","snapshot_observed_at":"2026-07-06T18:13:16.171803Z","submitted_at":"2024-05-13T01:50:05Z","title":"Sakuga-42M Dataset: Scaling Up Cartoon Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07425","snapshot_observed_at":"2026-08-06T20:44:01.983722Z","title":"Sakuga-42m dataset: Scaling up cartoon research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:01.983722Z"},"links":{"cited_paper":"/paper/2405.07425","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:8fa23f9c67e16607d44822573a05f98bc3bba1f527589ff98ff10bdbbedc3941","observation_id":"0dd5ea05-4e83-4055-a70c-c4843b72788b","resolution":{"observed_at":"2026-08-06T20:44:01.983722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:02.147334Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.147334Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:33d3b99f24508297f7dcf2b8ec8e3bc8a232f7d4abf0420a42bf59453f570766","observation_id":"f52c8dbf-68cb-46a3-9846-1ba67b399feb","resolution":{"observed_at":"2026-08-06T20:44:02.147334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-08-06T20:44:02.239414Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling.arXiv preprint arXiv:2310.15169, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.239414Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:3655ee762fb534c44daa66327919d951d97864482778ef07efab6a47910d6197","observation_id":"55aec288-e13e-4a46-9503-143893af8070","resolution":{"observed_at":"2026-08-06T20:44:02.239414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:02.319811Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.319811Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:bf1764249726a370a3edd739f5f27cfb701af538f03e12966a0d97811f412265","observation_id":"1ad4202e-f42e-401d-b574-8d8bfb281b0d","resolution":{"observed_at":"2026-08-06T20:44:02.319811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-04T02:26:31.748049Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T20:44:02.396979Z","title":"Consisti2v: Enhanc- ing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.396979Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:a003ccff1ec3cc63648213df02ddc6967bbd75518da4bf9ee428d59a8a2e0458","observation_id":"0e9d9cd6-f653-43ae-84d8-114b51743f50","resolution":{"observed_at":"2026-08-06T20:44:02.396979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-06T20:44:02.472353Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.472353Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:45f3c304937b7338bb65aad5971c54e75fc1269f09b5e02dee2a1aeee7c21e35","observation_id":"402060c6-11ee-452e-afb6-8d77ad4cb01e","resolution":{"observed_at":"2026-08-06T20:44:02.472353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.135330Z","title":"Inception transformer","venue":null,"work_id":"1491d0b9-d70a-4ee9-917b-38b19a1d668d","year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.602200Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:24604b26216e296cb7203e4c64c778ceafe42622c99c9f44c5a29cfe638131cf","observation_id":"d51b70ec-8bd1-4b6b-9165-ed2ca6a491cb","resolution":{"observed_at":"2026-08-06T20:44:05.208434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:05.008671Z","title":"Probing multimodal large lan- guage models for global and local semantic representations","venue":null,"work_id":"2907fcac-d361-4599-bf7e-8ebe5668a4c9","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.703575Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:2cad85f65599c95bd0007152228cb5fd9b0cbb590f4a1e7b85f769a86c740b09","observation_id":"17d2a476-2584-4063-926b-2195fdc6f1df","resolution":{"observed_at":"2026-08-06T20:44:05.064454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T20:44:02.787099Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.787099Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e5e2e78d566f52edc6dd5f89c714fa66f5b87aab4f6db90bc76ff25fe457e311","observation_id":"5decbd04-0f3b-447a-9014-812ce65d4961","resolution":{"observed_at":"2026-08-06T20:44:02.787099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05962","last_updated":"2022-03-09T23:55:24Z","snapshot_observed_at":"2026-07-06T12:46:48.184877Z","submitted_at":"2022-03-09T23:55:24Z","title":"Anti-Oversmoothing in Deep Vision Transformers via the Fourier Domain Analysis: From Theory to Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05962","snapshot_observed_at":"2026-08-06T20:44:02.857894Z","title":"Anti-oversmoothing in deep vision trans- formers via the fourier domain analysis: From theory to practice","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.857894Z"},"links":{"cited_paper":"/paper/2203.05962","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:a198e5471913f491813170a9aa12db2421e127d7893d56ab8a1a78235daa6363","observation_id":"afb30076-2c66-46ce-bedc-3cb48b30dce4","resolution":{"observed_at":"2026-08-06T20:44:02.857894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02192","last_updated":"2025-07-20T07:07:13Z","snapshot_observed_at":"2026-08-07T15:56:36.657828Z","submitted_at":"2025-05-04T17:19:20Z","title":"DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02192","snapshot_observed_at":"2026-08-06T20:44:02.935387Z","title":"Dualreal: Adaptive joint training for loss- less identity-motion fusion in video customization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:02.935387Z"},"links":{"cited_paper":"/paper/2505.02192","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:3e8c4e748172a1580e25399fca9eba50f7c906363849daeab2c400c111b34cb7","observation_id":"5b800691-8ff4-450a-a543-366bc7720bc9","resolution":{"observed_at":"2026-08-06T20:44:02.935387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20504","last_updated":"2025-03-24T02:17:34Z","snapshot_observed_at":"2026-07-06T20:14:22.094082Z","submitted_at":"2024-12-29T15:42:24Z","title":"ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20504","snapshot_observed_at":"2026-08-06T20:44:03.079113Z","title":"Retake: Reducing temporal and knowledge redundancy for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.079113Z"},"links":{"cited_paper":"/paper/2412.20504","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:8a2c5ce0c4cf7143d4ef11d3326f534cf72b8f784a77ff40fad80fd6b6cd5eb8","observation_id":"3fbb95af-caf3-4d79-a8bc-191d95e8f8e2","resolution":{"observed_at":"2026-08-06T20:44:03.079113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:03.202268Z","title":"Longllava: Scaling multi-modal llms to 1000 images efficiently via a hybrid architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.202268Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:82b4569e113d3326c6475412234ecd268b89e706b0fc1010177633fa631e30b3","observation_id":"934ffdaf-9814-4917-b425-ddcc1df4661d","resolution":{"observed_at":"2026-08-06T20:44:03.202268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01071","last_updated":"2025-08-02T13:32:09Z","snapshot_observed_at":"2026-07-06T19:09:10.244642Z","submitted_at":"2024-09-02T08:52:58Z","title":"VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01071","snapshot_observed_at":"2026-08-06T20:44:03.238976Z","title":"Videollamb: Long-context video understanding with recur- rent memory bridges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.238976Z"},"links":{"cited_paper":"/paper/2409.01071","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:21d574e1057019c614e59b5d23c87cbd4a150581294ca386f73478af2c8f332d","observation_id":"ca68543e-d87a-4c79-9db9-02a69d12bdf8","resolution":{"observed_at":"2026-08-06T20:44:03.238976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:03.340554Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.340554Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:a2e817b1ac07c3ec5eae441102a461976be14f87e254ffba86c5ece717ca1ac1","observation_id":"b43cc7b9-7520-4e32-99bd-c706d025c075","resolution":{"observed_at":"2026-08-06T20:44:03.340554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:03.403346Z","title":"Longvlm: Efficient long video understand- ing via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.403346Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:8d180aa61d63739d08b4571ca8704ee361d9077242d20083d6e0f0a2747256ac","observation_id":"aff3db0b-262a-4c15-9e01-c0d3f4ca5240","resolution":{"observed_at":"2026-08-06T20:44:03.403346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.871515Z","title":"Deep reward supervisions for tuning text-to-image diffusion models","venue":null,"work_id":"853d7805-c032-4ccc-a739-1542a1e3606d","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.447993Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:1af36c66a1aa57c6b94331a7833b2eb660883c0a273ec7e3ef9fd08e2c32c94f","observation_id":"aa0bf80d-b286-46d1-9ee8-d63a5a31ae21","resolution":{"observed_at":"2026-08-06T20:44:04.937092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.760594Z","title":"Tooncrafter: Generative cartoon interpolation","venue":null,"work_id":"66d3706c-c212-4cac-9619-e5cee482b450","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.552164Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:f9bcc6d7d973401f13e00c3a7a76f2711813f16368c3f930725961b95d1546d9","observation_id":"ac667245-c17c-4537-83cb-bd07bf772ee1","resolution":{"observed_at":"2026-08-06T20:44:04.805445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.660949Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation","venue":null,"work_id":"d95f4603-587f-417c-8339-c0fee21ee7e1","year":2023},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.620317Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:7c95b77df2a4dcce21f7ebeae6aad9feb877c9d36eb19d673d834d8321a38beb","observation_id":"ecd540ba-027e-42f1-ba64-2a3e24665a9a","resolution":{"observed_at":"2026-08-06T20:44:04.710878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08295","last_updated":"2025-03-22T14:09:40Z","snapshot_observed_at":"2026-08-07T04:02:16.440219Z","submitted_at":"2025-01-14T18:22:21Z","title":"LayerAnimate: Layer-level Control for Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08295","snapshot_observed_at":"2026-08-06T20:44:03.687210Z","title":"Layeranimate: Layer-specific control for anima- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.687210Z"},"links":{"cited_paper":"/paper/2501.08295","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:859947577aea7051399993b98b8b0bd97f8031103077a6c0828287666234ab28","observation_id":"2fc57576-a339-4c26-909a-43dc356b3a52","resolution":{"observed_at":"2026-08-06T20:44:03.687210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T20:44:03.739778Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.739778Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:f81334a4e4aaae8f46c2b4e30b38fdca118b7e74e61f5868318930dfa724b2c3","observation_id":"de44c0f2-b7e3-483d-ac2e-9e230e352d7e","resolution":{"observed_at":"2026-08-06T20:44:03.739778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.540636Z","title":"Animation line art colorization based on the op- tical flow method","venue":null,"work_id":"3c72ea35-b770-451b-93cc-4c659c4521cd","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.774727Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:e0bee206cb4df2dd5965473c0c2c8aeac0311cce6a62e72e23ea1a5f4dbf1795","observation_id":"bb6e6654-375e-4c02-a9a4-4c3c4add112e","resolution":{"observed_at":"2026-08-06T20:44:04.589919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:44:04.440519Z","title":"Make pixels dance: High- dynamic video generation","venue":null,"work_id":"c59f3a9a-80a4-4e4e-9a55-4c949800a117","year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.820747Z"},"links":{"citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:aace1a9c5fb56a4c190249c1291aa76b6df8a2a01e126ec4f075a250058f6583","observation_id":"f4a4d1bd-a069-4727-89f4-7cbce5f8b49c","resolution":{"observed_at":"2026-08-06T20:44:04.488221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T20:44:03.876972Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.876972Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:b2ff8c39ebf92cfe9318043f721cd27824b8cf41346656a414581699b83d350e","observation_id":"2b6eb28b-ed98-4ca9-b951-d01c3c376df7","resolution":{"observed_at":"2026-08-06T20:44:03.876972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16948","last_updated":"2025-08-07T08:42:42Z","snapshot_observed_at":"2026-08-07T18:43:45.586277Z","submitted_at":"2025-03-21T08:53:14Z","title":"Follow-Your-Color: Multi-Instance Sketch Colorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16948","snapshot_observed_at":"2026-08-06T20:44:03.931604Z","title":"Magiccolor: Multi-instance sketch colorization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:44:03.931604Z"},"links":{"cited_paper":"/paper/2503.16948","citing_paper":"/paper/2507.01945"},"observation_digest":"sha256:74e6a9f68c1f1b2ff33aa73007abdf786a13be3b189ec19cf7f26bd5a6a5430d","observation_id":"64f42629-0620-4ee0-9e7e-297deb3cfb32","resolution":{"observed_at":"2026-08-06T20:44:03.931604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01945","last_updated":"2025-07-09T16:30:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:37:19.917083Z","submitted_at":"2025-07-02T17:55:50Z","title":"LongAnimation: Long Animation Generation with Dynamic Global-Local Memory"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2507.01945."}