{"as_of":"2026-08-07T18:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87edaacdebfda55fe558ba459744a28ba3a3db94e49c7d831aad463d91b46db8","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:12:11.643982Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T12:23:05.876881Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T02:40:14.528606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-07-13T12:23:05.876881Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation.arXiv preprint arXiv:2506.03126, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.03738","last_updated":"2026-04-04T13:50:38Z","snapshot_observed_at":"2026-08-06T04:04:52.686841Z","submitted_at":"2026-04-04T13:50:38Z","title":"Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T12:23:05.876881Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2604.03738"},"observation_digest":"sha256:0833c8986d2587f42523002ab917f1aefb2bb23bebeb0e61ed3d911f60be6bdf","observation_id":"12a9d3e5-c4e3-4a23-a319-0bec9d33f43d","resolution":{"observed_at":"2026-07-13T12:23:05.876881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2506.03126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation","venue":null,"work_id":"e38e35fc-a3e9-47ab-81c6-dd7d2b449865","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-05-09T04:03:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T06:28:42.129881Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:f0cbce5904cad11c9bb48affbc35542f05a785dcb0896b5a3b37beee8804c99b","observation_id":"03dd8ea7-b774-48bf-ab89-aa092011185b","resolution":{"observed_at":"2026-05-11T21:11:19.182772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2506.03126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation","venue":null,"work_id":"e38e35fc-a3e9-47ab-81c6-dd7d2b449865","year":2025},"citing_paper":{"arxiv_id":"2604.23789","last_updated":"2026-05-09T04:03:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-26T16:28:46Z","title":"MuSS: A Large-Scale Dataset and Cinematic Narrative Benchmark for Multi-Shot Subject-to-Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:10.509727Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2604.23789"},"observation_digest":"sha256:84a63c2067c9763c051a753932659a5c5586926f3275e711698cc4c00774adcb","observation_id":"1cf7ef51-3212-4406-ac33-bd2199c83f1a","resolution":{"observed_at":"2026-05-12T00:51:15.171755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2506.03126","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03126","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animeshooter: A multi-shot animation dataset for reference-guided video generation","venue":null,"work_id":"e38e35fc-a3e9-47ab-81c6-dd7d2b449865","year":2025},"citing_paper":{"arxiv_id":"2605.23508","last_updated":"2026-05-22T11:16:05Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T11:16:05Z","title":"DrawVideo: Generating Long Video from Storyboard Keyframe Sketches","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T02:40:00.873188Z"},"links":{"cited_paper":"/paper/2506.03126","citing_paper":"/paper/2605.23508"},"observation_digest":"sha256:c0c5d3f1a1ef74e2ac836b0d6c0ef22f45936784417ef54cba81b5b3cb8f6efb","observation_id":"0495b8e7-e0f5-4b47-8fb6-7ae4308d815c","resolution":{"observed_at":"2026-05-25T02:40:14.532466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03126/citation-record","integrity":"/paper/2506.03126/integrity","json":"/paper/2506.03126/citation-record.json","paper":"/paper/2506.03126"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.596205Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.596205Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:340709d569ab9c39ba6a892b780c57f903e584f4bb7f601840dba1daca33f5ea","observation_id":"389f885a-2c05-4557-aa24-30917415e80d","resolution":{"observed_at":"2026-08-07T11:12:07.596205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.662318Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.662318Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:25bed66cd9b76bca270dc9bcfc51967af9eaee9f35b3f47c4f1d4f84a6863e17","observation_id":"dd058a13-c529-4a70-ab25-e2538c4a7612","resolution":{"observed_at":"2026-08-07T11:12:07.662318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.730235Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.730235Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3be99c4c23e71c0f06bbc15461d33781d612e207e22d823c0479a35760b4dc2b","observation_id":"8af38723-941f-4c8c-a6f2-d8a21683ed7c","resolution":{"observed_at":"2026-08-07T11:12:07.730235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06187","last_updated":"2025-03-20T17:59:56Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:54Z","title":"Multi-subject Open-set Personalization in Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06187","snapshot_observed_at":"2026-08-07T11:12:07.805412Z","title":"Multi- subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.805412Z"},"links":{"cited_paper":"/paper/2501.06187","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3b5dffc54f1849abb978bfe8077ede12c8486bfd852b6f93c51bfe7d8068cdaa","observation_id":"da75d926-c224-400f-916a-84cd7e90880d","resolution":{"observed_at":"2026-08-07T11:12:07.805412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:07.888630Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.888630Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:074b6af96d9a8d9d3f43856b195be787d40f6402dad58c2ef6d8189a4d6b6ee1","observation_id":"7a32cccd-bf7b-4da4-9bb8-7731c437384d","resolution":{"observed_at":"2026-08-07T11:12:07.888630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01014","last_updated":"2025-05-30T14:00:25Z","snapshot_observed_at":"2026-08-07T16:16:47.784931Z","submitted_at":"2025-04-01T17:57:18Z","title":"AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction","version":2},"cited_work":{"arxiv_id":"2504.01014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.01014","snapshot_observed_at":"2026-08-07T11:12:12.011804Z","title":"AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction","venue":"cs.CV","work_id":"8ec1f20f-905a-45b6-aabf-ac74db814abf","year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:07.996721Z"},"links":{"cited_paper":"/paper/2504.01014","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7392c337288f35a673ad937d8e10d4728acac1086f6079dd5ba814aa5f1d90d5","observation_id":"2ad33bc0-f505-474e-b8ce-99f722b5d127","resolution":{"observed_at":"2026-08-07T11:12:12.106906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:14.099451Z","title":"Gemini, 2024","venue":null,"work_id":"334bd114-c08f-4f3f-9d8e-438941427f00","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.133677Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:71de3b607545bada00c772adbe93aa3a535ded73fa50797bb241cd5efe1a6391","observation_id":"42f72ecf-dc28-47aa-828b-08c5f6d867ff","resolution":{"observed_at":"2026-08-07T11:12:14.189027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-07T17:07:00.747879Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-08-07T11:12:08.227600Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.227600Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:1ea4fc0c2c0d7f4c0a84572bd8c28399b6621d8194f54f04b5227483f8a6a26b","observation_id":"10bbdf14-7a25-4c48-bb27-3789b2a20813","resolution":{"observed_at":"2026-08-07T11:12:08.227600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-07T11:12:08.339057Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.339057Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7dfb44678c650153f4faedf2acfd0095b612b1680db37dd863c46f97ac9bfb2a","observation_id":"374fa6d5-8d77-432a-8862-f6ea8f81c154","resolution":{"observed_at":"2026-08-07T11:12:08.339057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18247","last_updated":"2023-05-30T08:54:42Z","snapshot_observed_at":"2026-07-06T15:34:51.593721Z","submitted_at":"2023-05-29T17:11:39Z","title":"TaleCrafter: Interactive Story Visualization with Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18247","snapshot_observed_at":"2026-08-07T11:12:08.485043Z","title":"Talecrafter: Interactive story visualization with multiple characters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.485043Z"},"links":{"cited_paper":"/paper/2305.18247","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:68661b417695f0dfa240a0e74c22493101699feadfb6ba416875b5dc7ae77f81","observation_id":"8a36178e-afd2-410e-a11e-03b8c7f5c3c3","resolution":{"observed_at":"2026-08-07T11:12:08.485043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:12:08.630129Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.630129Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:b7076b4df34573fe858afc2a085a509825ba3fdec9c55718bd1d92911d1b0639","observation_id":"d64ba14d-5ff1-4bed-9806-cc8749ca3d35","resolution":{"observed_at":"2026-08-07T11:12:08.630129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:08.729397Z","title":"Mix-of-show: Decentralized low-rank adaptation for multi-concept customization of diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.729397Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:67aff1957004ebdfec73fd104db44c137daa97b8f98b550651cbbee061ffe929","observation_id":"b90d077f-4e9f-4da3-a746-15ea5e9d7b81","resolution":{"observed_at":"2026-08-07T11:12:08.729397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17949","last_updated":"2024-11-27T00:10:27Z","snapshot_observed_at":"2026-07-06T19:57:41.881817Z","submitted_at":"2024-11-27T00:10:27Z","title":"ROICtrl: Boosting Instance Control for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17949","snapshot_observed_at":"2026-08-07T11:12:08.846411Z","title":"Roictrl: Boosting instance control for visual generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.846411Z"},"links":{"cited_paper":"/paper/2411.17949","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3283cffd9acd690aaecbf24b91bd2ea3928cce9a33abb9cc37efa063cd060533","observation_id":"9356d9de-e9d4-44bb-bcb6-f78c65570da9","resolution":{"observed_at":"2026-08-07T11:12:08.846411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:12:08.909571Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.909571Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:153d112f45f61b0d89294442d6c35d583914fd46e7b39e5e9f4997a61bd1cad5","observation_id":"f573cba1-365b-462e-8c50-832797999e3e","resolution":{"observed_at":"2026-08-07T11:12:08.909571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-07T17:06:18.944213Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T11:12:08.965970Z","title":"Long context tuning for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:08.965970Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:a35b7f0a31f41a1c3bdf03386f996eb154f7c01793d3622d53e5b3fbfc261b00","observation_id":"0ffec6cb-a1a0-4858-b45a-43d583ac1ff2","resolution":{"observed_at":"2026-08-07T11:12:08.965970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09503","last_updated":"2025-05-01T09:16:20Z","snapshot_observed_at":"2026-07-06T20:21:55.366596Z","submitted_at":"2025-01-16T12:28:39Z","title":"AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09503","snapshot_observed_at":"2026-08-07T11:12:09.048829Z","title":"Anys- tory: Towards unified single and multiple subject personalization in text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.048829Z"},"links":{"cited_paper":"/paper/2501.09503","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:07bf0f3f597022b3eb4d26f6be7c2198d8a6b01438061a1b68c4eea80766000b","observation_id":"e051b2b5-5fe8-4eb4-944e-760793cdaaea","resolution":{"observed_at":"2026-08-07T11:12:09.048829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-07T11:12:09.126710Z","title":"Id-animator: Zero-shot identity-preserving human video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.126710Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:6940618938265bb3b0002dd7c129404b6c917697730dea1f1428a7ea17482f6f","observation_id":"7fa80870-4be0-4fc5-a828-286d8f634c71","resolution":{"observed_at":"2026-08-07T11:12:09.126710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T11:12:09.189653Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.189653Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:6d90dcb480fd59db9b470d35d1059b0827630132d85c40cb3d06a0315f99ac9b","observation_id":"aaf0aeb4-19f8-4519-9e5d-d7174043c9cf","resolution":{"observed_at":"2026-08-07T11:12:09.189653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09600","last_updated":"2024-12-12T18:59:01Z","snapshot_observed_at":"2026-08-05T00:53:15.041432Z","submitted_at":"2024-12-12T18:59:01Z","title":"Owl-1: Omni World Model for Consistent Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09600","snapshot_observed_at":"2026-08-07T11:12:09.266583Z","title":"Owl-1: Omni world model for consistent long video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.266583Z"},"links":{"cited_paper":"/paper/2412.09600","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:939b702743bb57471bcac9dfae8197eee2ecf473333f33588e5900caacb7aaae","observation_id":"a40c66a4-0d8e-408a-a927-93464dff33f3","resolution":{"observed_at":"2026-08-07T11:12:09.266583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-07T17:10:22.188545Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-07T11:12:09.347154Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.347154Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:a2e2eec822eb792c2066dc799e2f72cbce13e1ec43d94fa994dd3fa87706c8a5","observation_id":"bc92ba84-61f2-483c-bbe5-3ecf2d2c648f","resolution":{"observed_at":"2026-08-07T11:12:09.347154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-03T09:49:19.218280Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-08-07T11:12:09.446928Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.446928Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:c4fdef3da640e7dba71a230530534c938d7ed8487506b7018cb3a9889f4e7f73","observation_id":"ae659b54-8ae6-4d0f-8e35-7eb036357a6c","resolution":{"observed_at":"2026-08-07T11:12:09.446928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10255","last_updated":"2025-05-22T07:45:19Z","snapshot_observed_at":"2026-08-03T06:37:15.404756Z","submitted_at":"2024-12-13T16:24:58Z","title":"AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10255","snapshot_observed_at":"2026-08-07T11:12:09.494420Z","title":"Exploring the frontiers of animation video generation in the sora era: Method, dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.494420Z"},"links":{"cited_paper":"/paper/2412.10255","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:42970f216ca8087f7b9924a7e67874549b99601124a922f7e4b0d0fa206bfd75","observation_id":"75efc4a0-733f-4862-8af8-bcd8407e95e1","resolution":{"observed_at":"2026-08-07T11:12:09.494420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.905649Z","title":"Videobooth: Diffusion-based video generation with image prompts","venue":null,"work_id":"4d8ea5ca-b552-4d98-ab5a-a7d93a5e08cc","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.571073Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:3ab5e882604362483049800115e0de48cf9320738d74a8de4379460e8a2ee886","observation_id":"eb25d9f7-ac88-4b57-a016-a3eefcb212da","resolution":{"observed_at":"2026-08-07T11:12:13.999178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.736345Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":"53a03318-c0da-4533-b052-bcb193f45c77","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.665314Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7fa8a0eabea311fed77cf8a1c612c1df7b3d664f49dd6ebd4b95970b6c3b2519","observation_id":"cca380a1-eb77-432b-aa22-f71f09fbdc11","resolution":{"observed_at":"2026-08-07T11:12:13.803816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.629214Z","title":"Animeceleb: Large-scale animation celebheads dataset for head reenactment","venue":null,"work_id":"0c229959-596c-4af9-876a-91d34fcfa198","year":2022},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.757488Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:72123ca767891ce92210acd195641cad0e1bbf557df0023e262cbb9f25b40f01","observation_id":"35e5e471-8e47-4d3f-a3e5-44aaacf52b8a","resolution":{"observed_at":"2026-08-07T11:12:13.699408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:09.813019Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.813019Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:4939aab5403d00a612f2c0da00643cf2eb34635a8a400a0ab8edde7dc5b5f705","observation_id":"24929bb3-2b7c-47be-be85-b7fb14f89aa9","resolution":{"observed_at":"2026-08-07T11:12:09.813019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:09.891514Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.891514Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:391da1be318ab9888fbb17b3331acb12c8dea1b96e945f0520ec60fe091364e6","observation_id":"a86e30b0-d6d0-4c61-96be-3e92e6e1f0ac","resolution":{"observed_at":"2026-08-07T11:12:09.891514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.483417Z","title":"Anim-director: A large multimodal model powered agent for controllable animation video generation","venue":null,"work_id":"9b15ecf1-92f0-4ba9-9427-2ada5c7d12ea","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:09.969711Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:ee6e0b558843914f827f7a1c37968f350097d34d3c98144813d039c8216d9d51","observation_id":"36f8d7e7-a113-43b8-a597-b8278264c7b6","resolution":{"observed_at":"2026-08-07T11:12:13.577772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-07T11:12:10.052472Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.052472Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:ba3369507ab8784d0575f1ac0595eca1b5b7ba6de73bebd805619f65c94cfb1a","observation_id":"820661d1-558e-4c66-b64a-1d735b45ff39","resolution":{"observed_at":"2026-08-07T11:12:10.052472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.287293Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"07631ecf-a049-4d8b-8d35-f24412fb0da8","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.127134Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e2cc0e4198388585d8d791bd4bb9d7691591db09bc5c41a01ab4163b04c1a559","observation_id":"bfb470b3-7a96-427b-b7df-d31c0b71d6d1","resolution":{"observed_at":"2026-08-07T11:12:13.409848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T11:12:10.219918Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.219918Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:6538ed67903170dde660c692165e74bf7c35ce94945c37a3a8aa5cae4542f744","observation_id":"54f3858b-f0ae-4f61-9f1b-9fe9c8f76c74","resolution":{"observed_at":"2026-08-07T11:12:10.219918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.161049Z","title":"Videostudio: Generating consistent-content and multi-scene videos","venue":null,"work_id":"008aa8bb-8bd1-4a6d-b257-06a54d7b6106","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.299362Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:d535a920037fc445610dc9c789286dc50a2ad3d8d199d62b74f4df45b899d1aa","observation_id":"ec6cd1af-2c39-4fe7-ba93-a9203c189b99","resolution":{"observed_at":"2026-08-07T11:12:13.247077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:13.036742Z","title":"Gpt-4o: Multimodal large language model, 2025","venue":null,"work_id":"4b66fae8-7828-49c9-aa86-4da25dab8c0a","year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.378355Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:763ceef376e48387f386b65060a2a39099c4e02166168bda0f94b421828743eb","observation_id":"07fdbe30-a898-4f35-893a-7e0a49723455","resolution":{"observed_at":"2026-08-07T11:12:13.078271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07425","last_updated":"2024-05-13T01:50:05Z","snapshot_observed_at":"2026-07-06T18:13:16.171803Z","submitted_at":"2024-05-13T01:50:05Z","title":"Sakuga-42M Dataset: Scaling Up Cartoon Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07425","snapshot_observed_at":"2026-08-07T11:12:10.466249Z","title":"Sakuga-42m dataset: Scaling up cartoon research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.466249Z"},"links":{"cited_paper":"/paper/2405.07425","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:70e82a544dd48aaeeafc66ecabed0a40ab674c327c1b4e94101dc50fa1c13cfe","observation_id":"8c0100f0-a661-4ea9-be03-c8bdda53aa7a","resolution":{"observed_at":"2026-08-07T11:12:10.466249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:10.547419Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.547419Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:dab766f8b4d1b8a31c96e5681087aa4b42bd0545fd9a5b0bb034d16118125101","observation_id":"555b527d-8b63-4e0f-9bd6-be90d689a97a","resolution":{"observed_at":"2026-08-07T11:12:10.547419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T11:12:10.655648Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.655648Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:ef7c78fc1cdb6b7939acc6ba6fba31665838d50a496838dee5693e5c747b2a0f","observation_id":"db3ff834-c87b-4a72-8b25-6c91f900c8d6","resolution":{"observed_at":"2026-08-07T11:12:10.655648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:10.735546Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.735546Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:dfbb2e16653da6784a6205ab9e90b7704e388ef8b97b5ece571bca4ddf06df33","observation_id":"ef22b037-3bb6-4cbe-b768-acdf42d65130","resolution":{"observed_at":"2026-08-07T11:12:10.735546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.751487Z","title":"Videofactory: Swap attention in spatiotemporal diffusions for text-to-video generation","venue":null,"work_id":"8bb40c02-31d2-4ab5-81a2-e4edde4909df","year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.816759Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:c9e3868fb76c6d18c359bc348d38a89441bf061faeb75eeb991a59a2882a33ae","observation_id":"67e8c4e3-c52d-46b9-9d04-ae9478b51db7","resolution":{"observed_at":"2026-08-07T11:12:12.866309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T11:12:10.899127Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.899127Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:f805117b45b3d7b20c90e59df510d9aae820741ac3e097c4697c9eb5f305261b","observation_id":"d9559444-4464-46cf-b125-2bc3146cfffa","resolution":{"observed_at":"2026-08-07T11:12:10.899127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:10.988953Z","title":"Dreamrunner: Fine-grained storytelling video generation with retrieval-augmented motion adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:10.988953Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:fcff83d53e073b50f8de44935d83e0a91e55f824cfeebea1f7993c783d06c677","observation_id":"a3ff8ddc-5acc-4107-97cd-f55f3767ee50","resolution":{"observed_at":"2026-08-07T11:12:10.988953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.567107Z","title":"Understanding animation","venue":null,"work_id":"d5a42623-49e4-4105-8f9b-22582c494e10","year":2013},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.080666Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:5438d3cbcfe99192b7d4ddedddf3a22878daccc42627d8da018cb39f779c5cb1","observation_id":"6eb2fcc0-3d80-460c-8e33-0dc1fa6869a5","resolution":{"observed_at":"2026-08-07T11:12:12.648824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07314","last_updated":"2025-03-10T13:33:27Z","snapshot_observed_at":"2026-08-07T17:16:48.946119Z","submitted_at":"2025-03-10T13:33:27Z","title":"Automated Movie Generation via Multi-Agent CoT Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07314","snapshot_observed_at":"2026-08-07T11:12:11.166087Z","title":"Automated movie generation via multi-agent cot planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.166087Z"},"links":{"cited_paper":"/paper/2503.07314","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:e08f9da55781b73df2a37bfc67c4bf0ef8271d6e138ec2bd72f4cd3cff952cfb","observation_id":"6a6aa371-4938-48d2-90ad-025c4183ff3d","resolution":{"observed_at":"2026-08-07T11:12:11.166087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09455","last_updated":"2024-06-12T18:55:51Z","snapshot_observed_at":"2026-08-04T09:13:35.810711Z","submitted_at":"2024-06-12T18:55:51Z","title":"Pandora: Towards General World Model with Natural Language Actions and Video States","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09455","snapshot_observed_at":"2026-08-07T11:12:11.222249Z","title":"Pandora: Towards general world model with natural language actions and video states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.222249Z"},"links":{"cited_paper":"/paper/2406.09455","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:041bfa317edb0e7e51619c8f3ed7baaeff7a72a50637d7a1892384e103719775","observation_id":"30381dfa-6f88-438b-a9c9-990b24562a6d","resolution":{"observed_at":"2026-08-07T11:12:11.222249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.437344Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"e1d8e717-5a50-4e0d-821f-aac55f74e263","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.286902Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:766de9b4345a7d3f026bc97a34d60db5ee0390b281aacf6121f00b11f8d43dba","observation_id":"f75afb69-c4ce-4946-a2e8-a6659b257310","resolution":{"observed_at":"2026-08-07T11:12:12.492949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10816","last_updated":"2024-10-14T17:59:56Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-14T17:59:56Z","title":"LVD-2M: A Long-take Video Dataset with Temporally Dense Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10816","snapshot_observed_at":"2026-08-07T11:12:11.338933Z","title":"Lvd-2m: A long-take video dataset with temporally dense captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.338933Z"},"links":{"cited_paper":"/paper/2410.10816","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:7bb68594919cd3a1dd71e3bf31193b12133f0fb4afd47821e963267270a350e3","observation_id":"c906f12f-548a-4246-a263-f63b490a5dfd","resolution":{"observed_at":"2026-08-07T11:12:11.338933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.307202Z","title":"Vript: A video is worth thousands of words","venue":null,"work_id":"1dc247a1-a038-4b2d-97d7-3deff4d93e19","year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.402600Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:069691a430c787b86f21a6b38ed86113e6783f02c3bc1cc33adc695780ce2a59","observation_id":"50a82ba6-d370-4019-b301-e78b5afa1694","resolution":{"observed_at":"2026-08-07T11:12:12.358110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08683","last_updated":"2024-10-11T08:39:28Z","snapshot_observed_at":"2026-08-07T03:46:04.809939Z","submitted_at":"2024-07-11T17:21:03Z","title":"SEED-Story: Multimodal Long Story Generation with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08683","snapshot_observed_at":"2026-08-07T11:12:11.474850Z","title":"Seed-story: Multimodal long story generation with large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.474850Z"},"links":{"cited_paper":"/paper/2407.08683","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:8f68302661a7002a17f3f543621d96f19aa12f4e47f1706a28b541fd518ad919","observation_id":"bc59aa92-dab7-4113-ae87-2e9112b87892","resolution":{"observed_at":"2026-08-07T11:12:11.474850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-07T11:12:11.511487Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.511487Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:efa5ed8e330ef5760ed7ce8faab9d480f01bdd44d59b0f86554b4fe984840e02","observation_id":"2be077c8-5812-4e90-beb0-51b75fdd6892","resolution":{"observed_at":"2026-08-07T11:12:11.511487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T11:12:11.581622Z","title":"The girl said goodbye to the bear","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.581622Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:fad8ffb0d3970800dff2d1d2ac73aca289219ddd6b86802d4988f1b160811647","observation_id":"babab955-deef-496a-a763-52bb4fe2f02c","resolution":{"observed_at":"2026-08-07T11:12:11.581622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:12:12.182460Z","title":"a cow is mooning","venue":null,"work_id":"7828e83f-0f4d-448d-9af0-7bf522616d41","year":null},"citing_paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:12:11.643982Z"},"links":{"citing_paper":"/paper/2506.03126"},"observation_digest":"sha256:4b9e4a7c6b391c26534d635abad23dd4fe0efd371b5bcf2453b9444e26a5c263","observation_id":"3056d301-ef7b-43d8-90cb-904e1dcc52be","resolution":{"observed_at":"2026-08-07T11:12:12.237359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03126","last_updated":"2025-06-03T17:55:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:05:48.505195Z","submitted_at":"2025-06-03T17:55:18Z","title":"AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 4 inbound Pith citation observations for arXiv:2506.03126."}