{"as_of":"2026-08-15T13:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03c0b3eada138359c6fe5183d52858553fcae7c2308d1883a9edfa99413b5f60","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:59:00.878129Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T23:56:39.865433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:08:03.362718Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2604.11707","last_updated":"2026-04-13T16:42:46Z","snapshot_observed_at":"2026-08-14T02:26:44.424103Z","submitted_at":"2026-04-13T16:42:46Z","title":"Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:53.578491Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2604.11707"},"observation_digest":"sha256:df0501774efef3c6334856d9b5ab76fe81e9d334f74ef1e28b16ffb757ea25e7","observation_id":"0c581420-517e-46eb-bb5e-b46dd599550e","resolution":{"observed_at":"2026-05-11T08:45:58.546740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:51:12.604102Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:3f7f868bad2d8260c47bd8a8a47caec9a323857ae88f6e28f6c53375cdd173e6","observation_id":"9b9a431c-cd03-4a26-a05d-a30ccbe19679","resolution":{"observed_at":"2026-05-11T09:46:02.839422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:6987c836c931ed2694c5ad3eb54df9dfa00a88bef2940fdfccf1782e3bb76c22","observation_id":"e8bcbbe9-8751-4278-abd6-76fd8212487c","resolution":{"observed_at":"2026-07-02T23:57:27.892610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.24962","last_updated":"2026-05-24T09:28:05Z","snapshot_observed_at":"2026-08-02T19:14:30.533296Z","submitted_at":"2026-05-24T09:28:05Z","title":"Tempered Self-Similarity Alignment for Physically Plausible Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T11:39:06.597513Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.24962"},"observation_digest":"sha256:9eb806e01ec43ce3a42a9a753237ceccd4b1e256be8979a07a62ec64edca8bb6","observation_id":"01c8bdf5-8ded-4a4d-b33e-bcc1b905f302","resolution":{"observed_at":"2026-06-30T11:44:38.388278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2606.12217","last_updated":"2026-06-10T15:31:25Z","snapshot_observed_at":"2026-08-15T13:22:18.466951Z","submitted_at":"2026-06-10T15:31:25Z","title":"Making Foresight Actionable: Repurposing Representation Alignment in World Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:54.963759Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2606.12217"},"observation_digest":"sha256:87021f1c321e45e93579803a89dd2f1bfdba82c32a40cf330c421dfc45797a83","observation_id":"a4091bff-f3fe-4c4d-8b34-ebe2ff424477","resolution":{"observed_at":"2026-07-03T11:08:03.363913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09229/citation-record","integrity":"/paper/2506.09229/integrity","json":"/paper/2506.09229/citation-record.json","paper":"/paper/2506.09229"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T04:58:54.075933Z","title":"Agarwal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.075933Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:0252b7e3b3faf21d414a20af54ff20025f72f875c76b2c369d1a1a6c12176ce0","observation_id":"32cabdd5-345d-416c-ad84-abcc019dd647","resolution":{"observed_at":"2026-08-07T04:58:54.075933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.470221Z","title":"Baker, I","venue":null,"work_id":"a6011f1f-cfe4-4e9d-a3e4-9fb9d9c947f2","year":2022},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.147170Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:b5d3a5bb6a613cf24aea74e3c78c887020350a67548713d1ecbad177011287d5","observation_id":"b9e20daa-daee-4be6-8256-fd27d91260e7","resolution":{"observed_at":"2026-08-07T04:59:04.547903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.323989Z","title":null,"venue":null,"work_id":"76c6db22-1a18-4836-8d6b-d34e486a964e","year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.240845Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:cf20b1ea3bbcc9cc514a6275076c78d8abbaad8a5025354ad9f24cc56ab74819","observation_id":"484b1eae-df14-458f-bfc8-16c603cb49cb","resolution":{"observed_at":"2026-08-07T04:59:04.393193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.193904Z","title":"Scenes dataset.https://huggingface.co/datasets/bigdata-pw/scenes, 2025","venue":null,"work_id":"b96f5e7d-76bb-4bef-adb6-6fe0608a743f","year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.331646Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:cdbda9c90333f74bd10edab2079674331ea805852dc4d89af7f8e14b81339e02","observation_id":"212d2a9a-5448-41fa-9c4e-23250c39ebe9","resolution":{"observed_at":"2026-08-07T04:59:04.254765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T04:58:54.413395Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.413395Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:21286fe695a6965a3886f16007e6e45dd4746aa8b72b26c9e73a4a38b87c18ff","observation_id":"53e1fde2-3f87-4667-beeb-46ecd2477af3","resolution":{"observed_at":"2026-08-07T04:58:54.413395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.475871Z","title":"Blattmann, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.475871Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7579a1515ff130b008a1ef1376fe11236a2033a2c317cc1fc34e36c799b21383","observation_id":"82630d41-0eee-4c6e-ad39-e8e85365d390","resolution":{"observed_at":"2026-08-07T04:58:54.475871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.548379Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.548379Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:f3a1cc07d9f8c51636013fe0e9520e1ab25038fb9d7ffe04de01975758dad5ed","observation_id":"acfd326d-117e-4a67-bc07-936ccbe3078c","resolution":{"observed_at":"2026-08-07T04:58:54.548379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.642936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.642936Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:975c3f1493f9db543b3c490a49a4c4e85bda62a6ddd847b9fb86b4a227b0e951","observation_id":"82b0d012-c855-47e5-9950-e5cbf78187ef","resolution":{"observed_at":"2026-08-07T04:58:54.642936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.722164Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.722164Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:c4503c806b178650c7a8672fbd37e4d803f2090de42d36f364f984800795ff40","observation_id":"42931469-6608-4aba-a780-144f405df876","resolution":{"observed_at":"2026-08-07T04:58:54.722164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.006808Z","title":"Cakeify smol dataset","venue":null,"work_id":"ebb066d0-0eb8-44a3-8627-9786e287e844","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.781019Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:46e54ece39c39dd6fb92f62ba1a8e78d108f41e1809164d1df38fbeb0c7f6aeb","observation_id":"d2f99442-5670-492f-b528-85186922546f","resolution":{"observed_at":"2026-08-07T04:59:04.080717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.858218Z","title":"Crush smol dataset","venue":null,"work_id":"4888dbf6-5819-4543-b78c-8feb2a30f032","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.858367Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:9150823ab3689e26b7bd755f7d146f3e7cc2fb80907bed34ed6325ca702f0778","observation_id":"649f0bf5-6d9b-4a95-b46a-9115e20ed2d0","resolution":{"observed_at":"2026-08-07T04:59:03.922273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.718594Z","title":"Squish pika dataset","venue":null,"work_id":"3e5fe1ed-e4c3-47e8-84d3-1be9aa50679b","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.963160Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:f52847d35bcf3d165cfaecc36c4fc73828ab2a2af20c2e4a7ad4d6caf0921daf","observation_id":"dc1f7ff7-30dc-4055-be0f-c60ea87df8aa","resolution":{"observed_at":"2026-08-07T04:59:03.773661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-13T05:58:35.441148Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T04:58:55.068782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.068782Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:09c87dccc6c4b67f7485da2edcafdced3cd965c1bf622514239e6bba25c36523","observation_id":"b4f1e179-26a3-4a52-807d-ae4c96412b42","resolution":{"observed_at":"2026-08-07T04:58:55.068782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10964","last_updated":"2020-05-05T22:00:44Z","snapshot_observed_at":"2026-08-15T10:24:27.581301Z","submitted_at":"2020-04-23T04:21:19Z","title":"Don't Stop Pretraining: Adapt Language Models to Domains and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10964","snapshot_observed_at":"2026-08-07T04:58:55.232129Z","title":"Gururangan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.232129Z"},"links":{"cited_paper":"/paper/2004.10964","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:0c7169b4e68df9b5511c5a0b06401ba946f2f371c1ecead89cf42af4efed48cc","observation_id":"23d133e8-920f-4f41-ad68-41bfcba13ccb","resolution":{"observed_at":"2026-08-07T04:58:55.232129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.552852Z","title":null,"venue":null,"work_id":"445dcadb-7096-43b9-88cf-375d45e2b157","year":null},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.457490Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:5cb13b76c786a87b5c0f0fd209ac714bd4d3c5ea7c5a81d490429a7d3ffdb59b","observation_id":"77280d0b-4a9e-40bd-8acc-b87ddb79c0cb","resolution":{"observed_at":"2026-08-07T04:59:03.640450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:55.691200Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.691200Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:8576895fe98a862358e33ed123c0f69e66aec3ae7493e3eaa087ec3aaa8a44ff","observation_id":"50a983f2-0a97-4467-8978-967f0bc78d18","resolution":{"observed_at":"2026-08-07T04:58:55.691200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T04:58:55.911607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.911607Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:b3fbe696be1541fbbf031e7c72bbcf819154f01fc0ff6358d08e9ccb1a12b99b","observation_id":"f76c8697-c3b6-44c8-8c19-bafeb7f3a54f","resolution":{"observed_at":"2026-08-07T04:58:55.911607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.113423Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.113423Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:ffa30f79dfc5ddcca6e2e04a96aab0d123b0209bd2ed34d5f39c8a54b0a15246","observation_id":"90c07177-cd3a-4101-8641-b532ae18ea0a","resolution":{"observed_at":"2026-08-07T04:58:56.113423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13731","last_updated":"2023-06-23T18:34:30Z","snapshot_observed_at":"2026-08-14T02:39:35.898777Z","submitted_at":"2023-06-23T18:34:30Z","title":"How to Efficiently Adapt Large Segmentation Model(SAM) to Medical Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13731","snapshot_observed_at":"2026-08-07T04:58:56.274007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.274007Z"},"links":{"cited_paper":"/paper/2306.13731","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:b8154e247166081006e1465715ec3c42e4cd58859489bef35e30eee183daa552","observation_id":"814a947a-5024-480f-bbbc-f78e0c64b73d","resolution":{"observed_at":"2026-08-07T04:58:56.274007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.406571Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.406571Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:64ac89fb80f2e07d68b73aa27fc81984e2ac163c20da25353844b3b5b497ae79","observation_id":"a2e96d83-8c85-4b3d-8c5a-4c4b26f0f309","resolution":{"observed_at":"2026-08-07T04:58:56.406571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.383835Z","title":null,"venue":null,"work_id":"d285ff86-4e18-45e0-a3c0-5b09a91c2e5e","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.625548Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:d498589913d79653db2bd3d7401f79acd8fc0ff4f7fe8e85d5bdc71c80dd0bb9","observation_id":"c4de849f-3f50-4f31-b512-d293228bc8fe","resolution":{"observed_at":"2026-08-07T04:59:03.445152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.769059Z","title":"Kerbl, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.769059Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7a0bdce251fb3197b35eea19765d04e01193037804891d44ce125a01eef5e170","observation_id":"cb381b1f-6502-4a4a-b228-d47deeba0cd3","resolution":{"observed_at":"2026-08-07T04:58:56.769059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T04:58:56.895532Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.895532Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:2d58dcbc8723ea73f830c18fb4f1760593b334d96bf6e78677fae480706e0939","observation_id":"4cd1b8cd-4a87-4f6c-953d-79834911d265","resolution":{"observed_at":"2026-08-07T04:58:56.895532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.946497Z","title":"Kornblith, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.946497Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:45d396fce1940e0f82701f7ecdd4589e9a0f598e0bdd244002d1a9fa8dabeb4f","observation_id":"650cbaaa-7fc6-4ec5-bf33-a3e031ff69b2","resolution":{"observed_at":"2026-08-07T04:58:56.946497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-08-13T22:43:20.403436Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12091","snapshot_observed_at":"2026-08-07T04:58:57.092872Z","title":"Liang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.092872Z"},"links":{"cited_paper":"/paper/2412.12091","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:bad7f9d8759ea8188b84539930614a8463d3ee795c0933f969011b3124f283fa","observation_id":"d88d6dd3-420c-467a-bca7-fe1699492d03","resolution":{"observed_at":"2026-08-07T04:58:57.092872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.226813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.226813Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:2c0ef05df9522aa4d6a5eb1fbd2c3dcb0e08e276af2b1752bf84cd53b0b98ea8","observation_id":"f9999628-37dc-41a8-858d-b6df74cf6716","resolution":{"observed_at":"2026-08-07T04:58:57.226813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.238276Z","title":null,"venue":null,"work_id":"13dfc50f-9ee0-4524-a5dd-25024ee7886c","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.378218Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:127e543d05b47c85a39056481fd14fadf1e27f444ee474f08800f1b1d45e71ca","observation_id":"948327a2-94cf-4e92-91a0-12147e52608b","resolution":{"observed_at":"2026-08-07T04:59:03.303275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.624050Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.624050Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:4be01ef30627b635fdff2c46c31c469f2d7f31ddd0fb9a664f6564c4a161a483","observation_id":"79a89b01-c357-4afc-90d1-a9c17c84c86d","resolution":{"observed_at":"2026-08-07T04:58:57.624050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.094860Z","title":null,"venue":null,"work_id":"4ae521f8-4a82-4f8d-b18e-9362bd723daa","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.806559Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:9402860e574e2018ec3b3ed393d410df570c616686b21b70c68ea816fc177e9b","observation_id":"2861068b-d4e5-4de7-83a3-17defcf5ec11","resolution":{"observed_at":"2026-08-07T04:59:03.158274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07746","last_updated":"2024-12-10T18:45:04Z","snapshot_observed_at":"2026-08-15T13:40:39.172016Z","submitted_at":"2024-12-10T18:45:04Z","title":"LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07746","snapshot_observed_at":"2026-08-07T04:58:57.941066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.941066Z"},"links":{"cited_paper":"/paper/2412.07746","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:a9108f3a35e6c600c2238a17083e61ad52facd026c150b684a3332923df6d134","observation_id":"34e8cc7b-84cc-4e46-9428-ba9a762804f3","resolution":{"observed_at":"2026-08-07T04:58:57.941066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.964190Z","title":null,"venue":null,"work_id":"15803b23-cba5-4bb2-a681-feeffffe75a0","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.092897Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:5ab806a711b8687c246a47dd6103221b1c5b23f97d732de4301769dc561f039c","observation_id":"2a21b18b-2e71-46bf-ac81-e24fc942ab43","resolution":{"observed_at":"2026-08-07T04:59:03.023638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.846562Z","title":"Mahendran and A","venue":null,"work_id":"82cbaddf-d89b-408e-b5fd-2fffeb31a60f","year":2015},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.190029Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:5d3b7d202d1f19d5fcde2e68520c1875ea33495fe2b432f4f23e8c93dcb8573b","observation_id":"f47a902a-a281-45d0-9412-ef8ec2499fa4","resolution":{"observed_at":"2026-08-07T04:59:02.888084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.705623Z","title":"Oquab, T","venue":null,"work_id":"dd6c3240-ef15-4f72-aa75-7f7b2e529c21","year":null},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.326772Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:843df799880b13b27400ecc2ed8338e8dbeffb153f48af61db7e29ae19f16393","observation_id":"be8bc8ef-9ca7-4ffd-a473-154bc18b4658","resolution":{"observed_at":"2026-08-07T04:59:02.761707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.423770Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.423770Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:c9d036782e084af92a0bc7246ba03fbdc6aef427654f839bf1c7ad31d882711c","observation_id":"527b7160-ebef-46e0-b097-c51c3210dd7c","resolution":{"observed_at":"2026-08-07T04:58:58.423770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.550560Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.550560Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:225290aca544526f68e91606a04cf5fb4cfeb3642727e11961444f6ad79e73e1","observation_id":"28803efb-76e8-4332-a6d4-d2337ab15f35","resolution":{"observed_at":"2026-08-07T04:58:58.550560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.510897Z","title":null,"venue":null,"work_id":"d00b11da-0a39-4126-b7f2-88cece3c0a0b","year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.647520Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:f7b8672133eb76dc2c92619ab1c0f6ab83d7588c301dc63a78d2e302a91a13c3","observation_id":"2b114bc8-d6bf-4dd7-84b6-09c9a796cff2","resolution":{"observed_at":"2026-08-07T04:59:02.606531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.377278Z","title":null,"venue":null,"work_id":"4ef74dfd-994a-4b8c-adc9-30656ea9807e","year":2016},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.788656Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:d92cbc0d47273c98e85a007bb65a06dceac31353b5ad75f188a50c1ea3451801","observation_id":"ca972199-9970-43bc-a138-abe2203e1904","resolution":{"observed_at":"2026-08-07T04:59:02.433471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.252297Z","title":null,"venue":null,"work_id":"a0805bf0-314f-420d-8422-241d2860b154","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.925893Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:5be57d596409ff957626ca8f6ccfa22a7e930d5957a37bf1d4b2d992256512a3","observation_id":"fa87bace-6e62-4c44-9dba-cd9769ae9f8d","resolution":{"observed_at":"2026-08-07T04:59:02.314036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.999429Z","title":"Sohl-Dickstein, E","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.999429Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:50bf38b0486fddc3aa548968ef22457eac83afcfd7b5b0ce929ee6c19107f011","observation_id":"7a83ecd2-f632-46bb-b42b-6c2076c64569","resolution":{"observed_at":"2026-08-07T04:58:58.999429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T04:58:59.134015Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.134015Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:dbf9d6bba9fbf18d328002d50c039c07d354ca3a0d770139a50380126923548c","observation_id":"c9a00406-d5f2-4675-bcb9-ec4c402ed411","resolution":{"observed_at":"2026-08-07T04:58:59.134015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T04:58:59.265853Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.265853Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7850933c0743667d6ef9b8fde74ce242fc35a2a3d2fb527f756bca1c51d0d15c","observation_id":"20bfeda4-0466-4e40-8923-eeb37a2c6abc","resolution":{"observed_at":"2026-08-07T04:58:59.265853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T04:58:59.392779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.392779Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7af4d225e91a97ed29df073f073a6cca56606d4dadc312e751b7da4cb0e32a45","observation_id":"9de21364-8d91-4d7e-b1b0-be0ec841ca9b","resolution":{"observed_at":"2026-08-07T04:58:59.392779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.075959Z","title":null,"venue":null,"work_id":"dbd08a90-7b96-42ee-b7ad-67aeee732034","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.552589Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:9f523bc2befa38f38c160869a00bc59c391f39300f6c6370806193f2fdc9d077","observation_id":"7a6c2743-04ff-4c9a-b596-8b86fc65adfb","resolution":{"observed_at":"2026-08-07T04:59:02.142489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.957844Z","title":null,"venue":null,"work_id":"ade4d828-a95d-489d-afba-69a6b0a49239","year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.675013Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:3aab0f5af2a50b50cdc8b6d4eac553ba3f05940f2998991b8f53e036f1955a8c","observation_id":"68824346-05e2-4fcd-8d76-8c9e55b44672","resolution":{"observed_at":"2026-08-07T04:59:02.012157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.828699Z","title":"Disney video generation dataset","venue":null,"work_id":"50ccbb50-037d-43c9-8d29-da2e59943464","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.780924Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:773baddde6fcd81cff8d530eb898541e55ca1fc937276be064d9882737bbfc21","observation_id":"1fce435d-6b28-43ea-9bc9-27d8f14af809","resolution":{"observed_at":"2026-08-07T04:59:01.900089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.718510Z","title":"Tom and jerry video generation dataset","venue":null,"work_id":"a5e7d3db-42c1-43bb-a30a-23a5195eb6de","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.950113Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:3542b07b5e76b974d311950b2c96d9933b8894d5359a4b74dcc29076e949b9b0","observation_id":"0e4e0981-9d19-4072-b796-9033393f27df","resolution":{"observed_at":"2026-08-07T04:59:01.770396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.579137Z","title":"Xiang, H","venue":null,"work_id":"61d6ac4e-d932-41c2-be41-21e934edadcd","year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.081997Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:1c3846e93c737b8501b8ebbfa28b608ed9eb5df58a1447685fdcb3c4a259a3f4","observation_id":"5b90e42e-be20-4fd7-9174-67555a3f6b0d","resolution":{"observed_at":"2026-08-07T04:59:01.644663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.479128Z","title":null,"venue":null,"work_id":"75fd6236-fda2-4fc1-be33-45bbe1e2ac4f","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.309419Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:e0623ba7a4aeb03700e0e7334a58b3d43b32c7c3d45c5a50c8c6e51d94aad37a","observation_id":"584051e3-5bcf-4549-af5c-fa5966d48ab5","resolution":{"observed_at":"2026-08-07T04:59:01.537258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.378798Z","title":null,"venue":null,"work_id":"84be4be3-281f-47c5-a49e-2fd120423f3b","year":2022},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.471626Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:206a8ffd4dd6947ad988d5a2a918aaddc7e905eaad400e2929a6b61e7d5749b5","observation_id":"4265131c-7609-47fe-860d-62cc9724cbc4","resolution":{"observed_at":"2026-08-07T04:59:01.429395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-07T04:59:00.595140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.595140Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:f5e5f964855e8aeced6cd347e3169bb8cada4b7b03111ce99bed12aeac03c64e","observation_id":"bf9ad171-3aaa-49af-939f-bd57ef2b24f4","resolution":{"observed_at":"2026-08-07T04:59:00.595140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.228202Z","title":null,"venue":null,"work_id":"96834c7c-3388-4ca6-9fec-1f0d278f0d18","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.736880Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:124c09bbad905c99d498e6c9608ddbb36018135be61967adf57f68509b5cc054","observation_id":"1e6db635-0be2-4ab5-9fc0-9b3f8bd28ef0","resolution":{"observed_at":"2026-08-07T04:59:01.316779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T04:59:00.878129Z","title":"Zheng, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.878129Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:dec81dda64f0dec98a45d97b966b3c0b89c06823abe90050421cf5beaed74a93","observation_id":"d3923465-b429-4008-909c-96c613a3f77f","resolution":{"observed_at":"2026-08-07T04:59:00.878129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2506.09229."}