{"as_of":"2026-08-09T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3bc835317dd70666008c503ca13cbedeb6f6674486d6f004ba67ffb6cbaa351","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:20:26.816265Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T05:16:53.011837Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:19:51.134583Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"cited_work":{"arxiv_id":"2508.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10858","snapshot_observed_at":"2026-07-04T13:19:51.134583Z","title":"Hierarchical fine-grained preference optimization for physically plausible video generation.arXiv preprint arXiv:2508.10858, 2025b","venue":null,"work_id":"39415b77-6789-49b6-932c-5f958bef63a8","year":2025},"citing_paper":{"arxiv_id":"2509.24702","last_updated":"2026-04-06T10:12:03Z","snapshot_observed_at":"2026-08-02T11:34:44.120596Z","submitted_at":"2025-09-29T12:32:54Z","title":"Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T12:55:42.679016Z"},"links":{"cited_paper":"/paper/2508.10858","citing_paper":"/paper/2509.24702"},"observation_digest":"sha256:a035e35544550180c23ea75622ab045c164cfed7e14ad6591a1cf0b70cc202b9","observation_id":"9b6c971b-5815-4f63-a5ee-a0e25f2c471e","resolution":{"observed_at":"2026-05-18T12:56:24.358453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"cited_work":{"arxiv_id":"2508.10858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10858","snapshot_observed_at":"2026-07-04T13:19:51.134583Z","title":"Hierarchical fine-grained preference optimization for physically plausible video generation.arXiv preprint arXiv:2508.10858, 2025b","venue":null,"work_id":"39415b77-6789-49b6-932c-5f958bef63a8","year":2025},"citing_paper":{"arxiv_id":"2606.26916","last_updated":"2026-06-25T11:53:27Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T11:53:27Z","title":"PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:16:53.011837Z"},"links":{"cited_paper":"/paper/2508.10858","citing_paper":"/paper/2606.26916"},"observation_digest":"sha256:138bf5045f6fc30937029d6000f508776651ebffe88aa082933695254a87ed7c","observation_id":"a879c04e-fbe0-4fea-8dd9-1829d19b1123","resolution":{"observed_at":"2026-07-04T13:19:51.135891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10858/citation-record","integrity":"/paper/2508.10858/integrity","json":"/paper/2508.10858/citation-record.json","paper":"/paper/2508.10858"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-05T20:20:18.864970Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication.arXiv preprint arXiv:2303.09540, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:18.864970Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:fae769e5eee24f177b059dfb921521f2b20e206672d53cd3ca913676c1177ea8","observation_id":"abf23093-d4ad-4e32-b2da-982c4241e377","resolution":{"observed_at":"2026-08-05T20:20:18.864970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T20:20:18.913406Z","title":"Cosmos world foundation model platform for physical ai.arXiv preprint arXiv:2501.03575, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:18.913406Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:328d841580ff2a46301aab3f4a6b8efdc0b36a9e2c1f0b560980aa6de70310d7","observation_id":"d64476b5-49d1-42ef-9c3f-9cfe5d576912","resolution":{"observed_at":"2026-08-05T20:20:18.913406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16827","last_updated":"2024-08-02T17:59:31Z","snapshot_observed_at":"2026-08-03T03:15:21.035418Z","submitted_at":"2024-02-26T18:54:35Z","title":"A Survey on Data Selection for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16827","snapshot_observed_at":"2026-08-05T20:20:18.970074Z","title":"A survey on data selection for language models.arXiv preprint arXiv:2402.16827, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:18.970074Z"},"links":{"cited_paper":"/paper/2402.16827","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:74559b021dc1e07223825252f08dfa7315bdf09efb704f60673588c878233232","observation_id":"5ddcda5b-52a2-4b74-8e88-2511b99e865b","resolution":{"observed_at":"2026-08-05T20:20:18.970074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T20:20:19.063594Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.063594Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:358109b240322a2abab14ebe8e35cbe2e62a9eee102a45c7eac5e4da5f65d29d","observation_id":"9ca91353-6b53-4548-baf8-5e7ae911819c","resolution":{"observed_at":"2026-08-05T20:20:19.063594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14378","last_updated":"2025-03-18T16:10:24Z","snapshot_observed_at":"2026-08-07T16:54:31.868932Z","submitted_at":"2025-03-18T16:10:24Z","title":"Impossible Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14378","snapshot_observed_at":"2026-08-05T20:20:19.177850Z","title":"Impossible videos.arXiv preprint arXiv:2503.14378, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.177850Z"},"links":{"cited_paper":"/paper/2503.14378","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:24c623a11b551004af23c1d920ca2dabd2e95095c01746dc8fc6b35c0138a965","observation_id":"3dacba08-9c05-4bb6-a707-90dafb382f8d","resolution":{"observed_at":"2026-08-05T20:20:19.177850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-05T20:20:19.271049Z","title":"Videophy: Evaluating physical commonsense for video generation.arXiv preprint arXiv:2406.03520, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.271049Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:8f775aa87ae4413eff507274174ac26cdca2ab29332a49cb7756c34241113073","observation_id":"518f6c32-6529-4df0-82bf-52258b828d38","resolution":{"observed_at":"2026-08-05T20:20:19.271049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:19.367520Z","title":"Color-filter: Conditional loss reduction filtering for targeted language model pre- training.Advances in Neural Information Processing Systems, 37:97618–97649, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.367520Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:cf9e534aed0edb329bc2babf926f3d132894cb921584721959e8ce5d477f183b","observation_id":"899e01b2-a302-470b-9d4d-992a9894b4e8","resolution":{"observed_at":"2026-08-05T20:20:19.367520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:19.425811Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.425811Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:206570aedad43dc3465751003d0eb0abcaa20b43f16367572526fdeaed5e7faf","observation_id":"008d113b-95d1-4954-891b-a06c1ddb3524","resolution":{"observed_at":"2026-08-05T20:20:19.425811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15176","last_updated":"2025-04-21T15:35:48Z","snapshot_observed_at":"2026-08-07T16:00:33.150121Z","submitted_at":"2025-04-21T15:35:48Z","title":"DSPO: Direct Semantic Preference Optimization for Real-World Image Super-Resolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15176","snapshot_observed_at":"2026-08-05T20:20:19.505496Z","title":"Dspo: Direct semantic preference optimization for real-world image super-resolution.arXiv preprint arXiv:2504.15176, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.505496Z"},"links":{"cited_paper":"/paper/2504.15176","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:9ce70daff58170c285d4307bbf7259976442681823302adcc584e3287f17b82c","observation_id":"1c1915f3-c09b-4849-b363-339011c6d4c7","resolution":{"observed_at":"2026-08-05T20:20:19.505496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-05T20:20:19.593337Z","title":"Skyreels-v2: Infinite-length film generative model.arXiv preprint arXiv:2504.13074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.593337Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:ed41672abb5ca7f8aeebf2455404d6c035135a7721fe9968391d945d7c461254","observation_id":"360f1a25-5f17-431b-bfa1-3e0ac64e5df7","resolution":{"observed_at":"2026-08-05T20:20:19.593337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02114","last_updated":"2025-03-18T10:51:59Z","snapshot_observed_at":"2026-07-06T20:00:41.813099Z","submitted_at":"2024-12-03T03:10:19Z","title":"Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02114","snapshot_observed_at":"2026-08-05T20:20:19.757644Z","title":"Beyond generation: Unlocking universal editing via self-supervised fine-tuning.arXiv preprint arXiv:2412.02114, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.757644Z"},"links":{"cited_paper":"/paper/2412.02114","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:5fe3f2a1a7e1e00b0db7d3a22cd3d766616aefcab380b9b12a21e8c61b4829cc","observation_id":"a7cab711-dbdb-42d1-b728-89ee17489c6d","resolution":{"observed_at":"2026-08-05T20:20:19.757644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15417","last_updated":"2025-03-19T16:59:32Z","snapshot_observed_at":"2026-08-07T16:51:16.617489Z","submitted_at":"2025-03-19T16:59:32Z","title":"Temporal Regularization Makes Your Video Generator Stronger","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15417","snapshot_observed_at":"2026-08-05T20:20:19.836330Z","title":"Temporal regularization makes your video generator stronger","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.836330Z"},"links":{"cited_paper":"/paper/2503.15417","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:88c6ba598e5cc74efd11c49a1986e4c83dc9db4d35e751ef58918487c43e3444","observation_id":"eb9cf167-802a-404d-8273-687f51135387","resolution":{"observed_at":"2026-08-05T20:20:19.836330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08701","last_updated":"2024-02-13T18:37:25Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-17T17:59:40Z","title":"AlpaGasus: Training A Better Alpaca with Fewer Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08701","snapshot_observed_at":"2026-08-05T20:20:19.958156Z","title":"Alpagasus: Training a better alpaca with fewer data.arXiv preprint arXiv:2307.08701, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:19.958156Z"},"links":{"cited_paper":"/paper/2307.08701","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:db34862a3c55c5ba2ff3ef24bf7928b9c0a82c1a3989617d49ae33744e08ff25","observation_id":"2702ef9f-e525-4f6d-a4a5-6c44f15edbf0","resolution":{"observed_at":"2026-08-05T20:20:19.958156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-05T20:20:20.049659Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.049659Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:b313e451e12c2e3ee51473e2bd6525e2e16fcf79481e7570b59ae66884c7ed70","observation_id":"da65e6d6-5bcd-40e6-9e80-76ea5c5d9830","resolution":{"observed_at":"2026-08-05T20:20:20.049659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08542","last_updated":"2025-04-11T13:55:48Z","snapshot_observed_at":"2026-08-07T16:06:32.406926Z","submitted_at":"2025-04-11T13:55:48Z","title":"Discriminator-Free Direct Preference Optimization for Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08542","snapshot_observed_at":"2026-08-05T20:20:20.137671Z","title":"Discriminator-free direct preference optimization for video diffusion.arXiv preprint arXiv:2504.08542, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.137671Z"},"links":{"cited_paper":"/paper/2504.08542","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:b146c88c9ab0b1917d9a5926255eeb86e3409a42888d26922c90887df16984aa","observation_id":"fc531090-7222-4546-8570-8544b1a865ac","resolution":{"observed_at":"2026-08-05T20:20:20.137671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:20.263958Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.263958Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:0b65da4ccde8391493387c427f572704c84328f5b1cc550ba13d417b972bc4d6","observation_id":"e660235b-2a14-4d3d-b5fb-254abd944c28","resolution":{"observed_at":"2026-08-05T20:20:20.263958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-05T20:20:20.333257Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback.arXiv preprint arXiv:2310.01377, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.333257Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:fdcde4974329044adf32e27214af7a48837fb66d586bf9680d81432dfa5766a1","observation_id":"4feab0fe-0d78-4c9b-8026-51ffc2d90a3b","resolution":{"observed_at":"2026-08-05T20:20:20.333257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-05T20:20:20.444530Z","title":"One-minute video generation with test-time training.arXiv preprint arXiv:2504.05298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.444530Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:bcff9606f0459636c1b4155974c15b10ad65ac024f2c845cf5c791f6c65c4c55","observation_id":"35289050-813a-4314-9f89-d981b3262802","resolution":{"observed_at":"2026-08-05T20:20:20.444530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-05T20:20:20.542447Z","title":"Enhancing chat language models by scaling high-quality instructional conversations.arXiv preprint arXiv:2305.14233, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.542447Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:7515f1c7fc260381330f292758edad00d5c81f89863a66287fbed22477a658e2","observation_id":"aceb8c06-4215-4d64-92c6-4254da7e712b","resolution":{"observed_at":"2026-08-05T20:20:20.542447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20707","last_updated":"2024-03-05T20:02:31Z","snapshot_observed_at":"2026-08-09T06:57:55.062530Z","submitted_at":"2023-10-31T17:59:38Z","title":"What's In My Big Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20707","snapshot_observed_at":"2026-08-05T20:20:20.607812Z","title":"What’s in my big data?arXiv preprint arXiv:2310.20707, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.607812Z"},"links":{"cited_paper":"/paper/2310.20707","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:474afe38451e19ba3b502c1b9cb7465e46c1be4d3ec43246de8e48b32fa544d9","observation_id":"7ff24b6c-da73-41cd-aa42-6b7c0ba0c349","resolution":{"observed_at":"2026-08-05T20:20:20.607812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:20.685721Z","title":"Wave: Warping ddim inversion features for zero-shot text-to-video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.685721Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:5ed2bb173efd4954c52cc3d9b482ebbd4a042df104807474fac694cc08545b55","observation_id":"4f34db5d-18fe-44c1-83d7-8721d6c9753c","resolution":{"observed_at":"2026-08-05T20:20:20.685721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:20.753555Z","title":"CHip: Cross-modal hierarchical direct preference optimization for multimodal LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.753555Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:4decfce94d614d28019aa642b7d77812ebf7a23314f56e6700f17f866dc6866b","observation_id":"8e721712-d8a3-424e-ba03-a7f8b3724e2c","resolution":{"observed_at":"2026-08-05T20:20:20.753555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18191","last_updated":"2024-11-18T09:26:51Z","snapshot_observed_at":"2026-08-06T04:43:12.571506Z","submitted_at":"2024-02-28T09:27:29Z","title":"Clustering and Ranking: Diversity-preserved Instruction Selection through Expert-aligned Quality Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18191","snapshot_observed_at":"2026-08-05T20:20:20.833251Z","title":"Clustering and ranking: Diversity-preserved instruc- tion selection through expert-aligned quality estimation.arXiv preprint arXiv:2402.18191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.833251Z"},"links":{"cited_paper":"/paper/2402.18191","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:bb9febf673019c07899b8505a49b27783f8a77f4961e9854a442be04233f62a4","observation_id":"d83a193b-9e33-4b12-a773-3bf547b306cb","resolution":{"observed_at":"2026-08-05T20:20:20.833251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:20.911462Z","title":"Task-adaptive pretrained lan- guage models via clustered-importance sampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.911462Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:4b2b1893a229a6db8a928f23836cd3a58c0d71a2377b075c7f85750a030c4a99","observation_id":"0713bf26-92b0-47a8-97f6-9f0379df09f7","resolution":{"observed_at":"2026-08-05T20:20:20.911462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T20:20:20.981259Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:20.981259Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:52fbe4a24209911eca77604de6b287fb548122e327411b5413aae6cfbe73afec","observation_id":"bd0002af-fcb6-4af4-85e7-8b2896b7531d","resolution":{"observed_at":"2026-08-05T20:20:20.981259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:21.089437Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.089437Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:ad6152e24acacb7f492ea4a4babfda09fe1479a066218a269b83ebae2fcefa2d","observation_id":"da01cf88-ec14-453b-aa55-1de806c1a4b1","resolution":{"observed_at":"2026-08-05T20:20:21.089437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-07T17:06:18.944213Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-05T20:20:21.169944Z","title":"Long context tuning for video generation.arXiv preprint arXiv:2503.10589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.169944Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:de1e0a5833034eda04bb2f092cf5462c3430f5032509b0ef156098bb0516eab1","observation_id":"1cc8a74b-56f0-4691-af30-bc092bd97b36","resolution":{"observed_at":"2026-08-05T20:20:21.169944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:21.235156Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.235156Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:a889a3ad9c7eff3c6590fd8033c2268688261728366e6905cb74d007a4cf745c","observation_id":"520bed0c-b3f4-4081-93d4-56cc2b83e60a","resolution":{"observed_at":"2026-08-05T20:20:21.235156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:21.301457Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.301457Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:5da01e6f353174d467c15154ee3c7c1ac1025469d454772921db75f3268306cf","observation_id":"466cf268-80ba-4380-b297-27deda305d82","resolution":{"observed_at":"2026-08-05T20:20:21.301457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13122","last_updated":"2025-04-17T17:39:41Z","snapshot_observed_at":"2026-08-07T16:01:21.534867Z","submitted_at":"2025-04-17T17:39:41Z","title":"VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13122","snapshot_observed_at":"2026-08-05T20:20:21.374295Z","title":"Vistadpo: Video hierarchical spatial-temporal direct preference optimization for large video models.arXiv preprint arXiv:2504.13122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.374295Z"},"links":{"cited_paper":"/paper/2504.13122","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:32cd1fd37acd14a49c522d54ebcec644fb68e971483f0e254cfd3ad5ada43156","observation_id":"da0bf6ba-2227-4950-a54e-0e4d03af8456","resolution":{"observed_at":"2026-08-05T20:20:21.374295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:21.451153Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.451153Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:f2f46d58a75b45bcbfedbee918ff8faca02d6d331389b49f736e2d65692abf5b","observation_id":"1187b530-f1d1-4485-9edf-5c0cc2d7d5ac","resolution":{"observed_at":"2026-08-05T20:20:21.451153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-08T15:16:50.023350Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-05T20:20:21.541805Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning.arXiv preprint arXiv:2501.04698, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.541805Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:ed727a51443a2b41a9e819ee83635975513654698cd793fa20415b2afe6d55dd","observation_id":"01466845-10fd-4bbc-add5-daa1763e6c93","resolution":{"observed_at":"2026-08-05T20:20:21.541805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:21.620108Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.620108Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:f899a3d8f61979d31933e14f179dc4170844fdc347d579b663a562f8a0fc2c1e","observation_id":"1f287759-521d-44df-abae-1128db21b639","resolution":{"observed_at":"2026-08-05T20:20:21.620108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-09T03:30:59.643714Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-05T20:20:21.735542Z","title":"Camels in a changing climate: Enhancing lm adaptation with tulu 2.arXiv preprint arXiv:2311.10702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.735542Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:809daf74f7f84a3121d2173a56eab853035520eedfbef448dd72460208960cbb","observation_id":"ac2b474c-0bc4-4d32-95cf-174ee9080b64","resolution":{"observed_at":"2026-08-05T20:20:21.735542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01690","last_updated":"2025-02-02T16:55:42Z","snapshot_observed_at":"2026-07-06T20:30:31.588538Z","submitted_at":"2025-02-02T16:55:42Z","title":"HuViDPO:Enhancing Video Generation through Direct Preference Optimization for Human-Centric Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01690","snapshot_observed_at":"2026-08-05T20:20:21.813777Z","title":"Huvidpo: Enhancing video generation through direct preference optimization for human-centric alignment.arXiv preprint arXiv:2502.01690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.813777Z"},"links":{"cited_paper":"/paper/2502.01690","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:97e864b86743add944fa5059fc2d1b77135fcef8c35a0b43ffd0ec0dbe3d8023","observation_id":"7cb2e6fd-bab4-49c8-9373-17dc1e3b5506","resolution":{"observed_at":"2026-08-05T20:20:21.813777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:21.894678Z","title":"Miradata: A large-scale video dataset with long durations and structured captions.Advances in Neural Information Processing Systems, 37:48955–48970, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.894678Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:857d56987e124a15214d5834ff31a916bd5953669b17f79d6037555932f19282","observation_id":"af17686a-932f-4e0e-9f69-247ef1f6758b","resolution":{"observed_at":"2026-08-05T20:20:21.894678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02385","last_updated":"2025-06-22T03:30:55Z","snapshot_observed_at":"2026-08-02T22:45:54.982294Z","submitted_at":"2024-11-04T18:53:05Z","title":"How Far is Video Generation from World Model: A Physical Law Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02385","snapshot_observed_at":"2026-08-05T20:20:21.965641Z","title":"How far is video generation from world model: A physical law perspective.arXiv preprint arXiv:2411.02385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:21.965641Z"},"links":{"cited_paper":"/paper/2411.02385","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:89fc789da291881c45df4e29a71610cc070ca09e1719f0829b5bc9d33b332893","observation_id":"d4405d33-50e3-4729-bde0-a99f6cd52645","resolution":{"observed_at":"2026-08-05T20:20:21.965641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T20:20:22.046197Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.046197Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:987c6ec12ffbe1dda69a762986f23e7a2c99ee96b44c2e902773122e7bd016ea","observation_id":"5b0cdf9a-c003-4143-94df-a6798363e951","resolution":{"observed_at":"2026-08-05T20:20:22.046197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:22.098980Z","title":"Differentiable physics simulation of dynamics- augmented neural objects.IEEE Robotics and Automation Letters, 8(5):2780–2787, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.098980Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:1b7617d049977875cfe25cd585143104a6e0397f5037f44d408b47cd603dd3d3","observation_id":"f8879f6b-f98e-403d-ae76-26c11288dd3d","resolution":{"observed_at":"2026-08-05T20:20:22.098980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09595","last_updated":"2025-03-12T17:58:14Z","snapshot_observed_at":"2026-08-07T17:09:25.212342Z","submitted_at":"2025-03-12T17:58:14Z","title":"PISA Experiments: Exploring Physics Post-Training for Video Diffusion Models by Watching Stuff Drop","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09595","snapshot_observed_at":"2026-08-05T20:20:22.186537Z","title":"Pisa experiments: Exploring physics post-training for video diffusion models by watching stuff drop.arXiv preprint arXiv:2503.09595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.186537Z"},"links":{"cited_paper":"/paper/2503.09595","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:a8cd65d598de2c07370f2ba961cc09b1b8981dc2cef7549a88d1e43eeb1d1c10","observation_id":"3d95949e-f262-4622-9a1a-f1a603c5a664","resolution":{"observed_at":"2026-08-05T20:20:22.186537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20694","last_updated":"2025-02-28T03:58:23Z","snapshot_observed_at":"2026-08-07T17:41:02.221324Z","submitted_at":"2025-02-28T03:58:23Z","title":"WorldModelBench: Judging Video Generation Models As World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20694","snapshot_observed_at":"2026-08-05T20:20:22.262308Z","title":"Worldmodelbench: Judging video generation models as world models.arXiv preprint arXiv:2502.20694, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.262308Z"},"links":{"cited_paper":"/paper/2502.20694","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:886d824b9df063268fe89046ffcf710f2a1a03a3f056a6df0e00962b70fd9a7c","observation_id":"944ebd82-9e66-4707-8ce6-2fd22fdaa43f","resolution":{"observed_at":"2026-08-05T20:20:22.262308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12689","last_updated":"2025-03-16T23:15:09Z","snapshot_observed_at":"2026-08-07T17:00:03.554802Z","submitted_at":"2025-03-16T23:15:09Z","title":"MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12689","snapshot_observed_at":"2026-08-05T20:20:22.336182Z","title":"Magicid: Hybrid preference optimization for id-consistent and dynamic-preserved video customization.arXiv preprint arXiv:2503.12689, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.336182Z"},"links":{"cited_paper":"/paper/2503.12689","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:5addce0d507b6a70244c341e3e034909d1b278922f28ccfc8d0fb54dd04c23e9","observation_id":"10d5fa82-edcb-4837-8e3c-9b681172311d","resolution":{"observed_at":"2026-08-05T20:20:22.336182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:22.417850Z","title":"Science-t2i: Addressing scientific illusions in image synthesis.arXiv preprint arXiv:2504.13129, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.417850Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:8d6cb5af8ff5cdec7bbbca8bdf4152befa1c4e995bac77497a8c0a786ecc9487","observation_id":"190e7bf0-694b-4ae6-8619-5dd8486a2610","resolution":{"observed_at":"2026-08-05T20:20:22.417850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12032","last_updated":"2024-04-06T03:52:04Z","snapshot_observed_at":"2026-07-06T16:09:28.325603Z","submitted_at":"2023-08-23T09:45:29Z","title":"From Quantity to Quality: Boosting LLM Performance with Self-Guided Data Selection for Instruction Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12032","snapshot_observed_at":"2026-08-05T20:20:22.473706Z","title":"From quantity to quality: Boosting llm performance with self-guided data selection for instruction tuning.arXiv preprint arXiv:2308.12032, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.473706Z"},"links":{"cited_paper":"/paper/2308.12032","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e922f98ee25de5b412e1510c4b6ffabd6b6cdd157f4eb79e6bdedd57ddd01464","observation_id":"20b8d4f3-aa50-4441-930d-1de62a6c5da9","resolution":{"observed_at":"2026-08-05T20:20:22.473706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:22.547866Z","title":"Selective reflection-tuning: Student-selected data recycling for llm instruction-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.547866Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:bf4c4e18f6b4cb2c111181bed84ee47f9c15abe0a368d2002054bddc32f0f93a","observation_id":"60fd8e12-1717-477e-adc8-a456d0c4366a","resolution":{"observed_at":"2026-08-05T20:20:22.547866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00530","last_updated":"2024-06-07T20:28:36Z","snapshot_observed_at":"2026-08-09T09:08:37.888988Z","submitted_at":"2024-02-01T11:57:53Z","title":"Superfiltering: Weak-to-Strong Data Filtering for Fast Instruction-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00530","snapshot_observed_at":"2026-08-05T20:20:22.587802Z","title":"Superfiltering: Weak-to-strong data filtering for fast instruction-tuning.arXiv preprint arXiv:2402.00530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.587802Z"},"links":{"cited_paper":"/paper/2402.00530","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:edb05a805927f7b4e42680e6e05757666cc77ea4aaaf6dcea41dc27e553a6a74","observation_id":"e025c603-835d-4347-b7e3-f1551c58d54e","resolution":{"observed_at":"2026-08-05T20:20:22.587802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-05T20:20:22.655498Z","title":"Open-sora plan: Open-source large video generation model.arXiv preprint arXiv:2412.00131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.655498Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:9b19d3ac16cd20ec7e16079c893deca94c41b8a2858e1cb294969bd5f2f0026c","observation_id":"51874436-f855-475c-bd13-030ec8abd31e","resolution":{"observed_at":"2026-08-05T20:20:22.655498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:22.719445Z","title":"Yu, and Meng Cao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.719445Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:3517bcd90b96a8b1b8e2a297e7d0e5f2b5c0ba79057a743a7028db6caf493d96","observation_id":"184ef0c6-6137-4bfb-8bab-8d669f992ca6","resolution":{"observed_at":"2026-08-05T20:20:22.719445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10493","last_updated":"2025-06-24T20:53:27Z","snapshot_observed_at":"2026-07-06T20:06:48.183096Z","submitted_at":"2024-12-13T18:59:52Z","title":"AlignGuard: Scalable Safety Alignment for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10493","snapshot_observed_at":"2026-08-05T20:20:22.784344Z","title":"Safetydpo: Scalable safety alignment for text-to-image generation.arXiv preprint arXiv:2412.10493, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.784344Z"},"links":{"cited_paper":"/paper/2412.10493","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:6b5777a4759d2c6ac6dd5a35ffb7374caf73dc635e8cfbff9de2d00e63decb2a","observation_id":"5cabad66-aa5d-4a44-982d-aa5b481def45","resolution":{"observed_at":"2026-08-05T20:20:22.784344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14167","last_updated":"2024-12-18T18:59:49Z","snapshot_observed_at":"2026-08-09T07:20:53.172443Z","submitted_at":"2024-12-18T18:59:49Z","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14167","snapshot_observed_at":"2026-08-05T20:20:22.847704Z","title":"Videodpo: Omni-preference alignment for video diffusion generation.arXiv preprint arXiv:2412.14167, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.847704Z"},"links":{"cited_paper":"/paper/2412.14167","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:7d50a056c47585d9aab83b340ad127d850448dbad06bb220fa8c1f6984dfb12e","observation_id":"ec73463d-1051-4d07-a729-7fcf599b405e","resolution":{"observed_at":"2026-08-05T20:20:22.847704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:22.907977Z","title":"Physgen: Rigid-body physics-grounded image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.907977Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e8023cab6decebf8d18f04dbcfd96b20717e26c88fa82b73a1eb5e75a8f20fbf","observation_id":"28a6f193-cd6e-484d-be30-095404c0cbd3","resolution":{"observed_at":"2026-08-05T20:20:22.907977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:22.939440Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.939440Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:d4a5ddb39f56b587449e999c0b3320e30a68cc7a0e55e52ca0e0bbad920b785d","observation_id":"4ccbe447-d961-45bb-9576-ae086fb134eb","resolution":{"observed_at":"2026-08-05T20:20:22.939440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-05T20:20:22.994345Z","title":"Towards world simulator: Crafting physical commonsense- based benchmark for video generation.arXiv preprint arXiv:2410.05363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:22.994345Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:040382a6cbcfdc6ea123d9b804b113d8d187906b703f916995e58b6f6fd3a5c2","observation_id":"688f7ec0-68dc-4c27-9285-6256e8b5d541","resolution":{"observed_at":"2026-08-05T20:20:22.994345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.069148Z","title":"Motioncraft: Physics-based zero-shot video generation.Advances in Neural Information Processing Systems, 37:123155–123181, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.069148Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e84a9f85d9f5547fc1b06158babd07a9f0a2418b65ca193e5154e8f10af58d3d","observation_id":"120fdf91-fe6c-4f69-92f8-3312b3d1ed70","resolution":{"observed_at":"2026-08-05T20:20:23.069148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09038","last_updated":"2025-02-27T15:10:51Z","snapshot_observed_at":"2026-08-02T17:18:33.867969Z","submitted_at":"2025-01-14T20:59:37Z","title":"Do generative video models understand physical principles?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09038","snapshot_observed_at":"2026-08-05T20:20:23.148950Z","title":"Do generative video models learn physical principles from watching videos?arXiv preprint arXiv:2501.09038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.148950Z"},"links":{"cited_paper":"/paper/2501.09038","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:126031efd533aed0258e149ab2f143fce904f7964105855b9ff87c0a45fe9b48","observation_id":"021a286a-9255-4536-9f95-7a9c32ceb515","resolution":{"observed_at":"2026-08-05T20:20:23.148950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-05T20:20:23.216728Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation.arXiv preprint arXiv:2407.02371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.216728Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:abd2411a24b23ea522e4c99f9d3dd999d94a7a949c9c351296da3fb7b6ea8cf3","observation_id":"fd7ec827-d3d9-4081-998c-6d329554d3b2","resolution":{"observed_at":"2026-08-05T20:20:23.216728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.295361Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.295361Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:0e89f800265c8c85b7b712bb4685d2dbf7da8944a64921c116132ce92918ec28","observation_id":"e57bbf06-a529-4a4c-9de1-ba4d8a329310","resolution":{"observed_at":"2026-08-05T20:20:23.295361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12915","last_updated":"2024-07-07T08:16:28Z","snapshot_observed_at":"2026-07-06T18:17:25.642584Z","submitted_at":"2024-05-21T16:38:13Z","title":"G-DIG: Towards Gradient-based Diverse and High-quality Instruction Data Selection for Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12915","snapshot_observed_at":"2026-08-05T20:20:23.343005Z","title":"G- dig: Towards gradient-based diverse and high-quality instruction data selection for machine translation.arXiv preprint arXiv:2405.12915, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.343005Z"},"links":{"cited_paper":"/paper/2405.12915","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:abcaa82e6803f78859cdf68d25a82f66eece2d8675e6abe197f8ab9c5c12d07a","observation_id":"b037cf95-413f-4476-b9e1-49f4121dbd6e","resolution":{"observed_at":"2026-08-05T20:20:23.343005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-08-05T20:20:23.423843Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling.arXiv preprint arXiv:2310.15169, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.423843Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:62c816521cc07a1448856df6d186d296b45006be7733f079d55f72c8c83140c5","observation_id":"34663629-1456-48f5-baac-7c804ec7bd97","resolution":{"observed_at":"2026-08-05T20:20:23.423843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.500580Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.500580Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:ccce0a59146bd8cebc439954fa8d2f5b4b3dd0acaead4648d896537cd95efc91","observation_id":"049af62a-a3b5-44cd-b1ac-10c70d1491c7","resolution":{"observed_at":"2026-08-05T20:20:23.500580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.588669Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.588669Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:d8a2f020efd822512fa85630dd5732d0e9e77a99cd696fa6cf3aa54a81ad1be7","observation_id":"1a8c6334-89a6-4460-b5ee-524cb29461cb","resolution":{"observed_at":"2026-08-05T20:20:23.588669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.668075Z","title":"Towards nsfw-free text-to-image generation via safety-constraint direct preference optimization.arXiv preprint arXiv:2504.14290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.668075Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e3e5103dc1f17cdbce64bc8ed663e4c1279f7d110a4ef523679be2f4a8322359","observation_id":"1bac3b26-74f5-4098-9ea2-7d330c95100f","resolution":{"observed_at":"2026-08-05T20:20:23.668075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-09T05:24:50.195241Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-05T20:20:23.748468Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model.arXiv preprint arXiv:2504.08685, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.748468Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:f992ec27b5d230511692dc91a0ba6c766da9ba1b01d61d99c8bcda940eb399e7","observation_id":"0c85decf-415d-402c-9e4e-9a7b071d41b3","resolution":{"observed_at":"2026-08-05T20:20:23.748468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.829668Z","title":"Finephys: Fine-grained human action generation by explicitly incorporating physical laws for effective skeletal guidance","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.829668Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:a648561aac3b8c5c38e87148b05477dd0044dc35c452d26b82b0a5828ddafd9a","observation_id":"31de2f42-3116-4dd9-81f5-263f29278912","resolution":{"observed_at":"2026-08-05T20:20:23.829668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:23.920281Z","title":"Deep unsuper- vised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.920281Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:0c44a872de4ad52b67c3c77ea7add97705c37a6e8e548d6267da3f65dc3c63fa","observation_id":"e4444878-f4b5-45de-99f1-2c73b4be6d5f","resolution":{"observed_at":"2026-08-05T20:20:23.920281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02823","last_updated":"2024-04-03T15:55:39Z","snapshot_observed_at":"2026-07-06T17:55:12.784422Z","submitted_at":"2024-04-03T15:55:39Z","title":"Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02823","snapshot_observed_at":"2026-08-05T20:20:23.997025Z","title":"Conifer: Improving complex constrained instruction-following ability of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:23.997025Z"},"links":{"cited_paper":"/paper/2404.02823","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:10a79420f14427681d13e7c75562d77930f34da1ae8282d5ea6c711346e73971","observation_id":"e69ad3f7-4fab-4175-be85-2fd3819ccb08","resolution":{"observed_at":"2026-08-05T20:20:23.997025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:24.059788Z","title":"Dsv: Exploiting dynamic sparsity to accelerate large-scale video dit training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.059788Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:8a4a38594991359165df2879f2c898bc66d180928ef0947ed20ee0c9060c4bdd","observation_id":"c1d7dc81-6468-40fd-b414-f63276c780f6","resolution":{"observed_at":"2026-08-05T20:20:24.059788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:24.101688Z","title":"Stanford alpaca: An instruction-following llama model, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.101688Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:f805bcb7469209cc743e4d7bd88fddeca43c968b61dcd1533a775105a1d1ec4c","observation_id":"eadfa2d2-3b99-4fe2-8e5e-e2766a7e3c46","resolution":{"observed_at":"2026-08-05T20:20:24.101688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:24.150267Z","title":"D4: Improving llm pretraining via document de-duplication and diversification.Advances in Neural Information Processing Systems, 36:53983–53995, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.150267Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:72301c8e82c35fedd46373b3eb49d5611bf458bb9e7a858528a0c5ab6790b36e","observation_id":"e4b19ad2-7a43-4db2-bf6a-0b18eca2f7d3","resolution":{"observed_at":"2026-08-05T20:20:24.150267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T20:20:24.231554Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.231554Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:4a67a81c905ba2655ebbabf1435733b0065a12f51c06385107ecddd81fdfa0d9","observation_id":"06bb5adf-bd40-4529-a9d8-6da2d549d10c","resolution":{"observed_at":"2026-08-05T20:20:24.231554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:24.309441Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.309441Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:d1e6703e53f2a7936d2c43b80e34cbb57c1e5a1bf22a01cfadf22c1f51386e71","observation_id":"96f28482-adbe-4037-9204-bd6d6014fa57","resolution":{"observed_at":"2026-08-05T20:20:24.309441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T20:20:24.402498Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.402498Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:10c5deadc6bd5a656e6ea11439e7bbc59b9403b679470a465bf0201c1df59c2e","observation_id":"21f3ecdf-36b9-4a04-8ada-782f40b42ad6","resolution":{"observed_at":"2026-08-05T20:20:24.402498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05123","last_updated":"2025-08-26T15:28:36Z","snapshot_observed_at":"2026-08-04T16:46:26.858502Z","submitted_at":"2024-02-04T13:32:01Z","title":"A Survey on Data Selection for LLM Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05123","snapshot_observed_at":"2026-08-05T20:20:24.467176Z","title":"A survey on data selection for llm instruction tuning.arXiv preprint arXiv:2402.05123, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.467176Z"},"links":{"cited_paper":"/paper/2402.05123","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:1aa051a13d804571889b850a498b942c8c8af9a23bfb33728410033fc3b7e00b","observation_id":"3afcc84e-8dac-4d38-8c70-2f79f03afed4","resolution":{"observed_at":"2026-08-05T20:20:24.467176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08153","last_updated":"2025-03-11T08:10:03Z","snapshot_observed_at":"2026-08-09T00:50:01.098728Z","submitted_at":"2025-03-11T08:10:03Z","title":"WISA: World Simulator Assistant for Physics-Aware Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08153","snapshot_observed_at":"2026-08-05T20:20:24.540226Z","title":"Wisa: World simulator assistant for physics-aware text-to- video generation.arXiv preprint arXiv:2503.08153, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.540226Z"},"links":{"cited_paper":"/paper/2503.08153","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:80ebf665004d5a0879181737aa98e0a652f6bfad659f482b26f7883051320649","observation_id":"e669cf76-5d02-4bbf-8ced-da7d2095d66a","resolution":{"observed_at":"2026-08-05T20:20:24.540226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-05T20:20:24.611355Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.611355Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:066e92a59f3badaf12556f2fd997697a6ab8ff289affdaa8ebaf7b48bd8cd793","observation_id":"b12fb950-5c87-4313-9cd8-23b23ac671e4","resolution":{"observed_at":"2026-08-05T20:20:24.611355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-05T20:20:24.687999Z","title":"Self-instruct: Aligning language models with self-generated instruc- tions.arXiv preprint arXiv:2212.10560, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.687999Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:95d177f4521f175b54132a813ba96accf65888de861460c61992986ee4804c46","observation_id":"826f0fe6-f4d1-4d59-a6e0-4a08ab5d21cc","resolution":{"observed_at":"2026-08-05T20:20:24.687999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08619","last_updated":"2025-03-11T16:58:02Z","snapshot_observed_at":"2026-08-07T17:12:23.355096Z","submitted_at":"2025-03-11T16:58:02Z","title":"LightGen: Efficient Image Generation through Knowledge Distillation and Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08619","snapshot_observed_at":"2026-08-05T20:20:24.799234Z","title":"Lightgen: Efficient image generation through knowledge distillation and direct preference optimization.arXiv preprint arXiv:2503.08619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.799234Z"},"links":{"cited_paper":"/paper/2503.08619","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:370a033cd6d679b09a3476f9dc662ce01402c759ac950816d355d3dbf284a49b","observation_id":"e70f2bde-befd-405e-bbf3-446cfb302307","resolution":{"observed_at":"2026-08-05T20:20:24.799234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-05T20:20:24.847410Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.847410Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e2d4704e4ab182e8266d649b1fcca9805647bb0f467d7b297f85062e50499c37","observation_id":"c78059b2-1a8e-49e2-bd41-b770a054e651","resolution":{"observed_at":"2026-08-05T20:20:24.847410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:24.914535Z","title":"LESS: Selecting influential data for targeted instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.914535Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:d85bcc17608e04b5809e61f16970bf0a3ca0d357da0bd3116c6986abb6b16187","observation_id":"5a34d58a-0ece-43ed-9178-65bb60bf9c10","resolution":{"observed_at":"2026-08-05T20:20:24.914535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:24.992293Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:24.992293Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:a4151f36a24347375a9c38f3a71d464955f3325fd8b8f9a2928e80284501e722","observation_id":"5a85a87b-7bc1-481e-bf84-dbd83be02403","resolution":{"observed_at":"2026-08-05T20:20:24.992293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:25.095140Z","title":"Tooncrafter: Generative cartoon interpolation.ACM Transactions on Graphics (TOG), 43(6):1–11, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.095140Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:67cb1a9e308e7e234f84b312adbcb93479f1de29f462e1fd9045eeaabf10eb82","observation_id":"fdb13d32-32e5-4015-a4f6-c9caac4a8a50","resolution":{"observed_at":"2026-08-05T20:20:25.095140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:25.175943Z","title":"Make-your-video: Customized video generation using textual and structural guidance.IEEE Transactions on Visualization and Computer Graphics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.175943Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e5ba2d3138e6feb2f846930f0c86ae554ddf71aba466218fd57b7a154c519b1c","observation_id":"dba73fdd-ef53-42f0-8661-d71483d37478","resolution":{"observed_at":"2026-08-05T20:20:25.175943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-05T20:20:25.284690Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.284690Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:2f53bcf91f2b0ca26e02cb953edaf99ee632c5ec4fd58bf8754c6ec517fb4cec","observation_id":"2036bb0c-4685-44a2-99ea-81124d3e73ed","resolution":{"observed_at":"2026-08-05T20:20:25.284690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00596","last_updated":"2025-04-01T09:33:55Z","snapshot_observed_at":"2026-08-09T04:50:48.889729Z","submitted_at":"2024-11-30T22:02:12Z","title":"PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00596","snapshot_observed_at":"2026-08-05T20:20:25.354451Z","title":"Phyt2v: Llm-guided iterative self- refinement for physics-grounded text-to-video generation.arXiv preprint arXiv:2412.00596, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.354451Z"},"links":{"cited_paper":"/paper/2412.00596","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:b030a1fc96c86b2ef6ade4ca722390824b7615a38bf8c7b79e0bbfc91cbf1591","observation_id":"5a83502f-e937-4cab-a414-ecd4269b0cc9","resolution":{"observed_at":"2026-08-05T20:20:25.354451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T20:20:25.470971Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.470971Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:7a0610a96c62eaf0a90ef8068df6bf9e2e8921ad41fd171572fe1808bb45545a","observation_id":"af672e98-b20a-439a-9727-76067662cddf","resolution":{"observed_at":"2026-08-05T20:20:25.470971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03708","last_updated":"2025-03-27T11:46:22Z","snapshot_observed_at":"2026-08-07T17:26:55.188082Z","submitted_at":"2025-03-05T17:59:19Z","title":"Rethinking Video Tokenization: A Conditioned Diffusion-based Approach","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03708","snapshot_observed_at":"2026-08-05T20:20:25.564162Z","title":"Rethinking video tokenization: A conditioned diffusion-based approach.arXiv preprint arXiv:2503.03708, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.564162Z"},"links":{"cited_paper":"/paper/2503.03708","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:661e6dca579d013d05e2b64039333dacad69213c1f5dc05bba6f850fd42364cf","observation_id":"4ef4f03a-0d38-4567-9a85-67f46d7ba348","resolution":{"observed_at":"2026-08-05T20:20:25.564162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:25.714266Z","title":"Vlipp: Towards physically plausible video generation with vision and language informed physical prior.arXiv e-prints, pages arXiv–2503, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.714266Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:b844ff9012aef07af36feb2d8b72561b9fc135b1671230fbfd5fea6a59a7b994","observation_id":"d5fdc7aa-1dad-42e8-a46c-79c7710ad291","resolution":{"observed_at":"2026-08-05T20:20:25.714266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02418","last_updated":"2023-12-05T01:19:30Z","snapshot_observed_at":"2026-07-06T16:56:57.763886Z","submitted_at":"2023-12-05T01:19:30Z","title":"Decoding Data Quality via Synthetic Corruptions: Embedding-guided Pruning of Code Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02418","snapshot_observed_at":"2026-08-05T20:20:25.803393Z","title":"Decoding data quality via synthetic corruptions: Embedding-guided pruning of code data.arXiv preprint arXiv:2312.02418, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.803393Z"},"links":{"cited_paper":"/paper/2312.02418","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:6daf2f344abcbd90b7ed730d4a684d4362c5819df1ff8c98934f551ba3a58d83","observation_id":"b85b6055-590e-4ced-b5e4-cc56a6859ffe","resolution":{"observed_at":"2026-08-05T20:20:25.803393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T20:20:25.911307Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:25.911307Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:2db7f0e65b26b92ff3e18ba19d1224356f00fe670143598764f2afac059714ee","observation_id":"8713a1c7-87a2-4aa4-bec3-3cd307951862","resolution":{"observed_at":"2026-08-05T20:20:25.911307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-05T20:20:26.006631Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.006631Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:40930f210f969df6b57e818754e3365c3af28c17d35f856422648bceedb5a002","observation_id":"ea2ee177-e28c-4e6d-b998-70b6069ce1ba","resolution":{"observed_at":"2026-08-05T20:20:26.006631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:26.093846Z","title":"Gamefactory: Creating new games with generative interactive videos.arXiv preprint arXiv:2501.08325, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.093846Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:bd1dee1dfa0704ef389148da6794fbec5c7a887912fc635e00d2d0f0bc85af5c","observation_id":"7b04a895-03f7-4390-9ecf-6177df70d104","resolution":{"observed_at":"2026-08-05T20:20:26.093846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:26.097826Z","title":"Magictime: Time-lapse video generation models as metamorphic simulators.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.097826Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:f3e00004425dfbf1c181f84912d4cd392e5f8cb2b3a226d6094c5121d5f507c6","observation_id":"d18c32c4-22ef-46ad-8e59-2a049e054efb","resolution":{"observed_at":"2026-08-05T20:20:26.097826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:26.147343Z","title":"Onlinevpo: Align video diffusion model with online video-centric preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.147343Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:f464e7eccdcf135f1bb8b32626a3dd175428799bdff21167b377cd2f582e2cd3","observation_id":"4b9afc6a-a732-4704-82eb-3a5818f75d5b","resolution":{"observed_at":"2026-08-05T20:20:26.147343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15235","last_updated":"2024-07-21T17:59:20Z","snapshot_observed_at":"2026-08-07T00:28:19.060122Z","submitted_at":"2024-07-21T17:59:20Z","title":"TAGCOS: Task-agnostic Gradient Clustered Coreset Selection for Instruction Tuning Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15235","snapshot_observed_at":"2026-08-05T20:20:26.205369Z","title":"Tagcos: Task-agnostic gradient clustered coreset selection for instruction tuning data.arXiv preprint arXiv:2407.15235, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.205369Z"},"links":{"cited_paper":"/paper/2407.15235","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:b80c4e8e12ababa56012d57783d53dfc9e5d662f3c2c833f583dc6027f225acf","observation_id":"86953cee-2773-4711-881e-ae620e58f9d3","resolution":{"observed_at":"2026-08-05T20:20:26.205369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:26.289918Z","title":"Packing input frame contexts in next-frame prediction models for video generation.arXiv preprint arXiv:2504.12626, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.289918Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:e292d12378d0df9d6ca5f7734ad7a759b1b47ef617e10d6d130707440152fff6","observation_id":"aff15324-4a8c-40bf-8369-e0a35695ded8","resolution":{"observed_at":"2026-08-05T20:20:26.289918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04507","last_updated":"2025-06-04T23:21:39Z","snapshot_observed_at":"2026-08-08T22:25:30.997284Z","submitted_at":"2025-02-06T21:17:09Z","title":"Fast Video Generation with Sliding Tile Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04507","snapshot_observed_at":"2026-08-05T20:20:26.373467Z","title":"Fast video generation with sliding tile attention, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.373467Z"},"links":{"cited_paper":"/paper/2502.04507","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:1ba9d10a473f76c327d7213ff35d4629b818b194b5dc1e4c6b2ea5428eb94fa5","observation_id":"c3b29894-f158-4794-91e6-1b2dccbd8d98","resolution":{"observed_at":"2026-08-05T20:20:26.373467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20822","last_updated":"2025-03-26T00:45:07Z","snapshot_observed_at":"2026-08-07T16:37:00.297428Z","submitted_at":"2025-03-26T00:45:07Z","title":"Synthetic Video Enhances Physical Fidelity in Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20822","snapshot_observed_at":"2026-08-05T20:20:26.433306Z","title":"Synthetic video enhances physical fidelity in video synthesis.arXiv preprint arXiv:2503.20822, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.433306Z"},"links":{"cited_paper":"/paper/2503.20822","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:c6676d137949061e98fbe975f7f6ea2bdd47915c697041dde75c81607dccd151","observation_id":"ef7937bb-5a5c-4068-bd49-b5477674f288","resolution":{"observed_at":"2026-08-05T20:20:26.433306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-05T20:20:26.570925Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.570925Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:82f9266016b12b590788d1b6de49ecd244db8593750bbe9358a1d872c51dea0b","observation_id":"433b6377-20a2-40c0-80b2-edc6fe17c8fa","resolution":{"observed_at":"2026-08-05T20:20:26.570925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:26.671291Z","title":"Deco: Decoupled human-centered diffusion video editing with motion consistency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.671291Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:603a7bebdd34d0015779b7f7e88f268fdb915cb07f6b894b9d85056970503432","observation_id":"a65f0930-7e38-428e-b35d-f8d1096be413","resolution":{"observed_at":"2026-08-05T20:20:26.671291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:20:26.816265Z","title":"Lima: Less is more for alignment.Advances in Neural Information Processing Systems, 36:55006–55021, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-05T20:20:26.816265Z"},"links":{"citing_paper":"/paper/2508.10858"},"observation_digest":"sha256:75b24882b08a0e1d3aa2a8aae91159904d85ed3a4aeb451e79ab41cdfee55d02","observation_id":"f43e9135-d0e3-4c05-87df-99559ab50658","resolution":{"observed_at":"2026-08-05T20:20:26.816265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10858","last_updated":"2025-08-14T17:30:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:22:47.570469Z","submitted_at":"2025-08-14T17:30:37Z","title":"Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 2 inbound Pith citation observations for arXiv:2508.10858."}