{"as_of":"2026-08-10T11:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e30e2d2bf84077885dbcdeef687ecfc1520f1620bc1e7a5883edfe9285af981f","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:26:17.427689Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:55:02.514189Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T00:14:04.743463Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"cited_work":{"arxiv_id":"2502.06812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06812","snapshot_observed_at":"2026-06-30T00:14:04.743463Z","title":"arXiv preprint arXiv:2502.06812 (2025) 4","venue":null,"work_id":"396e07f5-5bb1-4cd4-aace-f1c21a69f065","year":2025},"citing_paper":{"arxiv_id":"2605.25759","last_updated":"2026-05-25T12:10:23Z","snapshot_observed_at":"2026-07-06T23:35:41.527169Z","submitted_at":"2026-05-25T12:10:23Z","title":"Towards Anatomically Plausible Human Image Generation via Synthetic Localized Preferences","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T22:55:02.514189Z"},"links":{"cited_paper":"/paper/2502.06812","citing_paper":"/paper/2605.25759"},"observation_digest":"sha256:5da58f5bbdca4aab87de57a3ebeec540511eceff170de59d9e9f109fcb087898","observation_id":"00c016e6-4207-42fb-87cc-2dd859cd3def","resolution":{"observed_at":"2026-06-30T00:14:04.744750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06812/citation-record","integrity":"/paper/2502.06812/integrity","json":"/paper/2502.06812/citation-record.json","paper":"/paper/2502.06812"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.243081Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.243081Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:81f469358f1f2d1caf3352c79a0266c67cf4a3ae25f39121c48fba4c02693c91","observation_id":"8c5a285f-8ac6-42b5-8765-f6c555b337b3","resolution":{"observed_at":"2026-08-09T11:26:17.243081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.153633Z","title":"URL https://pictory.ai/blog","venue":null,"work_id":"cdbb099d-7ae7-45ff-a329-7c070b11234c","year":2025},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.248155Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:be8d8700000f0321af9f6fa408c3eae93bb471460b43d6ad0b5d5e122d4fdbda","observation_id":"3fbd6934-8faf-4eb0-b755-3fdc48153444","resolution":{"observed_at":"2026-08-09T11:26:18.157160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.142982Z","title":"URL https://runwayml.com/","venue":null,"work_id":"55ba8e54-c929-4220-a90a-8618c0d7c9e4","year":2025},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.253340Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:8dafdd6e4a45d92e9bc3a283d964ac0d4376df536dea29e1ddf17aa72a3aaf5a","observation_id":"8b75cea8-a0a0-4062-8e95-6c007e4a12b1","resolution":{"observed_at":"2026-08-09T11:26:18.146504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.131923Z","title":"URL https://www.synthesia.io/tools/ai-video-editor","venue":null,"work_id":"a2fdafb7-316b-4881-b915-67910effb908","year":2025},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.257049Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:b88fcb8ba4f79cb0f96d55e4ee8fdd4019d0c1b8b7e215cf9d1790a220da9e32","observation_id":"aedda03a-87d7-4a68-ab79-768bf9587477","resolution":{"observed_at":"2026-08-09T11:26:18.135495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.121618Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"1c9bceec-756b-4134-b7b6-c526f636d32b","year":2021},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.260790Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:9d1c5fa565298e90d01474f9acfd60f663ca1c5d0b570bff6db74b33c18af32e","observation_id":"efeb00fe-29df-4a0d-8be1-5a03cdde91c2","resolution":{"observed_at":"2026-08-09T11:26:18.125190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.109978Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":"45b2f0a4-8df5-4257-a4cb-2fa9e931d99c","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.264626Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:3ecee69833c90bff886c4531c556f202da42de31e0ded51aeb6dafd4afcbf774","observation_id":"5df60e09-8171-4268-82fe-fb82643f38ca","resolution":{"observed_at":"2026-08-09T11:26:18.114384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.098607Z","title":"W., Fidler, S., and Kreis, K","venue":null,"work_id":"0f299ae6-0494-4ea3-b617-756fd863a8a8","year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.268305Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:2919a172ca86533870bdd0ab9932fb080a9ee508abdd70e8e443b0d8a23badcf","observation_id":"de1572f6-76a2-441a-be2d-add4be29ed80","resolution":{"observed_at":"2026-08-09T11:26:18.102381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-09T11:26:17.271948Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.271948Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:2e5641229fc1f85a125154108fb6843cc06d9eafa7f62cf1a133008bd2af23c9","observation_id":"dc14affc-bd09-4e31-b33f-bc07333ecdc7","resolution":{"observed_at":"2026-08-09T11:26:17.271948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.087344Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"12140473-9c42-45fa-b2c1-2839629cce4f","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.275902Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:9026ddb72cee82adc19cdd50da2f532230ae6cf7c6c22896b10c1b8d426576c5","observation_id":"e2fed0ae-baa9-4c8f-b9b3-22ac36d071b5","resolution":{"observed_at":"2026-08-09T11:26:18.091279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.076500Z","title":"S., Brox, T., and Ronneberger, O","venue":null,"work_id":"04a78e8d-dc75-48c5-9cb2-35827a4a5f79","year":2016},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.279374Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:19ade186595b249de5da1eb3b0e16466e791d6bbd0d19c2084f837deb7a85fb4","observation_id":"fde46d5c-986b-4c56-ab52-c3ff07c40c11","resolution":{"observed_at":"2026-08-09T11:26:18.080150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.065457Z","title":null,"venue":null,"work_id":"74268766-c25e-4f43-8125-bf00b3c7d00a","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.283020Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:54acce4f5fe22bbdc2611fe024ec15eb20fccd797a750bca3bea4ae177e59810","observation_id":"1bac0149-6a1c-49f8-8c9d-6579e6e16b07","resolution":{"observed_at":"2026-08-09T11:26:18.069161Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16381","last_updated":"2023-11-01T04:48:26Z","snapshot_observed_at":"2026-08-09T13:57:01.633043Z","submitted_at":"2023-05-25T17:35:38Z","title":"DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16381","snapshot_observed_at":"2026-08-09T11:26:17.286546Z","title":"DPOK: reinforcement learning for fine-tuning text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.286546Z"},"links":{"cited_paper":"/paper/2305.16381","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:c8a365e1c38e3ca04ecc78b1909318eae57c1802e56a5a4f31c6c595fd78e08f","observation_id":"ced1d457-8368-476b-af66-8257e700416c","resolution":{"observed_at":"2026-08-09T11:26:17.286546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.054141Z","title":"D., Ni, Y., Lyu, B., Narsupalli, Y., Fan, R., Lyu, Z., Lin, B","venue":null,"work_id":"b9786f90-adb8-41b1-b2a0-1ba0f9ce0f70","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.290440Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:22c02784a8e1b25c516e6f1e3448465b71ee90aaa37761214dde20178b13714d","observation_id":"7245801a-4267-4d2f-8344-a3abe0d74e8a","resolution":{"observed_at":"2026-08-09T11:26:18.058047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.293856Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.293856Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:0fc55986ed4097fd21479e7d88e22259f6ac22512fc30c35e974f2d037df2450","observation_id":"12601fad-88be-4d2b-b42d-9f27ac66d592","resolution":{"observed_at":"2026-08-09T11:26:17.293856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-08-09T11:26:17.297240Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.297240Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:d3e23849fdb2f8fc4fe9e6dbacd9211758bb403532834438afe7cf4097b6f2f2","observation_id":"5ef611e7-864f-491f-8fe7-6842261106a1","resolution":{"observed_at":"2026-08-09T11:26:17.297240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.300911Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.300911Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:110ed8aec7eb892e566ab332c1fbdef663b1b7815d0e1fbc04f9e88a959e8345","observation_id":"01ef9893-5173-45df-a4f6-c633fc7e7f41","resolution":{"observed_at":"2026-08-09T11:26:17.300911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.304046Z","title":"J., Shen, Y., Wallis, P., Allen - Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.304046Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:e7b98f766c0ea5271f1ed4408b4294f6557867ed36532b59a9e9f8a9ce14d282","observation_id":"41c20b07-a1e8-4943-aedf-ea363127e0ab","resolution":{"observed_at":"2026-08-09T11:26:17.304046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.023675Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"e9c25298-4da5-43b1-a256-42e0009d5ca9","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.307223Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:0eb726830bbed73cda804b74ccb174f6987254df74686f2fe751033e8322cad7","observation_id":"1c883af6-977d-49db-b3e8-a0d5e6802840","resolution":{"observed_at":"2026-08-09T11:26:18.027581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-09T11:26:17.310948Z","title":"MANTIS: interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.310948Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:9fe1997181b611ee4a879971e7ce8a7c6f40f4db82846070fd5ae99d455e21fc","observation_id":"13f1cb82-f460-4ad9-a828-d0af78269364","resolution":{"observed_at":"2026-08-09T11:26:17.310948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:18.012130Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":"d2c97bff-d2ff-418b-99eb-74724c52699a","year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.314581Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:e6de02b6719602a761c8b6eb3768b6152e698ff639fedd31cb6ff4ab8cec5461","observation_id":"e90345d2-d1b0-462c-9b14-49de74ab4ccc","resolution":{"observed_at":"2026-08-09T11:26:18.015879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.317958Z","title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.317958Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:980a63dd36ac31fbad3e9c3f346494cac4cdba011e9c2aae4e62ae1f32a4aa65","observation_id":"bf72edf6-0785-4f72-8c9e-10a2e351ee92","resolution":{"observed_at":"2026-08-09T11:26:17.317958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-09T11:26:17.321272Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.321272Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:8b0381683ea2cc707f3befaee77fe5c4b717df72c05db1c7addb65eaeb348ab2","observation_id":"290e26b9-8ff6-43c0-ada4-d2130980bf9c","resolution":{"observed_at":"2026-08-09T11:26:17.321272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-09T11:26:17.324956Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.324956Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:412cfdceda356f515bf66d1b5f0ee86f5cf4e65e98dbad49e692fcee70283aee","observation_id":"baf6ea88-7f3d-473c-98db-8daeaf0af1a1","resolution":{"observed_at":"2026-08-09T11:26:17.324956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-08T11:19:14.293609Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-09T11:26:17.328708Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.328708Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:6ad2f2e7d67d4d1e9aa98e5cb34260f5d39afb15018a1587471be0719a48039a","observation_id":"9bc82d02-afd8-4e98-b2cb-a35855234460","resolution":{"observed_at":"2026-08-09T11:26:17.328708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.332358Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.332358Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:aba7c4a1ca3474e35ed3054636abbd65218976289ce136420396fb9c238bf8c8","observation_id":"9579da8f-f846-4c91-84c6-1b1559d92b32","resolution":{"observed_at":"2026-08-09T11:26:17.332358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18438","last_updated":"2023-07-03T13:08:46Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T01:18:39Z","title":"Reinforcement Learning with Human Feedback: Learning Dynamic Choices via Pessimism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18438","snapshot_observed_at":"2026-08-09T11:26:17.335567Z","title":"Reinforcement learning with human feedback: Learning dynamic choices via pessimism","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.335567Z"},"links":{"cited_paper":"/paper/2305.18438","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:2fad2998e6eb97be790e0bc1dcd1b420b312369bd6c26d87b008ce00620fc4f5","observation_id":"80cabdce-42f1-4842-bbbe-f9b87b4f4220","resolution":{"observed_at":"2026-08-09T11:26:17.335567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.994653Z","title":"Training diffusion models towards diverse image generation with reinforcement learning","venue":null,"work_id":"3d45d6ae-a607-4108-bba4-ce648046636d","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.339251Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:e7222d9010f5e474c933609cc3d775d121e830f0accd70799e2d588a6ee2164a","observation_id":"e20643f3-bd49-4963-8475-adfa24984a24","resolution":{"observed_at":"2026-08-09T11:26:17.998359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-09T11:26:17.342550Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.342550Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:7a0c3db780d4e233283ac689dc30efd8e52c3485483c7ab6a57d4d7d5cc8912d","observation_id":"092329e7-6779-4fc7-b795-96716892445d","resolution":{"observed_at":"2026-08-09T11:26:17.342550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T11:26:17.346201Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.346201Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:17426d2c4a10c7923b613d752cc9b7dd486e32148a9b9b703ec767ab4e8d5f3d","observation_id":"c94f1892-48bb-460f-8567-a32f4cd29ebc","resolution":{"observed_at":"2026-08-09T11:26:17.346201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.983959Z","title":"L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P","venue":null,"work_id":"9d66307c-ff8b-4cbf-9c2d-8c77607ecdf3","year":2022},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.349544Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:3ef1bf957c59df763f0cb4366eed2519df23485fc941315f183279ba4cb15483","observation_id":"cb54f3f0-f509-4844-a63a-e9f8678a61ed","resolution":{"observed_at":"2026-08-09T11:26:17.987745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.972378Z","title":"L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L., Simens, M., Askell, A., Welinder, P., Christiano, P","venue":null,"work_id":"e56da44e-6db6-4f3f-9885-aa6cc5793942","year":2022},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.352961Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:7cd26d263741f48150d1b6ed9e4c2043a13243929702dea1cae2364a9cc211ba","observation_id":"4891e545-c561-4147-b1d1-866eb9da518e","resolution":{"observed_at":"2026-08-09T11:26:17.976260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.356423Z","title":"and Xie, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.356423Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:e45205a3ac3a1835e2162aaf351a1aab957be0c921147211c0c663ab1c7fd782","observation_id":"463148d6-1883-4822-b165-b519192fe8ae","resolution":{"observed_at":"2026-08-09T11:26:17.356423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.954380Z","title":"SDXL: improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"a9ed0c65-ac77-42cd-a04d-1d9570eafecc","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.359920Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:e6186ec19bd9ce83a65236f31706bcd211e02f0851713becaf1fb2e445b6f782","observation_id":"f1b94478-f388-4ac6-80cc-a501d47f4708","resolution":{"observed_at":"2026-08-09T11:26:17.958648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.943386Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2b77d100-85ac-4c37-bfe9-0e89b1192bde","year":2022},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.363268Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:c277a38fb151054efc5be0c809151a888bfe8f038d1952268e6d8d9bbdf799c8","observation_id":"2ee32771-19e3-4a1e-8b84-ee6453f5bf6c","resolution":{"observed_at":"2026-08-09T11:26:17.947151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.366845Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.366845Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:7d593f1bf4e3aa5576885c2a79e6b327d680208d169c126ef21b08184795d741","observation_id":"da93ef58-bc8b-4450-a102-4989ded7d2f2","resolution":{"observed_at":"2026-08-09T11:26:17.366845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.925695Z","title":"LAION-5B: an open large-scale dataset for training next generation image-text models","venue":null,"work_id":"b6f19ab9-59dd-45ac-adec-4d61dae028bd","year":2022},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.370367Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:327d488fad9545f854e69f91e170595658554217d3343fdeaa2a1c16ee2854db","observation_id":"2a54d9d5-d202-4512-890d-61b9cf982b8d","resolution":{"observed_at":"2026-08-09T11:26:17.929516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.914939Z","title":"A., Maheswaranathan, N., and Ganguli, S","venue":null,"work_id":"97bfd0cb-9011-4e0f-8dfa-fd469cbdc388","year":2015},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.373782Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:ba42f3a67d5a3013a44b30229a1b9798a5aabae7ed656b5056e8c7772c3f4c3f","observation_id":"f2c659b3-a8b7-4766-bd25-9870c2910a2d","resolution":{"observed_at":"2026-08-09T11:26:17.918690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.377376Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.377376Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:09167261270f0a0aa4ea3d8ed2e3bb216324807430731dd2e72c599f7cf72e65","observation_id":"74c99577-e516-4fe2-a861-162206aba917","resolution":{"observed_at":"2026-08-09T11:26:17.377376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.895493Z","title":"Consistency models","venue":null,"work_id":"7d9b1c2f-f36a-4b54-9c0b-d72c4cb92a20","year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.380794Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:ae98c644748c3a39102a6d194e0f7fe138b726344e2aa53a930d216d2a0df8d9","observation_id":"81da2080-a620-444a-93a4-19e85f845eb5","resolution":{"observed_at":"2026-08-09T11:26:17.899497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-09T11:26:17.384105Z","title":"R., and Shah, M","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.384105Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:a14271c5fce34ee9a03103aa8c92d5d9d5700115cf6b9cd342c20e352e3a4bc0","observation_id":"fd1b764d-4f11-42f3-bc79-9d06f29c65a9","resolution":{"observed_at":"2026-08-09T11:26:17.384105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.883675Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":"28fc6161-5b63-4cec-9aa3-7cd4179ea4a4","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.387754Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:bfb1a4b1f0a886fe2bbd649928166e1218a1bf3ec4ceaebc9746bb6f9faf463e","observation_id":"8752b132-1c6b-4e5d-ad17-277fb32a4aee","resolution":{"observed_at":"2026-08-09T11:26:17.887636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.872554Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":"f5881730-1238-475a-b223-329ac28c44ae","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.391188Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:036e3e40f7339d02157cadea89f91fb2557da06231457714345ebc86af50b1a3","observation_id":"0b6d9d1b-668d-4bd5-9932-1cf822a576b5","resolution":{"observed_at":"2026-08-09T11:26:17.876517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-09T11:26:17.394937Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.394937Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:57840f05b3f36e3036c2fff52994f38ba9949f054d2f8bec1917c5b1a0b418c2","observation_id":"3d57ade5-7816-4cc7-800d-c48ab8671811","resolution":{"observed_at":"2026-08-09T11:26:17.394937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12566","last_updated":"2024-10-01T04:42:48Z","snapshot_observed_at":"2026-07-06T18:32:57.295918Z","submitted_at":"2024-06-18T12:52:51Z","title":"RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12566","snapshot_observed_at":"2026-08-09T11:26:17.398677Z","title":"Richrag: Crafting rich responses for multi-faceted queries in retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.398677Z"},"links":{"cited_paper":"/paper/2406.12566","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:c1b39f0656e2c62808da4cb4e065ffb7a52886a7165ab1f10546690ada9caa47","observation_id":"baa090bd-7c97-4d66-a500-6a3906b8df0d","resolution":{"observed_at":"2026-08-09T11:26:17.398677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-09T11:26:17.402512Z","title":"C., Dai, B., Lin, D., Qiao, Y., and Liu, Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.402512Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:ed1c7a9493c8a4b3564a6b4bca531c56f219363efe69f16da614da649332f0b7","observation_id":"7d231b12-a8c4-46ee-b5e2-0186e4827714","resolution":{"observed_at":"2026-08-09T11:26:17.402512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.861820Z","title":"A., Khashabi, D., and Hajishirzi, H","venue":null,"work_id":"3f7aa5b9-201e-4c5e-ad46-0edc2a4417b8","year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.406014Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:1f4bdcd9191180293529ca292088b3c8b113ba48de1f93322735f68f34cc4431","observation_id":"75a0a4aa-c41d-4012-82b4-d9c5bb0410e9","resolution":{"observed_at":"2026-08-09T11:26:17.865449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-09T11:26:17.409465Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.409465Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:26a142a1b145e6c77a409c722f61419c26046f829b45001447e4c5e8acf3e9bf","observation_id":"e9cf16ff-c0b8-4e7a-a393-d939dc595ad5","resolution":{"observed_at":"2026-08-09T11:26:17.409465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.413483Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.413483Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:2c9769aabdb4bd0e608898f0d80e8bd510b45d509d632810f0290e3e30168207","observation_id":"5551404b-fa29-4bb9-99ce-2a951dd855d8","resolution":{"observed_at":"2026-08-09T11:26:17.413483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-09T11:26:17.416856Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.416856Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:69e31f8edcf417be3df555f7fd85b36ef60da720e5a1ad7d92bc74c49ef96275","observation_id":"ac826ea7-c472-40d0-a0f3-b374c6d65701","resolution":{"observed_at":"2026-08-09T11:26:17.416856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.850720Z","title":"S., Eom, S., Han, G., Nam, D","venue":null,"work_id":"ebc2f820-6d89-40be-91d2-c7dbe669a5aa","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.420575Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:dff6fca487e7f0862ee6db29245870f5c60fa2833d78a45282647a45244702db","observation_id":"2e0eadc8-e38b-4b08-9360-074146c24f07","resolution":{"observed_at":"2026-08-09T11:26:17.854512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:26:17.836747Z","title":"Instructvideo: Instructing video diffusion models with human feedback","venue":null,"work_id":"bafb8de0-622e-4d53-8d9b-a1a4844a1d49","year":2024},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.424192Z"},"links":{"citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:dc7313fa47ca21230c06cbf1c4d55c928b98e1489b391bb0af7d8b501c69aee3","observation_id":"333f10b4-35ed-40bb-bb5a-faa9522fd818","resolution":{"observed_at":"2026-08-09T11:26:17.842663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-09T11:26:17.427689Z","title":"J., Wu, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T11:26:17.427689Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2502.06812"},"observation_digest":"sha256:e482260089014b8d3cbf3ce60a22cecc175a4a414435b2ca98cf7e202220e7fc","observation_id":"0dc15b45-3499-4c62-8900-cadfb86ff712","resolution":{"observed_at":"2026-08-09T11:26:17.427689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06812","last_updated":"2025-02-17T20:35:45Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T13:57:18.227101Z","submitted_at":"2025-02-04T21:10:25Z","title":"Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2502.06812."}