{"as_of":"2026-08-08T20:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc536ce4046c4cf4db81923e2a702c46b05efddaa4e9f9cc2325c4e51ae83a5f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T20:36:08.401563Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T04:29:45.017327Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:23:15.759179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"cited_work":{"arxiv_id":"2511.19356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19356","snapshot_observed_at":"2026-07-17T02:21:30.636526Z","title":"Growing with the generator: Self-paced grpo for video generation","venue":null,"work_id":"7d438a3a-5698-4c02-a742-f48ef2a9dee2","year":2025},"citing_paper":{"arxiv_id":"2604.19234","last_updated":"2026-04-27T09:55:01Z","snapshot_observed_at":"2026-07-06T23:05:53.378585Z","submitted_at":"2026-04-21T08:37:13Z","title":"Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:26.580964Z"},"links":{"cited_paper":"/paper/2511.19356","citing_paper":"/paper/2604.19234"},"observation_digest":"sha256:8e5dbf58d61f79e5be2419ae2e86312a175ab0b5873c2ee0871487afcb4d0cde","observation_id":"f1482365-50cf-48cd-a368-7d3c056db61a","resolution":{"observed_at":"2026-07-17T02:21:30.636526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"cited_work":{"arxiv_id":"2511.19356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19356","snapshot_observed_at":"2026-07-17T02:21:30.636526Z","title":"Growing with the generator: Self-paced grpo for video generation","venue":null,"work_id":"7d438a3a-5698-4c02-a742-f48ef2a9dee2","year":2025},"citing_paper":{"arxiv_id":"2605.15458","last_updated":"2026-05-14T22:40:56Z","snapshot_observed_at":"2026-08-01T23:49:14.751351Z","submitted_at":"2026-05-14T22:40:56Z","title":"Video Models Can Reason with Verifiable Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T15:03:14.894952Z"},"links":{"cited_paper":"/paper/2511.19356","citing_paper":"/paper/2605.15458"},"observation_digest":"sha256:8aab03c1d49bf78cb539e294fc18220949d3f0633ad7405228b5bb82e7e50649","observation_id":"db3f62fc-c43c-45e2-9240-efef6d48f3fe","resolution":{"observed_at":"2026-07-17T02:21:30.636526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"cited_work":{"arxiv_id":"2511.19356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19356","snapshot_observed_at":"2026-07-17T02:21:30.636526Z","title":"Growing with the generator: Self-paced grpo for video generation","venue":null,"work_id":"7d438a3a-5698-4c02-a742-f48ef2a9dee2","year":2025},"citing_paper":{"arxiv_id":"2605.29602","last_updated":"2026-05-28T08:40:34Z","snapshot_observed_at":"2026-07-31T08:03:40.151420Z","submitted_at":"2026-05-28T08:40:34Z","title":"CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-29T08:14:20.558527Z"},"links":{"cited_paper":"/paper/2511.19356","citing_paper":"/paper/2605.29602"},"observation_digest":"sha256:981e08ff488e4156ebc2eeecbbe117988024f05805851f7dc93874246505352d","observation_id":"0f6f0326-c438-4795-a64c-3eb17e0c1d8d","resolution":{"observed_at":"2026-07-17T02:21:30.636526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19356","snapshot_observed_at":"2026-08-01T04:29:45.017327Z","title":"arXiv preprint arXiv:2511.19356 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22531","last_updated":"2026-07-24T17:59:39Z","snapshot_observed_at":"2026-08-07T13:04:18.211748Z","submitted_at":"2026-07-24T17:59:39Z","title":"Twins: Learn to Predict Unified Representations with Focal Loss","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T04:29:45.017327Z"},"links":{"cited_paper":"/paper/2511.19356","citing_paper":"/paper/2607.22531"},"observation_digest":"sha256:d9f907506fc8fb6bf82fe878e501fb624853bcd8c6571187eaae64e0f80a5f2a","observation_id":"7a91ca6b-51ee-4564-8968-651b80867ef4","resolution":{"observed_at":"2026-08-01T04:29:45.017327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19356","snapshot_observed_at":"2026-08-01T02:49:59.034747Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25321","last_updated":"2026-07-28T06:13:18Z","snapshot_observed_at":"2026-08-07T09:19:37.277038Z","submitted_at":"2026-07-28T06:13:18Z","title":"Physics-Grounded Fluid Video Generation with a Simulation Dataset and Dual-Stream Optical-Flow Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:49:59.034747Z"},"links":{"cited_paper":"/paper/2511.19356","citing_paper":"/paper/2607.25321"},"observation_digest":"sha256:7bef50b14f514c40c60c400ef64178b57ac2c628fb402450e9b0a6e1c9b69110","observation_id":"2a221d75-1be6-4883-ac0e-b10d67f04d23","resolution":{"observed_at":"2026-08-01T02:49:59.034747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.19356/citation-record","integrity":"/paper/2511.19356/integrity","json":"/paper/2511.19356/citation-record.json","paper":"/paper/2511.19356"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-03T20:36:05.488757Z","title":"V-jepa 2: Self- supervised video models enable understanding, prediction and planning.arXiv preprint arXiv:2506.09985, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.488757Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:5f40ef57c15468c33bbe5ede655de4bc61df9706911cb0c5987280797d5b04ab","observation_id":"7a26b75e-ccdb-4541-94ad-957a160d7f01","resolution":{"observed_at":"2026-08-03T20:36:05.488757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-07T17:17:34.989308Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-03T20:36:05.524886Z","title":"Boosting the generalization and reasoning of vision language models with curriculum reinforcement learning.arXiv preprint arXiv:2503.07065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.524886Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:8dfa0602c5418e890021800f452d604c6dd4b791ac8ca27a74e201bbcc3aa42c","observation_id":"7fbcfb2d-1706-4683-aed3-2eb00a406eee","resolution":{"observed_at":"2026-08-03T20:36:05.524886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:05.580757Z","title":"Reinforcement learning in continuous time and space.Neural computation, 12(1):219–245, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.580757Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:4934c074b53f1778700e717c5ea1af044ddd95ca68895893205e509d16dcd58d","observation_id":"4ffd453f-6682-4f08-b348-8ab98838e177","resolution":{"observed_at":"2026-08-03T20:36:05.580757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17574","last_updated":"2025-05-23T07:33:25Z","snapshot_observed_at":"2026-08-07T14:42:15.150633Z","submitted_at":"2025-05-23T07:33:25Z","title":"InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17574","snapshot_observed_at":"2026-08-03T20:36:05.640778Z","title":"Inflvg: Reinforce inference-time con- sistent long video generation with grpo.arXiv preprint arXiv:2505.17574, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.640778Z"},"links":{"cited_paper":"/paper/2505.17574","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:8d86524e512def412a22c223042475bca582626a50ea7c8df18ea0dcd1077e8d","observation_id":"c372b29d-e85b-44d5-88db-1a97d8c7edca","resolution":{"observed_at":"2026-08-03T20:36:05.640778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:05.709921Z","title":"You only look at one sequence: Rethinking transformer in vision through object detection.Advances in Neural Information Processing Systems, 34:26183–26197, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.709921Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:639274933cd9c2a887cbd0e4fe8fc1628eb1b86b86113e8bff386d339b564f12","observation_id":"b8c870be-03be-4cf7-884c-a0d416dd60bc","resolution":{"observed_at":"2026-08-03T20:36:05.709921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02617","last_updated":"2026-04-17T21:00:45Z","snapshot_observed_at":"2026-07-30T10:05:05.279382Z","submitted_at":"2024-12-03T17:44:23Z","title":"Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02617","snapshot_observed_at":"2026-08-03T20:36:05.771107Z","title":"Im- proving dynamic object interactions in text-to-video gener- ation with ai feedback.arXiv preprint arXiv:2412.02617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.771107Z"},"links":{"cited_paper":"/paper/2412.02617","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:4b87b75d58f03afc60913b75091758a86869cf6a2a05a35c149d32d384bfd4d4","observation_id":"d0b4da14-7099-4ac6-a8d1-ec0faacc4d3a","resolution":{"observed_at":"2026-08-03T20:36:05.771107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:05.878239Z","title":"Hierar- chical process memory: memory as an integral component of information processing.Trends in cognitive sciences, 19 (6):304–313, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.878239Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:832c2f60a972f94f8a09ea89255635b59d5e1ddf93b3ab3413e490c5e740f1fc","observation_id":"8f136264-316f-4b35-bea6-c297c3a28190","resolution":{"observed_at":"2026-08-03T20:36:05.878239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04324","last_updated":"2025-10-15T06:35:29Z","snapshot_observed_at":"2026-07-06T22:08:40.965707Z","submitted_at":"2025-08-06T11:10:39Z","title":"TempFlow-GRPO: When Timing Matters for GRPO in Flow Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04324","snapshot_observed_at":"2026-08-03T20:36:05.891548Z","title":"Tempflow-grpo: When timing matters for grpo in flow models.arXiv preprint arXiv:2508.04324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.891548Z"},"links":{"cited_paper":"/paper/2508.04324","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:49aa531a2bbe2e9fd4df1602eb68510f32372b1cb897ab1c6bffc267a25f3764","observation_id":"0ed3e48a-db57-4fd3-b1a0-0585347694f0","resolution":{"observed_at":"2026-08-03T20:36:05.891548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:05.936110Z","title":"Non-negative matrix factorization with sparseness constraints.Journal of machine learning re- search, 5(Nov):1457–1469, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.936110Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:233a5bdc59a80dd324b6c4ac155f1faea49868e29c687d6f27bb0cef2dd07729","observation_id":"f9dcbf46-a30c-4650-906c-97ad8217fc24","resolution":{"observed_at":"2026-08-03T20:36:05.936110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:05.985497Z","title":"A reinforcement learning-based automatic video editing method using pre-trained vision-language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:05.985497Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:2d59fda5c7b6838ac621fdfbf6868dc8f9b03d7eb5c617f02f89716564676139","observation_id":"2b19eb94-d592-44b4-bf51-c4ef1596d038","resolution":{"observed_at":"2026-08-03T20:36:05.985497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.095455Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.095455Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:1ff048e036ee761a1e49fff600369e2f0e4976f279b93bf1051553ce04af5a27","observation_id":"bb29fbe3-b2a9-4ce3-beb3-4f54649712ed","resolution":{"observed_at":"2026-08-03T20:36:06.095455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.157189Z","title":"istock video dataset.https : / / www","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.157189Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:d1e4c0a046378239f87acfeb11bd4ffaf9ebf6b5e0e0e297b33ccdaf9cf4697b","observation_id":"3fe8ecbf-bf06-499f-8aac-c389af856352","resolution":{"observed_at":"2026-08-03T20:36:06.157189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T20:36:06.225043Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.225043Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:ec304ce5712546ee682419144c2576db5c45c453425ba883fbc0c2be7789f633","observation_id":"dfe3484d-e872-494c-8a88-fb3fa698eb21","resolution":{"observed_at":"2026-08-03T20:36:06.225043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.329285Z","title":"Early language acquisition: cracking the speech code.Nature reviews neuroscience, 5(11):831–843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.329285Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:27a0ddf2c4534aec60f85e3ad2b28f893f50409c7baae474d58a661bddb50958","observation_id":"bf740fa4-ed8d-4eb3-b7d0-30c45294ce47","resolution":{"observed_at":"2026-08-03T20:36:06.329285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.406540Z","title":"T2v- turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.406540Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:0d4a10544b431e650715b0f48627a202aec6613c820799db07baeecb1ea8bd5a","observation_id":"0ad24454-862c-4482-8ccf-81fa676d4ba9","resolution":{"observed_at":"2026-08-03T20:36:06.406540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21802","snapshot_observed_at":"2026-08-03T20:36:06.500523Z","title":"Mixgrpo: Unlocking flow- based grpo efficiency with mixed ode-sde.arXiv preprint arXiv:2507.21802, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.500523Z"},"links":{"cited_paper":"/paper/2507.21802","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:f13bca79435ee63ba6e6b6f6d5ea2c3440cb2aeb45df1bec5e9f9eadfc33433b","observation_id":"5db676d6-2ab4-4175-bdba-39f7c6d3850f","resolution":{"observed_at":"2026-08-03T20:36:06.500523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.566506Z","title":"Spatial-then-temporal self-supervised learning for video correspondence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.566506Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:8c6e5b307f86703bd87c45f8f14c4fa740f90d8cb774e1da90a62692c2007657","observation_id":"baf2ad4b-590f-401f-978b-c3089fe149a8","resolution":{"observed_at":"2026-08-03T20:36:06.566506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.634807Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.634807Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:932967edea4db82a8a09e1007f5bfc4bee5c99d2b9a9afb932fb312daf07057f","observation_id":"fcce184f-2472-4bae-9d17-de9bcbb1404a","resolution":{"observed_at":"2026-08-03T20:36:06.634807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-08-06T11:11:00.378627Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-03T20:36:06.785918Z","title":"Flow-grpo: Training flow matching models via on- line rl.arXiv preprint arXiv:2505.05470, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.785918Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:07db6da0d982d23eaafe07ee2b72e03bc19f0a039a5569ab9d5f1a0f442f55f4","observation_id":"eec0061d-2857-4c57-aad3-9bb6de700600","resolution":{"observed_at":"2026-08-03T20:36:06.785918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-08-03T20:36:06.855065Z","title":"Improving video generation with human feedback.arXiv preprint arXiv:2501.13918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.855065Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:f4ec0a85639e621659673f382ccee297adefb5c2e01e02b0b83dfc19eba00ab5","observation_id":"154dd822-2a02-43a7-99a6-6f69ec2495f7","resolution":{"observed_at":"2026-08-03T20:36:06.855065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:06.920341Z","title":"When the future becomes the past: Taming temporal correspondence for self-supervised video represen- tation learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.920341Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:d87759e4d492a436158fa42e25809cecf85ead2300af02a09fac7e81722e837e","observation_id":"27cf8f20-695f-42bc-84dc-dc927d85c6f1","resolution":{"observed_at":"2026-08-03T20:36:06.920341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07508","last_updated":"2025-02-27T08:35:45Z","snapshot_observed_at":"2026-08-08T12:27:23.398874Z","submitted_at":"2025-02-11T12:22:35Z","title":"Enhance-A-Video: Better Generated Video for Free","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07508","snapshot_observed_at":"2026-08-03T20:36:06.992333Z","title":"Enhance-a-video: Better generated video for free.arXiv preprint arXiv:2502.07508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:06.992333Z"},"links":{"cited_paper":"/paper/2502.07508","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:25869e54aae4ec7d281873a78c552c473f5128bc3c085673563d8ec926f99303","observation_id":"8f458605-b810-4ace-a867-b7761e23c5cc","resolution":{"observed_at":"2026-08-03T20:36:06.992333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:07.038736Z","title":"Liv: Language-image represen- tations and rewards for robotic control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.038736Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:99af88a179972238b67eaf56210dca8d042cbef18e6ccd16ade5320fd73ae094","observation_id":"42c0482e-3c03-40c8-b80a-e1abebd19b69","resolution":{"observed_at":"2026-08-03T20:36:07.038736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08737","last_updated":"2024-07-11T17:59:45Z","snapshot_observed_at":"2026-08-08T15:12:28.628966Z","submitted_at":"2024-07-11T17:59:45Z","title":"Video Diffusion Alignment via Reward Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08737","snapshot_observed_at":"2026-08-03T20:36:07.105901Z","title":"Video diffusion align- ment via reward gradients.arXiv preprint arXiv:2407.08737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.105901Z"},"links":{"cited_paper":"/paper/2407.08737","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:5839e29fa923feda4bef2ccc5f7455c80170303b337af016db624fecd02ed9d3","observation_id":"8b1d7051-8449-4d88-8b13-ffdd7cd19a90","resolution":{"observed_at":"2026-08-03T20:36:07.105901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:07.166691Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.166691Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:625e17a38f6f34977d3e74d75eaf54a3b87471ee984c836808a1a2800824860e","observation_id":"b3afd3ad-b9b6-4d74-bbbe-462bae08cb7a","resolution":{"observed_at":"2026-08-03T20:36:07.166691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-03T20:36:07.266533Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.266533Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:007fce2c649f72bb28fbc645967385e708269ac4f71ea15b0cea2ef377d9541d","observation_id":"e65b5bb0-a5c6-4c4b-bef3-69403e135409","resolution":{"observed_at":"2026-08-03T20:36:07.266533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:07.330783Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in neural in- formation processing systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.330783Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:dc40a0f0ad9c71088331303c3c8b161f33a5a48d3284bd3d77ecea70a0ef0bde","observation_id":"bdedb479-18c1-4fa4-b884-2e3eabbf9305","resolution":{"observed_at":"2026-08-03T20:36:07.330783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:07.378888Z","title":"Predictive reward signal of dopamine neu- rons.Journal of neurophysiology, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.378888Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:c806f0ab3e2adfdd5178b4f64ff463203f61dcf407bb8a4b99589eda266cc85f","observation_id":"51ec4549-e869-4fa7-860b-df6749cf4024","resolution":{"observed_at":"2026-08-03T20:36:07.378888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T20:36:07.472490Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.472490Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:2be0b249f584e25c1f5cc43538ad0c5df81fc6547b396d8bebe9b711ede690c8","observation_id":"7478f871-005d-4492-8f96-b64fe333e03d","resolution":{"observed_at":"2026-08-03T20:36:07.472490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:07.684556Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.Advances in neural information processing systems, 35:10078–10093, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.684556Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:00926ab94ce29003c2c23d407e54b112ef03fa27de8deb904ff08469cfb61223","observation_id":"09bffd77-3d7a-4723-9087-5940c2d7594a","resolution":{"observed_at":"2026-08-03T20:36:07.684556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T20:36:07.757082Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.757082Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:7f3654b933bf4f798e9a3c8b84df79c9b223c672802235879b79fd1691f0b8b9","observation_id":"ff7f33f3-eb8b-42b9-8c58-d3ba12d758c5","resolution":{"observed_at":"2026-08-03T20:36:07.757082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-03T20:36:07.941340Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:07.941340Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:f16d282214d9dc45aeb1e0134f8ca6a4ab513c64ef4883b7ce4f30780f29de1e","observation_id":"1148c233-707d-42d5-8580-ef6b65130e5e","resolution":{"observed_at":"2026-08-03T20:36:07.941340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-03T20:36:08.000682Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:08.000682Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:ddf5c0430abe1e3569e99d60c9c978685fd89b9d59457c2c22986f59cd58a767","observation_id":"da874b86-f657-4855-9bd6-5e66fe2fced6","resolution":{"observed_at":"2026-08-03T20:36:08.000682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-03T20:36:08.085061Z","title":"Dancegrpo: Unleashing grpo on visual generation.arXiv preprint arXiv:2505.07818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:08.085061Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:655eb6a10256b4972477a7f1c2093f1a6e035347fd26449a93c09d20b789263a","observation_id":"27b698f3-cd13-49ca-985c-5b610c9a5b47","resolution":{"observed_at":"2026-08-03T20:36:08.085061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:08.240538Z","title":"Self-rewarding large vision-language models for opti- mizing prompts in text-to-image generation.arXiv preprint arXiv:2505.16763, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:08.240538Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:a3ab8ff0715648f47886b9aaa4a683a347299bf74015005836c4176dbe8df461","observation_id":"f5292d51-25b2-4bed-b186-ec7a93c6829b","resolution":{"observed_at":"2026-08-03T20:36:08.240538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T20:36:08.401563Z","title":"{text_prompt}","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T20:36:08.401563Z"},"links":{"citing_paper":"/paper/2511.19356"},"observation_digest":"sha256:dbf698feb73ce9b8d054dda60fc7447c47fa60df94fc82829609eee91fadb3cd","observation_id":"2800b94a-0457-477b-b420-fa151df9509f","resolution":{"observed_at":"2026-08-03T20:36:08.401563Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.19356","last_updated":"2026-07-17T04:00:04Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:36:41.910465Z","submitted_at":"2025-11-24T17:56:03Z","title":"Rethinking Reward Signals in Video GRPO: When Scores Become Targets"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 5 inbound Pith citation observations for arXiv:2511.19356."}