{"as_of":"2026-08-07T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:435cc77d7efdd084b4bb994e55ef4f1be72c11b16764d1cf4367d9b830804cc6","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:56.714854Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:52.913763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:57.820556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-07T10:28:52.913763Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-07T10:19:01.005683Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:52.913763Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:bff48df41d62d5dc5168300d8a4ed68aac195bf57df229ee0e441db218384082","observation_id":"215d5d21-18fc-4a75-a40d-6afad8aef6a6","resolution":{"observed_at":"2026-08-07T10:28:52.913763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-19T07:47:34.464711Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2506.18871"},"observation_digest":"sha256:460eecb7f4f59603a98d1f8de07f821da9b508a7bf613390a6228eb5af148f14","observation_id":"e5ba5c38-9473-4601-832d-f72cf168f5e3","resolution":{"observed_at":"2026-05-19T07:52:10.937303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2507.21802","last_updated":"2026-03-20T17:20:12Z","snapshot_observed_at":"2026-08-01T16:12:11.335962Z","submitted_at":"2025-07-29T13:40:09Z","title":"MixGRPO: Unlocking Flow-based GRPO Efficiency with Mixed ODE-SDE","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T13:27:50.031781Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2507.21802"},"observation_digest":"sha256:1847f2c0c3ea5124a753834379549fa27589d641695c4bd045cc01f5f06d4139","observation_id":"f6720920-3ec0-48c8-ae9e-3d68f885258f","resolution":{"observed_at":"2026-05-13T13:27:50.062590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-05T20:44:15.870519Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09987","last_updated":"2025-08-13T17:59:28Z","snapshot_observed_at":"2026-08-06T06:04:10.094208Z","submitted_at":"2025-08-13T17:59:28Z","title":"Echo-4o: Harnessing the Power of GPT-4o Synthetic Images for Improved Image Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:44:15.870519Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2508.09987"},"observation_digest":"sha256:0360373a98af270eda950b324925b6e0adedfeba4e77c9a2ecd3fc6e35e57b3f","observation_id":"0751e862-9eb7-42f8-90f8-edd4ff0e57a6","resolution":{"observed_at":"2026-08-05T20:44:15.870519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2508.20751","last_updated":"2026-04-20T06:12:09Z","snapshot_observed_at":"2026-08-03T03:28:58.341337Z","submitted_at":"2025-08-28T13:11:24Z","title":"Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T20:31:28.371368Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2508.20751"},"observation_digest":"sha256:fedb02c6659cb121cffd0803840b811bb5bc74c4fca8de67da4edaccbe35164d","observation_id":"56128ab7-bace-4d99-8095-329180615e9c","resolution":{"observed_at":"2026-05-18T20:31:50.190725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2512.07348","last_updated":"2026-04-28T10:02:14Z","snapshot_observed_at":"2026-08-06T12:32:11.849043Z","submitted_at":"2025-12-08T09:40:11Z","title":"MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T00:20:58.483350Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2512.07348"},"observation_digest":"sha256:093dfe49e1c78ea2c866d67ee70106fd0b134242cba5f0c16dadf3e3654ff3b9","observation_id":"fa82dde3-e6ba-4cd9-9f27-3430c0e0db5f","resolution":{"observed_at":"2026-05-17T00:21:23.397685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-08-02T20:14:04.125091Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-07T16:58:33.100618Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.125091Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:bb028300b791e5933b9301bbd009fb442a85e26cfa2baaa8296987666e4a608a","observation_id":"f372d45e-5e7b-40e5-94aa-87ed35887192","resolution":{"observed_at":"2026-08-02T20:14:04.125091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2604.02355","last_updated":"2026-03-12T12:49:26Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-03-12T12:49:26Z","title":"From Broad Exploration to Stable Synthesis: Entropy-Guided Optimization for Autoregressive Image Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T12:50:13.764159Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.02355"},"observation_digest":"sha256:01db7ed97de028fde0f468c9f3102505d79da49b7ff7c64ed2539a856161dccf","observation_id":"d8fe2b4f-c45c-47d2-9105-f294673a21f1","resolution":{"observed_at":"2026-05-15T12:50:37.149568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2604.02467","last_updated":"2026-04-27T18:17:15Z","snapshot_observed_at":"2026-08-02T13:43:39.563153Z","submitted_at":"2026-04-02T18:58:56Z","title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T21:14:42.021240Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.02467"},"observation_digest":"sha256:632bc9e49a599c3a8e4d8f85aac2fd2f9e0573a0d9324313b1bfe36206b662fb","observation_id":"9fd36647-1579-44e2-9743-98f1d1e369a0","resolution":{"observed_at":"2026-05-13T21:18:17.195366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2604.09629","last_updated":"2026-05-27T20:51:39Z","snapshot_observed_at":"2026-07-13T22:22:34.250681Z","submitted_at":"2026-03-19T13:12:53Z","title":"HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T08:42:28.685159Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.09629"},"observation_digest":"sha256:399f8cc788fef063d57ac6d2921e2b7c7be355b9900c70bf169be106f9cf3a25","observation_id":"ab32f4e7-7889-451a-912b-01d5df6cd009","resolution":{"observed_at":"2026-05-15T08:45:19.190774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-13T22:22:41.696113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.09629","last_updated":"2026-05-27T20:51:39Z","snapshot_observed_at":"2026-07-13T22:22:34.250681Z","submitted_at":"2026-03-19T13:12:53Z","title":"HumorGen: Cognitive Synergy for Humor Generation in Large Language Models via Persona-Based Distillation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T22:22:41.696113Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2604.09629"},"observation_digest":"sha256:5f65eb1095b662504c7c1e873312a7a6ed69c77a86306e456ccc280ff3620d45","observation_id":"d3492cb3-6d89-4e83-9cb4-6f17fc5ff95d","resolution":{"observed_at":"2026-07-13T22:22:41.696113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2606.17888","last_updated":"2026-06-16T13:09:32Z","snapshot_observed_at":"2026-08-04T07:49:41.211792Z","submitted_at":"2026-06-16T13:09:32Z","title":"MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-27T01:23:40.564561Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2606.17888"},"observation_digest":"sha256:047f6c9a96f359956a8a610b52f35bac31e2832c78abe859cc70405c6a91ad2a","observation_id":"5476f687-e9dc-49c4-81ae-c0f378828bc3","resolution":{"observed_at":"2026-07-03T20:18:57.824204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"cited_work":{"arxiv_id":"2505.17017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17017","snapshot_observed_at":"2026-07-03T20:18:57.820556Z","title":"Delving into rl for image generation with cot: A study on dpo vs","venue":null,"work_id":"b4b8af2b-875c-4eef-8139-d2217eb87e57","year":2025},"citing_paper":{"arxiv_id":"2607.02291","last_updated":"2026-07-02T15:08:56Z","snapshot_observed_at":"2026-08-07T15:44:37.020127Z","submitted_at":"2026-07-02T15:08:56Z","title":"Optimizing Visual Generative Models via Distribution-wise Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-03T16:39:12.711424Z"},"links":{"cited_paper":"/paper/2505.17017","citing_paper":"/paper/2607.02291"},"observation_digest":"sha256:32c52bc3b3627d9fcc2bea2bb7ab4da9c0136c7c8d9f75b7607b380925e2ac86","observation_id":"7b1e81b3-7ddd-4e79-a312-382928ac04eb","resolution":{"observed_at":"2026-07-03T16:48:39.692094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17017/citation-record","integrity":"/paper/2505.17017/integrity","json":"/paper/2505.17017/citation-record.json","paper":"/paper/2505.17017"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.823649Z","title":"https://www.anthropic.com/claude/sonnet/, 2025","venue":null,"work_id":"a07cc04d-620b-4001-a246-ddada94c5b63","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.317351Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:63da6f0f6a2938f4f1705054c082c88bf5c1f9587d498e66d25b424a7bd909a2","observation_id":"c3e0d43a-e781-4bb8-9f69-4309bee371a1","resolution":{"observed_at":"2026-08-07T14:56:00.913770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.642431Z","title":"https://deepmind.google/technologies/gemini/pro/, 2025","venue":null,"work_id":"ae8cdc2d-3612-4503-b9d9-0fcb466b4210","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.378463Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2300a7ec6430e6b3a6b3a3b1791ff4812838799398b4c499dba6cfa6e7913c0c","observation_id":"359f5ec5-250e-4b04-a289-1452bb414858","resolution":{"observed_at":"2026-08-07T14:56:00.726291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T14:55:50.431952Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.431952Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:b26aa8b935027750b6ed5989047c701734549fad9334d9784d3342361ed3ac23","observation_id":"7f2ec122-7832-494f-8238-9c8fa8bef65c","resolution":{"observed_at":"2026-08-07T14:55:50.431952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-07T14:55:50.485153Z","title":"MathQA: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.485153Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e1a7210e82a64b24935d40a1598317ca5e3e42c5e64477a4f84bedff30eec3b3","observation_id":"0f70fb72-5c3c-45e7-8989-7a6151e3e5b2","resolution":{"observed_at":"2026-08-07T14:55:50.485153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T14:55:50.558588Z","title":"Nye, Maarten Bosma, Henryk Michalewski, David Dohan, Ellen Jiang, Carrie J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.558588Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:ca74735848bd30b4243cdd9cc708329d0684a6f989ac3d9e82d35858fdfbed18","observation_id":"865e8eba-a415-411f-8e38-0a8706c7f078","resolution":{"observed_at":"2026-08-07T14:55:50.558588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:55:50.610635Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.610635Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:715a454baaf58b0bc9a886549d7dd5071d3b77e192be1418d0825f36ee03a69f","observation_id":"9b3f9923-ebb4-4dff-955c-ad8be9d64559","resolution":{"observed_at":"2026-08-07T14:55:50.610635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.493477Z","title":"MaskGIT: Masked generative image transformer","venue":null,"work_id":"56a352d7-8f0e-4e16-b51f-cf8fb5a733dc","year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.698683Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:dd9d0a94fe451e332e3b8f2d57a1faf73141a7f295db77d347a74aa28bfc2959","observation_id":"6b5d2924-ea14-4772-b4dc-cd1c2d13bccb","resolution":{"observed_at":"2026-08-07T14:56:00.581232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T14:55:50.751073Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.751073Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7c1e6a603c9bafeee6a07bf388a251cc49dc7439bdc5d445c7848969440ae80d","observation_id":"73efef0d-ae15-4a8c-ae56-c0b095bb9ebe","resolution":{"observed_at":"2026-08-07T14:55:50.751073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-07T14:55:50.825180Z","title":"Janus-Pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.825180Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:9d9cc13a779017d4fbb2ff0b6ad8bb824c74868cd7e3c0e48ce7c9cfa3195199","observation_id":"bf05aa7c-a1ea-4549-8892-0e238d00bbd1","resolution":{"observed_at":"2026-08-07T14:55:50.825180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-07T14:55:50.898025Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.898025Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2585f67301cd52e6fda9ed7db11911ce0414ed650b83c37d642c530a3caaa553","observation_id":"9fbdc1ef-c2a2-489d-88c9-3148afa46cd8","resolution":{"observed_at":"2026-08-07T14:55:50.898025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.357509Z","title":"DeepSeek-R1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"bab5f324-ca45-4045-954a-09e36e57fd8a","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:50.980864Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:cca0eba133dc69d66b3712eecfb959e32bb374f72f4e4a77efb81c825c360f0d","observation_id":"ed3149c3-aceb-4027-bb4f-1ecaa2225239","resolution":{"observed_at":"2026-08-07T14:56:00.409929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.096255Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.096255Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7939625e77170ae30014c1456f98be99964a15ec9564f0264653c0ee3a5e448c","observation_id":"b03dfef3-9e3c-4dc0-85f9-135553a7ca59","resolution":{"observed_at":"2026-08-07T14:55:51.096255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.104750Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.104750Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e036d27dfe7a36c2397ea0efab33aea599b255f070d428b7ce3aef90bf12f151","observation_id":"507abb59-e777-4a29-a576-b466f32e1ca6","resolution":{"observed_at":"2026-08-07T14:55:51.104750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:56:00.148931Z","title":"Video-R1: Reinforcing video reasoning in mllms, 2025","venue":null,"work_id":"e4ea4932-8326-4760-a3c4-a7504d487e80","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.147433Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:62181eaf5075dad11a6d04bd1f5d7ab7057e5100ed0ccec618ba0087fcb013cb","observation_id":"9cbe2bcc-01ab-4e06-bdce-3af667445360","resolution":{"observed_at":"2026-08-07T14:56:00.209672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.197669Z","title":"Geneval: An object-focused framework for evaluating text-to-image alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.197669Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2f8392241ea97bd1e61c01f17dbc8d3650baedd7765e7509478d2f7a5e9452fc","observation_id":"c97fdc58-343b-4ef6-adff-f48df04e373a","resolution":{"observed_at":"2026-08-07T14:55:51.197669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:55:51.296056Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.296056Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:60315ba515cd60b6f863dcfb684e3ed0cf13a9e5b66cf244331f8715697123cc","observation_id":"d225a9ee-30c4-4bfb-b251-25ff1b66c382","resolution":{"observed_at":"2026-08-07T14:55:51.296056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10627","last_updated":"2025-03-13T17:59:32Z","snapshot_observed_at":"2026-08-07T17:06:08.693257Z","submitted_at":"2025-03-13T17:59:32Z","title":"SciVerse: Unveiling the Knowledge Comprehension and Visual Reasoning of LMMs on Multi-modal Scientific Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10627","snapshot_observed_at":"2026-08-07T14:55:51.415780Z","title":"Sciverse: Unveiling the knowledge comprehension and visual reasoning of lmms on multi-modal scientific problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.415780Z"},"links":{"cited_paper":"/paper/2503.10627","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:1d59581a7b777a178ac1a31b9d98bb1d5050e7180f956178ef9959c3561a0ea3","observation_id":"217e9aec-6b6f-42ec-b807-9c66c9954767","resolution":{"observed_at":"2026-08-07T14:55:51.415780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T14:55:51.520817Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.520817Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f7bc0765124f9ba450b728ddc52a561a66bd7927cef0a41110212c677e1d9ae6","observation_id":"052310a6-09eb-4896-a7dd-72062cfa63af","resolution":{"observed_at":"2026-08-07T14:55:51.520817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:51.647139Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.647139Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c2127ed5557c9a8bc80b78064fb939aa1956d42c09beb074ad1aded5f50e5fca","observation_id":"2d65c360-5a19-443f-9765-18bcdeb960b2","resolution":{"observed_at":"2026-08-07T14:55:51.647139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.970886Z","title":"Gritsenko, Jasmijn Bastings, Ben Poole, Rianne van den Berg, and Tim Salimans","venue":null,"work_id":"54f8d88f-bde8-4ab0-99ef-2792d34dd7a6","year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.759498Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:099730175429797a6ee72b0bea58e5eba2a42fd9f9d3714ceb140814ab9b6a98","observation_id":"245ed011-309c-4e79-b538-9efa1570f074","resolution":{"observed_at":"2026-08-07T14:56:00.020467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.810109Z","title":"T2I-CompBench: A com- prehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":"164a7976-45d0-4193-88b9-86a93622acad","year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.859745Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f88884ec2e86452d9f2adbb13b4d30aa1b4c2598fdc5dd5078c850c915a193a8","observation_id":"972274fa-eef1-4abd-a1b6-0693320ef687","resolution":{"observed_at":"2026-08-07T14:55:59.888512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T14:55:51.953592Z","title":"LiveCodeBench: Holistic and contami- nation free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:51.953592Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:667a1cc60c26c911bc7878342485e9b3563de398dd6b25a299908aad89fe4de5","observation_id":"d607f266-e310-41ae-8c12-c247a1e5c781","resolution":{"observed_at":"2026-08-07T14:55:51.953592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-07T14:55:52.031634Z","title":"T2I-R1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.031634Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:98c9a73846b17c2340da9744be2c3dba0001cf061f4d6e566bb536746a1c14b3","observation_id":"6cae1717-2a14-4e02-8196-c49abafb20a8","resolution":{"observed_at":"2026-08-07T14:55:52.031634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:52.179275Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.179275Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:0abc0c84cf3e0f340e6ac53bcefe2370e0349aca4a778d26ea464eec2d825fff","observation_id":"70ee7bc9-52fd-45dd-9250-797e0d1ace69","resolution":{"observed_at":"2026-08-07T14:55:52.179275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-07T14:55:52.344176Z","title":"VideoPoet: A large language model for zero-shot video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.344176Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:19466558720de2c653e1c7fb782614027eea7178e5921d1cbba83249561303aa","observation_id":"2be8be33-2dab-4e68-976c-8379b846a7ea","resolution":{"observed_at":"2026-08-07T14:55:52.344176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:52.466438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.466438Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c0862b1670ccef9db846cb5feb3e6bc1b6d907248a565dc8ffaf02196aea5df2","observation_id":"69914c10-c486-40b0-a882-4fff1238d08c","resolution":{"observed_at":"2026-08-07T14:55:52.466438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:55:52.582353Z","title":"LLaV A-OneVision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.582353Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:3bd088ff1ee91c73fd938f5bc196565535046e184b80975171e6b2eeb4c09824","observation_id":"76765892-f7f3-4f0a-b521-9039ed32dcac","resolution":{"observed_at":"2026-08-07T14:55:52.582353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T14:55:52.695914Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.695914Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c512b4028163ad860404430f091a4d2b8e8f6b6ab3e130293f5fcf716224eb61","observation_id":"5c0dda25-23c1-44e5-9915-fb6ca1751178","resolution":{"observed_at":"2026-08-07T14:55:52.695914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.636352Z","title":"VideoChat-R1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning, 2025","venue":null,"work_id":"deb5346d-90b7-4bf4-8ef9-ee1f46aebd6d","year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:52.830543Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:255d58240637ab395616573e343c8a8726232e8199a3d088cfeeb23db2362c3e","observation_id":"d6931dd5-8f76-4216-ba1f-aaaa4d0fd839","resolution":{"observed_at":"2026-08-07T14:55:59.681942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.002220Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.002220Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:1175223fde26efb418132a6f0cb22e4ac78b243548422649c6f3b67489863bda","observation_id":"768dd5fd-8570-4e7a-ad2c-dd089deafb31","resolution":{"observed_at":"2026-08-07T14:55:53.002220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T14:55:53.166352Z","title":"Visual-RFT: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.166352Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:cbbb98ec9e095e9dd477713c6c1550b78cec2f73854266c42e38f99df665ba05","observation_id":"afd2a74a-c2c3-4465-ba2e-b549029c4eea","resolution":{"observed_at":"2026-08-07T14:55:53.166352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.258103Z","title":"American invitational mathematics examination - aime","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.258103Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:27b0e0d1e39012c12f8b3b1dd72af0c122ba8b248704cfd3afb3d20d5446961f","observation_id":"cd557c76-2f94-4dcb-a8aa-b6415f016d87","resolution":{"observed_at":"2026-08-07T14:55:53.258103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.502948Z","title":null,"venue":null,"work_id":"59c6bb0b-066c-483c-af28-53bc07ef6800","year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.441712Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:0dfa7335b048b542dd20501ecdd89a58662acb85bd0ff157c904802dbd67256a","observation_id":"6eddfe43-730f-4c0c-888d-ef2066bd308c","resolution":{"observed_at":"2026-08-07T14:55:59.554579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.582237Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.582237Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:bd1b0276151533a660b003a6725daaaeca0929bcd80e182404790baae1c80347","observation_id":"f8ffe76c-c587-4c75-be09-570240960d69","resolution":{"observed_at":"2026-08-07T14:55:53.582237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.350771Z","title":"OpenAI o1 system card, 2024","venue":null,"work_id":"c2b8f7bf-6e64-4dba-a380-a5180364556a","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.699183Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:83cb1c61da72a440e2fe33a87865f856839869d29c8671cd905dccb7745b971d","observation_id":"c1e073c8-ab00-4c75-822b-d03d10e2ced7","resolution":{"observed_at":"2026-08-07T14:55:59.407866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:53.844686Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.844686Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e381c04e1bbfc726faf50f7ddd7f55064284c6a6f69718b4d1749b959b98b439","observation_id":"7805cc68-d011-4869-a0ab-e0839c948934","resolution":{"observed_at":"2026-08-07T14:55:53.844686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:59.104283Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":"0effd036-2473-4264-8a62-8c4be0082c3b","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:53.982080Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:a4487f539a68513513a21144f7fa5a8c0e589eb7cdcd2166165087c2a30c0b25","observation_id":"f40e5c07-c350-4479-95d0-67056c5c6e2d","resolution":{"observed_at":"2026-08-07T14:55:59.219934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T14:55:54.154340Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.154340Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f2583580b324e52470a01d3b44d248d4db903fada64500ee7a2cac768258cb21","observation_id":"493ee883-eac6-4594-b315-d8512b81770a","resolution":{"observed_at":"2026-08-07T14:55:54.154340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:54.311678Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.311678Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c623b288afc91d5b9c239b42c43b6ab0f62ca84771e32c903b528619e80f157a","observation_id":"996690e2-b131-4ce5-874d-2a7bc002187f","resolution":{"observed_at":"2026-08-07T14:55:54.311678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:54.426573Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.426573Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:000d0703de2767551f1de7b93f37826cd0ff6e21587e10498c6c8aa1302fdaae","observation_id":"8ea8d8dc-3b12-4d22-97fa-e1300cf41597","resolution":{"observed_at":"2026-08-07T14:55:54.426573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T14:55:54.498153Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.498153Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2ae6da9409a820991c89ed6ea8119dff9e8530900a180010ad64ce2fe5a53de7","observation_id":"6246b52d-5954-485e-bd3d-2ebc214a4369","resolution":{"observed_at":"2026-08-07T14:55:54.498153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:55:54.567116Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.567116Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:4ba3bdedcebe761ddb6cdbe1ee19a83955b836222e0178fa56e68644f5f362c7","observation_id":"dddb4f89-c7e4-43f6-92ee-f660d2653159","resolution":{"observed_at":"2026-08-07T14:55:54.567116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:55:54.665299Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.665299Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:00aead3926f6ede38f9533bef33e1da6f05cf6394900a273d7fd269ef1874336","observation_id":"307c3867-8f6f-4974-92fc-8b3b1bc88cd8","resolution":{"observed_at":"2026-08-07T14:55:54.665299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-07T14:55:54.754970Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.754970Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:eb61c6d2ce55c46e1a51e9891b467ebc19f5c3fad3fa11310064f3a3fa8821d8","observation_id":"68aa617b-2484-4b7d-8d6d-5518e7f48e6e","resolution":{"observed_at":"2026-08-07T14:55:54.754970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:55:54.845570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.845570Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:518837a11082bfda090a251a4c16f1e290d78154c7d7de11c75c2625e6afb4f4","observation_id":"67ffbb2b-5402-417b-be92-d947d17bcc75","resolution":{"observed_at":"2026-08-07T14:55:54.845570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.899912Z","title":"LaMDA: Language models for dialog applications, 2022","venue":null,"work_id":"b222a65a-f24f-4c8c-883c-ebdc33755689","year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.911937Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:4a3d1ca2017567aaa5a498448b961bd375fff26765406bfbcd7b42e81de87ce8","observation_id":"12979f00-01d9-48cc-b3d3-742632bdd7ac","resolution":{"observed_at":"2026-08-07T14:55:58.997167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:55:54.983985Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:54.983985Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:30e66115918764f8a30e5784f4d32b3783a1a1febb93fead0431ad8d637c97e6","observation_id":"74e00793-1e6b-4c4e-bf61-f5b472092833","resolution":{"observed_at":"2026-08-07T14:55:54.983985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11455","last_updated":"2025-04-15T17:59:46Z","snapshot_observed_at":"2026-08-07T16:02:04.272189Z","submitted_at":"2025-04-15T17:59:46Z","title":"SimpleAR: Pushing the Frontier of Autoregressive Visual Generation through Pretraining, SFT, and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11455","snapshot_observed_at":"2026-08-07T14:55:55.061900Z","title":"SimpleAR: Pushing the frontier of autoregressive visual generation through pretraining, sft, and rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.061900Z"},"links":{"cited_paper":"/paper/2504.11455","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:62af6e93ec2c346e381e961af5bf3150bbb1af69e7917c789a6509692e978bf6","observation_id":"0609fef1-cc26-4865-a8ea-2ac1bf490271","resolution":{"observed_at":"2026-08-07T14:55:55.061900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.685385Z","title":"Reasoning in conversation: Solving subjective tasks through dialogue simulation for large language models","venue":null,"work_id":"c03f2397-6f32-4d4c-9dee-569c81873ecc","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.131047Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:da0b6841ef6a46d952e2622f06b3806595d6f8c89553c9c5096cf35854f1501f","observation_id":"1e187a1a-9e83-4952-b891-dad26567e6e2","resolution":{"observed_at":"2026-08-07T14:55:58.794682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.501004Z","title":"Le, Ed H","venue":null,"work_id":"d0136c12-3ec9-4a33-94bc-05dd995cb3ab","year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.222227Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:72214a2b64c8be49fb15660149b404c7d09c1135e8945a4aa3c9dfe843bfaabd","observation_id":"5b9cc19e-30b8-4bc5-b80a-19cec2698a79","resolution":{"observed_at":"2026-08-07T14:55:58.573936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05236","snapshot_observed_at":"2026-08-07T14:55:55.299644Z","title":"Unified reward model for multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.299644Z"},"links":{"cited_paper":"/paper/2503.05236","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:f9c4a1b66affea0606047ce7aa1ae411099c899118ce552ab37c6aa35baea95c","observation_id":"a7820c84-0c1f-4296-9edb-9640123c910d","resolution":{"observed_at":"2026-08-07T14:55:55.299644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:55.388496Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.388496Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7fc3ccfdf3d9ce7941d8e582bdd2ffabf888966c3017aa9835a11631ebd63f16","observation_id":"4c0a8dfa-552e-48f1-b390-7b3b6fc9aa2f","resolution":{"observed_at":"2026-08-07T14:55:55.388496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-08-07T14:55:55.475472Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.475472Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:22f89d83c5caa376215f5f37af320757bd48985d4c96a89f7cb72b9ad2480f24","observation_id":"0c95efc2-6a09-4c19-a25d-aecb404deb1b","resolution":{"observed_at":"2026-08-07T14:55:55.475472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-07-06T15:43:07.989730Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T14:55:55.543870Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.543870Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:4cbadb2b318e94f5f7a4b225c6c02cfbd61d1d7a0ced83fd69002082d3f66c05","observation_id":"9bbd3866-6666-4c54-bc94-565bacdcece0","resolution":{"observed_at":"2026-08-07T14:55:55.543870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-07T14:55:55.602449Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.602449Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:2f3f49f02b896e5f3ef07d2544bbce3155fa31bb5163d60a828272945292b4a5","observation_id":"c0e88441-b730-427f-bee8-b976b37589ea","resolution":{"observed_at":"2026-08-07T14:55:55.602449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:55.664044Z","title":"ImageReward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.664044Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:9b038d1384fbbbf585a27bbd7039ed2e17b015d05dcba182bbaee97d9097bc81","observation_id":"5f2273de-bae4-489f-9dbd-b4131c80edd4","resolution":{"observed_at":"2026-08-07T14:55:55.664044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-07T14:55:55.743601Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.743601Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:3dfd6812ea880a817d22c1bce865adcbb3beae8bdeba788cc85b8c6b00ae4588","observation_id":"2411a786-693a-4729-b382-0ad45550c05d","resolution":{"observed_at":"2026-08-07T14:55:55.743601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-08-07T14:55:55.854961Z","title":"Dancegrpo: Unleashing grpo on visual generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.854961Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:021c3a4df7d50542e0fa078f7a925baefad5a9ffa0b5da62837641c4e2aa6ab6","observation_id":"111ed8cb-763d-4fa0-8eda-bb83ab36e378","resolution":{"observed_at":"2026-08-07T14:55:55.854961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T14:55:55.929798Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:55.929798Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:a9866f13768905fc399e1d210e3b2ccba13b8084b0188077564f9d36b167d034","observation_id":"4ef71de6-d9f6-4576-8362-a8326dc81bc1","resolution":{"observed_at":"2026-08-07T14:55:55.929798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T14:55:56.042260Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.042260Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:5eb3cdf31d175d1140c08eabe33ad17dcc09c49368c711d6b2712d98505e452b","observation_id":"d5c1b975-fb60-4432-b4ea-9fedb2b99cf2","resolution":{"observed_at":"2026-08-07T14:55:56.042260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T14:55:56.192183Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.192183Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:7299c01bea2de4c18149ad1c2d2caadeaa73b54645015f422cad70faa81f55f6","observation_id":"249c4d65-1e62-49b1-8920-e501a572bab4","resolution":{"observed_at":"2026-08-07T14:55:56.192183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.310608Z","title":"ReST-MCTS*: Llm self-training via process reward guided tree search","venue":null,"work_id":"dca08680-eea9-4341-a674-9543e94b97da","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.304989Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:a3e7f694b0a9801e5618472742cc35d44b9ef77aeddb41ead510a6c2f0cb86e3","observation_id":"88d1fbe9-1623-40cf-bcb3-e30f7da695b7","resolution":{"observed_at":"2026-08-07T14:55:58.393634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:56.411952Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.411952Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:678a67dc2ca612f951b13a2688c6e53f00640f482e11707a54a92e4e40a26e49","observation_id":"32fe3a93-ddcd-4ff6-9d99-efd0f5a22756","resolution":{"observed_at":"2026-08-07T14:55:56.411952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:58.089987Z","title":"Llama-adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":"8e096bfe-eafb-4d29-a780-6c2f15359174","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.497410Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:c929277e4613ce6020a643f614ce7ca4217c84cf91d8ef701592feb205c0b0ad","observation_id":"e1ee7f91-4b22-4b0f-9b66-5ce90750e7d0","resolution":{"observed_at":"2026-08-07T14:55:58.222658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:57.851519Z","title":"MathVerse: Does your multi-modal llm truly see the diagrams in visual math problems? ECCV 2024, 2024","venue":null,"work_id":"c9296d24-e5b9-489f-ba8a-c1223a208a67","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.612251Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:fe3e1e4a1049a2f77fe6a7f9293c14e776d9d6badfcfcb1a2656d3cea1583254","observation_id":"fd2712e2-69dc-46ff-b7c0-86a9b2a7b790","resolution":{"observed_at":"2026-08-07T14:55:57.995183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-08-07T14:55:56.665148Z","title":"Mavis: Mathematical visual instruction tuning with an automatic data engine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.665148Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:69310cc889ae960ba3d51ad85fa87955fe5ec5733e7a7dbc25889de6c0503e71","observation_id":"b529bdf1-551a-4362-aa4e-a75d6d4924ab","resolution":{"observed_at":"2026-08-07T14:55:56.665148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:57.612301Z","title":"SafetyBench: Evaluating the safety of large language models","venue":null,"work_id":"7d5e0f89-d934-4ce1-85e7-8fada273e085","year":2024},"citing_paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:56.714854Z"},"links":{"citing_paper":"/paper/2505.17017"},"observation_digest":"sha256:e812272e5ab77fa4e30f2620c8b5f70ff1a9c3fc30d0504e2b7844fec4b2bab0","observation_id":"feb97369-90bc-4b4f-8c97-12b7ce006be6","resolution":{"observed_at":"2026-08-07T14:55:57.728336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17017","last_updated":"2025-06-10T13:46:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:38:00.494377Z","submitted_at":"2025-05-22T17:59:49Z","title":"Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 13 inbound Pith citation observations for arXiv:2505.17017."}