{"as_of":"2026-08-08T14:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a80222088e8d25c742d5adc886b49ac82e7045dd8b4744a02b1b8955658500f","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:34:53.874909Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:15:37.528799Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T06:49:38.201535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-07T12:15:37.528799Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00178","last_updated":"2025-07-22T18:01:11Z","snapshot_observed_at":"2026-08-07T23:16:23.624156Z","submitted_at":"2025-05-30T19:33:41Z","title":"Tournament of Prompts: Evolving LLM Instructions Through Structured Debates and Elo Ratings","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:15:37.528799Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2506.00178"},"observation_digest":"sha256:e4f439b8194c4f831aeb59ea85c60cff8c21037457421d89ebe2a0ed9a03c89f","observation_id":"aab485b9-07c5-43db-a0cd-505f144055de","resolution":{"observed_at":"2026-08-07T12:15:37.528799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T06:07:56.678339Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2507.17746"},"observation_digest":"sha256:6375b9e4f084d50cf5bd3b84f9388351cc1a2d11b2e0b753512dd99c2d0d834d","observation_id":"04ec0a88-7b73-41a4-92c7-b46d6cf7ab9b","resolution":{"observed_at":"2026-05-13T06:07:56.760173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-06T14:51:26.527647Z","title":"Hassid, M., Synnaeve, G., Adi, Y ., and Schwartz, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17797","last_updated":"2025-07-23T15:22:51Z","snapshot_observed_at":"2026-08-07T23:16:26.181265Z","submitted_at":"2025-07-23T15:22:51Z","title":"GenSelect: A Generative Approach to Best-of-N","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:26.527647Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2507.17797"},"observation_digest":"sha256:e3ef17de309021092f68101af13612562438ddad64e641d5d21406a2595d2def","observation_id":"a2818eef-f5ce-4311-b868-782e9556d367","resolution":{"observed_at":"2026-08-06T14:51:26.527647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T12:20:17.430881Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:27777360b6fd0fc271d5553284b35366e2ae260b7542b02ad062ba191e629062","observation_id":"cf18a61e-8d83-4445-8171-7d29f8bc4780","resolution":{"observed_at":"2026-05-22T12:21:30.995972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-06T04:27:05.207869Z","title":"arXiv preprint arXiv:2505.14674","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03556","last_updated":"2026-06-01T05:14:12Z","snapshot_observed_at":"2026-08-06T04:27:04.622929Z","submitted_at":"2025-08-05T15:25:24Z","title":"VRPRM: Process Reward Modeling via Visual Reasoning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T04:27:05.207869Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2508.03556"},"observation_digest":"sha256:ba539c68aa7edf2514ffb3b235d44b78b117d615fd2403535fe9f68a178ba6b3","observation_id":"a5c71336-4ebc-41fc-83b2-a6491ddc19d0","resolution":{"observed_at":"2026-08-06T04:27:05.207869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2509.00084","last_updated":"2026-04-27T15:34:36Z","snapshot_observed_at":"2026-08-04T00:21:22.483235Z","submitted_at":"2025-08-27T06:51:48Z","title":"Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-18T21:16:15.703057Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.00084"},"observation_digest":"sha256:c27bdbf7138d048bef1f078a0e56aad21304a1b44f48ddbc2e3307aebad07252","observation_id":"25a4676c-98de-4856-8bc4-f4660d2fd46d","resolution":{"observed_at":"2026-05-18T21:16:50.971419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:839e9875bf179573fc806009b945432f41f6fdebfb442a3599d7de8586c0ad11","observation_id":"589bb886-b043-4291-8a39-8c5ed8c35d8c","resolution":{"observed_at":"2026-05-18T00:05:31.631151Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T16:07:29.589806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.589806Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:2959aa02b19c19e449e33d113fd2b2b4e0a39c73da9b46055d308ab4f181f479","observation_id":"c3900aa1-9feb-460d-9ceb-9b19a2dc5c8d","resolution":{"observed_at":"2026-08-04T16:07:29.589806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-03T23:17:37.743021Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:31ad0fa82294e21c5a218093b3d3131193c322a06dcd16c58ff8208d58e0b84d","observation_id":"5ee2d70b-a2a2-46cf-ad4e-9e71f89c5c87","resolution":{"observed_at":"2026-05-18T03:20:49.334817Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T07:43:24.151892Z","title":"Reward reasoning model.arXiv preprint arXiv:2505.14674,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-07T23:16:25.258712Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.151892Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:fbc7c2f6839fa86893b6bc5cf5cfc15dd34448c42cf721637f00dd016f830c1e","observation_id":"c37af3d7-af75-4336-af67-24164bd603c7","resolution":{"observed_at":"2026-08-04T07:43:24.151892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-02T18:14:50.408504Z","title":"Reward reasoning model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14473","last_updated":"2026-07-15T10:22:14Z","snapshot_observed_at":"2026-08-05T20:09:51.962104Z","submitted_at":"2026-03-15T16:31:51Z","title":"AI Can Learn Scientific Taste","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:14:50.408504Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2603.14473"},"observation_digest":"sha256:261b1e0afd2531ce68c9e7f96c6e452b0f09e97f34720c1851da12c4967426ba","observation_id":"7a625218-dee7-4b6e-b395-3d97d857f5b3","resolution":{"observed_at":"2026-08-02T18:14:50.408504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:c0f3376ceed1c79162201ba02fe6ba3c9ba60505b2d1b73c550493fadc04d0b7","observation_id":"e63bc315-3599-4d2c-9fd4-993a8f2154b0","resolution":{"observed_at":"2026-07-01T20:56:13.571928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2606.08147","last_updated":"2026-06-06T12:56:08Z","snapshot_observed_at":"2026-08-07T03:25:50.518862Z","submitted_at":"2026-06-06T12:56:08Z","title":"Biological Reasoning-Informed Regression for Interpretable Regulatory DNA Activity Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T19:01:43.892354Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2606.08147"},"observation_digest":"sha256:ccfa4f52b1a5623d1f42fcc7d9696703077cf35f8de8601f983a66e3b4e17e38","observation_id":"ad125d65-8338-4ff8-b3a2-25cb045d814e","resolution":{"observed_at":"2026-07-02T22:17:26.268285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":"2505.14674","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-07-04T06:49:38.201535Z","title":"arXiv preprint arXiv:2505.14674 , year=","venue":null,"work_id":"6329708f-a68b-495d-8809-ef6742c84f90","year":2025},"citing_paper":{"arxiv_id":"2606.21627","last_updated":"2026-06-19T17:30:56Z","snapshot_observed_at":"2026-08-07T08:25:40.894867Z","submitted_at":"2026-06-19T17:30:56Z","title":"Counsel: A Meta-Evaluation Dataset for Agentic Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T14:07:59.446478Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2606.21627"},"observation_digest":"sha256:9665c441348d4b01543a16fe61874de852ef7a437f6fb820bb6bfe4eb96ad1d5","observation_id":"d329b7c8-0292-4432-947f-e065d7525ebf","resolution":{"observed_at":"2026-07-04T06:49:38.204971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-01T18:24:04.760985Z","title":"Reward reasoning model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17317","last_updated":"2026-07-19T16:01:11Z","snapshot_observed_at":"2026-08-07T23:16:24.147023Z","submitted_at":"2026-07-19T16:01:11Z","title":"TAPAS: Throughput-adaptive Perception for Autonomous Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:24:04.760985Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2607.17317"},"observation_digest":"sha256:4c580d20db923fe3e9dec7a2d0ac6da15cda1f0e71ea4a9ebb9fbca0cca5e8c9","observation_id":"12a1c266-d55d-436a-b877-aadc29b49771","resolution":{"observed_at":"2026-08-01T18:24:04.760985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14674/citation-record","integrity":"/paper/2505.14674/integrity","json":"/paper/2505.14674/citation-record.json","paper":"/paper/2505.14674"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:34:50.218433Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.218433Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:7506e4734cd03c20fe7e4595251daaa8a74edebacf05094870ce8140be57c7cf","observation_id":"2b5dc76e-1feb-4983-8214-fa8e19d1cf8a","resolution":{"observed_at":"2026-08-07T15:34:50.218433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-07T23:15:28.158449Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-07T15:34:50.264050Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.264050Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:e522177b2100099789a9533888d810098c80af869a973ff00029dcca5fe47d45","observation_id":"ef46c4eb-d007-43dd-bcac-af4fe3fbe2f0","resolution":{"observed_at":"2026-08-07T15:34:50.264050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17195","last_updated":"2025-01-27T15:09:08Z","snapshot_observed_at":"2026-07-06T20:27:32.742145Z","submitted_at":"2025-01-27T15:09:08Z","title":"Atla Selene Mini: A General Purpose Evaluation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17195","snapshot_observed_at":"2026-08-07T15:34:50.298845Z","title":"Atla selene mini: A general purpose evaluation model.arXiv preprint arXiv:2501.17195, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.298845Z"},"links":{"cited_paper":"/paper/2501.17195","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c4b5c0a153f875da90881ea1a7a0700cd9cdae866756c7e10ee5d6fb85388a07","observation_id":"10d6e181-a23c-4326-a1ea-b681e34819c8","resolution":{"observed_at":"2026-08-07T15:34:50.298845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.335857Z","title":"The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1:1, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.335857Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b51e2bdc5be71d52833baf810499cd33b8850e00d9bdc5e6068d8b64c0892752","observation_id":"324dd137-dbb8-4b26-ad1d-bfb5723149e7","resolution":{"observed_at":"2026-08-07T15:34:50.335857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1219","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.964877Z","title":null,"venue":null,"work_id":"3ac70652-05d0-4445-8653-93d8ee6dca4d","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.375780Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:57be531a02809fdc55cadcf96a644637343f32005faababb28a88e4c4dc835a9","observation_id":"abb5fcfe-f89d-4712-9a0a-c907f47bcfec","resolution":{"observed_at":"2026-08-07T15:34:54.013847Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:34:50.406624Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.406624Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:96cb0594040d271ff90d63bf96d92b5dca868034ef17c71ed02e9d0f79b527db","observation_id":"47b45be1-fd2f-4c65-b61d-eb409a76aef7","resolution":{"observed_at":"2026-08-07T15:34:50.406624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T15:34:50.446245Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.446245Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:41d6577aca78f9dcb9c861ef056e428d138a9dbe85bdbc67b49eec1c814c177e","observation_id":"f6cb77be-ec9f-4514-991a-2a89a49521dc","resolution":{"observed_at":"2026-08-07T15:34:50.446245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-07T15:34:50.491218Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.491218Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a3d4a2f38fc4630e5c085d4cb9ab93b5ddede9ab8419b2ef63d165e1626d2df0","observation_id":"c9e244ad-e186-419b-a6b6-3427b84bc06e","resolution":{"observed_at":"2026-08-07T15:34:50.491218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.535585Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.535585Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:01ff2d54139a42315af300893295b30d2f30524645afd2dfa5cfdef348ea0691","observation_id":"7d2dc476-2b95-4d48-8f9e-b5fce7fb796a","resolution":{"observed_at":"2026-08-07T15:34:50.535585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.592474Z","title":"Sparks of artificial general intelligence: Early experiments with GPT-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.592474Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:7414239b6c1c249a65258282955336d0e7ffa5ac6f2b257946cae7f9afa2836e","observation_id":"b2be30d7-3095-4200-b422-7a1795082215","resolution":{"observed_at":"2026-08-07T15:34:50.592474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-08-07T15:34:50.638608Z","title":"Compassjudger-1: All-in-one judge model helps model evaluation and evolution.arXiv preprint arXiv:2410.16256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.638608Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ec6ecb6d600eea1c55c0d181fa24f7d8487b70b058ac3c87c4cb1ab1c0fe0924","observation_id":"f46c7d44-57de-479f-95fe-2c2c9e4dd482","resolution":{"observed_at":"2026-08-07T15:34:50.638608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.684754Z","title":"Judgelrm: Large reasoning models as a judge.arXiv preprint arXiv:2504.00050, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.684754Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:78801a10e883885bd877d91775ec97c151b8b1b2caac7281677b60de0dd88ce5","observation_id":"ecaf28c3-59e1-4e5f-9512-4f3d20541476","resolution":{"observed_at":"2026-08-07T15:34:50.684754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.725027Z","title":"Seal: Steerable reasoning calibration of large language models for free","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.725027Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6397d534c1d0147679164e8b9bcd006181bd3918eab0c30d4bf672d4008dd59c","observation_id":"a6981fcf-1d7b-42ff-b33b-3da231f42faf","resolution":{"observed_at":"2026-08-07T15:34:50.725027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.777215Z","title":"Rm-r1: Reward modeling as reasoning.arXiv preprint arXiv:2505.02387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.777215Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c209f4a453e128033d6d9591c97dd39123a784a663168d75e4797f5da1b88c00","observation_id":"89dbad2b-12a3-4097-97aa-2fe0d4550f18","resolution":{"observed_at":"2026-08-07T15:34:50.777215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.819870Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.819870Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:79bff308aa3d03108ed89f02f1cb5bf3f9cd1f753b5077b67233d56ce77b6e27","observation_id":"4325b17c-a6d6-41a3-89e8-0f630abe60e5","resolution":{"observed_at":"2026-08-07T15:34:50.819870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:34:50.852224Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.852224Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:81aba739f664ea67116b206de91b909fbd922dbf064c22ec0b0bdf1024e74624","observation_id":"1c864530-7a15-455c-a7f2-e29d36148472","resolution":{"observed_at":"2026-08-07T15:34:50.852224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.904944Z","title":"Elo.The Rating of Chessplayers, Past and Present","venue":null,"work_id":null,"year":1978},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.904944Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a625f04aac027494ec09405edbbffd91ab3ae016a1baa49b388a367e2c368bc6","observation_id":"99b94b53-9660-4767-8b08-eb18dde2642a","resolution":{"observed_at":"2026-08-07T15:34:50.904944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:50.948093Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.948093Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:2850d089a705a1c3a04a0df49f765f4784a4622f3c9009c63dcfe30c441eb49d","observation_id":"7e5287c2-99f5-44e1-9322-1a6eb4ea874c","resolution":{"observed_at":"2026-08-07T15:34:50.948093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-08T01:11:30.324736Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T15:34:50.993826Z","title":"On designing effective rl reward at training time for llm reasoning.arXiv preprint arXiv:2410.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:50.993826Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ec5c754d34545de819b7d7f09f6ff5cf89342d76f076d1173c35523f44a16d0d","observation_id":"5f88e40d-533c-4b66-bd39-e43d86ce9f77","resolution":{"observed_at":"2026-08-07T15:34:50.993826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.045534Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.045534Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:11c3dac63c90575b2713679741362a64205ca4627d2719f64c07de16bba38dbe","observation_id":"033762ca-1f77-4f47-a0ad-dbf9d7e01395","resolution":{"observed_at":"2026-08-07T15:34:51.045534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-07T15:34:51.098716Z","title":"A survey on llm-as-a-judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.098716Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c10b311b2d0e382a7dfb46af72d110c2daec614352fb20c6fcbd023f4102b1a7","observation_id":"ca1e8f79-71e1-4408-afda-e93bfc3593fb","resolution":{"observed_at":"2026-08-07T15:34:51.098716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:34:51.142179Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.142179Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:747571406f35b456014d1918ae2c4a4822416fbdb2d9e6816763cf7616758cdc","observation_id":"9251b517-e7ab-4e26-8341-e109762f8faf","resolution":{"observed_at":"2026-08-07T15:34:51.142179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.178507Z","title":"Mcranker: Generating diverse criteria on-the-fly to improve pointwise llm rankers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.178507Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:fbddabab126a220957cd024ebcfecee8929ed385188bbf9d54f438ce5cfba4f9","observation_id":"f8aff6e2-39e4-47fe-9c9e-541080cb20fd","resolution":{"observed_at":"2026-08-07T15:34:51.178507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.224822Z","title":"Skywork open reasoner series","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.224822Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8ef986e37077419ac275132ecd634f0df098c11193a7ce6f57bb47c758feb62f","observation_id":"8b2953dc-7c4b-4ecd-a612-2d49d768aa75","resolution":{"observed_at":"2026-08-07T15:34:51.224822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.954276Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"34aad050-b87a-4f47-9d51-9090acba04cb","year":2021},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.259139Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:2dadf8252de3d08d99d32b16900a23a9fc4a40bf08632d4b643170faf8b3bb9d","observation_id":"e6099a2b-3bf3-4ae4-aec6-0aec91939039","resolution":{"observed_at":"2026-08-07T15:34:55.958482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:34:51.300610Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.300610Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ce3f5bd9aab2ce095916ef829601cdee90720fd749953891c31c31003fc460b4","observation_id":"f12a8b94-3cf5-4ae0-851e-f9a5556d8a5d","resolution":{"observed_at":"2026-08-07T15:34:51.300610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:34:51.337869Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.337869Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1ccbcfc19a764107a47c6d39b2b3484d315ea2a3b09414325972d42c6943cdab","observation_id":"31bd0b84-c20e-4a88-b147-8b2dd8f52a19","resolution":{"observed_at":"2026-08-07T15:34:51.337869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.370094Z","title":"LLM-blender: Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.370094Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:0a51e2d9bb6803b8fa16e3eaf5e9a3403124726f0f950a13fed6a244b69c1063","observation_id":"536d8b20-32fd-46c3-a843-3794f23bc031","resolution":{"observed_at":"2026-08-07T15:34:51.370094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.410454Z","title":"SWE-bench: Can language models resolve real-world github issues? InThe Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.410454Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c8e0a54565471b357d793dc4630bcde6217ba565dc3e352a0bc3e89bcfd114d7","observation_id":"cd8e1793-3b22-41ac-acd8-1db43cb79403","resolution":{"observed_at":"2026-08-07T15:34:51.410454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T15:34:51.450665Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.450665Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:696c02797611e70e2f88a65aef6739fab72f2554d7e38eb6d07c8c219eca0ccf","observation_id":"825d3a07-6a2b-4c64-aec2-07b755b4daa0","resolution":{"observed_at":"2026-08-07T15:34:51.450665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.493581Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.493581Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:014a4e9053863ed0e0048c92f17488983a18c0b1e36c9528a016aeb5ca46e156","observation_id":"8afb08ed-a533-41f1-a60d-44f323f602d8","resolution":{"observed_at":"2026-08-07T15:34:51.493581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.527785Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.527785Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:7f900803778d1b0fadbbd6e20e48a7a165bca69f87e9df02c88d15aba74209d0","observation_id":"95386e55-d1bd-4352-9799-9053ebb635a1","resolution":{"observed_at":"2026-08-07T15:34:51.527785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T15:34:51.610704Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.610704Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:e030a756cc3ea4288c5d081ab154d101a77da3f4cd26967406a65ba7966ccf7b","observation_id":"ce635670-f63c-447b-afd0-6a86ceaab1fe","resolution":{"observed_at":"2026-08-07T15:34:51.610704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T15:34:51.641108Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.641108Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a29cb3dbbfae5bfced69b3734497175d75666f6c251a39ad5e2f4a50f5bf2720","observation_id":"1ce3f9a5-3861-4ee6-b727-1c15d0e0512d","resolution":{"observed_at":"2026-08-07T15:34:51.641108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.932515Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":"7b7b8dde-8658-4ad7-9fd6-af21bdb83207","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.675833Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:2996d5d7b07bd57a12fd2cd55776764374fed995111f149133a0d81ca93361db","observation_id":"d59bc306-acfb-42b5-9cef-d49b096d8c08","resolution":{"observed_at":"2026-08-07T15:34:55.936539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T15:34:51.745476Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.745476Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:51e06d4f2c01e9262d6ed2120ec1ff2d860f543bd442f29d5197b32e6d55ceb0","observation_id":"97e93a02-a458-4cf8-bb3d-1fa1e9b98994","resolution":{"observed_at":"2026-08-07T15:34:51.745476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.922124Z","title":null,"venue":null,"work_id":"9e86a22e-07da-47a0-a435-8a5e96a6b5b6","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.708821Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1be048a19ca8c5799164b0b7ff9b2cb2efa6d84b6dcf593c4f3258c542c9009f","observation_id":"d0dc8f84-b9f5-42c8-8c22-50f1fcd63e53","resolution":{"observed_at":"2026-08-07T15:34:55.926236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.842603Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.842603Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ee3c8846abb5dbca121ce424f1b094256b4459bd37a699b87e273662f5c81c08","observation_id":"17a41f16-cc95-4c35-847c-587a961c0c0d","resolution":{"observed_at":"2026-08-07T15:34:51.842603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.791581Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.791581Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6f589fd3d0ee28e1db91da5d51e635855f609fa5dd6f43b4cb50d9b90c30ae51","observation_id":"6ef38318-1a13-4659-b948-b3841db37b33","resolution":{"observed_at":"2026-08-07T15:34:51.791581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13007","last_updated":"2025-02-19T13:35:48Z","snapshot_observed_at":"2026-07-06T20:24:31.858337Z","submitted_at":"2025-01-22T16:49:37Z","title":"PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13007","snapshot_observed_at":"2026-08-07T15:34:51.960784Z","title":"Pairwise rm: Perform best-of-n sampling with knockout tournament.arXiv preprint arXiv:2501.13007, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.960784Z"},"links":{"cited_paper":"/paper/2501.13007","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8c51fd31172133be95ad9b2c9cfd3706f15a86fb918192263cdc548dd589e6b8","observation_id":"10f0424d-d52f-4e3b-bd01-22350bb450f2","resolution":{"observed_at":"2026-08-07T15:34:51.960784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T15:34:51.910884Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms.arXiv preprint arXiv:2410.18451, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.910884Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:13ce2f156184d5dec1f3e5d532c706f0bc0562a38c342112bd87e886214ab733","observation_id":"1944545c-20ca-4cd3-a1b0-57e105fd9972","resolution":{"observed_at":"2026-08-07T15:34:51.910884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.899341Z","title":"General-reasoner: Advancing llm reasoning across all domains","venue":null,"work_id":"6a055450-5709-41e2-97cd-512c188a6b21","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.052327Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:38be948012c734df3af7f672278cd7de7f746be4e1bd87a7e0fbf44ea65793dd","observation_id":"0f772cdb-2858-463c-9082-4001e982e021","resolution":{"observed_at":"2026-08-07T15:34:55.902751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.997784Z","title":"Inference-time scaling for generalist reward modeling.arXiv preprint arXiv:2504.02495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.997784Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:aac0040ae0f89ff322af4c04b88f5ab2a0becdc922029417cfecb4f1c8d7dbd6","observation_id":"fbbf5d0d-d666-4fea-beba-18ae91c32152","resolution":{"observed_at":"2026-08-07T15:34:51.997784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.887173Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"5635e6ea-38e0-46d0-a1a2-132bb5ac6455","year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.134440Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:65c9c4a392ef2a3d754152db27f831ffe935214444565a0ef67f1a2ff0a26766","observation_id":"ca842ffc-23a6-46a5-a14a-e0cee2affeb2","resolution":{"observed_at":"2026-08-07T15:34:55.891726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-07T15:34:52.079730Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.079730Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:4187f891829804363e0cc30ac42c382feabc4b13536ae5ba0de29f6178a3d150","observation_id":"04e333ca-9936-4e0a-b645-56707c172df2","resolution":{"observed_at":"2026-08-07T15:34:52.079730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.199462Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.199462Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:6fd1341c2565dafbdd6001060346e5181b7127d902662d4cd91c8267612d1a89","observation_id":"e156917e-cdb5-489a-9e9f-32173197839d","resolution":{"observed_at":"2026-08-07T15:34:52.199462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.171617Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.171617Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:dea39e74b9eecbac9d5d2da47c0b79c529dec92b8cff0a21e537627c683158bb","observation_id":"2e9deba9-8e08-489e-9407-3eeaba038f60","resolution":{"observed_at":"2026-08-07T15:34:52.171617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:34:52.271529Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.271529Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8499423af4ea428b8a1ae4b8ab5cf364f319d6490ed1e2b660513f0719f80566","observation_id":"d40c1b1c-1b3f-4874-8d8c-5e9cad63712b","resolution":{"observed_at":"2026-08-07T15:34:52.271529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.231093Z","title":"OffsetBias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.231093Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8e7b90e8f8de5906ed8976a9220ecdfda5d8664ba25bbe83cf7df231755a6e56","observation_id":"7f077f48-f53e-4671-8c10-968b40c4aba1","resolution":{"observed_at":"2026-08-07T15:34:52.231093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.862659Z","title":"Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":"979072f5-3275-4f30-ad6e-e8c8f801c236","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.342892Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c4bfca5e61705333fd73c2d19427fd7bffa441e8e5e86f56ec3fee69f5c25f74","observation_id":"6d207513-7fda-4cb8-bf09-5dedac3090c0","resolution":{"observed_at":"2026-08-07T15:34:55.866191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.301877Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.301877Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:4ac6032ad829f7aa8b846fd5399676e38ddd2466eac1a03d33fa47dff40fc93e","observation_id":"93b2115a-a6af-4994-afc3-20a88c48f4dd","resolution":{"observed_at":"2026-08-07T15:34:52.301877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:34:52.426178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.426178Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ba348c6e9d374b0d4e458fde976cb23b25b19b70717fea4e49273aa00684fa50","observation_id":"1b28ebea-f75d-48d4-8953-78e11cbea415","resolution":{"observed_at":"2026-08-07T15:34:52.426178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.852642Z","title":"The limits of automatic summarisation according to rouge","venue":null,"work_id":"f0ab21c9-1301-4347-ad15-c451ed1844a7","year":2017},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.383058Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1cceb74d92fc50d9a6259edeeb79feee6e9d60d5afabb01a367f083d85d86a18","observation_id":"a5b06b04-de8e-479d-85e1-a53711d9db2d","resolution":{"observed_at":"2026-08-07T15:34:55.856216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.496371Z","title":"Skywork critic model se- ries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.496371Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:efdc5c4a80e1cdaf4a96f8768ad289df63a44007549504fb85bb670dd6171ee7","observation_id":"a9d9763e-c9e5-4662-920b-503fffe91314","resolution":{"observed_at":"2026-08-07T15:34:52.496371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T15:34:52.464502Z","title":"HybridFlow: A flexible and efficient RLHF framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.464502Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:e6068ec06b43bf88807484d784799c3b5b7ef49924c8cb8a0b0d1bece4b90b87","observation_id":"c60e5510-ccfa-4c84-8520-879502e2d277","resolution":{"observed_at":"2026-08-07T15:34:52.464502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:34:52.573985Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.573985Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b77231661399e5a7205ef16c8c6f2129ab2dff27ddbfcd33909347ee63e52c8c","observation_id":"8540d3f5-3be1-4a25-9b67-af2314e4b64a","resolution":{"observed_at":"2026-08-07T15:34:52.573985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.538743Z","title":"Scaling LLM test- time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.538743Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b3ad56dc267003f4f9c53ab05939ddb11240ec6bb3908b013ddb624ddc0205a3","observation_id":"cfef8121-af75-407d-85ed-ec9b6453c90e","resolution":{"observed_at":"2026-08-07T15:34:52.538743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-07T15:34:52.624148Z","title":"Secrets of rlhf in large language models part ii: Reward modeling.arXiv preprint arXiv:2401.06080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.624148Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:827af363072c78d53069c89f3dd38ca0918f452f534da798b4e938d7ea7bb776","observation_id":"a812a115-e4e8-4789-8eca-a48adb5d8948","resolution":{"observed_at":"2026-08-07T15:34:52.624148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.593804Z","title":"Foundational autoraters: Taming large language models for better automatic evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.593804Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:ef0b0ea6003b083a559a656b23b20f702305183985f62b9a41ca47c4d454dc93","observation_id":"9e4f17b6-25e3-441e-a397-57d7508cd05e","resolution":{"observed_at":"2026-08-07T15:34:52.593804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.830825Z","title":"Pandalm: An automatic evaluation benchmark for llm instruction tuning optimization","venue":null,"work_id":"162dff6b-6dd4-42c7-8fa7-ef4b74da6d05","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.701742Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:47e44b62006fa24178ca5bbcf2c1d54ae075dec6b9c6228a0ddf4c0162f268ac","observation_id":"72abce9f-4137-4ad2-b582-5787a5b1cfe9","resolution":{"observed_at":"2026-08-07T15:34:55.834388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02666","last_updated":"2024-08-08T17:09:58Z","snapshot_observed_at":"2026-08-08T10:45:45.471332Z","submitted_at":"2024-08-05T17:57:02Z","title":"Self-Taught Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02666","snapshot_observed_at":"2026-08-07T15:34:52.667559Z","title":"Self-taught evaluators.arXiv preprint arXiv:2408.02666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.667559Z"},"links":{"cited_paper":"/paper/2408.02666","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:bc12a65a2e6788eb3996704089f182d821b7c1063f79b674663eba532d5074b9","observation_id":"d720deb4-efae-4f39-b636-0d2064001d37","resolution":{"observed_at":"2026-08-07T15:34:52.667559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-07-06T16:48:21.364659Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-07T15:34:52.819560Z","title":"Helpsteer: Multi-attribute helpfulness dataset for steerlm.arXiv preprint arXiv:2311.09528, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.819560Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:89fe8b873d5ecb8e618b227818a6507983289b20f58326e7ee78b918465be7c7","observation_id":"3b22891b-1cb1-4eb9-8f68-fa2c7b066dd8","resolution":{"observed_at":"2026-08-07T15:34:52.819560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.819810Z","title":null,"venue":null,"work_id":"45187b9d-aded-4857-8e3e-77e69e7b7856","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.737656Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:e6de2308bff675cf1d549ab9361bfd4e2c3437e98701e4fc491bcfef78ac1150","observation_id":"341ee96e-1efe-4a1d-bfac-48453a6ff084","resolution":{"observed_at":"2026-08-07T15:34:55.823373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.808896Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":"db5e5f52-e94a-4a8a-9b20-090d070f8ce9","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.773786Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:f06f852a7e857642f7004bbdacd61a0cc539d7e5d600714a9df9d6ffbab3a7cf","observation_id":"34bbcde9-445e-44e9-a73d-b4270e62c790","resolution":{"observed_at":"2026-08-07T15:34:55.813269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.940879Z","title":"J1: Incentivizing thinking in llm-as-a-judge via reinforcement learning.arXiv preprint arXiv:2505.10320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.940879Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:3da5cc7b3dd2011cfb9d2d9f7a56504f344357369955f5dc74beeeb938698b83","observation_id":"ba7f0d83-0f17-420d-866d-a61a987a3d3a","resolution":{"observed_at":"2026-08-07T15:34:52.940879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.797802Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":"03c3272c-d63b-43c3-b669-4e92c29d55d7","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.862712Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:37df988dc2a250a27aa44dd1f3301f96a96ccd5411d1567d3d14c217433349a4","observation_id":"514a7db1-078e-4cde-b405-c3bca95521a6","resolution":{"observed_at":"2026-08-07T15:34:55.802137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:52.909489Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.909489Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:58b4fc80e36cd160218181ddf808e6bfb2fdde7ab6206ac89a1b3c5f7bd0b565","observation_id":"a79a40e6-edfa-40cc-b0df-2f7e4ae87bf4","resolution":{"observed_at":"2026-08-07T15:34:52.909489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.021374Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for LLM problem-solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.021374Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:5184674f7b3ae3373a81e676f3d1446a65d4635d363e6ff2bfdfd418d605a683","observation_id":"6245467e-b388-4761-9d3c-06b0d0775aed","resolution":{"observed_at":"2026-08-07T15:34:53.021374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.775126Z","title":"Metametrics: Calibrating metrics for generation tasks using human preferences","venue":null,"work_id":"0689a3b9-6d93-475e-bf7b-1db5daa8b330","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:52.996374Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:706a925261a3d343ae9ac70cb685dc4a9ab9b0d40a6ce7e012ed3ddd6184cf60","observation_id":"3914fb9b-10c8-4674-9571-b66f9dc9e801","resolution":{"observed_at":"2026-08-07T15:34:55.784727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19594","last_updated":"2024-07-30T01:38:06Z","snapshot_observed_at":"2026-07-06T18:53:00.965448Z","submitted_at":"2024-07-28T21:58:28Z","title":"Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19594","snapshot_observed_at":"2026-08-07T15:34:53.003907Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge.arXiv preprint arXiv:2407.19594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.003907Z"},"links":{"cited_paper":"/paper/2407.19594","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b82955c8802567f603f6e168aa279b14fbc1f98c15f4d39369d6733f10e35c0c","observation_id":"84ed587f-2345-4098-8b28-592c52a1dbb8","resolution":{"observed_at":"2026-08-07T15:34:53.003907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.752053Z","title":"Learning LLM-as-a-judge for preference alignment","venue":null,"work_id":"64a3cc67-61af-4276-a53a-eff393fa4b84","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.201510Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:35714a3efd03ddef5b9d5f57100f70eb50e6b28a877552a235ffee8590964cd8","observation_id":"ed3d3685-5069-4f6d-a549-19afa6aca6af","resolution":{"observed_at":"2026-08-07T15:34:55.759404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T15:34:53.085306Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.085306Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1f41181bbed4170ad70a18494e8bc264ac0a0d31219223a3d56886113cb4ef4e","observation_id":"24c0ae7f-4b60-4b0e-9cc0-07b08648a264","resolution":{"observed_at":"2026-08-07T15:34:53.085306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:34:53.137028Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.137028Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:c720ea98799ce0dba8af6f3c36adfa314e1e62e560c64c45b31805c8e809b163","observation_id":"85e6dfe3-c4c2-442f-bd24-53cb550d790f","resolution":{"observed_at":"2026-08-07T15:34:53.137028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.349374Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.349374Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:126e53eeac2e45be1b5484f4c2fd582cf6661b851e1d42cd46ce67c3bb894ae5","observation_id":"de494628-796f-48eb-8e34-1871d3509850","resolution":{"observed_at":"2026-08-07T15:34:53.349374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:34:53.259571Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.259571Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:207714718cc601495e82fd7fdc6b352e7ffb0902050fe68ce1b10b6bbf48656e","observation_id":"a6fdcaf4-4f08-469b-9515-792345129f24","resolution":{"observed_at":"2026-08-07T15:34:53.259571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.731135Z","title":"Self-generated critiques boost reward modeling for language models","venue":null,"work_id":"cd2e72f4-f8ae-495a-ab90-ee17974b8fd3","year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.306879Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:fbf1c1538a01b5d9ed7ab623c19fb4dafbdcaa5bf75248a7c59d5f9e22d031d1","observation_id":"e64558c4-476e-4df2-888d-8be1b6db038b","resolution":{"observed_at":"2026-08-07T15:34:55.740256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.509079Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.509079Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:f83fd77c3224066bb4dcc0196d2ca10520782a25cb99764634097b15b611b3a1","observation_id":"3868ed14-945a-4658-936a-d99a0c28f3ae","resolution":{"observed_at":"2026-08-07T15:34:53.509079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.706991Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"1fa3ddf2-4e76-4406-a6a1-df7c7114be01","year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.404561Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:8692d5a1bbdff568775df451c10ec04645a540fd877199f3eebed9b920879bcf","observation_id":"bf5a87e0-1d19-497d-8395-e141e26afb38","resolution":{"observed_at":"2026-08-07T15:34:55.714358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T15:34:53.466706Z","title":"The lessons of developing process reward models in mathematical reasoning.arXiv preprint arXiv:2501.07301, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.466706Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:53584efea496ee2d4af455101fcfc83c184d99476961ea89c10bf09988c9d7a5","observation_id":"a5b784e3-5bd9-4f6e-949f-953ce030b548","resolution":{"observed_at":"2026-08-07T15:34:53.466706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.675943Z","title":"JudgeLM: Fine-tuned large language mod- els are scalable judges","venue":null,"work_id":"9248a066-e519-42ca-83a4-c065fafc7154","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.658787Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:5b7f00e6e0420f8ff56c3246f22d6725758119164ec7a9419c84369bf8ea765a","observation_id":"09dd05a2-446f-4202-8241-8fb9c98a7b3c","resolution":{"observed_at":"2026-08-07T15:34:55.686012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:53.545855Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.545855Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:b7031eb303ae056890bda43b64cf6baaf02acf72cc7e7b43df63745c1eb33a20","observation_id":"9df9a508-d550-4afe-bdfb-f965df1da3ef","resolution":{"observed_at":"2026-08-07T15:34:53.545855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-08-07T16:06:17.033571Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-08-07T15:34:53.601769Z","title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future.arXiv preprint arXiv:2504.12328, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.601769Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:f72bc2934fb5e4ab2990c0872ef6afd3d9542c2f828e3843a512ee687074b142","observation_id":"e82255d5-fafd-40d0-857b-3536af06b0d7","resolution":{"observed_at":"2026-08-07T15:34:53.601769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.364923Z","title":"Partially Adhered","venue":null,"work_id":"96bf66ed-c058-4ede-869f-3e75824ece2a","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.781321Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:f37100bdfb48f1f21fe4ecdf7a1719aec8a24e7d21c477944d082238bcdb0b97","observation_id":"f22bab45-4e75-432a-8778-e7f7e5105b1a","resolution":{"observed_at":"2026-08-07T15:34:55.466419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.050032Z","title":"Useful but Incomplete","venue":null,"work_id":"228d0c94-171d-4890-b190-21af508097f4","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.828691Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1a9f0b49d10b0f27e5e057affaf74d228f3c42115499421cae7cf9299fe12c81","observation_id":"5065b370-aea8-49c4-9f0b-5c6e0df169ea","resolution":{"observed_at":"2026-08-07T15:34:55.250151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:54.768225Z","title":"Not Detailed","venue":null,"work_id":"e9db1e55-855f-4c1a-a488-63da2a69ea22","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.874909Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a23fae56856d88da50524fcf2efdbf229f23c5145ab1b462a1abc477c9673fa6","observation_id":"51c7af70-e049-4117-9136-927f002999ed","resolution":{"observed_at":"2026-08-07T15:34:54.938238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:51.573946Z","title":"doi: 10.18653/v1/2024.emnlp-main.248","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:51.573946Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:1fcd0c19d5175fd03a0faf2c9efda93d49a5b9bb1955ac94d9f3af4cfdcba272","observation_id":"7be62865-2f07-45af-bfcd-045c54341bcd","resolution":{"observed_at":"2026-08-07T15:34:51.573946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:34:55.657228Z","title":"\\boxed{Assistant 1}","venue":null,"work_id":"495e6f84-0968-4165-b08c-ca7cef92db81","year":null},"citing_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:53.714483Z"},"links":{"citing_paper":"/paper/2505.14674"},"observation_digest":"sha256:a433b6696e156ed61a58c5e1deca6c8e91c330a5e743c3b532c3a8ce2bd70cd7","observation_id":"6be746c7-c633-497b-844a-2731a542c577","resolution":{"observed_at":"2026-08-07T15:34:55.665928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:14:31.982740Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":68,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 15 inbound Pith citation observations for arXiv:2505.14674."}