{"as_of":"2026-08-17T09:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23a0927c93e5d8da65b3ec2d9cbcc29f4ac6c5ae7ab80ffa05ade05d007bfa9f","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:04:14.799234Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T22:50:33.285830Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:26:27.242958Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-07T22:50:33.285830Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.09053","last_updated":"2025-08-05T02:23:31Z","snapshot_observed_at":"2026-08-15T19:20:27.516820Z","submitted_at":"2025-02-13T08:08:27Z","title":"Game Theory Meets Large Language Models: A Systematic Survey with Taxonomy and New Frontiers","version":2},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-08-07T22:50:33.285830Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2502.09053"},"observation_digest":"sha256:07041accbfc4f2ba63432d1fca9ccd74e62d4f27fac57fb5b6bc71fadfed7fdf","observation_id":"8f069e31-eeec-4285-8eab-5a9ed739cc23","resolution":{"observed_at":"2026-08-07T22:50:33.285830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-07T14:00:03.410838Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.410838Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:583bf6117308098af804e9a71ecf81dc9c3b71c1a7d46aa28e116e9086d4239c","observation_id":"baa57ae7-86c2-4a8e-90df-38e7964957d1","resolution":{"observed_at":"2026-08-07T14:00:03.410838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-07T10:24:24.520322Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning.arXiv preprint arXiv:2504.19162, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:24.520322Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2506.06395"},"observation_digest":"sha256:bc326f79c49434aff2c4dbb067186e0b56baba54e4bf2a1b664e6c2c0793d528","observation_id":"a60935ee-dde6-4400-8c29-27d6730082b3","resolution":{"observed_at":"2026-08-07T10:24:24.520322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-06T15:47:30.674164Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15024","last_updated":"2025-07-20T16:19:51Z","snapshot_observed_at":"2026-08-15T06:24:01.751486Z","submitted_at":"2025-07-20T16:19:51Z","title":"RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:47:30.674164Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2507.15024"},"observation_digest":"sha256:2b7de5e339baa87433b0cde3ae2b1cdced07ec0e96ec95869dcc5c94c5b114d3","observation_id":"449b5695-ac43-4588-9625-8b28fde75fd8","resolution":{"observed_at":"2026-08-06T15:47:30.674164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-08-06T15:02:26.869430Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17147","last_updated":"2025-07-23T02:26:33Z","snapshot_observed_at":"2026-08-14T08:12:16.849492Z","submitted_at":"2025-07-23T02:26:33Z","title":"CogDual: Enhancing Dual Cognition of LLMs via Reinforcement Learning with Implicit Rule-Based Rewards","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:26.869430Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2507.17147"},"observation_digest":"sha256:9c80da468dfee1d43f9ba9249601ff2b9168f0da0d998c343d550935310409c3","observation_id":"6a359f50-1ac9-471b-9300-3a38ec70366e","resolution":{"observed_at":"2026-08-06T15:02:26.869430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":185,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:6f91559745102e00c0b6c54befb6fc143e11968d2a0ca9983cf19bacf7ce24ce","observation_id":"adff3f02-7490-446b-9e66-2fd40970239c","resolution":{"observed_at":"2026-05-14T22:23:14.992423Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2601.04809","last_updated":"2026-05-04T13:55:24Z","snapshot_observed_at":"2026-08-14T00:52:49.914352Z","submitted_at":"2026-01-08T10:42:04Z","title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T16:24:04.132572Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2601.04809"},"observation_digest":"sha256:2949509a1dcc0865923466331f9b626389301583eec7be56cbb0b886f95db80e","observation_id":"c95307ca-c6ad-4781-96d8-a1e6fefae90c","resolution":{"observed_at":"2026-05-16T16:28:05.750232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-08-11T07:05:08.289927Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:16f7b94dc6adca8b805680bfa6328da4a33ea277c7577f8e4a79c049ed125ae1","observation_id":"b8b22f47-daa5-455e-80bb-bc43f4b79248","resolution":{"observed_at":"2026-05-11T13:21:18.201366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-08-11T16:16:11.008726Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:12456177a8ebe1acf78ad0a4cb2881ca868c32a4531c81677daa2e4728cdd1f2","observation_id":"a0bca19f-eea2-4e01-97e0-3a4d26c32514","resolution":{"observed_at":"2026-05-12T07:11:24.388622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2605.18799","last_updated":"2026-05-11T09:22:39Z","snapshot_observed_at":"2026-08-15T14:04:10.185906Z","submitted_at":"2026-05-11T09:22:39Z","title":"ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T22:51:56.666980Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2605.18799"},"observation_digest":"sha256:52cce246bf15232dddc742189f43a56e3c7382d5e38c281d75c27152ceec8fb1","observation_id":"63701c8b-1f32-45b6-84b9-d8b8cb3173f4","resolution":{"observed_at":"2026-05-20T22:53:49.190678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2605.20531","last_updated":"2026-06-17T20:49:55Z","snapshot_observed_at":"2026-08-02T23:01:03.272596Z","submitted_at":"2026-05-19T22:08:51Z","title":"Pseudo-Formalization for Automatic Proof Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T06:25:01.098420Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2605.20531"},"observation_digest":"sha256:907df45215f1818fb3661b7ffd4d20f8aa8755e6eb5b669e1878a40598b988a9","observation_id":"72136545-3aff-48b4-82af-61d346e61e27","resolution":{"observed_at":"2026-05-21T06:29:42.216570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2605.20531","last_updated":"2026-06-17T20:49:55Z","snapshot_observed_at":"2026-08-02T23:01:03.272596Z","submitted_at":"2026-05-19T22:08:51Z","title":"Pseudo-Formalization for Automatic Proof Verification","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:17:48.969969Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2605.20531"},"observation_digest":"sha256:c8f05169b9309ad6647dafd86156f09eff9530deaf5473545f1f7bb3557c0738","observation_id":"33f4a043-fb6c-4b9f-bbc3-3c9edc09d1b8","resolution":{"observed_at":"2026-06-30T17:24:57.676445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-07T00:11:41.078023Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:030eff6e6aab722a4e176bcd4cf024acf35c58b2ac16d0411584ebe2b3aca1ee","observation_id":"84fa483e-fc08-4289-b1c0-d2a7ebe9195a","resolution":{"observed_at":"2026-07-02T02:26:27.244722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19162/citation-record","integrity":"/paper/2504.19162/integrity","json":"/paper/2504.19162/citation-record.json","paper":"/paper/2504.19162"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.505744Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.505744Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:4d14ef2dd949dd13ffc5c4466d11c9258ed6c96e2a8107ced27f5ab0bf5676c7","observation_id":"c4818701-5414-400a-b2b0-3172ff58f326","resolution":{"observed_at":"2026-08-16T06:04:14.505744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-16T06:04:14.510381Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.510381Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:3e8cfe2963bb6c42f8df14bfb613a1f346b6f4cd2305bb482d9528e9be68ac1f","observation_id":"b5ce3b57-5804-4880-a878-40df3552ad78","resolution":{"observed_at":"2026-08-16T06:04:14.510381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-08-15T06:19:06.009960Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-16T06:04:14.514628Z","title":"Thoughts are all over the place: On the underthinking of o1-like llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.514628Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:e8f98a507c489282215e8670e7147f1221d7709f83ad7846b43784ae8ec98222","observation_id":"df0345db-cf64-4aab-a358-bd463743294f","resolution":{"observed_at":"2026-08-16T06:04:14.514628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.681563Z","title":"Language models are few-shot learners","venue":null,"work_id":"652b22d7-3111-4a8b-a80b-b5417be940fe","year":2020},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.518559Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:6c908dbcaac77d8401198c0553bba780821c9b3c038b47eba5027a2419a98686","observation_id":"3a7747f8-1245-4caa-ae39-9760be751873","resolution":{"observed_at":"2026-08-16T06:04:15.685549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T06:04:14.522368Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.522368Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:2c7411a3fcca01f7ea94c9904a48a2f2766bf24407ded30975d2405e40eb4067","observation_id":"e5305829-e3d4-45f2-93a8-630535500090","resolution":{"observed_at":"2026-08-16T06:04:14.522368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T06:04:14.526276Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.526276Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:7d59511dd3c821f7f2fa547c9301218b5ca547d0f1e4fe125fc0fac81b1f0f75","observation_id":"8336a4cf-a945-4d4b-9779-6e19f95b6cc9","resolution":{"observed_at":"2026-08-16T06:04:14.526276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.670186Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":"bba1c427-5110-4213-999a-fe1fafad26f4","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.530539Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:47f409eec97a547c16e3a972bab466fd84429ce66bf03ed1eab153b57b061c4a","observation_id":"98957b60-8a51-4a93-9994-04fe5aab8d3a","resolution":{"observed_at":"2026-08-16T06:04:15.673877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.534386Z","title":"Introducing the next generation of claude, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.534386Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:d7e60920513728bb58a886578749089d02755a99ae2459961b98882a06cf91aa","observation_id":"126b6d6c-fd87-4997-b62c-e67baad1b90d","resolution":{"observed_at":"2026-08-16T06:04:14.534386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T06:04:14.538558Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.538558Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:8a7d16516cdaa21d0a8dabc6f4ea69666a1b0a78249cf2105e17f8bee77e87ea","observation_id":"1b22498d-faa8-4b2b-9cb2-cd8533744021","resolution":{"observed_at":"2026-08-16T06:04:14.538558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T06:04:14.543126Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.543126Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:d1da9717ba43266d7be1d7e37de9b9d6e4ce39d03e7516366645eac611571ec8","observation_id":"71a068a0-3664-4b5a-aefd-7e082174e3b3","resolution":{"observed_at":"2026-08-16T06:04:14.543126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-16T18:57:50.930866Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-16T06:04:14.547292Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.547292Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:8aab4670b79680f2d9b7764e8a07411f3cfab341cfa4dc80e73c10228a7143ad","observation_id":"3940a032-2ae3-4bf8-8e44-47a30610ba77","resolution":{"observed_at":"2026-08-16T06:04:14.547292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.551312Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.551312Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:3a3e492b2b57cc35dd298af5f69d86f01dd6ae2d60bff149792a62b5ce071ce0","observation_id":"e6b8881a-ede2-457a-8d78-14d3f6f15d67","resolution":{"observed_at":"2026-08-16T06:04:14.551312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T06:04:14.554833Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.554833Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:9241d961e2055e2d163a859c0a1e5ced92c246f62f9c5d1a755df2d246189730","observation_id":"607bad48-0883-47b1-9c40-e25489c5fb88","resolution":{"observed_at":"2026-08-16T06:04:14.554833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.559247Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.559247Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:38dc219cb5f24cb4b111b44585a526fdb288712bdaf2b5aba918d7965e0d4d20","observation_id":"3985ae24-e812-43ad-93f1-4933b7637891","resolution":{"observed_at":"2026-08-16T06:04:14.559247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-16T06:04:14.563002Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.563002Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:1300c7b4044a981e87a05783116235c211ca86d73e6f54b4cdcdb4f2a0e04a0e","observation_id":"ce7406d9-8776-4bc6-8d1c-8bd8d96dfce0","resolution":{"observed_at":"2026-08-16T06:04:14.563002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T06:04:14.567228Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.567228Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:3fafde0cf59f747bc8ec2889ac3be5e278b73fe29f1b6adafce41166195a9de8","observation_id":"de4e5c97-5d48-444f-a6d3-4b79199e8eb8","resolution":{"observed_at":"2026-08-16T06:04:14.567228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T06:04:14.571617Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.571617Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:67b9491d95add361190e72f2f412398f630a194dfb5403714db33a08698beecf","observation_id":"3c82e5a0-b269-412f-9aee-d82439a078bf","resolution":{"observed_at":"2026-08-16T06:04:14.571617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-15T08:59:30.302596Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-16T06:04:14.575844Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.575844Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:da9087d64b43fdb951ddde35b14f18b4685e061370b98e9d0219339cf7b241b1","observation_id":"81e9d7c7-abc3-4954-b1a5-30cf1d1eb324","resolution":{"observed_at":"2026-08-16T06:04:14.575844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13692","last_updated":"2024-08-01T17:18:54Z","snapshot_observed_at":"2026-08-16T13:32:58.254180Z","submitted_at":"2024-07-18T16:58:18Z","title":"Prover-Verifier Games improve legibility of LLM outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13692","snapshot_observed_at":"2026-08-16T06:04:14.579837Z","title":"Prover-verifier games improve legibility of llm outputs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.579837Z"},"links":{"cited_paper":"/paper/2407.13692","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:fb2ceda9285ec63cf94eacb3bf22c82896d192118b76b60d6400dfe85d0eb23a","observation_id":"659adce1-6566-4e18-9750-2302a2330d78","resolution":{"observed_at":"2026-08-16T06:04:14.579837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.637904Z","title":"Openai o1 system card","venue":null,"work_id":"6379ec75-35a1-4436-8d47-8c1a3e959e63","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.584281Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:0619b8df705214799fb810f1a23611bcf59d88d95e44133531bb6f3c91e2ee14","observation_id":"382acda4-e014-4b37-b9b4-75f5e90ccbda","resolution":{"observed_at":"2026-08-16T06:04:15.641541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T06:04:14.587663Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.587663Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:3b0cd3f289bf11b294c8bcd2bffb5b48e63d6f45da7d71ee60716eb3c8229ca2","observation_id":"9ef91387-af08-46eb-acbf-d943021de027","resolution":{"observed_at":"2026-08-16T06:04:14.587663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.591591Z","title":"Qwq: Reflect deeply on the boundaries of the unknown, November 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.591591Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:b260e854ece59d05a87612a6f5e7b0d8ed3b51fcdc81135a37ddf0a55e69e20e","observation_id":"123b766a-2c5b-449d-b8ad-84cc6dfb3316","resolution":{"observed_at":"2026-08-16T06:04:14.591591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.595052Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.595052Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:156f65e20f3236b0e5c907e022fc86d54acdeaf498dd76d57001715b61b35db8","observation_id":"91671b48-b76b-42f4-ba6c-5f99bb9d76e2","resolution":{"observed_at":"2026-08-16T06:04:14.595052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.611423Z","title":"Skywork-o1 open series","venue":null,"work_id":"cfec1960-41bd-42b3-b823-3e1d9fa59105","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.598579Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:23ef181179b17e09fffdfdf13464d7ef8aea59b7de03b3c8f15b8827b9256675","observation_id":"14020d1c-0b0a-47ed-a7cc-a95d351da66d","resolution":{"observed_at":"2026-08-16T06:04:15.615374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.601970Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.601970Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:1ab83141a6bc87cd10cef28bcb45af462eb81402c07e5686b8585d88d63a9355","observation_id":"e1e8737e-ea83-413f-99b7-d0ae2ae338c9","resolution":{"observed_at":"2026-08-16T06:04:14.601970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.605869Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.605869Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:336e6849c9c33d07278916d3137100511f172410852fb84b4a65bf9d02d1d958","observation_id":"f6110111-5df8-4562-b836-aa4c29c75581","resolution":{"observed_at":"2026-08-16T06:04:14.605869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-16T06:04:14.609396Z","title":"Processbench: Identifying process errors in mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.609396Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:15835d19409cceb7e6f32bbab44042daf81a42fb52d8054720c1e9c08b246737","observation_id":"0e45cfc4-fcc0-49da-9398-c466e1de19c5","resolution":{"observed_at":"2026-08-16T06:04:14.609396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.584182Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"d8e45ee8-7a5b-45a0-889c-45ace50e06b8","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.613377Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:5f14292ab11973a396b44993650844b5cb242271578253a4f5c795d98f6c26a8","observation_id":"64bbadf7-c265-4275-a40f-5cea1e0f3438","resolution":{"observed_at":"2026-08-16T06:04:15.588205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16646","last_updated":"2025-02-09T07:53:38Z","snapshot_observed_at":"2026-08-13T05:48:57.895519Z","submitted_at":"2024-11-25T18:28:26Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16646","snapshot_observed_at":"2026-08-16T06:04:14.616880Z","title":"Self-generated critiques boost reward modeling for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.616880Z"},"links":{"cited_paper":"/paper/2411.16646","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:b0312be867bf988a2dbe0dcfce5d96a2dc63ea9b39a665b27ae6772439e48384","observation_id":"e96f158f-e359-4e4f-bac7-52b63dee4c60","resolution":{"observed_at":"2026-08-16T06:04:14.616880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16326","last_updated":"2025-06-11T02:01:02Z","snapshot_observed_at":"2026-08-16T13:23:00.317616Z","submitted_at":"2024-08-29T08:02:09Z","title":"Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16326","snapshot_observed_at":"2026-08-16T06:04:14.620811Z","title":"Critic-cot: Boosting the reasoning abilities of large language model via chain-of-thoughts critic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.620811Z"},"links":{"cited_paper":"/paper/2408.16326","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:9a4cadeaf3c577a45a05147951703b0f3c4ea953077675332484a04e21c82cee","observation_id":"6c250693-50eb-4c2d-9664-cc2b2f285829","resolution":{"observed_at":"2026-08-16T06:04:14.620811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12853","last_updated":"2025-02-18T13:40:22Z","snapshot_observed_at":"2026-08-16T12:57:19.745389Z","submitted_at":"2025-02-18T13:40:22Z","title":"S$^2$R: Teaching LLMs to Self-verify and Self-correct via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12853","snapshot_observed_at":"2026-08-16T06:04:14.624752Z","title":"S 2r: Teaching llms to self-verify and self-correct via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.624752Z"},"links":{"cited_paper":"/paper/2502.12853","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:350b91748af34cf00bac3ede19ccd66ad46bc390e2a42297da80be014fc41cda","observation_id":"27a71eaf-1c26-4cbc-b64f-d6301da3b8f1","resolution":{"observed_at":"2026-08-16T06:04:14.624752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06195","last_updated":"2024-08-12T14:42:13Z","snapshot_observed_at":"2026-08-16T22:23:21.433393Z","submitted_at":"2024-08-12T14:42:13Z","title":"Mutual Reasoning Makes Smaller LLMs Stronger Problem-Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06195","snapshot_observed_at":"2026-08-16T06:04:14.628433Z","title":"Mutual reasoning makes smaller llms stronger problem-solvers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.628433Z"},"links":{"cited_paper":"/paper/2408.06195","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:4d02c43c17a8bd6813fec7bdd7111abe2fe3d547f284e585835148d3fd353565","observation_id":"2ee8533a-66dc-448b-8027-995dbdfc8a08","resolution":{"observed_at":"2026-08-16T06:04:14.628433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12253","last_updated":"2024-12-10T18:19:29Z","snapshot_observed_at":"2026-08-17T03:24:15.091127Z","submitted_at":"2024-04-18T15:21:34Z","title":"Toward Self-Improvement of LLMs via Imagination, Searching, and Criticizing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12253","snapshot_observed_at":"2026-08-16T06:04:14.632334Z","title":"To- ward self-improvement of llms via imagination, searching, and criticizing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.632334Z"},"links":{"cited_paper":"/paper/2404.12253","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a80963ef55b029108ff6e2f474c7ab74b6f6b2b1525ced2cdc8fdd725f4bad90","observation_id":"ac1f8437-b4dc-4094-9155-267366176814","resolution":{"observed_at":"2026-08-16T06:04:14.632334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.572316Z","title":"O1 replication journey – part 2: Surpassing o1-preview through simple distillation big progress or bitter lesson? Github, 2024","venue":null,"work_id":"8f767a34-5403-49bb-b9ab-767c890e9ba1","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.636473Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a843411bb60c3b2074358498a200fe0969735e10f3473ade9a61d7955e1715a8","observation_id":"b7a22f54-3bf6-4827-9f33-52d5703701f3","resolution":{"observed_at":"2026-08-16T06:04:15.576261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.560338Z","title":"Can large language models detect errors in long chain-of-thought reasoning?, 2025","venue":null,"work_id":"9442c4ed-ad01-40d3-a5c9-131c19e4d8fb","year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.639953Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:42ee486a56e3ec5a64708f5a8f02e10de86c00d41a99d3754aa7c67da29063d9","observation_id":"dfb04b07-7747-45b5-955b-0e03d499233f","resolution":{"observed_at":"2026-08-16T06:04:15.564637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-16T06:04:14.643907Z","title":"Measuring faithfulness in chain-of-thought reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.643907Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:c15d83f215401a047db9fdf301cf2e414bb8451702eaaf73d4458765cd3774ac","observation_id":"7fc92d19-3714-444a-bfb4-c76381a12a9e","resolution":{"observed_at":"2026-08-16T06:04:14.643907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.547930Z","title":"Aime 2024, 2024","venue":null,"work_id":"9d26e0fd-7d55-4645-b199-d10393bcc8bd","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.647592Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:d569db6593fa7a185a18a108097f12b5816b3ead3ed4a4f15b69c1dccf7721f6","observation_id":"28f58e72-2a5d-441e-9b80-8c9f6b497f49","resolution":{"observed_at":"2026-08-16T06:04:15.551941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.536627Z","title":"Introducing meta llama3: The most capable openly available llm to date, 2024","venue":null,"work_id":"d5c8e7e4-5018-462a-a9ef-b803d197cf60","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.650918Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:60414efdd5721d12b8368e524d6599049c8874371fd7af75c71b9c96127810dd","observation_id":"eae23f51-f64e-4364-94da-f84539ee27fc","resolution":{"observed_at":"2026-08-16T06:04:15.540384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.654469Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.654469Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:060589a7bb4db89ed452ee8a6a3f434cee3c207824bfe4c082d794386895f5bf","observation_id":"a0e24e55-c82a-446e-8918-7537347e26c7","resolution":{"observed_at":"2026-08-16T06:04:14.654469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.657957Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.657957Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:6fc1b2167064de8c9661698da3035e500540a634e5bd7cb2c10d01acd28f993d","observation_id":"24849fa7-1d53-4019-b291-6823dd354168","resolution":{"observed_at":"2026-08-16T06:04:14.657957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.661555Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.661555Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:791f32ca4a9f770cd6765fce6e669e9b48299396a10e17a8910a1dadba7e9a3a","observation_id":"6e1b4268-29d2-486c-b4fd-3ede57d6e91e","resolution":{"observed_at":"2026-08-16T06:04:14.661555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.665289Z","title":"The lighthouse of language: Enhancing llm agents via critique-guided improvement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.665289Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:4dcdfa5090352d4db9d2eaa3abec00d51b51172e4069bf467939ff0c7423331f","observation_id":"8716aa30-5ffc-42c8-966b-7b000b68704b","resolution":{"observed_at":"2026-08-16T06:04:14.665289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:14.668679Z","title":"Some studies in machine learning using the game of checkers","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.668679Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:10eff5f5b68bf78dec25d87b9288d1dc5e7794eb230688afed6efe987858fa9e","observation_id":"6c49bf63-b568-44fd-9b63-e71d0ac3af5b","resolution":{"observed_at":"2026-08-16T06:04:14.668679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.497639Z","title":"Temporal difference learning and td-gammon","venue":null,"work_id":"f9f1dea6-b3d9-43b0-96e0-7ee01ed53db9","year":1995},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.672523Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a364c9ad4c9ce4d116e611b0e349188bdde00fde2ac24c9593b21c7bc02371ee","observation_id":"90787b21-6b19-4cd9-96d8-029faaa6ee36","resolution":{"observed_at":"2026-08-16T06:04:15.501633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-14T20:06:37.819179Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-16T06:04:14.676179Z","title":"Mastering chess and shogi by self-play with a general reinforcement learning algorithm","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.676179Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:f792bfed33efeef99bede403204b90df7227bb502afa555a1d89a73251f317d4","observation_id":"7ced5c1c-4dc2-4e17-8a53-fcf4c196b2b7","resolution":{"observed_at":"2026-08-16T06:04:14.676179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.486901Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":"640a7808-2ea5-451a-beb7-ccf1ab2d73d1","year":2017},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.680019Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:96a895e3cda2d9c7fe5c5d0ec8cebfb77961413bdf476e076be7d6e15af8e68d","observation_id":"def38d47-ab18-456d-8563-61ab31747f66","resolution":{"observed_at":"2026-08-16T06:04:15.490754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.475222Z","title":"Self-playing adversarial language game enhances llm reasoning","venue":null,"work_id":"c4e6ae3c-88fc-47bb-84d7-b5756071dcd6","year":2025},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.683478Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:20c020d04345c55daebac0046edc5daa65f4b3d0e201bbc2f1319ba41a244588","observation_id":"e49a1add-e3fc-4072-9728-f90a8444246c","resolution":{"observed_at":"2026-08-16T06:04:15.479356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00062","last_updated":"2025-04-09T19:53:54Z","snapshot_observed_at":"2026-08-16T13:04:14.801252Z","submitted_at":"2024-10-31T08:15:32Z","title":"Scalable Reinforcement Post-Training Beyond Static Human Prompts: Evolving Alignment via Asymmetric Self-Play","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00062","snapshot_observed_at":"2026-08-16T06:04:14.687140Z","title":"Evolving alignment via asymmetric self-play","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.687140Z"},"links":{"cited_paper":"/paper/2411.00062","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:2af962e95cca2548060cc57d3ae671d9a2e7100d9631cf3fd733ebd97c70e35c","observation_id":"587296c3-cfe3-49ca-8001-53afc87b5fdc","resolution":{"observed_at":"2026-08-16T06:04:14.687140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12474","last_updated":"2024-01-23T03:56:22Z","snapshot_observed_at":"2026-08-16T14:25:21.107239Z","submitted_at":"2024-01-23T03:56:22Z","title":"Large Language Models are Superpositions of All Characters: Attaining Arbitrary Role-play via Self-Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12474","snapshot_observed_at":"2026-08-16T06:04:14.691014Z","title":"Large language models are super- positions of all characters: Attaining arbitrary role-play via self-alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.691014Z"},"links":{"cited_paper":"/paper/2401.12474","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:699f90efdbc818dc5964034778d3dfa73fe8fbbd366de27a57da17600f5e82d2","observation_id":"3f7a9601-fa4a-477f-94ce-b72c0b3f0ad5","resolution":{"observed_at":"2026-08-16T06:04:14.691014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-08-16T13:56:12.879059Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-16T06:04:14.695026Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.695026Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:0879e0b9dbafbfe367a6b1b339fe359a05e800165154baa46092c4246e24f5e8","observation_id":"523096d3-8559-4589-8215-367a6c681402","resolution":{"observed_at":"2026-08-16T06:04:14.695026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-16T06:04:14.698960Z","title":"Justice or prejudice? quantifying biases in llm-as-a-judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.698960Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:77b6b9eb4bbffa965a5f04c11e68419ed52b8120b2ec34cd71599b1dc33814b8","observation_id":"68a38343-2479-4304-9cb9-667ff43ea9f8","resolution":{"observed_at":"2026-08-16T06:04:14.698960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-16T06:04:14.702907Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.702907Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:f5294889546912317e96650a7b1434ca9a4e8af8f8f0a10fef6a3c6a3e898280","observation_id":"363c2bc3-6819-426d-ad6e-5e376d9c5d98","resolution":{"observed_at":"2026-08-16T06:04:14.702907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T06:04:14.706747Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.706747Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:52a1034ea0e6d45c309d66de1981f57963f6fbdd43c771fa83171dfe8bd3cc5f","observation_id":"b017651f-4cc6-4ed3-bad1-c3d8be3080c5","resolution":{"observed_at":"2026-08-16T06:04:14.706747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T06:04:14.710535Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.710535Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:1e05ecc24356fa7af6c2f040bfd753681e672963825aba40438563ef7468acd2","observation_id":"47dbf16d-0a09-4396-9816-f17e01c1f0f4","resolution":{"observed_at":"2026-08-16T06:04:14.710535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.464428Z","title":"Qwen2.5-math-7b, 2024","venue":null,"work_id":"e8b57630-2411-4852-aa57-25e741b43889","year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.714348Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:664b7742fb05ebde574c03c1c95d7ea22ed7dce1face507105d34ca31556f0c6","observation_id":"6bc964d7-207f-4dbf-babb-3dc0fd28d14e","resolution":{"observed_at":"2026-08-16T06:04:15.468330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T06:04:14.717750Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.717750Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:7c619a11dab37355a5bcd4e54aeabc47e0d39ba0ef40bcb3b64a854e31d36dcb","observation_id":"1c590def-d60e-478d-9be4-2ce55403d821","resolution":{"observed_at":"2026-08-16T06:04:14.717750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-16T06:04:14.721523Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.721523Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:c92f0a65b1996fa1b5d706d0a4d85cf5c3a262e61041e98f09cb446d600583a6","observation_id":"fe913151-b115-4f67-a1a4-4f9ece4fe7df","resolution":{"observed_at":"2026-08-16T06:04:14.721523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-16T06:04:14.725398Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.725398Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a08e52c817a4d58e8ec12b1bcc0494624dc2e30fa21300c4751a85f4b043a530","observation_id":"8016ad59-934f-4767-9b6c-82862739b37b","resolution":{"observed_at":"2026-08-16T06:04:14.725398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.419563Z","title":"Note: For each question, you will be given a reference incorrect last step","venue":null,"work_id":"a34f014d-8331-4d93-b6c8-c239041a9d91","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.740981Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a3e600fe3dfe8c26926bd88f4f19f1dac213bb49f18df2d36ab9d42eac7cc9b4","observation_id":"f3b4ea95-52ea-4912-8ff1-901514054820","resolution":{"observed_at":"2026-08-16T06:04:15.423442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.386587Z","title":"At the end of the response, output \\\\boxed{{Correct}} or \\\\boxed{{Incorrect}} to represent the correctness of theLast Step","venue":null,"work_id":"227c095b-765b-446a-86c3-9f34ebaeb885","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.751478Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:3ce0173744e6bb25f269c2539c51f829aacf2de1a627a2891ef1d6545a4501a9","observation_id":"6bd5e618-e267-4f57-aae1-f049e5c14b2b","resolution":{"observed_at":"2026-08-16T06:04:15.390785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.375806Z","title":"If the Draft Critique includes this analysis, you can directly summarize from it","venue":null,"work_id":"31eab461-bb61-4342-b338-6f6a91afea35","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.755268Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:ebbb63c3d3af002eb1673ed416129cdb8c02d359bc74ee80ef059e643a9c0331","observation_id":"8538f9b0-462b-4ed8-83a6-e40eed9d9f8b","resolution":{"observed_at":"2026-08-16T06:04:15.379384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.365110Z","title":"You should write a new version of brief critique here","venue":null,"work_id":"451847db-35fb-40a0-bdc5-df48425f8f37","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.758769Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:262dc6944d8557f9b90f6c7b2b73b04f6372438f7619637e57790d7697ac0051","observation_id":"37bb3787-2a1a-40a7-88fc-da73680c846a","resolution":{"observed_at":"2026-08-16T06:04:15.368837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.353814Z","title":"Please draw a conclusion about the correctness of the Last Step","venue":null,"work_id":"e6335b70-2f8f-495d-8366-4580e11325b9","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.762121Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a0ecc91e4a09d83c73a6f5ce830c6a5214c699354134bf213975ccee095a5d8f","observation_id":"53131bf5-e9cd-4903-a610-04691b79be61","resolution":{"observed_at":"2026-08-16T06:04:15.357381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.342589Z","title":"the critique","venue":null,"work_id":"ae52f893-f7a9-46d9-8d2f-2838256b2b06","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.765564Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:a6456997274285774e594cc56ef5ce0051b206c3b2aa2b1d8f82491c0ea9d035","observation_id":"31d32af9-ab56-49a3-813d-f9cff886c7f9","resolution":{"observed_at":"2026-08-16T06:04:15.346433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.331345Z","title":null,"venue":null,"work_id":"8be50831-432d-4eb2-aa7e-052e3019737e","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.768916Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:f31117f4b1a2fafc92d17791db00654ce4298372a228c84c573f563cb1e6714d","observation_id":"bc56fce3-dcb1-4c2e-a818-b110ffd114db","resolution":{"observed_at":"2026-08-16T06:04:15.334974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.319500Z","title":"Instead, in the Critique, you start with an analysis of the Last Step","venue":null,"work_id":"ebfe518b-d70b-4279-91f5-9715ad331d3f","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.772248Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:ab78a6e8151a5f3f582c478fef470f7bd101d99f7031f20aaa484f82f539bd74","observation_id":"bd740ae5-ee52-47df-9226-cf956d234b14","resolution":{"observed_at":"2026-08-16T06:04:15.323484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.308458Z","title":"Y ou only need to focus on the correctness of the Last Step","venue":null,"work_id":"797a1d40-62c9-4fc5-82d2-000321e56cfe","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.775601Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:80754071b08ff910e8255dce9fd67054b40cd9bcf631dbd37ad895179d91bc72","observation_id":"340cf9aa-4dc5-4041-bbd2-66e65078d28f","resolution":{"observed_at":"2026-08-16T06:04:15.312478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.453168Z","title":"Clearly explain the solving process in the last step","venue":null,"work_id":"c0fb4853-9670-452e-be3d-e791fb3eebc8","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.778765Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:f601fc8070ab771333642cf2c3353c0a0858dca3ca45ef49a76ef8907ff2db4e","observation_id":"abdcb106-5899-4b5b-99e2-b66576ea4bda","resolution":{"observed_at":"2026-08-16T06:04:15.457002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.442094Z","title":"Predefined Error Types","venue":null,"work_id":"f2695ae1-f237-44e0-8f6c-3cff57fea9d6","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.782398Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:eb3b5df341b4f9b25cec5db1b422118b49581f6cf738d6a48ab60eed90da9ea1","observation_id":"e1c3e9be-5bd2-4dd4-8aea-8b3ff0618aaa","resolution":{"observed_at":"2026-08-16T06:04:15.445709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.430921Z","title":null,"venue":null,"work_id":"5189ad07-2410-4ae9-93f2-7a173db4fedd","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.785615Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:47860629728964e92b2656020c8739963a33043c7507366922dca2633d2b87e0","observation_id":"63eaa358-2ed3-4195-8007-0df80ecc3b84","resolution":{"observed_at":"2026-08-16T06:04:15.434535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.297189Z","title":null,"venue":null,"work_id":"5ff57f60-94c4-459d-bbf4-9aac60567f4d","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.788959Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:d6fc3b3cb95617300dbcc5e28f7bf7a28ff64a41fd004dbf92205ab229078fbd","observation_id":"c17ea9ab-5827-4b49-9985-6adc1f3e8fe3","resolution":{"observed_at":"2026-08-16T06:04:15.300833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.408817Z","title":null,"venue":null,"work_id":"4a8e7ff2-970a-4ef3-b208-2f4b8710635b","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.792447Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:252837ff82d3f9a054bdc9eb35e42211781e956b7824892a5fbde1dbd5e1671e","observation_id":"950be891-8172-4be9-b83b-1a8be41985c5","resolution":{"observed_at":"2026-08-16T06:04:15.412224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.398187Z","title":"You should write a brief critique here","venue":null,"work_id":"b7072be0-9cca-4d13-96f8-a72325a56392","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.795736Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:8846f253446fe488f00a2049366f68f6982b2d52e441ab8331bc2d26c7170090","observation_id":"c351eec6-d67b-4299-8ee4-b40abf1eabee","resolution":{"observed_at":"2026-08-16T06:04:15.401947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:15.283653Z","title":"At the end of the response, output <Answer>Correct</Answer> or <Answer>Incorrect</Answer> to represent the correctness of the Last Step","venue":null,"work_id":"d36d2b7c-32b6-4c5c-8877-8d5a840cde65","year":null},"citing_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:14.799234Z"},"links":{"citing_paper":"/paper/2504.19162"},"observation_digest":"sha256:28cee0ca532e0261f214cbab305ae5584e7fa7cea9c02c80e8d0accc1b4988b7","observation_id":"e47bb238-85ec-44f9-9cce-35007ee680ad","resolution":{"observed_at":"2026-08-16T06:04:15.289595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T00:05:00.684117Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 13 inbound Pith citation observations for arXiv:2504.19162."}