{"as_of":"2026-08-02T13:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c793d0914105b07903e2567345802e7119980418d24b386150fe357a4596fff8","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:51:00.913166Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T18:33:28.486944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20051","snapshot_observed_at":"2026-07-30T18:33:28.486944Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26873","last_updated":"2026-07-29T13:03:07Z","snapshot_observed_at":"2026-08-01T23:37:39.124113Z","submitted_at":"2026-07-29T13:03:07Z","title":"SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-30T18:33:28.486944Z"},"links":{"cited_paper":"/paper/2604.20051","citing_paper":"/paper/2607.26873"},"observation_digest":"sha256:81b639501379370d6a7222ac9e222b602be2c628abc4166b3cacfd2a34ab4731","observation_id":"cbeba9fc-2602-4817-898f-741f2802f596","resolution":{"observed_at":"2026-07-30T18:33:28.486944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.20051/citation-record","integrity":"/paper/2604.20051/integrity","json":"/paper/2604.20051/citation-record.json","paper":"/paper/2604.20051"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-07-10T18:57:31.585722Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:49439f2216b34eed6dfc93bfab66ff3b15e351c3a1679e0252393df39d5d6493","observation_id":"c16066c7-4b69-46b8-80e6-d3f021fd5220","resolution":{"observed_at":"2026-05-13T05:18:21.444858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19162","last_updated":"2025-05-17T14:32:38Z","snapshot_observed_at":"2026-07-06T21:15:21.546083Z","submitted_at":"2025-04-27T08:45:06Z","title":"SPC: Evolving Self-Play Critic via Adversarial Games for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2504.19162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19162","snapshot_observed_at":"2026-07-02T02:26:27.242958Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning","venue":null,"work_id":"17d073b5-d246-4ecc-8a4b-944b453f8590","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2504.19162","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:a79963efc68bae6228d191dbd12baf4ef8debfb45cc1f9c6ee1200fe16a8c553","observation_id":"b8b22f47-daa5-455e-80bb-bc43f4b79248","resolution":{"observed_at":"2026-05-11T13:21:18.201366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10642","last_updated":"2025-01-24T15:21:47Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:16:22Z","title":"Self-playing Adversarial Language Game Enhances LLM Reasoning","version":3},"cited_work":{"arxiv_id":"2404.10642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- playing Adversarial Language Game Enhances LLM Reasoning","venue":null,"work_id":"bac5d626-62ac-48f5-95e5-0ffac3ff68a8","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2404.10642","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c8a3fdc0e7377ad60b1fdcfd1702e1713752f964c12a1dab94f106dc21af0d39","observation_id":"9b305eee-49a1-4e18-b7ad-5f8008fd23ad","resolution":{"observed_at":"2026-05-11T13:21:16.065828Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ba62d53268a2795aae15cfb4ed42ad46f19619bc5e3e235b10add586b2d0b952","observation_id":"cad5ea11-a550-4ee0-88cf-28b1382f298d","resolution":{"observed_at":"2026-05-12T01:23:37.463337Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:7ffd8b8ca6e36e6383b5a77cb5e5353b62053f6e94e99eb445b34d7dcfef5837","observation_id":"5ed87529-ca00-4062-963b-8737ce276527","resolution":{"observed_at":"2026-05-11T13:21:16.791554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:e8c8aa547cc8b3c46f0216fa59782d5981578247d3f3de4495d2f429b1ef4bca","observation_id":"ee773845-5881-47a3-aa5b-3c7013d6cb71","resolution":{"observed_at":"2026-05-11T13:21:16.865950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qa-lign: Aligning llms through constitutionally decomposed qa","venue":null,"work_id":"e6e1f65a-c461-4a57-b991-edf0f80d3f09","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:98df4ca51c6f35de658050f5a8d80c9f1420194c74a9eed3a4b67c684b116ab4","observation_id":"1b4f9982-637e-4fc4-b90c-afdd0c0ea026","resolution":{"observed_at":"2026-05-23T01:52:24.332412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openwebtext corpus","venue":null,"work_id":"5c053557-ff0e-453d-adcc-e82ea9910b1f","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:bf3b9dafb29bb100502734ddd8742fc1c543130b333f6d5f176d147d3b0fc329","observation_id":"13ee7d65-ed37-46ce-85f8-ba1621619c42","resolution":{"observed_at":"2026-05-23T01:52:24.335087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":"2507.17746","doi":"10.48550/arxiv.2507.17746","metadata_source":"pith","pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","venue":"cs.LG","work_id":"805a846c-dae9-4375-abd8-a86dc6934496","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:a1f461077c50c3c87dfba4ab0227cf0c8f17b8b09e0ef87dd9e45c48b9a1bf4b","observation_id":"4b045794-9b96-4880-9d6f-2330be434a01","resolution":{"observed_at":"2026-05-13T06:07:56.884714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.879284+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lighteval: A lightweight framework for llm evaluation","venue":null,"work_id":"47a23329-17e7-4139-a395-a8d1b16a5c8d","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:4cd80e404303985160cbf81aa9028d068f8171548885a794fa8a0c5420afaf4f","observation_id":"a50147df-d2eb-4762-bf22-a40cc296e96f","resolution":{"observed_at":"2026-05-23T01:52:24.356439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10507","doi":"10.48550/arxiv.2511.10507","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2511.10507 , year=","venue":null,"work_id":"9856b82b-89d8-4de5-95b0-b178d14f782f","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:43d16d7ccdf19093c6ed6137a3e4ecd3644b050e5054a0913d7ad4d4b8cddcae","observation_id":"f6e52eaa-d0ce-4952-b903-f137865b1e89","resolution":{"observed_at":"2026-05-11T13:21:17.432193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"2466cfce-03ff-4ed4-bf49-89198bf069c9","year":2021},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:022f8af41fdd37f02f9ab9bb90bb1a12c38eff98c81123bfdc76524fa2f1eab7","observation_id":"ead073ee-97ef-44fa-9525-ef81d57423d6","resolution":{"observed_at":"2026-05-23T01:52:24.320248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-10T18:17:33.697242Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:db5817a58ebfda4ae683e9e75e0a6bdc8659fb721e017b89c3a90bf94f2aa9be","observation_id":"16ef9c3e-12c6-4542-bc13-dc746c5cc050","resolution":{"observed_at":"2026-05-14T19:23:29.765778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dcrm: A heuristic to measure response pair quality in preference optimization","venue":null,"work_id":"609408f1-6a60-4e37-9fce-9ee3512ab228","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ba17470e0c5ba1b722b94f66308475e27961b347b2b17175401af2fcc07d9b3d","observation_id":"35977edc-4327-404e-9af5-ab41d386ea9c","resolution":{"observed_at":"2026-05-23T01:52:24.314439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models can self-improve","venue":null,"work_id":"993291b3-6f11-4afb-8c1e-9278893c8cb3","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:193d47b94eebb4a3df2c3f89dd116dbbafb7908d4d4280cb44c3f8e6789cfe27","observation_id":"e6e2648b-8406-4f60-a171-efc2ff33a10e","resolution":{"observed_at":"2026-05-23T01:52:24.317630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-07-06T22:14:21.107961Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"cited_work":{"arxiv_id":"2508.12790","doi":"10.48550/arxiv.2508.12790","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.12790","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Reinforcement learning with rubric anchors","venue":null,"work_id":"398fab11-98b0-469c-ab15-f1ada1de4450","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2508.12790","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:b62f12b653e8bf9456582cf802b2a2f2fc3c8cb6bef409c7dd7a8e176c92ffc1","observation_id":"df2ee1d2-1693-4e1f-85b2-8b40ec090896","resolution":{"observed_at":"2026-05-11T13:21:15.766370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c2c667b579f2a2efff3ce8c22950d9192e0f1cc9915441f04000aa0b9cac896a","observation_id":"46953652-3dbc-4c3c-b4ce-d0cec873f233","resolution":{"observed_at":"2026-05-11T15:00:28.883814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":"aa3eb51f-ff40-4cff-8aa1-fb7bb647bf2e","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:8a449ffa8b6a0422847a16037240643fc7f6588c8ad7e5dbb37084a2416c296c","observation_id":"a918c201-3f10-4d45-90eb-574ba0ab1a87","resolution":{"observed_at":"2026-05-23T01:52:24.322811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":"fe95a979-22ff-4be4-81e1-397604f7a5d6","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:efa4b7b1f122a3a411037b4d5d9b15e14e6b987e9587f76a1d6d9c1143f93984","observation_id":"13561926-7329-4bec-a0c7-7d0a9ae73aef","resolution":{"observed_at":"2026-05-23T01:52:24.306823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.24684","doi":"10.48550/arxiv.2510.24684","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Spice: Self-play in corpus environments improves reasoning","venue":null,"work_id":"7bf84ba5-f40a-459f-b34c-8a73545856b4","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:f404d0741800da1cb21dbb9c48e2f4fdc7199a91b382d5f22bd18db0bc2c151c","observation_id":"44782e97-3381-4c8d-bcce-60eb2d38ca20","resolution":{"observed_at":"2026-05-11T13:21:16.426077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.867858+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.867858+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"af21b8f5-3cd2-435c-bedf-6f515faf13c7","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:da5b2b8b4e8413c96af91ec1d49681e1420b1cef527a2e78546283878331390f","observation_id":"0cebd866-f376-4158-9a07-dd5a5d0450fd","resolution":{"observed_at":"2026-05-23T01:52:24.297173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advanced version of gemini with deep think officially achieves gold-medal standard at the international mathematical olympiad","venue":null,"work_id":"3be429ea-9dd4-415f-8e0a-a78335912645","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:b377572f964fb37345b854bc63a918d6ebfbad1e54a188cdf48b0034f5393d01","observation_id":"23004da3-0573-4573-80d6-05c6ebcc779f","resolution":{"observed_at":"2026-05-23T01:52:24.354128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building trust in clinical llms: Bias analysis and dataset transparency","venue":null,"work_id":"03d0bb6c-22b1-41e3-9a5b-3dd735f47169","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:a857532d37beaf56e8e1ab1e9b28440f82aeffec8d3c7c3c76b7c04c06d823ee","observation_id":"6cc02ad7-93fe-46f2-a834-5e82891d9f13","resolution":{"observed_at":"2026-05-23T01:52:24.289794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eq-bench creative writing benchmark v3.https://github.com/EQ-bench/ creative-writing-bench","venue":null,"work_id":"ca40b61a-823a-4f6c-9f8d-cede0f1f1c02","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:1eb7b942e066c9454a444d0b3afd6d9d0b52b6633f41f6019e223d2b982b6dd7","observation_id":"f58203d7-0612-46ac-beab-f7a969ec5519","resolution":{"observed_at":"2026-05-23T01:52:24.368160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering","venue":null,"work_id":"78a9b47c-94a9-4f9d-b673-ccf2945bde0a","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:5d36db43ccab8ab89cb9b6e41d9a7407cb0d98d37e99fc9b229ce98d3cf0f2b5","observation_id":"87aef807-ba0a-4b09-9a75-1a2b97409d78","resolution":{"observed_at":"2026-05-23T01:52:24.294895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23037","doi":"10.48550/arxiv.2503.23037","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"van Duijn, Niki Stein, Mike Preuss, Peter van der Putten, and Kees Joost Batenburg","venue":null,"work_id":"2ef68cac-3e16-425a-8584-a656156a326c","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:973363a02c76927d4d7d7896fcc23f36ac8f46845e4b2d83441855b5d6f181c8","observation_id":"ecc7d154-0fe6-434c-b2ec-717878a2d5df","resolution":{"observed_at":"2026-05-11T13:21:15.039504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-07-10T13:57:06.874927Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:f07dfce2eec8a03658bed9ce06d532abd15bb67aa1b4a25f2a52428bcad27a06","observation_id":"a9194573-f9b1-4726-a93e-d20276e60934","resolution":{"observed_at":"2026-05-11T13:21:15.477936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"384f32e1-14c7-4216-b925-c5603794dff2","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:4c6e9bad3ba8aeaf7b56f39ebf69c4417c04aae482f12ce4cee0066d53078640","observation_id":"b906ade4-0446-4b02-979d-2b8156a451d0","resolution":{"observed_at":"2026-05-23T01:52:24.299211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutherland","venue":null,"work_id":"7bce20e6-7eca-481e-be1d-34a66f7fb082","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:d1bd07f68470aa8b30a524afc9156084860214b6d1719d0119f68d7dce7c8748","observation_id":"3cf4977f-485d-41f4-aaa5-3b550ffc7f41","resolution":{"observed_at":"2026-05-23T01:52:24.351536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05218","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:34:40.450481Z","title":"Karl: Knowledge agentsvial reinforcement learning.arXiv preprint","venue":null,"work_id":"f0fbb5d8-dcd2-4d16-8abb-d042b2b19d66","year":2026},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:f2e8e5f92b9c5843fc1898504952353354739c91c606da6302f5e8a5b3b3f475","observation_id":"b446829e-512a-4c08-b734-14fa0f269c19","resolution":{"observed_at":"2026-05-11T13:21:15.049063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:49:44.762854Z","title":"Online rubrics elicitation from pairwise comparisons","venue":null,"work_id":"997bca21-08ad-4445-841f-1609abeb4657","year":2019},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:0317822e0aed957dad18d1abb8c9da8b219dabcd1bf68ab9825728d0253636a8","observation_id":"baea06cd-7924-41b9-9015-7b0e5ff2c439","resolution":{"observed_at":"2026-05-11T13:21:17.015919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:2a5ef1316705573b9db361e7bc3fd4e8d131fa020b58d09e981e35078c19434c","observation_id":"fcba67ff-a40e-41c0-a2c7-7c2a4c532907","resolution":{"observed_at":"2026-05-11T13:21:17.128690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19399","last_updated":"2026-05-15T01:32:52Z","snapshot_observed_at":"2026-07-06T22:36:49.325569Z","submitted_at":"2025-11-24T18:35:54Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","version":3},"cited_work":{"arxiv_id":"2511.19399","doi":"10.48550/arxiv.2511.19399","metadata_source":"pith","pith_arxiv_id":"2511.19399","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research","venue":"cs.CL","work_id":"86a914ac-f3fc-46c4-92f6-9ae10d186533","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2511.19399","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:28c07f6098618148fcc8cb838d416e7194992ea72d01914417e5a3618cb1c0d0","observation_id":"8f0b2e61-a066-4b38-b789-48f668c93a99","resolution":{"observed_at":"2026-05-20T00:00:28.487879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.04304","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:53:50.245781Z","title":"v 1: Unifying generation and self-verification for parallel reasoners.arXiv preprint arXiv:2603.04304, 2026a","venue":null,"work_id":"7bbcc938-b7ac-4ba5-83f9-e8f0a7be8bb3","year":2026},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:79788ac7c65c37186d65086d96b4e170f252424d9fdd0aba3d02a1f05474e52b","observation_id":"0fdb52c6-4825-4dc1-bab5-1f2408888556","resolution":{"observed_at":"2026-05-11T13:21:15.655944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Book titles and abstracts","venue":null,"work_id":"174a3d6b-2493-4fe1-95db-f13e2ec9ded3","year":2022},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:097c2ba3ea69a37acab5a8895d5fe8f752917dc6568c64a6450bbd4c6f637db5","observation_id":"882aaab8-7a17-4de6-8f88-86d8b69a5d45","resolution":{"observed_at":"2026-05-23T01:52:24.345305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the gap: Examining the self-improvement capabilities of large language models","venue":null,"work_id":"abc7cb4c-161e-4a2f-9de3-83035bf4ce50","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:91401dc275c7a9a9ca23e6af7c5defe03336562a1f9f8d47390dbf8b41d35433","observation_id":"004af272-0f62-4965-88bb-d0c37e4a3a2b","resolution":{"observed_at":"2026-05-23T01:52:24.278955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-07-06T18:14:03.830337Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":"2405.08448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-07-02T03:46:33.108981Z","title":"Understanding the performance gap between online and offline alignment algorithms","venue":null,"work_id":"92c35cdc-3e32-404d-a038-8a1f4228a044","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:d87d38bb6a1e5ca2ff6441ec80ffb6a226348672eb286c306edeee7118cce172","observation_id":"a16b9864-e86d-454b-844b-7afae12100a8","resolution":{"observed_at":"2026-05-11T13:21:16.758349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:5193b78743802a92bf2a41c33b49c5a334c937c2e05deee4942e908f404d0d05","observation_id":"d3c19b3e-ed8b-411a-8b86-303893dc19c8","resolution":{"observed_at":"2026-05-11T13:21:17.585101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:e5f4a424b3e54a2c472928f35b13eebd4ebf44eb1883eaaf36f8404404a4511f","observation_id":"2d8c22e1-6318-4674-b612-7b551211262f","resolution":{"observed_at":"2026-05-11T13:21:17.816751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Will we run out of data? limits of llm scaling based on human-generated data","venue":null,"work_id":"bc691af3-f586-4f09-a6e9-43bf3f039607","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:1f3396055b4b6095804c59cf9af6feb067f83d06d169bf60860f05285ecb9682","observation_id":"181960ab-b1c2-485c-8966-4aba5b9046ab","resolution":{"observed_at":"2026-05-23T01:52:24.340812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Checklists are better than reward models for aligning language models","venue":null,"work_id":"bfdf0b04-ee76-4835-bf6d-624265160d13","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:88ab2330ab22e743fe0cc0c7753429673795ef516a67fa808ee986ecc2ddead8","observation_id":"eb4e54e2-abdf-414b-b079-7117811a630e","resolution":{"observed_at":"2026-05-23T01:52:24.338244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"5c6ccae3-c0a7-4f08-996d-37e2a2ce96ed","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:fa387a0817267db108e3d95fdfdeffabca5787982087b23e5059fe03cb136cc5","observation_id":"f2bd45f3-8fbb-42a1-912d-b190b80ed32e","resolution":{"observed_at":"2026-05-23T01:52:24.276123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-rewarding language models","venue":null,"work_id":"f0ddd071-8e28-497f-95d7-4ea442eb8182","year":2024},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ac968fcbfca04715e13c9168d84301748d3a862ed38b4992a3ffd3de8816e9dd","observation_id":"c0593d53-32db-40ea-8e65-eccbeecc140f","resolution":{"observed_at":"2026-05-23T01:52:24.281802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11881","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:17:30.419305Z","title":"Better llm reasoning via dual-play","venue":null,"work_id":"69e8fa8d-6fef-443e-a767-f84822fc8d0b","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:02a0b4b093287e31d73b559d0216a64f36af699b6b7cce9575ae1504cb676d5c","observation_id":"fdfe0c9d-e0e2-414b-9b12-156e970004f7","resolution":{"observed_at":"2026-05-11T13:21:17.500054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":"2505.03335","doi":"10.48550/arxiv.2505.03335","metadata_source":"pith","pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-07-10T18:17:33.800267Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","venue":"cs.LG","work_id":"b59092c4-76ed-4c78-9006-312bde2e40a6","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:5e21024d145c52ce11474384c98633ac821b90700f8f1f825126931f21b76ea3","observation_id":"26d16d03-9b4c-430a-b486-f55d7916c973","resolution":{"observed_at":"2026-05-13T18:23:09.397455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"ddba11e9-380c-4ab3-8a7d-9f2ebfeade6f","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:78fbb91e853d959bae5432203a3a724a18d15fd4be76ba8faf9aca320c6f1e59","observation_id":"d22ca3be-823c-4c42-84d8-f51a07a433b9","resolution":{"observed_at":"2026-05-23T01:52:24.284299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:827f37ddf86ecf4685501d1a2dfda334f8375aa1a44d0bb383f5572b157b9e66","observation_id":"c794d79d-057f-49d1-ad6a-e9b15a81eba8","resolution":{"observed_at":"2026-05-11T13:21:16.695019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:50:10.633021Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:384e073650a2dd3d69e3600d99b5255cdf7b53aa371715089000a5303cfa3599","observation_id":"c8b42532-f4e1-44ed-84cc-8cc5bb2445ca","resolution":{"observed_at":"2026-05-11T13:21:15.325923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01716","last_updated":"2025-06-02T14:23:33Z","snapshot_observed_at":"2026-07-06T21:35:03.439393Z","submitted_at":"2025-06-02T14:23:33Z","title":"Self-Challenging Language Model Agents","version":1},"cited_work":{"arxiv_id":"2506.01716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01716","snapshot_observed_at":"2026-07-04T20:40:08.275113Z","title":"arXiv:2506.01716 [cs] doi:10","venue":null,"work_id":"f17aef0d-21ef-4877-b0a2-e7492e1d481f","year":2025},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"cited_paper":"/paper/2506.01716","citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:58a78f0d58b083f1963cb4dd01d6825146af43eef0ab39e7cb6cf4780bed2cfe","observation_id":"ec11e069-6aa6-4de0-9353-d988fd8028ef","resolution":{"observed_at":"2026-05-11T13:21:15.160379Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3327ede3-c8af-4137-a200-d93e53a18db5","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:92078b61b735fe89154769e730b4333dc241ee8653f62d879d175501ff64486b","observation_id":"8e7bbc34-6935-49cc-83fd-12c915292c90","resolution":{"observed_at":"2026-05-23T01:52:24.271410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a51cb668-8b26-4236-8138-c2dcf3248721","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:740f8e741f4f152f1b01b204d51cbe7f712b526013f442bdc621149099756edc","observation_id":"400b7898-0135-480e-9c81-e19e4b02b72c","resolution":{"observed_at":"2026-05-23T01:52:24.359068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9c509d6-b31a-486d-9bbf-e74e87eb4a72","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:650afa91ab51873847c72f350540cb4b3e6ae1de7a5007867a686948b02a4331","observation_id":"b089ffea-c2bf-482c-ab3c-5383421a50ec","resolution":{"observed_at":"2026-05-23T01:52:24.273495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enzyme Identification","venue":null,"work_id":"7a7d4d42-1fc8-4b0b-9c9f-0c004c823eb0","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:df12f80cd994c4437991375c434ddc71b8fd6560b8b83cbf69b525c1e2863627","observation_id":"5383c140-1ba4-46a1-a067-85939b894728","resolution":{"observed_at":"2026-05-23T01:52:24.287023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1bd9104-66d6-4213-992e-9e3e8b37c974","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c482feaee5f88686c47927f56052d75697ad857f0f3cf39b190d1785466f3897","observation_id":"924c6ae8-f303-4138-932e-be8ec1d40f06","resolution":{"observed_at":"2026-05-23T01:52:24.304236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Figure 44: Query (Instruction Following)","venue":null,"work_id":"288ebf08-3bba-418a-93b3-b1908cf4acef","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:83471addd6b2c5c6b3fb953625028e7d932fb6a184eabcc7ed076df5de41dd06","observation_id":"f72c0fbb-70ca-4011-b8f8-c017c65e93d4","resolution":{"observed_at":"2026-05-23T01:52:24.325189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9aba7a6a-49e5-4785-8d39-d586558ace51","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c7f7faa6506c37e400e7838260e2b53c4237cb55159355fdad83b787bcf4ccd1","observation_id":"1feccc5b-73fa-4e8e-950f-4968331f9809","resolution":{"observed_at":"2026-05-23T01:52:24.292393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"criterion_1","venue":null,"work_id":"cbc7222d-1d02-44bc-b3c9-361a0b9b900c","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:edcfe02f1a2144108cd5566e9ae183b359247647d47e4d1201e92d1fb647da9d","observation_id":"c7a45f16-28bc-4b44-b3bb-50d36e1f2d88","resolution":{"observed_at":"2026-05-23T01:52:24.301430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"He stated that he would continue to work within the framework of the Philippine constitution and existing governmental structures","venue":null,"work_id":"19a7dfe4-4c1e-458d-a00e-3aefa7d7c929","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:85a29e9cc43444e0882c21cd6a0a0799763fa0d43723124e948079c648883499","observation_id":"2a659855-aabb-49c3-bad4-a3e3de8d1645","resolution":{"observed_at":"2026-05-23T01:52:24.311963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"name\": \"Correctness of the first part of the answer","venue":null,"work_id":"6a01c103-179a-4b51-97b9-10126748b18e","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c5a74beaef66c9c1662a9464ba56a88e8318f07ecbd4d4329d6047ad192c5cdb","observation_id":"bea8f7a6-a5f0-47e3-a56c-49d776582e49","resolution":{"observed_at":"2026-05-23T01:52:24.266993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"He stated that the declaration was made under duress due to threats from opposing groups and to protect national interest","venue":null,"work_id":"66d9bb26-ad7e-40b1-af3b-3cb6dbb0c362","year":2017},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:3b0e13ba93a4192ab074015a87a870f24c124587d3d10362e7f2e2894638b791","observation_id":"4c7e9617-7256-4cd4-88ef-a583aebe27bc","resolution":{"observed_at":"2026-05-23T01:52:24.348055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"name\": \"Correctness of the first part of the answer","venue":null,"work_id":"ae251157-1020-41d8-9ca2-0ed41dbda8be","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:a2ae1ed3801dea49f3c592fdca6cb0cc86e222d103b4fde1f37d7442c3dd34db","observation_id":"abfbb882-59a3-4b30-b198-13856b5b3055","resolution":{"observed_at":"2026-05-23T01:52:24.384418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"098d109e-262f-44f6-a2ba-29ddd2578430","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c229bf056c3c606206383b79cccc4d2064e23de1938963399d661b385a7002c9","observation_id":"e573b348-c5b5-4967-8abb-f7271f4bf106","resolution":{"observed_at":"2026-05-23T01:52:24.262169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ensure that it is necessary and sufficient to use these facts to derive the correct answer to the problem","venue":null,"work_id":"7caa4c23-3329-4f4a-99e9-614b0d7c9126","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:e50255b85476ee083a4af17868575bd191b7443a0e05cc02a096259b1c707013","observation_id":"c6c0fe7b-fe19-416e-a416-8d538ddf34da","resolution":{"observed_at":"2026-05-23T01:52:24.382216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"* Provide a reference answer within <answer>...</answer> tags","venue":null,"work_id":"c725438f-95cf-474c-b192-6312d95c3b6f","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:d474fd59c6e970db7caa5b401a6ac74a8d473e30a80121f3b5689ca50313ec17","observation_id":"b908ea69-d599-4d05-a49e-8de5f4d22450","resolution":{"observed_at":"2026-05-23T01:52:24.255746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffb1dcf9-0361-4703-a520-7b2a2e9f4064","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:7ad2b610fc769caa268fcd98f96476b33487d672b432250d7738a2daef9ba344","observation_id":"a32a39af-36e9-4b1e-8309-4265a1689059","resolution":{"observed_at":"2026-05-23T01:52:24.259907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"## Format * Enclose the question statement within <problem>...</problem> tags","venue":null,"work_id":"1c443472-786f-41f7-9df9-738536d0b28e","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:57b6da18b148beb47b254dea6ee27bd823ee98fede2dfb7fc29f3cae1189605a","observation_id":"ef5d8dc3-4013-404c-941c-8e7f960e1109","resolution":{"observed_at":"2026-05-23T01:52:24.264469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"according to the text sample","venue":null,"work_id":"b88c677c-105c-4e2f-ad10-a447db0da631","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:fc431a6f90b16861ac8dd99ef3e5121f9f4d8d9b9f6d69ae3a5669bae5205962","observation_id":"40fc4e96-66de-4203-b52b-5e63518f6c62","resolution":{"observed_at":"2026-05-23T01:52:24.330038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9171e904-2a80-4ef8-b9a1-c4e52dd6e3dc","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:9f85158e8fd8415ef6b64db527b28eae31474b7f0162642f61d7b2edf022ad13","observation_id":"8af7f8f5-6931-4834-a013-b780d491fdc4","resolution":{"observed_at":"2026-05-23T01:52:24.363704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Length: 1000 words","venue":null,"work_id":"da4f9ccc-0543-4691-9462-67fe8bc30200","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c38fa81077fda038488942c696e2b69a1c4364cba6568ccda2400af26e7a84df","observation_id":"9ea86125-3e8a-4cca-893d-2c0ad75b6d66","resolution":{"observed_at":"2026-05-23T01:52:24.361507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"according to the knowledge","venue":null,"work_id":"21f29ab3-55f0-492b-8f80-2ec0bd15e0b4","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:66af1656152ad2671d8c38d2d8e68ef16d968cbf8c28204d3ad0a63f0e435a62","observation_id":"4134d31f-b407-4820-a9b3-136d3806fb2b","resolution":{"observed_at":"2026-05-23T01:52:24.365723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"criterion_1","venue":null,"work_id":"2ae4f186-5173-4d07-923d-beab7100669e","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:002554d3a53dd95c604a3016bc49bf9456058be2193d93e8d4d84b62e59932bc","observation_id":"d778a6bd-ac8f-48d8-9a0b-f68d07aa19fb","resolution":{"observed_at":"2026-05-23T01:52:24.386631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In general, the reference answer should have a high quality compared to the candidate answers, but this is not always true","venue":null,"work_id":"73f979cf-d058-4e33-98cf-fabca59ff464","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:0b47108cf8e95e722ff6a6fc59e2794cfe465735266c08178069a5af2de5aa4d","observation_id":"bf01da50-c8c1-499b-8678-5d123539d64e","resolution":{"observed_at":"2026-05-23T01:52:24.379607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f61a4e0-fa30-41c4-b6f6-d56ffe6eaa9b","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:1ad3418103ef02ff4dc4fa78affb909f5d481b182b5b8b3d2b52a9d6f36a26cd","observation_id":"994a32f2-05a2-41e0-8a3f-2c3120e3b373","resolution":{"observed_at":"2026-05-23T01:52:24.372941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"factuality","venue":null,"work_id":"446f0e0d-0181-498c-a78e-2c74f603a421","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:db55bece6f1a8ee4241097a4a3b218ba4539a2e529e6ce577e065ead183d8107","observation_id":"a7f4a737-b37d-4a43-80c2-08d93a67021d","resolution":{"observed_at":"2026-05-23T01:52:24.269116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"YYY\" of","venue":null,"work_id":"7d19de6d-93ff-44b8-b2ba-c06ab4800e31","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:ce173d62e395def6d2ef92de25b49c578af1da14570026e1d1f36c14e722b8ee","observation_id":"e54c8d39-e205-41e6-98bf-944ee822c9c0","resolution":{"observed_at":"2026-05-23T01:52:24.327410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not applicable","venue":null,"work_id":"954d8d87-743a-4565-b544-4a559025c716","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:70d729d31cde309ecc1b862b6236678609ad5ccb39c701b454c969e2a5e9cab2","observation_id":"97e0a20b-77e7-4aca-ad10-aece5e24e217","resolution":{"observed_at":"2026-05-23T01:52:24.370694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XXX\". To describe it, instead of saying","venue":null,"work_id":"d369ced9-c192-4ed3-9a9d-33dbad863e34","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:af38cf5032eeaa68372b98729781150102ce18de8d67384d90f94f028f75086c","observation_id":"ccd96c6c-c2a5-401b-8cbe-6ffd1ce1abf2","resolution":{"observed_at":"2026-05-23T01:52:24.375045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"criterion_1","venue":null,"work_id":"88f018ab-fe0c-47db-8187-6e3eb15ed7d5","year":null},"citing_paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T01:51:00.913166Z"},"links":{"citing_paper":"/paper/2604.20051"},"observation_digest":"sha256:c21d6afb681218d271be3d52730faac902f1c3a8657605a4a450af2f44e36250","observation_id":"e80b7bcd-7cdf-42d8-bdbd-e244093b742c","resolution":{"observed_at":"2026-05-23T01:52:24.377227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.20051","last_updated":"2026-05-07T16:30:21Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T23:21:56Z","title":"Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":10,"verified_exact":23,"verified_fuzzy":41},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2604.20051."}