{"as_of":"2026-08-04T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80a339dec39b3919348caa3a53cb1167b7d4345ff4960d3284114a9bcc495704","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T20:58:07.921910Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:53:20.110535Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.14392","snapshot_observed_at":"2026-08-01T08:53:20.110535Z","title":"Learning to build the environment: Self-evolving reasoning rl via verifiable environment synthesis.arXiv preprint arXiv:2605.14392,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27360","last_updated":"2026-07-29T18:13:02Z","snapshot_observed_at":"2026-08-02T23:25:34.724077Z","submitted_at":"2026-07-29T18:13:02Z","title":"SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T08:53:20.110535Z"},"links":{"cited_paper":"/paper/2605.14392","citing_paper":"/paper/2607.27360"},"observation_digest":"sha256:39cb013b86e88486755e4004780306d409fe0152a50af5a7cb5d35fc9c2c4f8f","observation_id":"9c955222-a3f8-46fe-bfe1-b548ba89c74c","resolution":{"observed_at":"2026-08-01T08:53:20.110535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.14392/citation-record","integrity":"/paper/2605.14392/integrity","json":"/paper/2605.14392/citation-record.json","paper":"/paper/2605.14392"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":"2505.23281","doi":"10.48550/arxiv.2505.23281","metadata_source":"pith","pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","venue":"cs.AI","work_id":"61e8d872-ccc7-46b8-8ec1-94008704c941","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:218124cc367c8752f7ed704f4ea92d7fef1a9b9df09a756aca16b221e1b22450","observation_id":"6229edd4-ab9c-4f3b-b013-05b86abd056b","resolution":{"observed_at":"2026-06-30T21:05:04.699251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.321563Z","title":"Safe and scalable web agent learning via recreated websites,","venue":null,"work_id":"6b52ef49-dc38-4996-91e2-1871969cbbd2","year":null},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:2cd7ef739b9e74a885b0671ecb48007073565b37dbb5c88ddd75618e66a144f8","observation_id":"76173681-2e83-493c-b411-d7a9b04c8d2b","resolution":{"observed_at":"2026-07-07T18:24:01.323202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.10505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:09:59.138545Z","title":"Safe and scalable web agent learning via recreated websites.arXiv preprint arXiv:2603.10505,","venue":null,"work_id":"31858dd9-d0ca-41a2-a483-f97937c2e95c","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:c00402200792b47a0ed1e788ef43318f121bc71d7a207237da89c922ceb8f992","observation_id":"534311ea-f701-4f01-91e4-2f631e4e18e8","resolution":{"observed_at":"2026-06-30T21:05:04.678952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.299616Z","title":"Spc: Evolving self-play critic via adversarial games for llm reasoning, 2025","venue":null,"work_id":"f22d502f-7a90-4cbd-9d1b-f501b10a054a","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:d9dc6a2d0b846862a67be38c39d3bf245bc8ab6221ff3efab8ba6c3aa7e390d5","observation_id":"7271659c-099f-44de-8eb9-84f76207546c","resolution":{"observed_at":"2026-07-07T18:24:01.301211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.320838Z","title":"Self-questioning language models, 2025","venue":null,"work_id":"6b381534-7afa-42e1-977b-164a4588f961","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:cf1f1d426ad56ee62077c30025bda0a79bbd477dcdbacb5ad34bdc207f182325","observation_id":"ebc4e32f-3ffc-4138-8d81-064b0023cc21","resolution":{"observed_at":"2026-07-07T18:24:01.322176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.327345Z","title":"Multi-agent evolve: Llm self-improve through co-evolution, 2025","venue":null,"work_id":"64e32bc1-3b2c-4092-9f8c-f0511c8743c8","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:669dd37a346659b6f35434dfb9386b10abd64709f26399e276c974716a6d0859","observation_id":"708291ee-4cbd-4a10-8e8f-035d81cdd489","resolution":{"observed_at":"2026-07-07T18:24:01.328834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:05:34.030607Z","title":"Scaling agent learning via experience synthesis","venue":null,"work_id":"07901808-801a-418a-aa0f-4fbaebfab139","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:7fa156b8b2a3922cc25711d6bd40f0d9913f15d4ad9eee0f49e3c83712b7e15b","observation_id":"85e338d2-36fa-418b-8ea9-595baf7361c0","resolution":{"observed_at":"2026-06-30T21:05:04.685698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.304872Z","title":"Self-play fine-tuning converts weak language models to strong language models, 2024","venue":null,"work_id":"32fb8421-c2cb-492f-bf9f-c5fb7c122b71","year":2024},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:a17c384e350fdece42381efe01f2118369111df03b08d46b8ad352a2759186c6","observation_id":"96221136-8f61-411f-8323-74bef630b744","resolution":{"observed_at":"2026-07-07T18:24:01.306741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.307380Z","title":"Webevolver: Enhancing web agent self-improvement with coevolving world model, 2025","venue":null,"work_id":"2db415d0-5034-4e90-b15d-b48f9b07c287","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:a3cb9320d52944058fb2d49b8aca598e584bfc3cbd6d1b63ace36089397982f3","observation_id":"ba801b0e-2ca4-4b2c-a504-9e5fcc862940","resolution":{"observed_at":"2026-07-07T18:24:01.309307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.291491Z","title":"Serl: Self-play reinforcement learning for large language models with limited data, 2025","venue":null,"work_id":"a302031c-bf0b-4e37-bb36-ce2baa28220b","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:c17f0237eef7c291173ac14429b5546e9f271eb032a52202c259a97b0b238b5a","observation_id":"073a69ef-2661-491d-a163-4eada381642a","resolution":{"observed_at":"2026-07-07T18:24:01.293376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.288687Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"bb8a4228-30bc-4085-8923-4fcf7fa68405","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:ae11057f9350cd61a2ee5c9b0a7dd5d1e370407fe1d8e3d05afe6602c98fe5c0","observation_id":"41c86e56-5b54-4f8b-86b3-70099a394c40","resolution":{"observed_at":"2026-07-07T18:24:01.289853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.290359Z","title":"How far can unsupervised rlvr scale llm training?","venue":null,"work_id":"23ee4bfc-84a1-4262-a6f3-69e4fcd020b3","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:be7539ae0fc82ea75c3fd6bf465814bce6237cafe57b1f26216af6999c823308","observation_id":"61fbf321-5f2f-4c21-a9aa-9c01446f1947","resolution":{"observed_at":"2026-07-07T18:24:01.291648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.333543Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":"194cd376-7274-47cf-84a7-cc847cdaf6af","year":2024},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:65e486aefd54df1e57069fdfa9ffb3b9a952230daf02d9125005e2f0b30d60cf","observation_id":"5ee682ff-afc2-40fe-9cd1-0271d1c66469","resolution":{"observed_at":"2026-07-07T18:24:01.334707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":"2508.05004","doi":"10.48550/arxiv.2508.05004","metadata_source":"pith","pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-07-10T18:17:33.697242Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","venue":"cs.LG","work_id":"45b39aae-1151-4087-9b48-dd16313e6306","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:8561d8ea6ac51abc27807b05edaa1cf2b5fce5ab79a1b53d1bf26b8cf4035879","observation_id":"e35b5a32-7a9b-4e6d-a465-a6fe29d55074","resolution":{"observed_at":"2026-06-30T21:05:04.695285Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:06.742139+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:c7523a32fc912a7324d80208e81d1501832e1b19243a8bcb4a62a936c0c07c5d","observation_id":"9c15f3a0-2ffd-4d11-b266-141a6e55571a","resolution":{"observed_at":"2026-06-30T21:05:04.670936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.07414","doi":"10.48550/arxiv.2509.07414","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Language self-play for data-free training","venue":null,"work_id":"9dc2373f-5f64-4169-9c74-76e126641746","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:1dd839c49f06ee4246e235f8098e5fa2c95ac122b82c611f25b69945dbc5590e","observation_id":"3304a84f-7a9d-4e82-9560-55cc4517cdb6","resolution":{"observed_at":"2026-06-30T21:05:04.673560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:02.109615+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:02.109615+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.322773Z","title":"Opensir: Open-ended self-improving reasoner, 2025","venue":null,"work_id":"14d4f939-f186-47eb-af5b-aef652da6aba","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:8be1cc87f65632d5c93323b0b2dd86ef51623c6095a38c62cf24982bb7ce2fe9","observation_id":"6565bd01-f291-4c52-b2d1-223a27fc1a18","resolution":{"observed_at":"2026-07-07T18:24:01.324046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.335051Z","title":"Embomatrix: A scalable training-ground for embodied decision-making,","venue":null,"work_id":"2960f15d-7db4-417e-96df-27886ac8d794","year":null},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:484dabb1d7fa9c5790fd7289819c6fb877f3b1a8b781d62091cb0f464c9f1a1a","observation_id":"61336724-994b-4a19-807a-49254166e8e8","resolution":{"observed_at":"2026-07-07T18:24:01.336670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T21:05:04.706607Z","title":null,"venue":null,"work_id":"b82ad794-e089-46c6-9ea7-c7792a00dfcc","year":null},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:a81e6e6252a70f7aa8716e043a28afc9525ef0e8e8274d0b69e32e5b37b31a68","observation_id":"055c6546-859c-4831-8d3b-39bdc6635db0","resolution":{"observed_at":"2026-06-30T21:05:04.708147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.339979Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning, 2025","venue":null,"work_id":"9ef40b43-f4c6-4ff8-88c0-e5b37ad7942d","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:7e804c371f3838a04af44d83831adc9082e9fcf1bf59ac699bdfce9802612f4e","observation_id":"731dccc9-fc72-47cc-b9a2-9d29d58767e9","resolution":{"observed_at":"2026-07-07T18:24:01.341517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.314691Z","title":"Spice: Self-play in corpus environments improves reasoning, 2025","venue":null,"work_id":"4946dffd-6333-49af-b580-4a6e231638a8","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:4fed24932285868a417b52b5bd70caba1e769be1987b7d7948ee598d6fa7a453","observation_id":"35590a8e-073e-4df4-afc3-be32921ca8ec","resolution":{"observed_at":"2026-07-07T18:24:01.315957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.316551Z","title":"Chasing moving targets with online self-play reinforcement learning for safer language models, 2025","venue":null,"work_id":"ea65a903-fde9-47bd-87b4-f047208bef09","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:5ca6f8654b73bec8e33316818c9397459169f783fa2153bf7524985122c26875","observation_id":"7d8425b6-52cf-4752-8c9c-a96a22796687","resolution":{"observed_at":"2026-07-07T18:24:01.317977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.324804Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models, 2025","venue":null,"work_id":"6be323c9-2005-48dc-b63b-1e5a04717dcb","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:c4342c2a66e8e838428c74ad253c9b08a82662f18d01c0a8d9ef675cf15cbd29","observation_id":"ee23a353-2fbd-4293-8198-f0873e7045ad","resolution":{"observed_at":"2026-07-07T18:24:01.326203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.309911Z","title":"Search self-play: Pushing the frontier of agent capability without supervision, 2025","venue":null,"work_id":"19929822-1fd1-436b-8376-6b66545317e0","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:dbf063dc38ea633569dfc43f15944a8ba693b8453ded04ac5bd4e62e1b3796ba","observation_id":"5bc10d6a-fe1a-4b9f-979c-7130db21a115","resolution":{"observed_at":"2026-07-07T18:24:01.311818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-07-06T21:13:45.700548Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":"2504.16891","doi":"10.48550/arxiv.2504.16891","metadata_source":"pith","pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"arXiv preprint arXiv:2504.16891 , year=","venue":"cs.AI","work_id":"36221a56-7f42-4451-a935-a3eadab98ed4","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:9892b9e79289b8e56c39fdb0af0c0b6c205f3f18ea2f40ca2581db16dc200dee","observation_id":"a02f7a9d-22f3-46ff-8b41-75a19803e652","resolution":{"observed_at":"2026-06-30T21:05:04.665768Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.286809Z","title":"Self-consistency preference optimization, 2024","venue":null,"work_id":"f104d5e3-93af-4daf-b71b-de9a9f1ba6a9","year":2024},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:75e24c5ab7c8414e480491b0838950ab74689b033669eb0573f9c8957fb37c0e","observation_id":"e8f135e0-7446-4dca-8629-f53d78934288","resolution":{"observed_at":"2026-07-07T18:24:01.288472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.871554Z","title":"Scaling synthetic task generation for agents via exploration","venue":null,"work_id":"1610efc8-3ea0-47a3-be98-e6b8965cc4a2","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:762b42ccc65bb608007e96cd086c63c8ba2b04ad97bb26bbcf26beb2c0f361d9","observation_id":"82603b9c-0cca-4cd2-ad53-2bc396cb2b6c","resolution":{"observed_at":"2026-06-30T21:05:04.668535Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-07-10T20:57:34.817516Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:5f862ee3b134f46914fc1ef1e665ba12de8d174f13bbc7330ce26db409ec5e1b","observation_id":"083f6318-4345-4c8a-9c20-5e034afd9b66","resolution":{"observed_at":"2026-06-30T21:05:04.676192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-02T23:46:38.854124Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-07-10T14:47:14.590391Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:c8f8bfcb47664f65653accef54a661600d28bee9107fd95c14a60aeb67713bf6","observation_id":"aa23d257-2368-4a5f-85c9-9cd5e799e508","resolution":{"observed_at":"2026-06-30T21:05:04.681675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13914","doi":"10.48550/arxiv.2504.13914","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Seed1.5-thinking: Advancing superb reasoning models with reinforce- ment learning","venue":null,"work_id":"1eaca2b2-5ee7-4243-b8f5-117441248181","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:52ee8357e2983ef97d8933c51f9fd50b266d234e824ee639d9e4c455fef17bd0","observation_id":"2657400e-367e-498d-826d-b06ac8058d7d","resolution":{"observed_at":"2026-06-30T21:05:04.689661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.338880Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":"06277d89-8ef0-4bf0-9c15-fa4d07a391d1","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:af1a507ee6aacb61219b29473e9e695d7c501b20768eb5cafd460efbdce145f2","observation_id":"a66a1492-666e-485e-b4ba-70d2b61d3e55","resolution":{"observed_at":"2026-07-07T18:24:01.340322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.313667Z","title":"Beyond human data: Scaling self-training for problem-solving with language models, 2023","venue":null,"work_id":"da1befaa-32ae-4bb5-9df2-27c81983d51d","year":2023},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:f6a284079b344c45d9b3aad6eeef856cca938881bbdd2badb35e35d318c37a7d","observation_id":"971f2fc9-c1ad-422a-8557-274969bf2473","resolution":{"observed_at":"2026-07-07T18:24:01.314896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.283609Z","title":"Envscaler: Scaling tool-interactive environments for llm agent via programmatic synthesis, 2026","venue":null,"work_id":"130d513e-c8ec-4148-b037-9598559814a7","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:5cc0f0a72818f6ebf3ee292d546978f196308b9220a33fdf6312cb819567f8d7","observation_id":"91ef19e0-e861-4395-b37a-c4efee98d8ff","resolution":{"observed_at":"2026-07-07T18:24:01.284851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:7c79a7d1a36c02ea06d5e23d8101ddae2fef75efd72d14ad1a5255bae0f23b4d","observation_id":"07a92b4f-ac8b-4c18-ade0-7a3e0d053a27","resolution":{"observed_at":"2026-06-30T21:05:04.692501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.13607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:51.113523Z","title":"Nemotron-cascade: Scaling cascaded reinforcement learning for general-purpose reasoning models","venue":null,"work_id":"173f9208-0d90-4609-b922-87dc83059cc1","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:ae5c260e2125503762f2bc7cffbc3cd2ee758747c191dee9a2fdb7e09642e33e","observation_id":"2cc281f4-124d-45af-8cae-f7292f9acbfe","resolution":{"observed_at":"2026-06-30T21:05:04.702250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.01753","last_updated":"2019-02-21T01:17:31Z","snapshot_observed_at":"2026-08-02T23:13:12.652289Z","submitted_at":"2019-01-07T11:28:36Z","title":"Paired Open-Ended Trailblazer (POET): Endlessly Generating Increasingly Complex and Diverse Learning Environments and Their Solutions","version":3},"cited_work":{"arxiv_id":"1901.01753","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.01753","snapshot_observed_at":"2026-07-04T14:09:52.685775Z","title":"Paired Open-Ended Trailblazer (POET): Endlessly Generating Increasingly Complex and Diverse Learning Environments and Their Solutions","venue":"cs.NE","work_id":"073b760d-6502-4d35-9517-d673f6d08cf0","year":2019},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/1901.01753","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:94bbf1cd97dd934323dd6a5e28049e07d0e0dc366fb382e0e3becef74c804d9c","observation_id":"7d7bbe2b-24c3-4856-96b2-e8b3e9f44049","resolution":{"observed_at":"2026-06-30T21:05:04.705245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.284616Z","title":"Socratic-zero: Bootstrapping reasoning via data-free agent co-evolution, 2025","venue":null,"work_id":"5935ed1e-8ec5-4a58-8c45-dd7f7a5932e7","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:9b4496233c2c5d41d36d6d2220a43f98af3c4d12b44486aee73c6186f8f5bdf1","observation_id":"465d29ec-7be2-4c9c-8e51-18a92bc40378","resolution":{"observed_at":"2026-07-07T18:24:01.285924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.319408Z","title":"Llms as scalable, general-purpose simulators for evolving digital agent training,","venue":null,"work_id":"7a2b46d5-ff64-487f-a12a-26f6a05228bf","year":null},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:bf18e20c38a88ee8fe78ab354df5780890dce4b65d864279d55bb3e6deaf50ba","observation_id":"5cdf91e2-4317-4ed6-a3a6-41411a5bf475","resolution":{"observed_at":"2026-07-07T18:24:01.321013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14969","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T18:35:58.508444Z","title":"Llms as scalable, general-purpose simulators for evolving digital agent training, 2025","venue":null,"work_id":"3a0c8c53-9b16-47b1-9e0a-0f3c8ace981c","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:6ba37002354a41c8f58df854efb5f2f376c8d4083146232ff516f11d3b202fb1","observation_id":"95874242-244c-45dc-85fd-daf6ccb5bf29","resolution":{"observed_at":"2026-06-30T21:05:04.660361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18552","last_updated":"2026-06-02T06:06:43Z","snapshot_observed_at":"2026-08-03T15:02:08.953642Z","submitted_at":"2025-12-21T00:49:40Z","title":"Toward Training Superintelligent Software Agents through Self-Play SWE-RL","version":3},"cited_work":{"arxiv_id":"2512.18552","doi":"10.48550/arxiv.2512.18552","metadata_source":"pith","pith_arxiv_id":"2512.18552","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Toward Training Superintelligent Software Agents through Self-Play SWE-RL","venue":"cs.SE","work_id":"67efe4e8-f098-4cdf-9f63-9903c8999bfd","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2512.18552","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:a13bef999aa998430fd47bd754ac8538f0ac0299c2d484698e0faab32102c433","observation_id":"2c92b5f2-1f1d-416a-908e-5706f091332d","resolution":{"observed_at":"2026-06-30T21:05:04.649387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-07-06T22:20:21.987156Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"cited_work":{"arxiv_id":"2508.21188","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.21188","snapshot_observed_at":"2026-06-30T21:05:04.650707Z","title":"Mirage or method? how model-task alignment induces divergent rl conclusions, 2025","venue":null,"work_id":"f8eaecc2-84bd-45fc-99cd-b34f91d73b68","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2508.21188","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:4ec7a88471b7d602f346f3bf7e6718ff44fe03d2c60a861ff9fe6b09f3933354","observation_id":"6bf40004-0e52-4f1a-958a-38305042e275","resolution":{"observed_at":"2026-06-30T21:05:04.652492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14296","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:09:59.249841Z","title":"Autowebworld: Synthesizing infinite verifiable web environments via finite state machines","venue":null,"work_id":"34b02339-d42c-4f4b-a958-f47ca4eebb5f","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:bdcfa883d7dfc8cf344a143dcb39bc95641d75e706bf0d1b435e2b0f5213f8c4","observation_id":"cbe8ff7d-a908-4a56-b56c-516515d8bdfd","resolution":{"observed_at":"2026-06-30T21:05:04.657651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.305968Z","title":"Agent0: Unleashing self-evolving agents from zero data via tool-integrated reasoning, 2025","venue":null,"work_id":"20666ff5-2e0b-4476-9325-f8fc3d8b4842","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:7d5a5f84729568589f0e7d3ce3b7a23874a7069957de6798729793a6e5c063d8","observation_id":"bcad3a92-2457-4911-9568-0ef50ec95c26","resolution":{"observed_at":"2026-07-07T18:24:01.307666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:04:25.285631Z","title":"Qwen3 technical report","venue":null,"work_id":"ab7415c3-91fd-48f4-8bbc-60de3ddc96ef","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:86d30b61165689b45865bde9e3cd1a3bfbbcbb8da7e5d6318d497b8f28bdca92","observation_id":"d40fc918-a190-4212-b794-e2f871807885","resolution":{"observed_at":"2026-07-07T18:24:01.287976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.299115Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":"168ab5df-51eb-490c-9c37-3d6b78f6c9fa","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:76e789583b43eefc84ec8b0ec35e7d1ce7e408bfe4e9866b4609cbfe628b429d","observation_id":"f92b34e1-1251-4615-a232-ce6434f01949","resolution":{"observed_at":"2026-07-07T18:24:01.300324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.342100Z","title":"Self-rewarding language models","venue":null,"work_id":"82c18977-9919-4b3d-acb0-9213ff528c17","year":2024},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:3b33da9ef40590e8716fb5ca6e983a5519d5b8f027c5f7ffeffbe975d0f3341e","observation_id":"4889e128-47c4-41c4-9667-cdc5e2e3a076","resolution":{"observed_at":"2026-07-07T18:24:01.343517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.278350Z","title":"Star: Bootstrapping reasoning with reasoning, 2022","venue":null,"work_id":"69050dd5-9230-4add-b7ea-78b95504ad54","year":2022},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:ca80f3a020aee7df63ebc0bac9ec92aee56ad82f69683a2223244d7d402d3fb3","observation_id":"7ed36f63-9743-4266-9c43-9595912d209d","resolution":{"observed_at":"2026-07-07T18:24:01.279876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-10T13:57:07.038585Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:406cf27db35039633f041d90010f7840428e6f60f4246f6439880159ece1db17","observation_id":"c56b6159-8dca-4d3b-b3f3-75f35508a601","resolution":{"observed_at":"2026-06-30T21:05:04.662785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07317","last_updated":"2026-06-06T19:45:56Z","snapshot_observed_at":"2026-08-03T23:08:02.092548Z","submitted_at":"2025-11-10T17:18:35Z","title":"RLVE: Scaling Up Reinforcement Learning for Language Models with Adaptive Verifiable Environments","version":2},"cited_work":{"arxiv_id":"2511.07317","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.07317","snapshot_observed_at":"2026-07-04T18:40:03.168966Z","title":"Rlve: Scaling up reinforcement learning for language models with adaptive verifiable environments.arXivpreprint","venue":"cs.CL","work_id":"473aa4ef-e4ed-4db4-8436-c8e6e74f8e5d","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2511.07317","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:d90f50805811e345896a08e1c4c208a32720391b2113d460465ee746e128c5c0","observation_id":"a31563ec-0660-463c-bd50-6a643bd37c69","resolution":{"observed_at":"2026-06-30T21:05:04.654889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.296826Z","title":"Darwin gödel machine: Open-ended evolution of self-improving agents, 2026","venue":null,"work_id":"14eb6b9c-bce1-422e-9481-f599f7372ea2","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:6efe1e6b7329ea4457d1c130037f712150e023de785380f967a1bf1e9a156553","observation_id":"408213ea-bd1e-49b4-a78d-60dd186b9c68","resolution":{"observed_at":"2026-07-07T18:24:01.298524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.315488Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization, 2025","venue":null,"work_id":"19f17fb2-c3db-4145-a456-52a5bcf81d37","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:8f2cd3a52175477b1efc65c916a6c7c6c8182ce3913b508c0d04ffed96f28f57","observation_id":"673c081c-6d39-4ca1-847c-542af2027d1d","resolution":{"observed_at":"2026-07-07T18:24:01.316874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.332885Z","title":"Better llm reasoning via dual-play, 2025","venue":null,"work_id":"f6ef28b8-c221-4fe2-85b3-b63ad3c6dd10","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:07d74b8736829464a0ae013e53e3c7416b01bf5cf205b264c46ba2b607868424","observation_id":"188e7641-ca90-427a-b0d0-40165e43ba86","resolution":{"observed_at":"2026-07-07T18:24:01.334355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04126","last_updated":"2026-06-30T13:54:32Z","snapshot_observed_at":"2026-08-03T12:10:23.636506Z","submitted_at":"2026-01-07T17:40:08Z","title":"InfiniteWeb: Scalable Web Environment Synthesis for GUI Agent Training","version":3},"cited_work":{"arxiv_id":"2601.04126","doi":"10.48550/arxiv.2601.04126","metadata_source":"pith","pith_arxiv_id":"2601.04126","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Infiniteweb: Scalable web environment synthesis for gui agent training","venue":"cs.CL","work_id":"7062fa85-b97d-4d17-a090-f1c28ae316bb","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2601.04126","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:d5758b3b72f00ca2c73791b239f22d815ee21d31045770d18f840d17e6f37022","observation_id":"75f2629a-0279-4185-8ff5-6a08a5fa9bf6","resolution":{"observed_at":"2026-07-01T02:17:18.656844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":"2505.03335","doi":"10.48550/arxiv.2505.03335","metadata_source":"pith","pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-07-10T18:17:33.800267Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","venue":"cs.LG","work_id":"b59092c4-76ed-4c78-9006-312bde2e40a6","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:1c147fac1a1fb27ff21159b5c33bf8af89b8fa588cef033f331fc4bc2faaf767","observation_id":"58d684c2-18b4-4f52-9de9-9412e5345e42","resolution":{"observed_at":"2026-06-30T21:05:04.644104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.336955Z","title":"Learning to reason without external rewards","venue":null,"work_id":"fc06c464-2e1d-4260-8923-16c1dd4d35ac","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:8cbed04803f40b604c4e55a85dd10ace4716896de65270d508bac8898e065e07","observation_id":"94ad5bf9-665f-4960-894e-1ab6e992db1e","resolution":{"observed_at":"2026-07-07T18:24:01.338109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.335240Z","title":"Self-challenging language model agents, 2026","venue":null,"work_id":"1ee41a37-b0fc-4dfd-a279-1267796ddedb","year":2026},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:ab5b91fc1aea25eb2d0b5ab2e93df5c9e080298eaf1453557994fe5ef9317c68","observation_id":"0494669c-c16a-4189-a7c3-1e4690d5f8b7","resolution":{"observed_at":"2026-07-07T18:24:01.336472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.331587Z","title":"Evolving language models without labels: Majority drives selection, novelty promotes variation, 2025","venue":null,"work_id":"fe9ca26a-8ddd-49a6-8f3e-1f8bc4269309","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:a0218d1900d5490e9737ddb2d103585c3510b089a00a211fa391340c4b25ef03","observation_id":"9895ff99-bc01-4371-beca-e90cd763047a","resolution":{"observed_at":"2026-07-07T18:24:01.333061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12216","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.936605Z","title":"why is X happening","venue":null,"work_id":"555951e3-27af-49cd-b613-0a8eb10754b0","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:4aa21888e432cea8454e23db87710c99d8f7af8c48676fc77f7eefb57dcdd5d7","observation_id":"b5b51823-a1ca-4c77-a74d-c59e6cf188c7","resolution":{"observed_at":"2026-06-30T21:05:04.646962Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T18:24:01.337287Z","title":"Given the multiset {S}, find a nonempty","venue":null,"work_id":"da99eb0f-be00-4577-b9d3-eb5ec6bdb3d0","year":2025},"citing_paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T20:58:07.921910Z"},"links":{"citing_paper":"/paper/2605.14392"},"observation_digest":"sha256:44aed5928b972c7d8f106f611d9ffe9547d095b48d4e96fa76dfff6145ff8031","observation_id":"0aa5b604-a8ab-4b4d-bc9a-57451e340413","resolution":{"observed_at":"2026-07-07T18:24:01.339078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.14392","last_updated":"2026-05-14T05:14:45Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-01T17:31:25.827576Z","submitted_at":"2026-05-14T05:14:45Z","title":"Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":22,"verified_fuzzy":35},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2605.14392."}