{"as_of":"2026-08-06T04:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c216aa8ab991505b72cdc3c7263688530542a11aa5185462aa2daed71ff0cc29","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:27:42.198509Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:25:49.276550Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T02:56:29.103440Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":"2604.06268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-07-02T02:56:29.103440Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","venue":"cs.LG","work_id":"a226ed89-b777-4a0f-9e0a-17abeb1cac19","year":2026},"citing_paper":{"arxiv_id":"2605.07276","last_updated":"2026-05-08T05:41:25Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:41:25Z","title":"Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T01:21:43.166304Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2605.07276"},"observation_digest":"sha256:a0fa11cdc7b6217697f1cef266f80179ad27f734750ce926fc9e5ea9a8e0ef70","observation_id":"31b22a26-b089-4d9d-81b5-54ee2e38cf85","resolution":{"observed_at":"2026-05-11T04:25:59.115847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":"2604.06268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-07-02T02:56:29.103440Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","venue":"cs.LG","work_id":"a226ed89-b777-4a0f-9e0a-17abeb1cac19","year":2026},"citing_paper":{"arxiv_id":"2605.28774","last_updated":"2026-05-27T17:36:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:36:39Z","title":"Agent Explorative Policy Optimization for Multimodal Agentic Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T12:22:39.655615Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2605.28774"},"observation_digest":"sha256:ccdf54b1364edb03a500c452b0100acdc5512ee0cd492eda9e4d5d32ca08b4c8","observation_id":"c38e00c7-6d92-490b-a5d3-a8e1d7fb2ceb","resolution":{"observed_at":"2026-06-29T12:23:24.161662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":"2604.06268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-07-02T02:56:29.103440Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","venue":"cs.LG","work_id":"a226ed89-b777-4a0f-9e0a-17abeb1cac19","year":2026},"citing_paper":{"arxiv_id":"2606.03108","last_updated":"2026-06-02T03:47:48Z","snapshot_observed_at":"2026-08-02T21:19:39.471703Z","submitted_at":"2026-06-02T03:47:48Z","title":"EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T10:30:42.057301Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2606.03108"},"observation_digest":"sha256:aa6c2a74898010c62033cd135025dcff1fade5f9dcd29a55b50655cfd8a2d578","observation_id":"b6466a17-bf3a-442d-9222-54bb04b8c50d","resolution":{"observed_at":"2026-07-02T02:56:29.105430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-07-12T00:33:06.488657Z","title":"Ragen-2: Reasoning collapse in agentic rl.arXiv preprint arXiv:2604.06268, 2026b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03702","last_updated":"2026-07-04T04:45:05Z","snapshot_observed_at":"2026-08-03T14:40:44.889228Z","submitted_at":"2026-07-04T04:45:05Z","title":"Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:33:06.488657Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2607.03702"},"observation_digest":"sha256:25076e78efc0b6e95568ed5adac15f65e2a239ccf2cb298ee20061706e4e294c","observation_id":"e2305126-e912-4ecb-8e5c-b2975f885fa4","resolution":{"observed_at":"2026-07-12T00:33:06.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-08-04T15:25:49.276550Z","title":"doi:10.48550/arXiv.2604.06268 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-06T03:42:03.727460Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T15:25:49.276550Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:2e6930aaee7dbbca83616c0b52eea30a1a5b856027a3d506ae5a6a892e1975de","observation_id":"1be6bbd0-3f31-4d5a-a3e2-5382b62419c7","resolution":{"observed_at":"2026-08-04T15:25:49.276550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.06268/citation-record","integrity":"/paper/2604.06268/integrity","json":"/paper/2604.06268/citation-record.json","paper":"/paper/2604.06268"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.459543Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"19dbc933-eff7-47da-894e-0cb819f498b9","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:b9a82a4bdda30b699891663b4d9fcea16dfdd824ef673ecf0d416a8a1c4defe1","observation_id":"28350cce-a2f6-45e1-a12f-13a64501affc","resolution":{"observed_at":"2026-05-16T05:00:37.743796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai gym","venue":null,"work_id":"a9e00073-a37b-4b37-aee1-856d97eeeb8f","year":2016},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:384cbe1e5f90e2b9c00298da763421cb4d3f568c1c3832e12d5bf17fcc293c5c","observation_id":"eaae6871-6ef0-4989-a084-0cfe18ed64c6","resolution":{"observed_at":"2026-05-16T05:00:37.797017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internalizing world models via self-play finetuning for agentic rl","venue":null,"work_id":"c03e9ef0-a310-4ba7-a69c-3f31a895744d","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:17a082ad6f40dcfe93c70e699445d0b5c74a0bbcd53bb01056a55d77c7d9e019","observation_id":"667e742a-5e98-4cfc-bd6d-c42f44c52228","resolution":{"observed_at":"2026-05-16T05:00:37.904757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:45:59.141894Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":"1f7ff91e-3d16-4cba-ad18-3c6ae7ec674b","year":2021},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:151fc964673eb03681078a1e90e4add24a4d554b5e21b265474c31abc72034f1","observation_id":"5e01b4e1-8742-42b3-b380-69c363552ae1","resolution":{"observed_at":"2026-05-16T05:00:37.842690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cover and Joy A","venue":null,"work_id":"734461f8-4c47-4fa8-afc6-eb788b175c24","year":2006},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:8345474e787ed7c33e2777f6d54f4a2ef915519285f8da19789cd8bf7634b8f7","observation_id":"8adeb1ac-34a6-4a3a-b811-56efb34d90e5","resolution":{"observed_at":"2026-05-16T05:00:37.877149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":"d378ce65-60e4-48e4-af14-4e950ed93bef","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:8e803962311529ec87304910431bcc943d6aca6bf46de11f2f85389ebcacbfa7","observation_id":"dfa673ed-023d-4c3b-b16b-4f531b981b0b","resolution":{"observed_at":"2026-05-16T05:00:37.873821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, September 2025","venue":null,"work_id":"526365a8-bd0a-4555-8df9-e86af64c2e92","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:3adcfeb0cf0b7c81aa62943f1abe46f25372cc7008d9c764bc7324cc90cca2b1","observation_id":"942028a7-91a8-49af-b5c8-dedaf440765c","resolution":{"observed_at":"2026-05-16T05:00:37.874284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re-rest: Reflection- reinforced self-training for language agents","venue":null,"work_id":"86c02949-c834-4867-abd2-a529b7e45475","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:a328fd518a725dbeaf3a33b27fd0e9b2917248dbc291386ef02604df2174a12c","observation_id":"ffe4d188-fb6a-41a4-b7de-8821c07f48e1","resolution":{"observed_at":"2026-05-16T05:00:37.832804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Group-in-group policy optimization for llm agent training","venue":null,"work_id":"df545cfb-7711-4920-bb33-abc289792555","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:2994883a5528d6397e078b8061ad0ad9ebea293fc2751ef709f7a05aab0d1ca8","observation_id":"e5192c36-3a02-42e3-b73c-180a678672e7","resolution":{"observed_at":"2026-05-16T05:00:37.897656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dory: Deliberative prompt recovery for llm","venue":null,"work_id":"f2f9c2eb-fc4c-4e98-ba86-0291f015e0a8","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:e7530e348e8d36c610d7bf912a14c38669a71b81238ff4bb98936c70233ede41","observation_id":"ffff3b51-4bdc-4992-b80a-dd7c89b73f8d","resolution":{"observed_at":"2026-05-16T05:00:37.879894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liu, Phoebe Mulcaire, Qiang Ning, Sameer Singh, Noah A","venue":null,"work_id":"96573b3d-abd4-47e9-9499-10d4f1100d9d","year":2020},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:d1177d06b1053c256bf87bf20ff2c31593070f1e2c0038a73f43c37b8a3042aa","observation_id":"515b2649-604a-4830-91dd-ba17cab3b37d","resolution":{"observed_at":"2026-05-16T05:00:37.728392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roberts, Diyi Yang, David L","venue":null,"work_id":"e4a95997-f1ba-4576-9eb2-9499b39b9ee3","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:4a5704e7260889c3a384851d3b49c13ab0a4ea4b2a1208c5b34d1f3b26794c89","observation_id":"89703a0a-6b2d-472e-8b81-6f88374f065b","resolution":{"observed_at":"2026-05-16T05:00:37.766484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":"5b989fac-7123-42b4-b5a8-e1c9f84d3e29","year":2019},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:f4baf69294cc6bbc931dd820842b4407d8b5367a0f90fff73db72e4248793c02","observation_id":"18b6b94f-c114-4979-94b8-63ac0afcfa4d","resolution":{"observed_at":"2026-05-16T05:00:37.851415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:25:10.253101Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"21f76b7e-6599-4e14-8bea-b56f9367f220","year":2020},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:39db8ec8cb413088efc57a447a77f69867e8ee357695ad6b1cc4c5d1a0512372","observation_id":"1b4b231c-1a63-44fd-9d56-b19da856118e","resolution":{"observed_at":"2026-05-16T05:00:37.823491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:51ba0f501c11d972ce0f3166b1ef3d601cfef5c13da46b40bf87062098541c49","observation_id":"bfe2841a-a4a0-4e75-be34-8bb3c0e299b5","resolution":{"observed_at":"2026-05-10T22:55:51.538353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking llms on the game of countdown","venue":null,"work_id":"3c74cc7f-4bb0-42a6-b6d7-f002e5c47364","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:30eeffa3ed29cf88d29574921a234208d296276786b27acd19a3e1ba31029f75","observation_id":"68f63be9-2e1f-485d-8a3f-d38f8dfa106e","resolution":{"observed_at":"2026-05-16T05:00:37.762755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the effects of rlhf on llm generalisation and diversity","venue":null,"work_id":"971a8743-2658-42e9-b8cb-cd58a2a5a909","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:f886ba57762d249d3ed6c70e4a3ee8a04e4a5babe2ef0f7476c65d17454eb996","observation_id":"edb8b3ed-7af7-450e-9cb0-0b17cd7d0ef2","resolution":{"observed_at":"2026-05-16T05:00:37.919768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, and Ethan Perez","venue":null,"work_id":"2c7584b7-90fd-40e6-845c-ffb60d16acf5","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:b58b31fc158ce8ff5577911e2b2e8d97d54b63b2536bd36abaf057bf1fdb2518","observation_id":"9364c30f-0855-4944-acee-e1340709ba86","resolution":{"observed_at":"2026-05-16T05:00:37.835710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reverse prompt engineering","venue":null,"work_id":"059bec91-cad8-445f-929c-0c3ea04b6b8c","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:4c11cbe538de6e682019106367a18702dc1347db3e0798ceb8fa323d2753a290","observation_id":"cc66986d-21ac-45b6-a4dd-33d1fc572ec6","resolution":{"observed_at":"2026-05-16T05:00:37.802191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diversity-promoting objective function for neural conversation models","venue":null,"work_id":"ae89ff06-204d-406f-bb93-237d8376c851","year":2016},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:a1ccd74817021d04e66f8862b6acea8eb7137a4533c5317f6acfa889f7d0fbff","observation_id":"b3cbed5b-75be-4203-80a6-b894154de3ed","resolution":{"observed_at":"2026-05-16T05:00:37.789941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14852","last_updated":"2023-12-27T10:09:18Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:25:42Z","title":"TACO: Topics in Algorithmic COde generation dataset","version":3},"cited_work":{"arxiv_id":"2312.14852","doi":"10.48550/arxiv.2312.14852","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TACO: Topics in algorithmic COde generation dataset.arXiv preprint","venue":"arXiv (Cornell University)","work_id":"67740cc1-d973-4614-adf4-686babd14274","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"cited_paper":"/paper/2312.14852","citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:af82eff4806005bb7381df42f8e75c3100651dee092df17f0fad58324cb68e5b","observation_id":"9a0900a7-e352-4f55-b8cf-dc998bf08ad3","resolution":{"observed_at":"2026-05-10T22:55:51.524084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unary feedback as observation: Incentivizing self-reflection in large language models via multi-turn RL","venue":null,"work_id":"194f314b-61ba-4aa6-aa31-24c4662a3502","year":2026},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:9ea0f024da7729c5ec3812b7aa7ebc0c08466d9d5c94d6994163cd3c999a8d1d","observation_id":"6dc0a013-d290-4c5e-af0a-3f3dbf416d94","resolution":{"observed_at":"2026-05-16T05:00:37.712499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":"a3ab5fe0-e4f3-4a04-97fe-bfcaa6ee3e5c","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:369843eaec40887dc41ece79fe87e188bb1dc96209461773869cea2e7bc77b08","observation_id":"d0029fed-1c08-470f-a5d9-445481ff4df2","resolution":{"observed_at":"2026-05-16T05:00:37.756494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"ef763948-eabc-49b0-a88d-6582c9436dad","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:d3ef52851b117aa4668b28178ef6c8e60bb963780d0a5fb06132145cff732e94","observation_id":"9c176b54-51d2-4dac-9ad3-0bce6323706b","resolution":{"observed_at":"2026-05-16T05:00:37.885392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthetic-1: Two million collaboratively generated reasoning traces from deepseek-r1","venue":null,"work_id":"e2589892-fcd4-4c2f-8368-40ad96392405","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:202320d7d5090b7033106c54f0cee563fe60892437be3491071d538ee64c1da6","observation_id":"3944c950-2199-47e0-9146-7ef30a0ff7cc","resolution":{"observed_at":"2026-05-16T05:00:37.793890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama 3.2 3b model card","venue":null,"work_id":"0b6acc89-f0b3-4349-80f4-f66d5e7f8ab2","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:54a1a0ab88d6416869a8fc6ca68e8ae7be21cb4c9a41b4f0085366377fdfe8ce","observation_id":"d309c8d8-759b-4371-825b-a6b2fc18799b","resolution":{"observed_at":"2026-05-16T05:00:37.867406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jointly measuring diversity and quality in text generation models","venue":null,"work_id":"86691fca-42a3-4684-8b94-bc99fc00458f","year":2019},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:7efc869f72364fa37f765345177a86886689b7a720714d1dc1b8274187aff22a","observation_id":"a7d702ab-89a6-4d46-b104-8f2def1f19ed","resolution":{"observed_at":"2026-05-16T05:00:37.816282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Morris, Wenting Zhao, Justin T","venue":null,"work_id":"6368ebe9-9e7e-429e-95c1-bf9d06345f13","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:a99ba75c52b12c78ff93a284e897999ee0507b8666cffe0e2d7b6af4189dc43b","observation_id":"41d6b46c-a190-49dd-970c-e348cf7aac60","resolution":{"observed_at":"2026-05-16T05:00:37.867628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singh, DJ Strouse, Tuomas Sandholm, Ruslan Salakhutdinov, Anca D","venue":null,"work_id":"da80457c-44a8-48a0-9bad-d9391115e4e3","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:a50ae6bbafbd74a021ec1266a7d928ebbe8721877f7b1e239df8cbd645d83c17","observation_id":"fd6a84d4-dccc-4a72-88a9-5fe80f16151b","resolution":{"observed_at":"2026-05-16T05:00:37.779894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":"335162f7-182a-4176-a620-23b1e5caa61d","year":2022},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:7ed5f9ef9987c5c2a2d854d0afc7dbaf98c9ecb6fc31031dd020ed271de6a5aa","observation_id":"2cfaca5c-e74f-43c7-bfab-809e0e676dce","resolution":{"observed_at":"2026-05-16T05:00:37.822542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attributing mode collapse in the fine-tuning of large language models","venue":null,"work_id":"112f5c80-db75-4992-8213-422a355dfd35","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:e6bd726dd4bc5f8b37c3bae8a0bb26bafda02025a3d25e82de94f3c03b3c4e12","observation_id":"b9c116d0-5a1d-46ad-aabd-58640870efaf","resolution":{"observed_at":"2026-05-16T05:00:37.888268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9a5da3ad-8044-47e0-96db-ee6aae074eed","year":2022},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:ea3aa555ce003c36e6294cebe1bcd638d013fd853e40915a16439eac0d3e46f9","observation_id":"ac29c65a-ee4c-4e27-9764-eb7871567b04","resolution":{"observed_at":"2026-05-16T05:00:37.799373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mauve: Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"e38b8218-686b-45dd-8146-4428bd8bb5e1","year":2021},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:b13405cb0f38b797bd002d6ffc16016924019f06786dce1a9015ab827f0dd6c4","observation_id":"dad2f4a7-85bf-400a-a4a5-99fbf01f1ade","resolution":{"observed_at":"2026-05-16T05:00:37.812795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defeating the training-inference mismatch via fp16","venue":null,"work_id":"062849ab-f2fa-4424-8114-a64cc173586c","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:d7a0ccde41e9d3fb62e2ee7b44e255315ab5b878bffc6274d451b680506fb882","observation_id":"6b9efedf-aead-4e3f-876a-3445a881bf61","resolution":{"observed_at":"2026-05-16T05:00:37.834955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T22:04:07.818062Z","title":"Qwen2.5 technical report","venue":null,"work_id":"85e3ec1b-fd1e-4850-952d-c28eb67c623b","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:ad5ac9854543b87be62ab9f926f7287dd68ae2b6ea56b7545d5ab7734520c3f6","observation_id":"98b85036-4d88-4796-a66c-25cfa340cf0b","resolution":{"observed_at":"2026-05-16T05:00:37.860910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:55:03.430931Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":"62909e16-8557-4a07-ab16-44d86e35ec94","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:da5bce671077081227ce2cebd92c8f22b0d063e60ed4f64ee8f0f07edf68910a","observation_id":"2d1d1625-224d-4321-881a-40ada8be893e","resolution":{"observed_at":"2026-05-16T05:00:37.776463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond accuracy: Behavioral testing of nlp models with checklist","venue":null,"work_id":"b9ef3307-c2b4-45fc-b6e6-4d6a4c70a2bf","year":2020},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:0ef00b13b970bf9d590a63b32bfd8d21b114bc2646213b19a01eab840b8528e3","observation_id":"653adb4e-4415-407e-b775-9916d5a275cb","resolution":{"observed_at":"2026-05-16T05:00:37.882537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward estimation for variance reduction in deep reinforcement learning","venue":null,"work_id":"1617cca3-2705-4654-b88a-74f203d85b07","year":2018},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:1143ac4b64468520ee87de246be38f08eb16050ffabbd8ba9b4c1f8005ad09d0","observation_id":"ab38c871-57ca-4625-a210-075ae3ce6310","resolution":{"observed_at":"2026-05-16T05:00:37.746531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schrader","venue":null,"work_id":"137d7203-41b0-4f3f-a53d-4cd1b319ac3d","year":2018},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:afae26eeaabe12b04b41f952a551da0b685477f72839f754c25aa6479c27801f","observation_id":"1da224ad-3907-4857-b57f-8cb04dd6dc27","resolution":{"observed_at":"2026-05-16T05:00:37.876073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":"6ed967dd-8375-4630-b6b1-513ddace86d7","year":2017},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:6a6bb6c5ae39e4357a7d8d8569ca2ba682d561b51a2d418f5f368156bcef7c80","observation_id":"0e89ac8c-73e1-4030-80a0-03558b6001ba","resolution":{"observed_at":"2026-05-16T05:00:37.850039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":"bb45499d-7bf7-464a-8e2c-bb5d6fa5bfa6","year":2018},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:bd2267904645e48e028d74b1e55e2203045d3a4fd9f5954bdec03a0378551a71","observation_id":"96f2afde-b243-4e78-bf4f-cb13574ddb50","resolution":{"observed_at":"2026-05-16T05:00:37.871349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:06:10.239871Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":"3fd006b3-ce9f-4777-887c-2e1b5edfdf04","year":2017},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:6b5e83bf2134532824fffb0a06740093fba4685296c394ce69d55b9e2d76f69f","observation_id":"ff72a49d-ba72-4284-8eda-e4f2d4603bf7","resolution":{"observed_at":"2026-05-16T05:00:37.838717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On accurate evaluation of gans for language generation","venue":null,"work_id":"8e0e9c59-9a3c-49b0-b716-aad680d1e266","year":2019},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:42082a95400a8fe626c2e8f0e38c9e54ceae3ed621f6e08608e97a85fdd9d743","observation_id":"f034535e-6dbd-4eb7-bacd-c57d02cf28c2","resolution":{"observed_at":"2026-05-16T05:00:37.907882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9555175-db65-4ea2-b82c-647556f04510","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:d05d505400b58e56b17081744bfecdf46f1f889973a454e938d68c35e5356e4e","observation_id":"97dc48a3-2ca1-412b-b813-b058fc34a4f0","resolution":{"observed_at":"2026-05-16T05:00:37.842025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"6d0b03c1-e0e5-4ae8-845d-915e21aa8ca3","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:9951e25aa3ce4ef9905d2e08d1c9183596701f339c779035189dbb2a604059d4","observation_id":"8e53d5eb-a7d9-4aa0-b3c0-9de558d906f8","resolution":{"observed_at":"2026-05-16T05:00:37.787448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.379646Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":"bfedec71-2ac8-4324-b509-1ef43efdfeae","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:d7a5aca13e7c2237b17fb52a513c6155712f9e953df3c51ba243f3dd73649be3","observation_id":"3af635df-1b95-471d-8ab3-98f2db5ca5b2","resolution":{"observed_at":"2026-05-16T05:00:37.819947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai models collapse when trained on recursively generated data.Nature, 631:755–759","venue":null,"work_id":"3121d6c7-692c-4ce7-aa3b-7dcde7e2127d","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:7f2dba9bb365de01b5332ec42b3c1c6ee6e3cba2e8a4a4c77d9bf12690e71ce4","observation_id":"0c9feb05-51cc-43c7-b265-9dc00fce30b4","resolution":{"observed_at":"2026-05-16T05:00:37.728598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Siegel, Oana-Maria Camburu, Nicolas Heess, and Maria Perez-Ortiz","venue":null,"work_id":"db61e6c2-89ee-4bac-9406-7275cabd0c86","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:f4cacd666795081ccc32c8b5211af07abd3576c5ff02aea740f33c477e48b431","observation_id":"7bd00825-62a2-4618-905d-dee8a2aba694","resolution":{"observed_at":"2026-05-16T05:00:37.894651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"20957fee-5596-4bc0-9efc-df68d6aeba8e","year":2022},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:7a23051e47fdc4ee1d669c36544f5a1e0e8fb6a66339b10b05f7e8d39be5430a","observation_id":"4a9248ec-21e2-4858-b871-498d88ed116f","resolution":{"observed_at":"2026-05-16T05:00:37.731328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast best-of-n decoding via speculative rejection","venue":null,"work_id":"272644d9-c82d-4eb9-8aff-4e08f3f0391f","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:ff4dd834ed505a6eb0f2af49e01daa7b3b3a5e2b3342d287f1722e1930841ce7","observation_id":"124c9268-97a6-4a03-86d9-6ba8f1e3ac54","resolution":{"observed_at":"2026-05-16T05:00:37.864770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"rllm: A framework for post-training language agents","venue":null,"work_id":"6db66e54-34aa-4038-9686-dd2e215e6d47","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:663c9f974712698c26c47372140087cd357405d7a5f2440c2444c0a173b9358d","observation_id":"2295f0d7-5046-4de1-95e8-82635d402912","resolution":{"observed_at":"2026-05-16T05:00:37.765508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hybrid reinforcement: When reward is sparse, it’s better to be dense","venue":null,"work_id":"4faffe23-c1cd-478f-9c74-cf6f5e218a41","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:b853b20c51e3199bfe0ebe3074004cecb5a6e108822ecea3b29ef1d8da295fd1","observation_id":"1808a71a-70bf-4c7e-9c75-f9cf3e295a30","resolution":{"observed_at":"2026-05-16T05:00:37.838529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating the evaluation of diversity in natural language genera- tion","venue":null,"work_id":"667ccc5c-3898-4c24-9cc0-8b60a2f59319","year":2021},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:52422b883b59a3fd5b0ec679230b68c11f2ffc13685c0d1d2793b76df3b3a660","observation_id":"82ff4542-a2b4-4371-8c5c-c369a89f5db2","resolution":{"observed_at":"2026-05-16T05:00:37.891424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8171e08f-08c8-473d-af3c-8dec0db0865f","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:fc44bc7d91068c3f9e2e0c4e4cb02261c6de5cdf3e4e99f8014ed004d3f53e50","observation_id":"bafa2753-42b4-4461-bde8-2efba96bcc77","resolution":{"observed_at":"2026-05-16T05:00:37.770073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving math word problems with process- and outcome-based feedback","venue":null,"work_id":"c37da5ee-f6c8-415a-bc12-d7205c6b96b1","year":2022},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:16e9ba4feae711e6228dc23d5beeceebed6a4de5a03b7dc8bd9295d4917444c6","observation_id":"fb82b083-79c3-4b25-8a22-95616d530e23","resolution":{"observed_at":"2026-05-16T05:00:37.756834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Voyager: An open-ended embodied agent with large language models","venue":null,"work_id":"4b34d93f-dfd4-455e-ad53-a5cfa7af5bed","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:9a7e940b18a8916fd0fc2f6a853ca47c16ffe51ecf1e023a877e1d8bce5e2f52","observation_id":"5f5488e3-7c61-4f4d-8107-fb476a744b85","resolution":{"observed_at":"2026-05-16T05:00:37.861572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harnessing uncertainty: Entropy-modulated policy gradients for long-horizon llm agents","venue":null,"work_id":"2a6ed4f7-1ea8-4c3a-aee3-94fbc17bd2db","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:395fb945c8d0b321b90fc8cc367908602159157b1d016b4c67bb3c074133761e","observation_id":"c7cb231c-bb82-4ab8-a49e-2e76ccf20d96","resolution":{"observed_at":"2026-05-16T05:00:37.740876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:58:58.077170Z","title":"Vagen: Reinforcingworldmodelreasoningformulti-turnvlm agents.arXivpreprint","venue":null,"work_id":"d96823c2-b5e8-4fd0-a576-a93abd6858b0","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:266de6213ae37039eb10b4b05c2054f6fa9f500ec13e9aa4c2cafff899c95eae","observation_id":"245d5148-d44e-41f0-b01b-fdc039959c43","resolution":{"observed_at":"2026-05-10T22:55:51.516784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A practitioner’s guide to multi-turn agentic reinforcement learning","venue":null,"work_id":"611c342d-207a-4e1a-a324-1c70b1ad4c8b","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:fde3a6be4b0e3becceab8ef4214abc6fb692bc04d5205634382da6de499e94a8","observation_id":"7d663f49-0723-4d8f-8bd7-4cca1e51fd1d","resolution":{"observed_at":"2026-05-16T05:00:37.901608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":"aa923e21-74e2-4040-a103-60021ee15367","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:ff4b12a8845e015366d046fbe32bd8edc0f88e89dec318af532f5eb73af73cef","observation_id":"1a2712bc-3699-45bf-836b-ee70f80acad5","resolution":{"observed_at":"2026-05-16T05:00:37.857779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gtr: Guided thought reinforcement prevents thought collapse in rl-based vlm agent training","venue":null,"work_id":"ec7dd902-05ff-46a7-b858-b004e854ac7c","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:75c3f3a27767c4177d42267858775d1b595027b65c797168a8edbd59e7106bbd","observation_id":"b17b9b18-a658-493b-b972-ec0bab70dc6d","resolution":{"observed_at":"2026-05-16T05:00:37.737996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0cc71514-593d-48c6-9802-d94e4d90ee27","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:c352e74e908bb22fd79ec7c8484086eaa724b4033e9a322574df51b237adcc0f","observation_id":"6fa3dcc2-46b9-49f9-8e69-d37b017dccad","resolution":{"observed_at":"2026-05-16T05:00:37.848245Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diversity-aware policy optimization for large language model reasoning","venue":null,"work_id":"b68cce87-faf8-4311-bd46-2e777d2e6687","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:a980026ad861701e07856cb341110212f7a22830fccdfa45d9146d8b1139d406","observation_id":"f6d32405-37c1-4d19-b4c0-4a50a1df3bbc","resolution":{"observed_at":"2026-05-16T05:00:37.819505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Webshop: Towards scalable real- world web interaction with grounded language agents","venue":null,"work_id":"da8d1421-ef98-4a64-9d3f-705e5643cc22","year":2022},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:b5c793ab95123fba0b99034f45ee098566e2c4a5c72a8ee4a815a054b3750786","observation_id":"43fd0d40-c438-4899-ac70-0ff80ff8f4d0","resolution":{"observed_at":"2026-05-16T05:00:37.857918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.395366Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"e2cd986a-6ef2-4f6c-a46e-31c084394641","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:9aeb7d8373f2808b103f2e80fbd979c567169464ce22d0e91d861c201a7614a7","observation_id":"019452a4-6505-4619-aa2a-f47641e8ca58","resolution":{"observed_at":"2026-05-16T05:00:37.914028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21458","doi":"10.48550/arxiv.2506.21458","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa- tial mental modeling from limited views","venue":"arXiv (Cornell University)","work_id":"e7da71d2-40fb-4670-9c50-b37e7469d519","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:6451f3aa6ec7567cc3d7a5d513ce125a43e1f43d3644b83a0cf2413729e7fd70","observation_id":"78ba6300-3aad-41ea-9f3a-fe31e9b7d37f","resolution":{"observed_at":"2026-05-10T22:55:51.503835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu","venue":null,"work_id":"6ec453b8-b796-47bc-9cf0-64de0c687765","year":2023},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:33b9fe9b8a94d6d3154e9c207b25012fa694dde4aee1e4d324235ebc15ae23a3","observation_id":"284e55e5-0cea-4a04-b6f2-5a635979638d","resolution":{"observed_at":"2026-05-16T05:00:37.796360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.001376Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":"bfc4468f-8d85-4634-8538-5c8f16eca3f0","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:1f1eec268d3307d4e1f03f782fc0712eb99f4f7c4a2f3e5d2f5029106db57346","observation_id":"b50e34d4-1e8f-4d5d-b12b-07ba750ab561","resolution":{"observed_at":"2026-05-16T05:00:37.809935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The price of format: Diversity collapse in llms","venue":null,"work_id":"f9898f33-7535-4fc0-8105-e65ac122424c","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:2c8a61b00fdb694b3b77d1ea80d67b28158f1a1f590ff7e63bd791d87b91b93c","observation_id":"a21959a5-ba96-45c9-a512-e4240ed80656","resolution":{"observed_at":"2026-05-16T05:00:37.916766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is chain-of-thought really not explainability? chain-of- thought can be faithful without hint verbalization","venue":null,"work_id":"214f9486-beef-4038-8c23-a3ebc385e9a2","year":2025},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:c0405c5d94ea87fcd9103e2ffd3c342c01898143f87ad21b42810b959a40ab1d","observation_id":"e1b9ce37-610a-44ae-9976-02fcebbcc5c1","resolution":{"observed_at":"2026-05-16T05:00:37.722347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Morris, and Vitaly Shmatikov","venue":null,"work_id":"0092d0a3-9706-49a3-b181-5d0d1544fc48","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:af1496d57042bd30f9885596a66ce73b98d9e72f225d53739f62c665e47eeca7","observation_id":"b368af65-782b-4e84-9614-09aba062f739","resolution":{"observed_at":"2026-05-16T05:00:37.854451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond precision: Training-inference mismatch is an optimization problem and simple lr scheduling fixes it","venue":null,"work_id":"4932129c-ddff-45c3-ba18-bb208468087e","year":2026},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:588989dd623f37fd4d09ea6fd6cc7afbc6cae246ec0ca3093e587367a06972b6","observation_id":"d8d8ba7f-a28e-4869-8367-9f6bed2359f1","resolution":{"observed_at":"2026-05-16T05:00:37.702798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Promptbench: A unified library for evaluation of large language models","venue":null,"work_id":"dfc1ac63-e19f-4058-89b5-21c16fc8cae6","year":2024},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:2ab27f434cfe8ca95044315e3820063d74ac19879a47c2f2b6edcd23b3381c2e","observation_id":"7554ff2f-0dea-4fb7-8493-b75e10370b68","resolution":{"observed_at":"2026-05-16T05:00:37.910974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Countdown","venue":null,"work_id":"c99946e3-c84e-4131-805a-b7160ab790c0","year":2018},"citing_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T19:27:42.198509Z"},"links":{"citing_paper":"/paper/2604.06268"},"observation_digest":"sha256:30d0fd171966dfa8caf293d98b4d483f0c680ad920a1aa699f0f98c2e2842ba1","observation_id":"3e4332b2-2576-4e0c-9ecc-43f8d1ab0810","resolution":{"observed_at":"2026-05-16T05:00:37.749880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":4,"verified_fuzzy":66},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 5 inbound Pith citation observations for arXiv:2604.06268."}