{"as_of":"2026-08-07T17:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1c40262d6d09ad60fbf723d80780d6f291c9d8424adc21dd15cdf64c9c0621e2","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T02:07:21.806345Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:54:44.271066Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T21:54:44.689229Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2605.00380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00380","snapshot_observed_at":"2026-08-04T21:54:44.689229Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","venue":"cs.LG","work_id":"9ff2f967-b4c3-47f8-beda-d13f4813ddc8","year":2026},"citing_paper":{"arxiv_id":"2608.01743","last_updated":"2026-08-03T06:10:33Z","snapshot_observed_at":"2026-08-07T05:34:32.753899Z","submitted_at":"2026-08-03T06:10:33Z","title":"Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:44.271066Z"},"links":{"cited_paper":"/paper/2605.00380","citing_paper":"/paper/2608.01743"},"observation_digest":"sha256:4fc1770de63526948b8443db6ee52727c40fe0a44f9f2c6b1c609dad9d257c36","observation_id":"beb7572e-2aad-4fb6-9fb2-415e538b6b4d","resolution":{"observed_at":"2026-08-04T21:54:44.693998Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.00380/citation-record","integrity":"/paper/2605.00380/integrity","json":"/paper/2605.00380/citation-record.json","paper":"/paper/2605.00380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:34.119737Z","title":"Langley , title =","venue":null,"work_id":"6cd283dc-0548-45e9-af07-6bc1005593ad","year":2000},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:20a288cfd01de30892f81f59131a7b639f44285c18ff6f8a3218e65ef9d95d94","observation_id":"471bdb82-b65c-402a-98e1-3de2ac1190ef","resolution":{"observed_at":"2026-05-14T14:16:17.337713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.976173Z","title":null,"venue":null,"work_id":"6b09bca6-ef5d-4a83-8c8e-219f23cbd761","year":1980},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:f622e50ea9fc9391872c9ef984891559903ca4eca5b386d717fcea9f65a2da9f","observation_id":"546a4df3-dc4a-4b22-b01f-11c5e2f40e23","resolution":{"observed_at":"2026-05-14T14:16:17.342271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.841265Z","title":null,"venue":null,"work_id":"8efd8073-6f5d-45c5-94d5-62d366b52518","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:072944172a8443de5ed7a3df3fa36657e8110fd195d9f7f124f2e77cfcdd8d3f","observation_id":"d096e0b7-8402-4e5e-bb7e-352bd1147f78","resolution":{"observed_at":"2026-05-14T14:16:17.330303Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.783905Z","title":null,"venue":null,"work_id":"51835800-f16e-4534-8339-d3ea09147556","year":1983},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:4fb2613789ee1ef0796f20e52a7d6597d5f2d87c4762dfe9a75e9b71d51a2ed6","observation_id":"4da24c35-06fb-4158-8db0-3f9a315c748b","resolution":{"observed_at":"2026-05-14T14:16:17.332843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.877035Z","title":null,"venue":null,"work_id":"a24cb892-7ac9-4509-8f5b-abbdfb15998b","year":2000},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:1ed611fd00fd087148ebcb58ba4adfa40b7468a4516bdfeefc201f56b5edf5e4","observation_id":"4b967ab9-2ee1-4df0-bac4-e57c71f87615","resolution":{"observed_at":"2026-05-14T14:16:17.344241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:55.004500Z","title":null,"venue":null,"work_id":"744d3ca1-d321-4345-b9e3-30a42bcf1b37","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:83f44a5691e20fc9953abc84b2911790463e999a49c9b3bf0ef4a00dd4d080c3","observation_id":"4803c362-8cb1-402d-8537-518eeb78cfe1","resolution":{"observed_at":"2026-05-14T14:16:17.335377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.757534Z","title":"Newell and P","venue":null,"work_id":"c2e14246-296a-4c66-84e9-a797b1c9d6da","year":1981},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:5632d61a697e1a6ceba5e61cbabeea9102a99f1f2a12e09469aac0da0effd892","observation_id":"406212ef-e759-450e-a834-e38342b55c0a","resolution":{"observed_at":"2026-05-14T14:16:17.327742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.727878Z","title":null,"venue":null,"work_id":"8d7d9e29-63b8-4039-8dc1-7059f06840ea","year":1959},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:8cc058656069af2cce4e2561aab66550e5648c82a3179d2ea6df3c8558d5c6f6","observation_id":"e1bd28a7-41d1-46ee-b70e-dd8f09a8d416","resolution":{"observed_at":"2026-05-14T14:16:17.339890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"4a6024ad-9841-4622-8c55-1021d9d18959","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:2d27b65706b163eff7bbc296edec97139ad4ecbcc5897b294163cc82d34ee284","observation_id":"23fcf05c-f0ed-4744-926e-53855e604130","resolution":{"observed_at":"2026-05-14T14:11:04.033665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Surprising Effectiveness of Negative Reinforcement in","venue":null,"work_id":"b336b0e9-a634-44dd-8029-c9f2ba95b9c0","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:52eb7e88a06dac1df7c170e5eda7bc8d0eccd4329c0c0784df55d7725063de3b","observation_id":"880d5381-d9cc-4161-950c-81ae076f5f4e","resolution":{"observed_at":"2026-05-14T14:11:04.035306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"8b0c2d78-f4a4-4b78-837e-6052047b632c","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:570eddfc7a2be020b98b3c275dc495f46cdbee0574be5876851273fdd282abf8","observation_id":"9282e36f-e792-444c-a8f1-b454bf2d2a72","resolution":{"observed_at":"2026-05-14T14:11:04.030238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"2881356b-1b81-424b-94a3-0dc415750805","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:70d6b810ef17cc982ef331dd9cd9709d2e2b36ab3477740e509abe3655e15c90","observation_id":"952cbc23-2de4-49f2-8a03-2a4550e4d2b7","resolution":{"observed_at":"2026-05-14T14:11:04.028665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.717","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do We Really Need All Those Dimensions? An Intrinsic Evaluation Framework for Compressed Embeddings","venue":null,"work_id":"60176f0f-d224-4a17-89ce-07ae0b2d50c3","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:1a36cd6a00ad1f873d5d356248fc37a9cc6609c86cee07f42781598ba0b4aa63","observation_id":"3a9f59b6-9f0b-411a-842f-70542e8f564c","resolution":{"observed_at":"2026-05-11T02:10:52.878362Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.555992Z","title":null,"venue":null,"work_id":"6f6d209c-24e4-436d-a2a1-f4e57a2b8b51","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:ee7619f8ebe38a44b212e8d0bc97bc8a32fcd84e213260786e677d5223dd1454","observation_id":"57af6f8b-5697-4d51-b7c9-d910f59de4ff","resolution":{"observed_at":"2026-05-14T14:11:04.031831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00512","last_updated":"2019-09-02T01:51:46Z","snapshot_observed_at":"2026-07-06T08:18:18.838990Z","submitted_at":"2019-09-02T01:51:46Z","title":"How Contextual are Contextualized Word Representations? Comparing the Geometry of BERT, ELMo, and GPT-2 Embeddings","version":1},"cited_work":{"arxiv_id":"1909.00512","doi":"10.48550/arxiv.1909.00512","metadata_source":"pith","pith_arxiv_id":"1909.00512","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How contextual are contextualized word representations? comparing the geometry of bert, elmo, and gpt-2 embeddings","venue":"cs.CL","work_id":"f9f9736d-1065-4243-8be7-6f9238114277","year":2019},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/1909.00512","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:263bfb977872f7f4b2307d97b26e272db98238901a781376dbf4969762babc33","observation_id":"4c9b9538-fd4e-4a39-9708-f02b89daa0d0","resolution":{"observed_at":"2026-05-11T03:55:56.608612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:00:49.372351Z","title":"SC20: International Conference for High Performance Computing, Networking, Storage and Analysis , pages=","venue":null,"work_id":"f62f435f-90be-45ec-bdea-343bdc2734f6","year":2020},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:e4133d7424162d21446717e21e62e280723db98978ac3d911539765c3801209f","observation_id":"fb620dd3-b316-484c-9a96-df6b99fb768b","resolution":{"observed_at":"2026-05-14T14:11:04.037134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:30:47.522214Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"6a9022de-4076-4457-afc2-27f33b9d81fd","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:41161707b6bfcf4fb2391a1e69a26753b6d2aee516eaf458f9873f239e48936d","observation_id":"9d9c4c92-432d-4edf-a220-859ba6ee7e03","resolution":{"observed_at":"2026-05-14T14:11:04.041049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"0c02aa11-ccb4-4003-8860-d49b7005ea9a","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:db80d192aadaa72fb038fc17dd540e71ffbeea98c3eed5226e05f649a00590ce","observation_id":"55ba95a8-e18a-4715-af88-7c0abf63dbc1","resolution":{"observed_at":"2026-05-14T14:11:04.039179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:808c9422d691d1a88a7318a97c25c2d643a6cb4e19d7ab2ce9ce93525127e5b7","observation_id":"5adda6ef-1d25-4a5d-830e-8e2c27d3dee5","resolution":{"observed_at":"2026-05-11T03:55:56.660430Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2013 , publisher=","venue":null,"work_id":"ef52eaf6-b45c-48ea-b704-1012057429c0","year":2013},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:ecca4ba1f352e5f91528b034041beea1142c9be564c21f51c3c67334860f63d3","observation_id":"a9a2743d-76a0-4a1c-a585-caeb0e3e4063","resolution":{"observed_at":"2026-05-14T14:16:17.323594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:22:37.831020Z","title":"2012 , publisher=","venue":null,"work_id":"21423425-58df-4386-a5fe-1f1bc55bbe85","year":2012},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:2a8ccf50002c860b0190cf986a2d4293315e247cf51e41f926564a030a045a3b","observation_id":"b47d64d0-5500-4649-8639-d9475e7b60e6","resolution":{"observed_at":"2026-05-14T14:11:04.023176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:8e6cfd25be96889c1a48fa7916ce090b5a2253b514cdabf94844722361ed08fd","observation_id":"5c5f73ef-355f-4e69-981f-055e1109037d","resolution":{"observed_at":"2026-05-11T09:15:09.492454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"cited_work":{"arxiv_id":"2509.09265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09265","snapshot_observed_at":"2026-07-04T20:20:07.648363Z","title":"arXiv preprint arXiv:2509.09265 , year=","venue":null,"work_id":"8f9450ab-4c8e-490e-8115-d9850bcd4e9c","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2509.09265","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:f9c4f30ce423cfa5351e2c4978a7e900ab7914dd601167da753c308574e0c864","observation_id":"502ff5c2-6737-426d-b756-4871a14cb9a7","resolution":{"observed_at":"2026-05-11T03:55:56.612400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:84deec8d23a81a69dcad6b424b473ff97312c74f1d16ed507219dc9209b46c75","observation_id":"61eae873-89f3-4b89-8134-0b1b5bd8e10f","resolution":{"observed_at":"2026-05-11T03:55:56.527005Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:fd1d4198d24cfc59e865d9676f79b841ea1850ad9a6f63b7b81de7bbb609a5c4","observation_id":"cfbfb84a-302b-46eb-ab12-bdf53d39204c","resolution":{"observed_at":"2026-05-11T03:55:56.487618Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:55.532712Z","title":"arXiv preprint arXiv:2509.15207 , year=","venue":null,"work_id":"792e6e52-d465-4464-9da0-4747d275548d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:c0a900f9c49fae8c9ff57246bf303020987a4555a76100140ea98a61b1bfd975","observation_id":"5ef8e421-23e5-4f7f-910d-c73b75fc891b","resolution":{"observed_at":"2026-05-11T03:55:56.625674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:77390562402d794b74a768d54f25d7dc08f6589f930e772e00d4c4389838a335","observation_id":"e3470641-c74e-463a-b4ab-f68fe91a9841","resolution":{"observed_at":"2026-05-11T03:55:56.547823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.041897Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":"e01957fd-46be-40ec-9284-81b214b9911c","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:94cefdf7fb181f0e7b347ad86b7261f412d5421aa6cf1adafae2dbcc57514ab6","observation_id":"a789e726-9a07-42a8-a130-b84c4795a9bc","resolution":{"observed_at":"2026-05-14T14:11:04.025041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:02:58.716193Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":"d0870e7f-a33a-4020-8109-459b41853021","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:68c8f98ddc2386d9e542e540cdf5c3503f8f456c3cc972af0c3e7f80ccdec33f","observation_id":"4e0e4642-05a5-4796-a31b-cc271a856477","resolution":{"observed_at":"2026-05-14T14:11:04.016699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:19baa46efe49e789be42a88ebac95d03d7f667a94dbd21e0ddfd6c7ef49ffe24","observation_id":"0bf572a1-7a80-4ba8-991f-542737855d8b","resolution":{"observed_at":"2026-05-11T03:55:56.688441Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.243842Z","title":"2017 , eprint=","venue":null,"work_id":"5a794cfe-c0fb-4191-a347-b4e935d39d00","year":2017},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:e4c5e20238e3324a7f8417faaeaa235d02c8284a480eae6629e06451f4c32239","observation_id":"acfc92db-99d4-4235-b2d4-287104cf5a5e","resolution":{"observed_at":"2026-05-14T14:11:04.014824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:79e96a467b96a74ac5e81cc95ee5bba351b88fd4af16d9c6df4ce092fa1a869d","observation_id":"bc9a82e9-b86d-4558-afa0-f073776677e3","resolution":{"observed_at":"2026-05-11T03:55:56.589250Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.107753Z","title":"2016 , eprint=","venue":null,"work_id":"2d03abe2-0f55-41a8-9cb9-e8d3f4376824","year":2016},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:5c7b8d518c3862f33e65561b2c149f7962ce021b00056030117ad776684d5bb9","observation_id":"b2e24013-a5aa-46d8-8fed-112e11d49622","resolution":{"observed_at":"2026-05-14T14:11:04.018322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5250734f-4877-4ee2-a1f9-fe07bef78b6e","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:c7aae49a4fb61e7715dfdf1f7b7e34d33441569c4fec442d3329ea82e80c8e8a","observation_id":"f326481c-385c-4b6d-bce3-657f849182d0","resolution":{"observed_at":"2026-05-14T14:11:04.019859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , howpublished=","venue":null,"work_id":"7b74843e-3892-4167-b824-9adba1e7ace0","year":2023},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:9b6c9237805f9c9d4d965fd19fd85d625d80258dcbaf557c0583cdb54527ea10","observation_id":"c388450a-fc2b-4452-b222-870cf0b2aecd","resolution":{"observed_at":"2026-05-14T14:11:04.009231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.913804Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"c0f4aeec-4ad4-4db1-bb7d-82608131c729","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:73009bf924e81a0eced99df04c3f9e0f769565e6d0d4bfe25fbb14e8c443d828","observation_id":"e47e96c3-14cc-4ed8-962f-d48d67b988b0","resolution":{"observed_at":"2026-05-14T14:11:04.006026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving Quantitative Reasoning Problems with Language Models , volume =","venue":null,"work_id":"fcc4a965-bc62-4c44-9649-50e6f459ee3e","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:cb6ea7b32e713318ab42c9e7fe4fd576f771cf768875d4b3631295beac2a663e","observation_id":"a89baf4e-26eb-4081-8727-b3c3a7386eca","resolution":{"observed_at":"2026-05-14T14:11:04.004234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:30ce944113332033e8a232dad77d68ec804f3a70f49e9b036bfb0de47f84d02b","observation_id":"4cf893df-5431-429f-8196-76fc6a99ddce","resolution":{"observed_at":"2026-05-11T08:38:21.105975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:a86cf953614d7a82be69a099b2874b19fdf6a6a2777a95022bccefb612dbb9af","observation_id":"4147c05d-ae60-4ba5-9d3e-38e7bab3a220","resolution":{"observed_at":"2026-05-11T03:55:56.572533Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:11:21.619325Z","title":"Hugging Face repository , howpublished =","venue":null,"work_id":"98b7e1aa-e0c6-40f0-a3d3-39b14a89a495","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:85b650673b07c66839d402c531eeb43b1b519b51f3f27ee4c67659b11ec6b0c1","observation_id":"284d3897-1ef7-402a-8df1-e990dbe55012","resolution":{"observed_at":"2026-05-14T14:11:04.007708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.993402Z","title":"2021 , eprint=","venue":null,"work_id":"2bf5e215-aa95-4dba-89bd-c7c2b236f443","year":2021},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:72397ff4dfbbd683dfb44eac17d30565fe2a549856bdf49e387c45309e7c4ee4","observation_id":"d7d630a9-7b5e-49d8-a25a-2259477db3c9","resolution":{"observed_at":"2026-05-14T14:11:04.011105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:42:56.204813Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"8e05574b-4459-477c-8478-5f60a3bb36a2","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:3ee248ad37f417c29f3ac010dbd03574ada20b1eb26c809dd73d206dd14b9930","observation_id":"e972309a-a452-4238-8e36-6b3dab9f0e2e","resolution":{"observed_at":"2026-05-14T14:11:04.021557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:adb744df6492d3aab7a57b5c83982693cb7e40cb199c799260184224d5de7afe","observation_id":"245dd79f-19e2-4f08-8a3d-7cd7e80cdfcb","resolution":{"observed_at":"2026-05-12T06:39:15.970362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1ab9efd6-9c0e-4ac8-808b-f2ed6a681a24","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:9760a648137179c32168619d1bd90ae82bdc5f44aa2adffb09b6759ebc2947d0","observation_id":"d2efa496-1a1c-403c-88be-3e9ed309c279","resolution":{"observed_at":"2026-05-14T14:11:04.026652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"5ee9cecf-6375-41d7-bf12-00b658945c2f","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:ee76be47a65c52dc45b8a73f03591e7a7a613cee4110e73ea0d157f051c0edf6","observation_id":"9a203321-8085-45f3-bcb4-c465ea4f78d1","resolution":{"observed_at":"2026-05-14T14:11:03.998682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:c1cba29493cea5219e757ddf42e4d687bd19404a65a02710d9d7de0e4ee5b5d2","observation_id":"ef6e31e4-9e4d-4251-8137-34fcac0e28dc","resolution":{"observed_at":"2026-05-11T03:55:56.499161Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T23:04:01.319583Z","title":"InThe Twelfth Inter- national Conference on Learning Representations","venue":null,"work_id":"2d3486fe-3edb-4788-ba92-3253af54532d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:289f35d25f379c6067b384d53414779b855a473666eba04214a20f8902b5ea1e","observation_id":"40050088-539c-4c1b-a497-c5fe56084642","resolution":{"observed_at":"2026-05-11T03:55:56.495465Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:07:07.095771Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"c3e39c6f-1540-4e6f-8e66-55a348f5dd6f","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:afb1a3f5cacb7596079361cf8559dccabd4b4da8a47ca08479e31402615d80a5","observation_id":"241c99f0-3248-48d3-9161-04e3d76b4885","resolution":{"observed_at":"2026-05-14T14:11:04.002613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:b1a031ec7df47a6005859a96b1ffbd3f8076f7ce0dbce4f1a7258d50e3537fd6","observation_id":"8aedebd1-aba0-43a3-88c1-02f6e87acf0c","resolution":{"observed_at":"2026-05-14T00:26:48.594660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:06:34.823682Z","title":"On grpo collapse in search-r1: The lazy likelihood- displacement death spiral","venue":null,"work_id":"ccf2c4a4-1d0c-436f-a160-0001f11cc060","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:e96788bd347103dca77aa1b4602c96153a23dee922e196f2da872aff2b15fe38","observation_id":"fae9b3ce-9444-4c51-916d-d9f31c3d8476","resolution":{"observed_at":"2026-05-11T03:55:56.558114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.03772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.669302Z","title":"arXiv preprint arXiv:2508.03772 , year=","venue":null,"work_id":"5694fc9f-d85d-46e1-bbcf-199706efc784","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:58ad5c11e0cc32e259f86628f350dbea38aad154b5f8cb160777a640f401fb15","observation_id":"974941f5-c810-405a-a532-08dd6be20681","resolution":{"observed_at":"2026-05-11T03:55:56.568629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2nd AI for Math Workshop@ ICML 2025 , year=","venue":null,"work_id":"c0afee7d-aeae-48b7-aa9f-8abac78bf6b5","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:4ea22b9d231c28506bae37f19395f4dbbd62bb950af3880efbc00e0500ed6bfb","observation_id":"3a72436e-d0b4-42cb-8d71-39d42638d9f5","resolution":{"observed_at":"2026-05-14T14:11:03.997138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-07-06T18:02:02.384288Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:8cef8b3e99abd4fb276295a8d4c6d4bacc265c833c516a8636dae9f291a83929","observation_id":"f0ca4aaf-90d5-4706-bdf6-b147accde66f","resolution":{"observed_at":"2026-05-11T03:55:56.600639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.19439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:56:13.573932Z","title":"Surrogate signals from format and length: Reinforcement learning for solving mathematical problems without ground truth answers","venue":null,"work_id":"3a5eab7e-0418-4824-9a7c-28f4d7fc1878","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:9c2bdf0f7fb719e043f38c5c8f259636be25a2d44c4e8ace55c98c1f335e166b","observation_id":"78c5861d-4769-40ff-af89-31b2727ac214","resolution":{"observed_at":"2026-05-11T03:55:56.629247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":"2505.19590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-07-10T12:07:03.461827Z","title":"Learning to Reason without External Rewards","venue":"cs.LG","work_id":"7286f998-80ea-4c9e-8736-a39c53696142","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:779808671eb2aa866daf555a3f8bab4e76bc76d3fc0d10f455de4b3a7e2437be","observation_id":"f37e4fc4-c1e1-499b-b715-821b0df128b9","resolution":{"observed_at":"2026-05-15T21:16:57.297836Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-07-30T09:54:40.100382Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:538135c2c89c80d49237746c76ccb7eb00d4517a5db6f1b02bec003976b9b29b","observation_id":"f0af7455-69d4-43f4-a332-c2eef49e8601","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:de127ce88bfbdae5511c9737c40df9c4a88a2fdbf9de4c8c56a2d176c8708d72","observation_id":"2effd303-1372-46d9-91c5-f44aafb19f77","resolution":{"observed_at":"2026-05-11T03:55:56.670222Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"cited_work":{"arxiv_id":"2510.14807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14807","snapshot_observed_at":"2026-07-03T21:08:57.699582Z","title":"Simko: Simple pass@ k policy optimization","venue":"cs.AI","work_id":"29212f52-a9c4-4214-85da-144ddfcc8042","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2510.14807","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:a1665bc6fd212808b216278cdf0e22af6c3edb6e263514a27625512dac4f9468","observation_id":"970e2a00-9a0a-4ef2-a527-75ccb0bbab77","resolution":{"observed_at":"2026-06-19T17:09:49.354484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:fa6dae512f8d4b7f79c59dc72e709d0e5975b518bb4a713202268534cc1d969b","observation_id":"62a36ce3-ff9e-40dd-8908-3e040a63392a","resolution":{"observed_at":"2026-05-11T03:55:56.653228Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:b23a74781205cd65d142eab3fd491f9b1cf7dac2f6c883a36cf4ae6711a23ece","observation_id":"51162d63-f47d-4295-aad7-d13027ce7f2f","resolution":{"observed_at":"2026-05-11T03:55:56.520021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25454","last_updated":"2026-04-06T19:16:24Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T20:00:29Z","title":"DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search","version":4},"cited_work":{"arxiv_id":"2509.25454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.25454","snapshot_observed_at":"2026-07-04T19:20:06.715966Z","title":"DeepSearch: Overcome the Bottleneck of Reinforcement Learning with Verifiable Rewards via Monte Carlo Tree Search","venue":"cs.AI","work_id":"c834c167-f776-4768-8846-bf3619b98f80","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2509.25454","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:fcf0fd71a7ba01357ffb29dbe6fd73f968dc28982772173da63d121ee68faf66","observation_id":"ba339bc3-a0a6-439b-8147-b70473565199","resolution":{"observed_at":"2026-05-11T03:55:56.677053Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T12:12:29.397595Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"cited_work":{"arxiv_id":"2508.07534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07534","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From trial-and-error to improvement: A systematic analysis of llm exploration mechanisms in rlvr","venue":null,"work_id":"ac56228f-c766-462e-8c76-3db7885a98e2","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2508.07534","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:f78dde23ff52d26c2b914f205688bb56c2d2ae01dab9ac77722f9476e0165e3f","observation_id":"5c712013-bb5f-41fa-9ad7-1ab6b67256b3","resolution":{"observed_at":"2026-05-11T03:55:56.685011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13755","last_updated":"2026-04-12T13:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-19T11:51:40Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","version":8},"cited_work":{"arxiv_id":"2508.13755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13755","snapshot_observed_at":"2026-07-04T08:09:40.621610Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","venue":"cs.LG","work_id":"f6699fce-0a85-4d3e-958a-b94201b37151","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2508.13755","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:10f2746a444e5724fc36e5cce0b8d055006c06b092b0aa774b1f242a5af8a22f","observation_id":"42724834-59a7-4969-a8d7-4a2f898c3f30","resolution":{"observed_at":"2026-05-11T03:55:56.507385Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-08-07T15:20:22.627728Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":"2505.15201","doi":"10.48550/arxiv.2505.15201","metadata_source":"pith","pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pass@ k policy optimization: Solving harder reinforcement learning problems","venue":"cs.LG","work_id":"89595483-89ea-4826-91ac-09421f814681","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:3e424f51bfa3f2103853fdc99ee32478da54295cef7e7cf2e1f4623ddef0030c","observation_id":"461bf939-b0d7-4603-9146-f56ea80e2fb3","resolution":{"observed_at":"2026-06-11T02:08:32.357336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:53:19.113534+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:53:19.113534+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16231","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2511.16231 , year=","venue":null,"work_id":"b29870a3-4bb3-4c70-9647-147340476d7d","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:a5844477fca6816a60798a2966d8a270b2375438e54952bd2d11883494cd56c5","observation_id":"cefedd71-81d0-496d-993d-1865e9e04c10","resolution":{"observed_at":"2026-05-11T03:55:56.645213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 31st International Conference on Computational Linguistics , pages=","venue":null,"work_id":"e826eebf-db23-40ca-a1be-eef3d76b1f93","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:8372a7a654c9428f884bb36b6fb8e997adfb88bbfa84948f0c73aae7d2b6ea01","observation_id":"5e7a2117-5866-4393-b713-60a3e750c308","resolution":{"observed_at":"2026-05-14T14:11:03.995438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the association for computational linguistics , volume=","venue":null,"work_id":"ad1fd1e8-f4c9-4bc9-9357-ab6072e2e2a6","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:85190f9aa4c9fbf50038af33f0f654a167ad56dea39971a7bcfcf8ba82f6b814","observation_id":"fb342ba8-0328-4d25-86f1-b30f71632a71","resolution":{"observed_at":"2026-05-14T14:11:04.000792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.096579Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"c25e8154-fab2-455c-8a26-56e40aed5d2b","year":null},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:da21b306a1221df456fcc78dde94c886d17e733d14b0474cda8179c94fff96a3","observation_id":"9ab1f043-7895-44d4-9dd2-73f1bb734a20","resolution":{"observed_at":"2026-05-14T14:11:04.013107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":26,"parse_uncertain":1,"unresolved":8,"verified_exact":6,"verified_fuzzy":27},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2605.00380."}