{"as_of":"2026-08-13T00:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6dea190a81b5f04f01a78ad603b742c6643da52a31314e37212d31680219c5af","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:20:20.407043Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-25T21:15:07.735336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T19:30:07.857950Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"cited_work":{"arxiv_id":"2510.10541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10541","snapshot_observed_at":"2026-07-04T19:30:07.857950Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","venue":"cs.LG","work_id":"b113dc72-89b3-4a74-a074-ab6bf45ed274","year":2025},"citing_paper":{"arxiv_id":"2606.25527","last_updated":"2026-06-24T08:05:28Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T08:05:28Z","title":"Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T21:15:07.735336Z"},"links":{"cited_paper":"/paper/2510.10541","citing_paper":"/paper/2606.25527"},"observation_digest":"sha256:e480e175a3c0277bc29acec238e73ac764cd3d8ed34e602d7a8e1694b5e6c58f","observation_id":"a8fbd985-0893-40d4-a625-a2a3988894ea","resolution":{"observed_at":"2026-07-04T19:30:07.859170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2510.10541/citation-record","integrity":"/paper/2510.10541/integrity","json":"/paper/2510.10541/citation-record.json","paper":"/paper/2510.10541"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T10:20:18.047448Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.047448Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:d6ed67b2d4d0c7e0beb4e9ae68a50d66c46118065a2cf7aa39269c1760acdd65","observation_id":"4b1a2395-b57b-4d82-90e2-ecbfe2981f0c","resolution":{"observed_at":"2026-08-04T10:20:18.047448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.121512Z","title":"Shortcut learning in deep neural networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.121512Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:e851b295d1c8d5a5e642b18f3f038429c72a016216c00f381b4e6a3aa799a252","observation_id":"3ed62fb8-7d48-44dc-98be-f3aef646042c","resolution":{"observed_at":"2026-08-04T10:20:18.121512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.270251Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.270251Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:f948cc4a21f1030d622445b77dd7943d46a78404afe8be5a7d83eaea67d10fc6","observation_id":"9a346905-9ddc-414e-bf1d-1a8080810ceb","resolution":{"observed_at":"2026-08-04T10:20:18.270251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07328","last_updated":"2017-07-23T18:26:29Z","snapshot_observed_at":"2026-08-10T10:15:48.341478Z","submitted_at":"2017-07-23T18:26:29Z","title":"Adversarial Examples for Evaluating Reading Comprehension Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07328","snapshot_observed_at":"2026-08-04T10:20:18.361180Z","title":"Adversarial examples for evaluating reading comprehension systems","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.361180Z"},"links":{"cited_paper":"/paper/1707.07328","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:ffae968e4c8ea4b4fc7118b020510090ea598797d0600f555adc5bea471295f7","observation_id":"56a3c550-052d-4348-b875-16894bba678d","resolution":{"observed_at":"2026-08-04T10:20:18.361180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-12T17:03:44.244933Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-04T10:20:18.458587Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.458587Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:1b00a7cfa96db8ae744575086090268054db1641284ceaac99ae27be22ffd6a9","observation_id":"a6fa7254-93ae-453e-b732-8cbf73c1e452","resolution":{"observed_at":"2026-08-04T10:20:18.458587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.524173Z","title":"Think or not think: A study of explicit thinking in rule-based visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.524173Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:3e757a6cfff86dffa9e169647673ebc0976873e11ff7b5e9540bbf169ffb34c0","observation_id":"433ff859-2a4e-4de6-b343-f9853686de99","resolution":{"observed_at":"2026-08-04T10:20:18.524173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.590115Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.590115Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:7a0076311eb38b84cb44f8179b27e9ed1d14d12cd4578baf6f1613465e444907","observation_id":"ac220ade-97f4-47ec-ae94-9b163ee48c29","resolution":{"observed_at":"2026-08-04T10:20:18.590115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.665265Z","title":"Deepscaler: Surpassing o1-preview with a 1.5 b model by scaling rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.665265Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:dfa1a6a0ad71e9840611042cbc050e26bcfcd70728dcc218a3d51ae687092e9c","observation_id":"0ec04a5c-12af-419c-a04b-721bdc6b9759","resolution":{"observed_at":"2026-08-04T10:20:18.665265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.758528Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.758528Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:ab492f452ede6f3aed6aee7cac6dda54d6c2f6e3bf55c63d290efeb4df65ff03","observation_id":"cdbde81f-bb83-4466-8f7c-4181ea1a7913","resolution":{"observed_at":"2026-08-04T10:20:18.758528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.878037Z","title":"Curriculum reinforcement learning from easy to hard tasks improves llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.878037Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:29790de7195a3d926a5a2be529867e15c9966dd50f23c9a66be71c454f3995f5","observation_id":"ebcd2427-c0b6-4803-bf06-5750abe77b37","resolution":{"observed_at":"2026-08-04T10:20:18.878037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:18.993321Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:18.993321Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:a2f8c41c2cc9716f6b90aecf7375f557cf546bd9d7d9f4b6eebfb9747ea9b570","observation_id":"db9d3758-fb1d-40ca-a4a0-5cb6970d7162","resolution":{"observed_at":"2026-08-04T10:20:18.993321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T10:20:19.123246Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.123246Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:68ce216bb20cdb3d522de118f9c27cbae815d007007d40328dfbe0b3e158399d","observation_id":"983eeed1-c37b-46be-919d-6036b7315bb1","resolution":{"observed_at":"2026-08-04T10:20:19.123246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T10:20:19.245701Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.245701Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:4fb3e616895e516572d0a85e0779fe2c9f4aa502d84f226648f965b92af72d58","observation_id":"747ce24d-dcb6-4120-835c-625de9a36168","resolution":{"observed_at":"2026-08-04T10:20:19.245701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04701","last_updated":"2019-06-11T17:06:49Z","snapshot_observed_at":"2026-08-09T03:39:56.170437Z","submitted_at":"2019-06-11T17:06:49Z","title":"HEAD-QA: A Healthcare Dataset for Complex Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04701","snapshot_observed_at":"2026-08-04T10:20:19.327712Z","title":"Head-qa: A healthcare dataset for complex reasoning","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.327712Z"},"links":{"cited_paper":"/paper/1906.04701","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:21d937d7dbe4cc63de5f294a588af89ec45c60a87ac79d4f7afcf157f48f8932","observation_id":"47e73c85-0fb2-4f3b-a262-063dcc4ff5a1","resolution":{"observed_at":"2026-08-04T10:20:19.327712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T10:20:19.428770Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.428770Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:8ff8e3024e40733908fc70e650f6f5ffb1a31ec06a9ce8118416481407c3cde9","observation_id":"e01159f6-6375-4e28-975d-3c8078019ee7","resolution":{"observed_at":"2026-08-04T10:20:19.428770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:19.588462Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.588462Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:a77a45cffcf6f8d5655fef76ac36b3d4e3364caa42e18d39de62ca29e3414397","observation_id":"5f1baf7b-1d70-40de-a153-53e171474b09","resolution":{"observed_at":"2026-08-04T10:20:19.588462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-04T10:20:19.721870Z","title":"Tree of thoughts: Deliberate problem solving with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.721870Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:e565b48eea2b0b792f4ee874732030925f32bd2fcea601b9367c4a9ad8c938aa","observation_id":"9c7ad0c6-f9cd-4d50-9f3f-88f64a9e3845","resolution":{"observed_at":"2026-08-04T10:20:19.721870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:19.865669Z","title":"Frame: Feedback-refined agent methodology for enhancing medical research insights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.865669Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:d3f14e86bba587f5ea555de0603294c0a2e30fa06b76d752122cf2bba818bb58","observation_id":"e7fc6145-cb8b-4ef3-9e68-4cf5b78681d8","resolution":{"observed_at":"2026-08-04T10:20:19.865669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-04T10:20:19.991179Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:19.991179Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:f8c84b8edb8f1d855ee0b767202823900e7fb162ea3edde09a7dabed9060d883","observation_id":"d3795470-4370-46d5-9301-1677b24c1bc2","resolution":{"observed_at":"2026-08-04T10:20:19.991179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-04T10:20:20.043540Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.043540Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:8311edf35aaf699e27069afdb0b1d8836c6c201ba7c76097d9a65ff762b6a75e","observation_id":"664256ce-62d2-4b7a-9711-f17a87d68503","resolution":{"observed_at":"2026-08-04T10:20:20.043540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.091347Z","title":"Easyr1: An efficient, scalable, multi-modality rl training framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.091347Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:79b1b502a8871b6f0399fe4c68648fcd00fe7a14e7f56591193036fd74cd9563","observation_id":"85245822-8158-4d77-a0bb-7676a8d9b49a","resolution":{"observed_at":"2026-08-04T10:20:20.091347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.207076Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.207076Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:c3797b2a096f0e88db70d3190e729f855a6395bf3286d1f53bf84d71bdb49dc0","observation_id":"af54b007-148c-4ebc-bc7c-6ce0efd556a9","resolution":{"observed_at":"2026-08-04T10:20:20.207076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.302554Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.302554Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:a42d6c7e99b2f6d75a24f5d922eed164edc4cfbda729100691a14d0bad6f5c21","observation_id":"32270c72-0952-4a5f-aea5-d7edcf434404","resolution":{"observed_at":"2026-08-04T10:20:20.302554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.377723Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.377723Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:cfb45468332826346b9ff8ea34f0a7264e1239e3ac791b91a9735fbe5059267b","observation_id":"700a9b75-6981-47c6-ba3c-aea8b9ed55e9","resolution":{"observed_at":"2026-08-04T10:20:20.377723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:20:20.407043Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T10:20:20.407043Z"},"links":{"citing_paper":"/paper/2510.10541"},"observation_digest":"sha256:1629e696ec344f4121d899290c3e66b17966eb52ee1e190af0fa0fa7e512c50e","observation_id":"ce937af4-a397-4290-9587-029f73a6da46","resolution":{"observed_at":"2026-08-04T10:20:20.407043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.10541","last_updated":"2026-05-30T13:04:26Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T02:51:41.122105Z","submitted_at":"2025-10-12T10:49:57Z","title":"Rethinking RL Evaluation: Can Benchmarks Truly Reveal Failures of RL Methods?"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2510.10541."}