{"as_of":"2026-08-04T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10876770432869612da64e0b18e217efdc3010e59645588e2ff1879c69ea8300","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T09:48:56.990745Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:23:23.168854Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T23:07:27.269519Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"cited_work":{"arxiv_id":"2506.13351","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13351","snapshot_observed_at":"2026-07-02T23:07:27.269519Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","venue":"cs.CL","work_id":"83c204e8-dd80-4a60-9021-954166f727a0","year":2025},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-01T14:39:13.243144Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2506.13351","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:0e9ac7404bccfff9a159f8f008975295f2cf7ffc956000e8b1dd0ebaa71fa817","observation_id":"3984fa88-075b-41d5-be28-a20913e35529","resolution":{"observed_at":"2026-05-19T17:22:41.983841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"cited_work":{"arxiv_id":"2506.13351","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13351","snapshot_observed_at":"2026-07-02T23:07:27.269519Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","venue":"cs.CL","work_id":"83c204e8-dd80-4a60-9021-954166f727a0","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":169,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.13351","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:a79b53bc05addf8672995a57550fe089bba02d85810b8c2abf2b7e533a8e220d","observation_id":"8ee4c914-181f-481e-bcdc-8889895a1c0f","resolution":{"observed_at":"2026-07-01T20:56:13.576795Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"cited_work":{"arxiv_id":"2506.13351","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.13351","snapshot_observed_at":"2026-07-02T23:07:27.269519Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","venue":"cs.CL","work_id":"83c204e8-dd80-4a60-9021-954166f727a0","year":2025},"citing_paper":{"arxiv_id":"2606.08815","last_updated":"2026-06-07T20:08:36Z","snapshot_observed_at":"2026-07-06T23:48:16.585598Z","submitted_at":"2026-06-07T20:08:36Z","title":"Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T18:26:22.701076Z"},"links":{"cited_paper":"/paper/2506.13351","citing_paper":"/paper/2606.08815"},"observation_digest":"sha256:9a124da77df4828828c1cf115cf178478d2b64be317159f02d522e4adbc18b01","observation_id":"8d635831-158b-4d2e-9f7c-e682eb7be96e","resolution":{"observed_at":"2026-07-02T23:07:27.270961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13351","snapshot_observed_at":"2026-08-01T10:23:23.168854Z","title":"Direct reasoning optimization: Llms can reward and refine their own reasoning for open-ended tasks.arXiv preprint arXiv:2506.13351v1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27288","last_updated":"2026-07-29T14:46:04Z","snapshot_observed_at":"2026-08-03T19:05:39.789384Z","submitted_at":"2026-07-29T14:46:04Z","title":"Open Security Benchmark: Towards Autonomous Enterprise Cyber Defense","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T10:23:23.168854Z"},"links":{"cited_paper":"/paper/2506.13351","citing_paper":"/paper/2607.27288"},"observation_digest":"sha256:660f7a482381b68c40cc92402a1119bf0ec4c2734587a6eb0cb245dd4c2e9ed9","observation_id":"f2777606-e344-481d-91d4-74dea9cbc06a","resolution":{"observed_at":"2026-08-01T10:23:23.168854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13351/citation-record","integrity":"/paper/2506.13351/integrity","json":"/paper/2506.13351/citation-record.json","paper":"/paper/2506.13351"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.06963","last_updated":"2025-07-29T03:57:01Z","snapshot_observed_at":"2026-07-06T17:42:49.471518Z","submitted_at":"2024-03-11T17:47:30Z","title":"The pitfalls of next-token prediction","version":3},"cited_work":{"arxiv_id":"2403.06963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.06963","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The pitfalls of next-token prediction","venue":null,"work_id":"89b01901-dc9d-43f4-8c02-3c612086200c","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2403.06963","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:01d3260b810c9140417951376d0a8e63d453fd4078c39860938e62ad2514c13c","observation_id":"1c1b743d-b5eb-483e-b48c-637472cb1aaf","resolution":{"observed_at":"2026-05-19T09:52:14.138276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-07-06T19:46:24.121362Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":"2411.04282","doi":"10.48550/arxiv.2411.04282","metadata_source":"pith","pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"T., Savarese, S., Xiong, C., and Wang, H","venue":"cs.AI","work_id":"37baabdf-ea8c-4e71-a26b-e3aadca42a40","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:d1e3aaf472c795fb2f3f2d028623288ba6ee29a4fbd501d8db17df7e823a45ee","observation_id":"179665dc-1fcf-454b-9c3c-6bf43aa56ab8","resolution":{"observed_at":"2026-05-19T09:52:14.073815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.00050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:58:57.695120Z","title":"Enhancing uncertainty modeling with semantic graph for hallucination detection","venue":null,"work_id":"d3f2f979-3dda-4085-85f3-c8722fb1f679","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:2643f18da5d12c4b7ad516632cf606e4a584c8e7126d6d3627e10c24ada6e32a","observation_id":"6d886974-da84-403d-9a03-a5b3cba3403c","resolution":{"observed_at":"2026-05-19T09:52:14.087180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18116","last_updated":"2025-04-25T06:48:55Z","snapshot_observed_at":"2026-07-06T21:14:38.573913Z","submitted_at":"2025-04-25T06:48:55Z","title":"Think, Prune, Train, Improve: Scaling Reasoning without Scaling Models","version":1},"cited_work":{"arxiv_id":"2504.18116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.18116","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think, prune, train, improve: Scaling reasoning without scaling models.arXiv preprint arXiv:2504.18116","venue":null,"work_id":"0eb3f988-6ae2-4beb-9a72-47b2590d61a1","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2504.18116","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:afe41f90879989851d50e331eeaf9e1a1bc6b4b7847892d5914427c2e90864ba","observation_id":"b71a2602-5e4e-42db-bc26-2cf26d7a6d0f","resolution":{"observed_at":"2026-05-19T09:52:14.119976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":"2402.01306","doi":"10.48550/arxiv.2402.01306","metadata_source":"pith","pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","venue":"cs.LG","work_id":"28f4db09-e48a-458a-967b-755399c7d663","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:6209f2645e3627af89eeaaa94075dbd9d662f3c8429b438b28422784ee85b526","observation_id":"752909ee-b529-4540-8312-0ee5af3e777a","resolution":{"observed_at":"2026-05-19T09:52:14.105843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":"2411.15594","doi":"10.1016/j.xinn.2025.101253","metadata_source":"pith","pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Survey on LLM-as-a-Judge","venue":"cs.CL","work_id":"2676656a-67bd-4ad5-bad6-cb6f5fcdbfbe","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:6ae10515e2c0976d668894ffbf86b87a53885266c2ec5b7ddc4220b0bc6d474a","observation_id":"ad3a6eb2-fe66-45df-899e-6c975039dc0e","resolution":{"observed_at":"2026-05-19T09:52:14.103020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:20:01.818871+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:da417e5e7d1796990f42547692aa81304e1bd73496522807efd067f5cd6aa83a","observation_id":"73fb2433-34c9-418f-b41d-ea294dc85efb","resolution":{"observed_at":"2026-05-19T09:52:14.170732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10136","last_updated":"2024-04-15T21:02:48Z","snapshot_observed_at":"2026-08-04T06:52:33.518468Z","submitted_at":"2024-04-15T21:02:48Z","title":"Language Model Cascades: Token-level uncertainty and beyond","version":1},"cited_work":{"arxiv_id":"2404.10136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10136","snapshot_observed_at":"2026-07-03T11:18:03.484596Z","title":"Language model cascades: Token-level uncer- tainty and beyond.arXiv preprint arXiv:2404.10136","venue":null,"work_id":"fb994ffe-fa11-44c0-b33f-44cb9208fc91","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2404.10136","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:ded3e3a748194d8895f95aa5f55683a65e9f15d83d74ca8a087e923330899920","observation_id":"76a1baff-bdc8-4954-9157-54deaae169d3","resolution":{"observed_at":"2026-05-19T09:52:14.114295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:b7cc1885c619d7df4f9845d1648d0032e5d7d0f56808563629007abd75203da0","observation_id":"cfe89eaf-3165-4c07-abf4-1bc669127b95","resolution":{"observed_at":"2026-05-19T09:52:14.062147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00418","last_updated":"2025-06-03T04:43:45Z","snapshot_observed_at":"2026-08-03T22:44:59.556576Z","submitted_at":"2024-11-01T07:29:03Z","title":"Self-Evolved Reward Learning for LLMs","version":3},"cited_work":{"arxiv_id":"2411.00418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-evolved reward learning for llms","venue":null,"work_id":"8e15252a-ef9e-4358-8bc0-22f09fb4c98f","year":null},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2411.00418","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:b68cf1e174380c9050605babf0b30473779a4b83ac88bc65caaff904cc5692de","observation_id":"27fc0b52-f5ff-4bdb-a168-adbcd38d5fa2","resolution":{"observed_at":"2026-05-19T09:52:14.068048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-07-06T14:33:03.656499Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2212.10403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-07-02T19:27:18.690866Z","title":"Towards Reasoning in Large Language Models: A Survey","venue":"cs.CL","work_id":"d920638f-5831-406f-9ceb-41c99337b692","year":2022},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:041dbaa90984ab9dc7311516c1441f33bb331ad2e942d7131f9b3d63d077491f","observation_id":"474cd497-e9cc-4eb2-aaf9-b8898aceabd2","resolution":{"observed_at":"2026-05-19T09:52:14.148806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-11T03:17:51.754565Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:aeca3e4743d972f814f4f2cc0bfd6653f156245891d5e5acfe640542e69c1a6c","observation_id":"7202e720-1d9f-4df2-b612-4e6f98e094d0","resolution":{"observed_at":"2026-05-19T09:52:14.117083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14146","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"s3: You don’t need that much data to train a search agent via rl","venue":null,"work_id":"89f84d1b-8f81-40e8-b2a6-04aac62b27b8","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:156bf720424616a5ad62cbc62de6062744dc9fd8ea39b3ffe03793b522c75eee","observation_id":"a8b57cdf-c553-4123-9ce6-413cc63ce350","resolution":{"observed_at":"2026-05-19T09:52:14.181371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00241","last_updated":"2024-03-19T08:34:05Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T03:07:32Z","title":"CASIMIR: A Corpus of Scientific Articles enhanced with Multiple Author-Integrated Revisions","version":2},"cited_work":{"arxiv_id":"2403.00241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.00241","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Casimir: A cor- pus of scientific articles enhanced with multiple author-integrated revisions","venue":null,"work_id":"8ae611a3-b185-411e-8322-db4c2f681d9b","year":null},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2403.00241","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:7bfeb9ebc3017f6750d97a3bbadc4167edc6aba59c3d4bf43d1ea21a9ed0bf76","observation_id":"05bd0ce7-3127-4dea-9c8a-0f5d40bcb033","resolution":{"observed_at":"2026-05-19T09:52:14.108516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05222","last_updated":"2025-01-09T13:19:55Z","snapshot_observed_at":"2026-07-06T20:18:44.883632Z","submitted_at":"2025-01-09T13:19:55Z","title":"ParaRev: Building a dataset for Scientific Paragraph Revision annotated with revision instruction","version":1},"cited_work":{"arxiv_id":"2501.05222","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05222","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pararev: Building a dataset for scientific paragraph revision annotated with revision instruction","venue":null,"work_id":"a155c7af-e6cd-4522-91f1-6c379c434421","year":null},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2501.05222","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:68880e7d97d6f05b9f78acd395653709d17cbfa461ad6ef97664df920d9e768e","observation_id":"0cb9471e-feb2-4b79-9286-0d95976ef168","resolution":{"observed_at":"2026-05-19T09:52:14.065438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14859","last_updated":"2024-10-21T11:25:48Z","snapshot_observed_at":"2026-07-06T17:48:45.803098Z","submitted_at":"2024-03-21T22:08:44Z","title":"Log Probabilities Are a Reliable Estimate of Semantic Plausibility in Base and Instruction-Tuned Language Models","version":2},"cited_work":{"arxiv_id":"2403.14859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14859","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Log probabilities are a reliable estimate of semantic plausibility in base and instruction-tuned language models","venue":null,"work_id":"a61d6796-ac76-4518-8a03-3da1305982ce","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2403.14859","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:a0c3bda669fa1251c5e6d3191948b4418e7d80fa3056c40f926614b1a47d3a7f","observation_id":"99011ba1-ab7a-4c81-8572-1e6628cf102d","resolution":{"observed_at":"2026-05-19T09:52:14.129471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.5: Our most intelligent AI model","venue":null,"work_id":"b14921ea-2937-4581-bd26-e7211afede1e","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:7d84a833fd1fe63a3ef3c9dd172b748ced3320f7ec870d282b28cdb9ddb87190","observation_id":"103b764c-d556-4b2b-9bc6-2338fcdc6286","resolution":{"observed_at":"2026-05-19T10:03:02.362976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:33b01b0ddc72db8b604f2cbe1e692f4f2bfdfd5e3c980b0848ce51a0b414128e","observation_id":"707dcb62-1026-45f1-b86b-11462a399b4e","resolution":{"observed_at":"2026-05-19T09:52:14.135246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.18470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.583010Z","title":"Pan and H","venue":null,"work_id":"350b6461-07bc-469c-8a06-7ba712d7c0db","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:d4bd5ddd15284be7fec41e2e8fd30ee686e056e031e7f706cf352807b8ac7b89","observation_id":"2786c23c-680d-489f-9c4f-6d2f8954ec77","resolution":{"observed_at":"2026-05-19T09:52:14.080320Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:696ba63ff3fafc188f7eeadc12310aeb1da58703b94b6c63700376b9cb88c382","observation_id":"4aec18e5-fffe-4e03-8174-e28aba8cd4d8","resolution":{"observed_at":"2026-05-19T09:52:14.077117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft","venue":null,"work_id":"a97141dc-548c-4137-af3a-5ecd66138955","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:c3740f89d54d397d7bb7991096ca4a6bb43484d6132401b23c51214e6ab00fe0","observation_id":"e0278dc4-8130-4281-990a-5a781151c114","resolution":{"observed_at":"2026-05-19T10:03:02.361109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":"2501.19393","doi":"10.48550/arxiv.2501.19393","metadata_source":"pith","pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"s1: Simple test-time scaling","venue":"cs.CL","work_id":"806265b1-8f22-48dd-b8ad-a99823b18fa4","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:d0f6abb46eb1fbec162ac74b98354e61468cb87442fd2f51f0cd4aaa9e1aad64","observation_id":"09a83d25-af58-4e89-a882-da1e0dc94b45","resolution":{"observed_at":"2026-05-19T09:52:14.090011Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:52:44.227923+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:b94f308e3dd63fa35b4242e73dc9027cfdae879120c3a0a8c36f3ca53dc0ad52","observation_id":"ce90225b-c8f8-479b-bf1c-8504c24fbff9","resolution":{"observed_at":"2026-05-19T09:52:14.132222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:5ea23494d0179a3c1a9ada49cf2fa9833d39e7e8a1124634a49794bcc2e50901","observation_id":"7a06cae3-a6b7-4b61-87ee-2ee1a1e5f28d","resolution":{"observed_at":"2026-05-19T09:52:14.174956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:36e49263b729b83a2ef7adfe9c0958639bea9e2766143f2acce8e59a53fabd33","observation_id":"c0442bea-760a-4676-97e7-2fc13f8b4d84","resolution":{"observed_at":"2026-05-19T09:52:14.145232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-07-06T21:01:17.931818Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":"2503.23829","doi":"10.48550/arxiv.2503.23829","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Crossing the reward bridge: Expanding RL with verifiable rewards across diverse domains","venue":null,"work_id":"a1dbfba1-b433-4260-abc6-bf28628844b9","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:89074c2d7e85428d211d9bb3f84591ea3477a1f0dca649a1f228cc6cd14a7d1d","observation_id":"7745fa08-d56a-4cc0-aa9c-f06996f5d17d","resolution":{"observed_at":"2026-05-19T09:52:14.093197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19618","last_updated":"2025-05-28T14:42:09Z","snapshot_observed_at":"2026-07-06T20:58:23.695292Z","submitted_at":"2025-03-25T13:03:09Z","title":"Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data","version":2},"cited_work":{"arxiv_id":"2503.19618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19618","snapshot_observed_at":"2026-07-03T20:38:55.982366Z","title":"Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data","venue":null,"work_id":"03ad91b0-bdfa-4379-ba78-275537609db4","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.19618","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:14de2e1e2acdfc2bc83e3f5964783e231382d27f908b236ffdfb011b0d99452a","observation_id":"ed179084-8be9-4cb2-abeb-95217cf7a310","resolution":{"observed_at":"2026-05-19T09:52:14.141843Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03987","last_updated":"2023-08-12T14:57:37Z","snapshot_observed_at":"2026-07-06T15:51:43.130122Z","submitted_at":"2023-07-08T14:25:57Z","title":"A Stitch in Time Saves Nine: Detecting and Mitigating Hallucinations of LLMs by Validating Low-Confidence Generation","version":2},"cited_work":{"arxiv_id":"2307.03987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.03987","snapshot_observed_at":"2026-07-02T07:26:46.313156Z","title":"arXiv preprint arXiv:2307.03987 (2023)","venue":null,"work_id":"ed2401c9-d6cb-44af-8ff9-07841e73e642","year":2023},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2307.03987","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:22304138e145857ed2ce81cc1a8c3f8d21342804b20cfaa454de3af10f698e0b","observation_id":"4e99e11f-e55e-4aa3-80d5-5f162e0ee8da","resolution":{"observed_at":"2026-05-19T09:52:14.126420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08672","last_updated":"2025-04-11T16:26:23Z","snapshot_observed_at":"2026-07-06T21:08:01.403325Z","submitted_at":"2025-04-11T16:26:23Z","title":"Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning","version":1},"cited_work":{"arxiv_id":"2504.08672","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.08672","snapshot_observed_at":"2026-07-01T20:56:13.698844Z","title":"Genius: A generalizable and purely unsupervised self-training framework for advanced reasoning","venue":null,"work_id":"2fe7545d-8ef7-4686-989b-8f2490253877","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2504.08672","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:a0b102fb3b915c3cf41e09b6417130ddfb859ef839a7d9639897b25d27eff129","observation_id":"415cfe12-9a22-4b4a-8b22-8b65b53e2caf","resolution":{"observed_at":"2026-05-19T09:52:14.122863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":"2502.03387","doi":"10.48550/arxiv.2502.03387","metadata_source":"pith","pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"LIMO: Less is More for Reasoning","venue":"cs.CL","work_id":"04106d5b-ee5a-4d24-b54a-afec9c42d290","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:77d3dee06e911dbf5a7f55b67e062221810c9eda4b2ba2216e5197751cde450e","observation_id":"95300ed3-3406-401a-a6fc-5af3c0cdc81e","resolution":{"observed_at":"2026-05-19T09:52:14.059223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:afa6025bfc9ffc4a500cc189c0f7ad41ddedd90663a9c7f5bddd1faa182d97ce","observation_id":"c92f8f91-3a7a-4a5d-94f8-4032ea539520","resolution":{"observed_at":"2026-05-19T09:52:14.083201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-07-10T22:47:36.894457Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:204e81952063c1cf05ce637cdf1ed758a39a22126f40eac7bbdca583bd43399e","observation_id":"fa98ac6d-2f5b-4c26-8992-8370e5586ff0","resolution":{"observed_at":"2026-05-19T09:52:14.097098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14135","last_updated":"2024-12-18T18:24:47Z","snapshot_observed_at":"2026-08-03T23:00:22.560900Z","submitted_at":"2024-12-18T18:24:47Z","title":"Scaling of Search and Learning: A Roadmap to Reproduce o1 from Reinforcement Learning Perspective","version":1},"cited_work":{"arxiv_id":"2412.14135","doi":"10.48550/arxiv.2412.14135","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14135","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling of search and learning: A roadmap to reproduce o1 from reinforcement learning perspective","venue":null,"work_id":"6a0e5e21-c5d9-4094-9ee7-58c92f267e2b","year":2024},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2412.14135","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:67de0646fb84af6bb34c86d48dc7028b61e9140d2262f0079ea5b31a7afda0ad","observation_id":"e9b1f88b-5d58-4037-921a-64db6211d813","resolution":{"observed_at":"2026-05-19T09:52:14.111450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":"2210.03493","doi":"10.48550/arxiv.2210.03493","metadata_source":"pith","pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Automatic Chain of Thought Prompting in Large Language Models","venue":"cs.CL","work_id":"c3739d30-4ba4-47ca-a8c7-41daf3b51e71","year":2022},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:b61b8078f83b67ed85069d40d737a997f42cfd337139736eace7df13ee5dbbf6","observation_id":"74be46e2-347f-41b3-9412-e3c4e10abec1","resolution":{"observed_at":"2026-05-19T09:52:14.178050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-07-06T21:19:34.329442Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":"2505.03335","doi":"10.48550/arxiv.2505.03335","metadata_source":"pith","pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-07-10T18:17:33.800267Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","venue":"cs.LG","work_id":"b59092c4-76ed-4c78-9006-312bde2e40a6","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:83aff808a3fce1a05b20d3524d7227eeae3c50bd6ce3c30758e7adc3a03ff6dc","observation_id":"7200d265-0d91-40f9-b422-a5fac556602d","resolution":{"observed_at":"2026-05-19T09:52:14.070782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:59.097203+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:64dc424528a4bb11d3efab182ddd7f6b17e2410e24fbf1d54419d66ca6f576aa","observation_id":"09f1d75b-3d1f-411a-81d3-dc06e696881d","resolution":{"observed_at":"2026-05-19T09:52:14.184491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2504.16084","doi":"10.48550/arxiv.2504.16084","metadata_source":"pith","pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"TTRL: Test-Time Reinforcement Learning","venue":"cs.CL","work_id":"54ef1983-e8f7-4b17-9b74-6155b56c8b00","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:bff1c2c0a7dbc8df68a67f228654c15b5d5d0bac9f6e29b1b550d1259f605392","observation_id":"cb697b38-80ee-4fda-8a36-4d881b70c9f2","resolution":{"observed_at":"2026-05-19T09:52:14.100204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":30,"verified_fuzzy":2},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 4 inbound Pith citation observations for arXiv:2506.13351."}