{"as_of":"2026-08-07T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21e8b1334aaf9c1cf3350a0cd6364954df912ca7b1e3d4834fd499b19af7a35f","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:38:09.609972Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.20256/citation-record","integrity":"/paper/2605.20256/integrity","json":"/paper/2605.20256/citation-record.json","paper":"/paper/2605.20256"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.904895Z","title":"Minif2f: a cross-system benchmark for formal olympiad-level mathemat- ics","venue":null,"work_id":"a246aec4-3da4-47fb-a965-9759670b59b6","year":2022},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:9e7cb99ff710f4cbc1cd79323f353950b7879b140d3d29a39a198e8543ddb3a1","observation_id":"8158e572-a45c-4f6b-98fe-b5f5991614b9","resolution":{"observed_at":"2026-07-08T03:44:29.906125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01622","last_updated":"2024-10-23T15:02:57Z","snapshot_observed_at":"2026-08-03T17:10:32.264100Z","submitted_at":"2024-02-02T18:39:51Z","title":"TravelPlanner: A Benchmark for Real-World Planning with Language Agents","version":4},"cited_work":{"arxiv_id":"2402.01622","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01622","snapshot_observed_at":"2026-07-04T09:59:45.572230Z","title":"Travelplanner: A benchmark for real-world planning with language agents","venue":null,"work_id":"0cdaf974-0c0f-40ba-a494-df547f664899","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2402.01622","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:a7d18d19ca5fe5ab7b89df82a42cfee00e1c44a95f594af50f4b1c68dbfa563f","observation_id":"46bbace4-1160-4249-9603-213313f6a2a4","resolution":{"observed_at":"2026-07-01T14:55:48.262269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:8257dc8b4995047451674bd968c8f5537a07b067f4dc303b870864df8817159f","observation_id":"dbbc1452-4ab8-4b96-abff-b80eb66459a7","resolution":{"observed_at":"2026-07-01T14:55:48.256309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:368db1e131f0354c9692c468fb686f7524cbeb9a0d4f171b6d5e4f6eebd18e26","observation_id":"59e770ff-1a96-4679-a5d8-cafb82a1ea4c","resolution":{"observed_at":"2026-07-01T14:55:48.283447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:a56e71ede8073c8e6a3259c36f042f90f541cb6e9cc206cd25f8ee97cdea6cb3","observation_id":"a6151876-ba61-428d-b574-e0e569814d44","resolution":{"observed_at":"2026-07-01T14:55:48.276567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.906870Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"cf873a4c-b464-484b-962f-deed0102ea97","year":2022},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:3c038a0863ac1832775188a7bc402be9a8f943119ff2cf593772bd742deefb83","observation_id":"fba08b0a-187b-4564-95fb-8c87d673f41c","resolution":{"observed_at":"2026-07-08T03:44:29.908097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:57974842fd53f7442ec70d521cc665fedb7ea978d017a21b5525bda10b281c19","observation_id":"2d246294-27db-41e4-8094-dcd04e7434af","resolution":{"observed_at":"2026-07-01T14:55:48.279183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.908712Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"7a024e41-b875-4015-abbc-070b40d14125","year":2023},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:7c6b8217cff826a2611dd6f1bb769472c03483e21bec6c16f63191cfe49233f0","observation_id":"2d5e0a45-f96f-456e-aaea-1d57fd339105","resolution":{"observed_at":"2026-07-08T03:44:29.910177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.903102Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"b0eb6047-b3d0-4f84-8366-97d0ccb602f2","year":2023},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:f710602bbecfe5358343bcf449e7645255f1cbae3c86742faec346782ae734bf","observation_id":"111c27f2-ad05-4fdc-ab6a-c28212bd77aa","resolution":{"observed_at":"2026-07-08T03:44:29.904279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.899013Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":"3a56be76-314c-4554-9bfe-25f49d85a42e","year":2023},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:be32f90dfb0fe098936e88d68d4f67e51b8e9c9548a0c4c9c1c07ddc93454e0c","observation_id":"31389433-791c-4249-9512-441e860fe66f","resolution":{"observed_at":"2026-07-08T03:44:29.900407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.901349Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":"c726910d-4426-4f75-9ae9-c583edf70584","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:b177933db241ed797f57420fd9621959277e4a739ed7fffca64ca796d865cab3","observation_id":"75573ef9-c1df-4fa6-9239-8102996716bc","resolution":{"observed_at":"2026-07-08T03:44:29.902508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:5ef6eb5b17b53b4b1bb01eebc53fe49de2db48c3cc8adfec179876f473638169","observation_id":"a88a53a4-6b40-4b3d-999b-3550d06a8dd9","resolution":{"observed_at":"2026-07-01T14:55:48.287734Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:1f1640a3a36b331e3fe63001a899a6b5721eb184536192b5539df0cc2f24c932","observation_id":"468692c0-e142-4be7-8418-8c0a3f8749da","resolution":{"observed_at":"2026-07-01T14:55:48.262531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":"2310.01798","doi":"10.48550/arxiv.2310.01798","metadata_source":"pith","pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","venue":"cs.CL","work_id":"f63b261b-ef16-40f5-993b-9d37b1a51b92","year":2023},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:e71beb2deb06d18d7f9a5feb6136e1b3cd84aa1fbc2f09affbe7c79f38f008d8","observation_id":"053351d8-a1f8-4de5-8a8b-9de39a0419ff","resolution":{"observed_at":"2026-07-01T14:55:48.273946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.048248+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.048248+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:39ddf1968d83314c01d56b3f51204c99be28df9239b5990fb8098dc87db0d660","observation_id":"8e62c7fa-3064-4aa4-ba16-018c874f5038","resolution":{"observed_at":"2026-07-01T14:55:48.259700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.896844Z","title":"Math-shepherd: Verify and rein- force llms step-by-step without human annotations","venue":null,"work_id":"cc6505d1-08d2-48a8-8e24-fca0ed489228","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:024b455f50020000ddfd825bcdb086106a551cd55dd7adac2ef5eeba15d1ee08","observation_id":"b0dfe489-aae0-40a6-804c-cd4b4559b40f","resolution":{"observed_at":"2026-07-08T03:44:29.898384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.894931Z","title":"Critic: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":"79886ac8-2eaf-4596-86bd-a38fd1a2ee8a","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:a8529d00b3d57547aa940c58f574eda3c9ecdaf91c263a8dfd8dedcb0400e2a3","observation_id":"e90d92ab-85e5-4b7e-915a-3c958f7e8585","resolution":{"observed_at":"2026-07-08T03:44:29.896197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.891118Z","title":"Generating sequences by learning to self-correct","venue":null,"work_id":"ea088d07-3c83-45f8-8df2-5227e13b4fa9","year":2023},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:656da9cc6924da51751341dee87732fe4d4a5a66e29fffdcd75251eadb2e9f49","observation_id":"3cc9602d-eacd-45e8-80d9-d632ab112720","resolution":{"observed_at":"2026-07-08T03:44:29.892292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:8d8ad1f677060af3dfe22a3ee0e4e615022e6b715ca98025a79de6c5c1f100e3","observation_id":"5c49ffdd-5c4a-433c-a872-1b3b56046084","resolution":{"observed_at":"2026-07-01T14:55:48.280312Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.882530Z","title":"Self-rewarding language models","venue":null,"work_id":"6f5246dd-241b-4ae5-aa56-c6208cac5984","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:a16588d43806b2ac7a38c74e1f6c25e73434e49b05263ee3c46ec95a4232b1d0","observation_id":"62cfb1a4-fa64-47c8-be10-747a8cd75bf1","resolution":{"observed_at":"2026-07-08T03:44:29.883887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.889153Z","title":"Rl on incorrect synthetic data scales the efficiency of llm math reasoning by eight-fold","venue":null,"work_id":"0f3954be-e6df-4072-9fcc-67a7ec388553","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:bf8732fd87bc78426e231a00e7e7fc32f925669ca855717cbc2cc7d319b4e991","observation_id":"2187babb-5a66-4b0e-9bc3-f61a0dd94ef3","resolution":{"observed_at":"2026-07-08T03:44:29.890515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:31fb9730e3cf0114f69dd429a2a4341206947304f66519955309a547c9a42c22","observation_id":"05bf0cfb-0094-4d53-977e-58f0dab65e35","resolution":{"observed_at":"2026-07-01T14:55:48.267554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:59539e26acd0b5462527c3cfb71cb68db4f408302c959bc4630be928d643e303","observation_id":"0b52c1f3-20d6-414c-a0f4-58cce9c5c2f5","resolution":{"observed_at":"2026-07-01T14:55:48.277325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:93f1fe5e3e0850e87ef3517ad80347cd46135bdcae3866ab6490289a89ec9bcc","observation_id":"d49d42a1-cc67-4d85-ab7d-241102b51bb8","resolution":{"observed_at":"2026-07-01T14:55:48.264942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":"2504.20571","doi":"10.18653/v1/2024.acl-long.643","metadata_source":"pith","pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","venue":"cs.LG","work_id":"75a5258b-4143-4f2f-99f3-6d950a496305","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:fd2ebdb338e7b261ea8f579ae5727e233f77c00693eff7b05cc8f506fb11462f","observation_id":"b90a97b5-82a6-4100-81b2-cd3ab7c3b356","resolution":{"observed_at":"2026-07-01T14:55:48.284952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.884561Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":"4668de33-7020-4cd0-849d-e973a10461d0","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:da948112b34e40d12c7ebfac7928ed526ecff646912867c56eccae5440ace3e8","observation_id":"ca022e7d-b208-48d7-a81b-30f6cfedad54","resolution":{"observed_at":"2026-07-08T03:44:29.885989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10717","last_updated":"2025-08-23T15:18:17Z","snapshot_observed_at":"2026-08-05T20:37:15.873031Z","submitted_at":"2025-02-15T08:18:58Z","title":"Constraining Statistical Isotropy using 21cm Power Spectrum and Bispectrum","version":2},"cited_work":{"arxiv_id":"2502.10717","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.10717","snapshot_observed_at":"2026-07-01T14:55:48.269576Z","title":"Beyond grpo: Tree-search enhanced reinforcement learning for reasoning","venue":null,"work_id":"3d53b301-5280-4afe-8a2a-241069f87ee8","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2502.10717","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:ddc422def94ffa4f5f124a54622c921ab5ded20930ef69279bd12a3d500b6735","observation_id":"0d7f93e4-ae92-4d01-809f-91873f02c73f","resolution":{"observed_at":"2026-07-01T14:55:48.271182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:55:48.289044Z","title":"Exploration–exploitation trade-off in reinforcement learning for large language models","venue":null,"work_id":"a3f36091-93cb-4c6c-b4db-defb38af4e42","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:f24ff0b6f1e07420b7fea04940e8cc63c3832c08284387ade46f0b24e0637860","observation_id":"736b2028-1a9e-4653-842f-5086b3d901ee","resolution":{"observed_at":"2026-07-01T14:55:48.290623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.886601Z","title":"Recursive introspection: Teaching language model agents how to self-improve","venue":null,"work_id":"2d285745-70bd-43e0-8830-7608410c8810","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:6abd7aae14c6ca1ca52231f8d78d9750924d3d50984e531974959e976fd21d1a","observation_id":"a321ba01-88cc-4b99-8406-10ed859c32b0","resolution":{"observed_at":"2026-07-08T03:44:29.888447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":"2408.03314","doi":"10.18653/v1/2025.acl-long.1486","metadata_source":"pith","pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","venue":"cs.LG","work_id":"a8d50b24-bdf5-46ed-bc4f-2927dfd81f1d","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:ce1543979a54ae66506788606c2a3ebbeccfd9cec1ccb1e60a610773594dc022","observation_id":"bb098042-05dc-4cbe-8b8c-d0dffae9c050","resolution":{"observed_at":"2026-07-01T14:55:48.290536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.892931Z","title":"Training large language models for reasoning through reverse curriculum reinforcement learning","venue":null,"work_id":"9266bfe3-00a5-49d3-badb-b2f725afaf6e","year":2024},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:984f2dd4f05046cf17b8b399005004717d99e9577372b1aec5c6463e34a360b1","observation_id":"cf5e7e3c-9472-4968-8ee3-73a547e12a96","resolution":{"observed_at":"2026-07-08T03:44:29.894355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T18:38:09.609972Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2605.20256"},"observation_digest":"sha256:9eccdc974a0dff9b5db70b244fb2b1f368461096ee635b41da0efc453f62e760","observation_id":"e8c59bb4-f092-4d46-a3cb-c031ef797bff","resolution":{"observed_at":"2026-07-01T14:55:48.265222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20256","last_updated":"2026-06-28T10:49:31Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T15:09:03.387276Z","submitted_at":"2026-05-18T12:48:36Z","title":"FBOS-RL: Feedback-Driven Bi-Objective Synergistic Reinforcement Learning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":18,"verified_fuzzy":14},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2605.20256."}