{"as_of":"2026-08-11T05:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70cba57c5697497c5b24f986dd4d6e4b8cd7c5d016f7ae74409395767573f44c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T15:49:44.263123Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T10:07:39.554999Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-30T12:44:40.165250Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"cited_work":{"arxiv_id":"2505.07527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07527","snapshot_observed_at":"2026-06-30T12:44:40.165250Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","venue":"cs.LG","work_id":"74176827-8c58-4da0-92e3-82a54f94491c","year":2025},"citing_paper":{"arxiv_id":"2604.23056","last_updated":"2026-04-24T22:54:40Z","snapshot_observed_at":"2026-08-10T23:09:16.257998Z","submitted_at":"2026-04-24T22:54:40Z","title":"K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:27.571169Z"},"links":{"cited_paper":"/paper/2505.07527","citing_paper":"/paper/2604.23056"},"observation_digest":"sha256:7ad97ce640a6b71971600d3ffe9997996fbe82b875d7ba6e613ac834046908c4","observation_id":"8c11dbf0-e383-4487-848a-3fc79f54b69c","resolution":{"observed_at":"2026-05-11T19:21:09.801008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"cited_work":{"arxiv_id":"2505.07527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07527","snapshot_observed_at":"2026-06-30T12:44:40.165250Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","venue":"cs.LG","work_id":"74176827-8c58-4da0-92e3-82a54f94491c","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T07:00:32.206081Z"},"links":{"cited_paper":"/paper/2505.07527","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:a6e50f39a18ebcec36a33f7b97f86130c0f2c6c44661457c70c8015ab63f5508","observation_id":"c9146da6-0b66-425c-93b1-55f60eab6a53","resolution":{"observed_at":"2026-05-12T10:16:27.330837Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"cited_work":{"arxiv_id":"2505.07527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07527","snapshot_observed_at":"2026-06-30T12:44:40.165250Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","venue":"cs.LG","work_id":"74176827-8c58-4da0-92e3-82a54f94491c","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T23:47:53.282259Z"},"links":{"cited_paper":"/paper/2505.07527","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:ccbf4e65fa45dc02ae94d0147792a9b3157fa8addec27bcbb44501748ea602c0","observation_id":"bc0b0d50-775a-4cc3-95d7-dfcc27783808","resolution":{"observed_at":"2026-05-20T23:49:14.938994Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"cited_work":{"arxiv_id":"2505.07527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07527","snapshot_observed_at":"2026-06-30T12:44:40.165250Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","venue":"cs.LG","work_id":"74176827-8c58-4da0-92e3-82a54f94491c","year":2025},"citing_paper":{"arxiv_id":"2606.28707","last_updated":"2026-06-27T03:25:53Z","snapshot_observed_at":"2026-07-07T00:02:47.924620Z","submitted_at":"2026-06-27T03:25:53Z","title":"BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-30T10:07:39.554999Z"},"links":{"cited_paper":"/paper/2505.07527","citing_paper":"/paper/2606.28707"},"observation_digest":"sha256:cc050507833bc8844018a9d3a8e92eb9e657060d6969ee81e407d3036a7bc241","observation_id":"80214a48-80f4-4075-b238-ddc558fa6ac7","resolution":{"observed_at":"2026-06-30T12:44:40.166695Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07527/citation-record","integrity":"/paper/2505.07527/integrity","json":"/paper/2505.07527/citation-record.json","paper":"/paper/2505.07527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:f39ccb55111b6bd16e5395ebe5f0db293ac4fd1b6b4bf3411b6fab638cea00b7","observation_id":"25961d7c-7140-45db-844c-b65f30441bcb","resolution":{"observed_at":"2026-05-22T15:51:45.675038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":"2401.01335","doi":"10.48550/arxiv.2401.01335","metadata_source":"pith","pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","venue":"cs.LG","work_id":"6b7f0773-4e99-4274-9d8e-279a1f25c5e1","year":2024},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:050da1ad3d236fc23e55f727fa4f19a17ad561d3f8c5400044d5a57b81999a6f","observation_id":"3bbc3474-3d89-46b1-81b0-83b7fa8e909d","resolution":{"observed_at":"2026-05-22T15:51:45.628910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.040609Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30","venue":null,"work_id":"a63ca98b-8916-47bd-bd9b-d0c693024f4c","year":2017},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:f0b5199c294ef2c601d21e9b022d061d5dc75b3c6b4d61d694dc32ea25299088","observation_id":"5c392379-317a-4249-853b-1267ffc0f834","resolution":{"observed_at":"2026-05-22T15:51:46.207809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":"2402.01306","doi":"10.48550/arxiv.2402.01306","metadata_source":"pith","pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","venue":"cs.LG","work_id":"28f4db09-e48a-458a-967b-755399c7d663","year":2024},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:8aa2bc0288c582e33e4f1aa28374d3b0b606d4ed0d54b8b37b82620230fe9a98","observation_id":"ed0f3391-e43e-45a7-8914-0450d9384e14","resolution":{"observed_at":"2026-05-22T15:51:45.705241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.260479+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.260479+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"d183e26c-4c68-4f77-9222-adb4e470bad1","year":2018},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:048c2447da16ceda5a8046db2f61b2a53450e6fb468acdaffe89bef17617c3ef","observation_id":"ab189571-d92c-4e31-a563-b8f435f50c8e","resolution":{"observed_at":"2026-05-22T15:51:46.223065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":"2308.08998","doi":"10.1126/sciadv.abg6611","metadata_source":"pith","pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforced Self-Training (ReST) for Language Modeling","venue":"cs.CL","work_id":"db054f5c-62a3-405b-aae8-43e02c39f672","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:2001e0df4b0c535e3241a422c6fe1b0a84362d53d056706efffad05a28bbb69d","observation_id":"b7bcddd2-4d4b-4d9e-9b28-5725af001341","resolution":{"observed_at":"2026-05-22T15:51:45.634446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:cafe8fc76239e2cc9d62d06fec7b5f79e8f1f03ae40d3228a7dfed80c3dbe788","observation_id":"5421bf75-b042-4d23-904e-9e889de9bd6d","resolution":{"observed_at":"2026-05-22T15:51:45.690186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:f16c8913b2eed7a40202898452f67e11645ba5691033f0f99677382c3023a33c","observation_id":"b9a4d2fc-82d9-45f8-b5ea-511557d7374a","resolution":{"observed_at":"2026-05-22T15:51:45.699715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T21:38:16.985704+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:16.985704+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:16.985704+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":"295a6bc2-f3d8-465b-842b-c978f0aa4bf4","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:7127e2acfbc5939ce7fd3cb2971b6ca201968d3592b9fe1ba3e6eb7e1d3293e9","observation_id":"6d86d9e5-fff9-4d18-960b-482f72409ad1","resolution":{"observed_at":"2026-05-22T15:51:46.255448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:d4c68d2ffc95bfb79fa8f3a02538ea5660fcc2a96882d67adbf909c274b10f1a","observation_id":"9a230ab0-e798-42e9-805b-69b896b14f7b","resolution":{"observed_at":"2026-05-22T15:51:45.695064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:c63e004d39d55f147ffd96f3ebe8b645f29d288a1437a436b57b07c42da80292","observation_id":"d2aa0290-cb5c-4d89-a61d-df36ce13886e","resolution":{"observed_at":"2026-05-22T15:51:45.648565Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:a2fc27389c04718750ebf5c88bf1199681f8e79bcb88a08930d3bf79e1a8f472","observation_id":"aae992a3-4e35-49dd-aeec-e15126a143ae","resolution":{"observed_at":"2026-05-22T15:51:45.670408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforce- ment learning","venue":null,"work_id":"60b44170-16d2-4cdd-b86b-130381e2daf0","year":1928},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:6e95a1274217f4ae34a347e3287045ee4865d88bf4d1d60df88cb020b9b1f83b","observation_id":"f098e854-5555-4e31-88ba-005aabf4d6a1","resolution":{"observed_at":"2026-05-22T15:51:46.243639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:40e35ef9658d73f6142494694f13ba9d2448f1ec06c15a2b1a3d91e508a06889","observation_id":"741670e6-7972-4a48-bedd-1e53fa95df16","resolution":{"observed_at":"2026-05-22T15:51:45.679941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tiny-grpo math tasks dataset","venue":null,"work_id":"89df103e-3200-4e66-86a7-125507a19709","year":2024},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:e765d2ce84fac7d17153d54ac653ad034adc5e955cbd2834227a642fe28379fa","observation_id":"92ac8461-ff0a-4f85-b3c7-8770b39c976e","resolution":{"observed_at":"2026-05-22T15:51:46.269712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:9ffb2509de6b6a9581c265ed3b1b490a254ccd3c60daa86dc68eb05a98fd1f7b","observation_id":"ceaee7c1-da07-431c-ae74-1abfe8fef9fb","resolution":{"observed_at":"2026-05-22T15:51:46.234274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:04:08.151364Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"3d7bd959-c9d3-4e23-8061-2a337b9ebfb3","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:c2b68cbfeb7a1b010e57dbaa1a6612d075b593a2696d7609a96b33a3b2c11160","observation_id":"6c6d88f8-2e9f-492e-840c-505b8c086ef6","resolution":{"observed_at":"2026-05-22T15:51:46.239415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:37:16.167544Z","title":"Trust region policy optimization","venue":null,"work_id":"a3842771-6e88-4055-a9e3-a5d5f695dfc7","year":2015},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:e87d402f351839f88e9c6f920bed1ce79e5fceabd015ac471c493fbd8eaefe8c","observation_id":"9b90aaba-af82-4e8a-91b9-25e702432640","resolution":{"observed_at":"2026-05-22T15:51:46.247515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:8d536185e7ad12da9d210858e706ff661738095aa287927e634e8edb988fdcec","observation_id":"3a4c5fa6-4170-486d-839f-aa3baebb32a9","resolution":{"observed_at":"2026-05-22T15:51:45.665672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:a2cf7cbd5757bf26058a95a4c7f33493bd72102949c01e15200e7ab80082daf6","observation_id":"098193a6-8410-4310-a8a4-e65b507792d0","resolution":{"observed_at":"2026-05-22T15:51:45.659957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation.Advances in neural information processing systems, 12","venue":null,"work_id":"cd717f70-7518-4e05-a4f6-5071e3bf241f","year":1999},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:b115ba288782ea6ac84c0a721465b6a4c11eb090d6ef8cdef855afc9df1414bb","observation_id":"16cf6ee6-9cb2-46a2-990c-9b69aa0e85bb","resolution":{"observed_at":"2026-05-22T15:51:46.215922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T22:42:58.894866Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"1f8d1169-4b4f-438f-9b09-f3b07f8a3f37","year":2012},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:eceb03545aef418bee300df198fbd83d153c8306c1df71872c7c3d859de2ae82","observation_id":"b21c3ea2-5585-4556-b2ca-62fa64fd7165","resolution":{"observed_at":"2026-05-22T15:51:46.211852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10176","last_updated":"2024-11-03T03:48:02Z","snapshot_observed_at":"2026-08-06T07:29:34.258050Z","submitted_at":"2024-02-15T18:26:11Z","title":"OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset","version":2},"cited_work":{"arxiv_id":"2402.10176","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.10176","snapshot_observed_at":"2026-07-10T18:17:33.884574Z","title":"Openmathinstruct-1: A 1.8 million math instruction tuning dataset.arXiv preprint arXiv: Arxiv-2402.10176","venue":"cs.CL","work_id":"9000f710-e68c-43ea-854e-4e984f57f380","year":2024},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2402.10176","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:5b10f355e82284c59a7ebc86083e4c8a10fbc013021efaace6534a51a8124c99","observation_id":"f2e1eab8-a5dc-448a-9fcc-ecfb27978475","resolution":{"observed_at":"2026-05-22T15:51:45.642038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:1046cf3d374c4021a43332c9092932e29390d2da6deb2c7877b43976c2140117","observation_id":"3a1261fc-ebbc-4e11-8e24-588501fc336d","resolution":{"observed_at":"2026-05-22T15:51:45.654922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"e689639c-8d66-457f-bfd7-af30c2834a4d","year":2016},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:968a743107822dd8119ea3f55a3f53309270c528d2c8dc7bcce9479eb42b24c1","observation_id":"3e6a0e3e-d178-4ce9-a48c-e126da7efb4c","resolution":{"observed_at":"2026-05-22T15:51:46.262551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aime problem set: 1983–2024","venue":null,"work_id":"6496b8cb-8ac9-437c-866d-1216f2167cc5","year":1983},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:068e565a42c1a0b62826ebbddd15cb027c3e4c3f1396507e6873ded132b86b33","observation_id":"4a369a7f-6f62-4214-ad9c-d5e80188561f","resolution":{"observed_at":"2026-05-22T15:51:46.230411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-intersection traffic optimisation: A benchmark dataset and a strong baseline.IEEE Open Journal of Intelligent Transportation Systems, 3:126–136","venue":null,"work_id":"be94ab80-cc47-4910-acca-bea180a70686","year":2021},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:3c93944fc0d2f5d4fce8451099559a369538ba871f03351e90d3865b827f9e3b","observation_id":"3a51b174-adb8-430c-9b7c-fc2801e4f4fe","resolution":{"observed_at":"2026-05-22T15:51:46.226713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft expert reward learning for vision-and-language navigation","venue":null,"work_id":"ea6f4426-f582-4281-bdb2-d22a14864465","year":2020},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:418d21f26914600f0a8a77c96d51dc9fa8ac8e3a32c404f8dabd226d5c4d65eb","observation_id":"c5100b9e-2bab-498c-ab30-b5f518f8c777","resolution":{"observed_at":"2026-05-22T15:51:46.266182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":"02d84b5d-dabb-4765-a52c-339278c5a0bc","year":1995},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:85b762e4b13bfb71becbe156a26df009d01dc5567fa5fd45dc6a7e1fd29bd3e5","observation_id":"ddf5a0f0-c074-401e-b154-fe352a500b3e","resolution":{"observed_at":"2026-05-22T15:51:46.251172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:5a4b90c92da4d8e7d101362aff73081da1666c5f9a9b2b0b2c816e73b76baf9d","observation_id":"c7cb80a5-9253-417f-a78f-1b3c45744716","resolution":{"observed_at":"2026-05-22T15:51:45.685027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"fixed value","venue":null,"work_id":"d8197963-6f2c-4306-a577-e1cabb6d5a99","year":2023},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:48399aff45e227b1719a6924250fd26579728ded87a23a2ce1b0dd386788bc0c","observation_id":"b2df3508-e3b9-4a0e-ba58-aab5762e3347","resolution":{"observed_at":"2026-05-22T15:51:46.219463Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"type\": “Algebra","venue":null,"work_id":"2a21bf85-73e2-4425-be9a-0dea8d41c5ea","year":null},"citing_paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T15:49:44.263123Z"},"links":{"citing_paper":"/paper/2505.07527"},"observation_digest":"sha256:cf74ec33663c67b278e814c5f756ae2dda2ad50aade12b87fe888d25b7ff7b2f","observation_id":"1cf9a237-883a-4fc7-abb5-459b8cad96c9","resolution":{"observed_at":"2026-05-22T15:51:46.258983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07527","last_updated":"2026-04-21T19:04:07Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T13:09:49Z","title":"Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":15,"verified_fuzzy":16},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2505.07527."}