Pith. sign in

Paper Citation Record · LEDGER

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 4 inbound Pith citation observations for arXiv:2505.07527.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.07527 v5

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-22T15:49:44.263123Z

measured 36 of 36 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-30T10:07:39.554999Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-06-30T12:44:40.165250Z

Reference resolution

32 of 32 outbound references displayed

  • verified exact15
  • verified fuzzy16
  • unresolved0
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 25961d7c-7140-45db-844c-b65f30441bcb · outbound

This paper cites GPT-4 Technical Report.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning GPT-4 Technical Report

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.675038Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:f39ccb55111b6bd16e5395ebe5f0db293ac4fd1b6b4bf3411b6fab638cea00b7

Observation 3bbc3474-3d89-46b1-81b0-83b7fa8e909d · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.628910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:050da1ad3d236fc23e55f727fa4f19a17ad561d3f8c5400044d5a57b81999a6f

Observation 5c392379-317a-4249-853b-1267ffc0f834 · outbound

This paper cites Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.207809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:f0b5199c294ef2c601d21e9b022d061d5dc75b3c6b4d61d694dc32ea25299088

Observation ed0f3391-e43e-45a7-8914-0450d9384e14 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning KTO: Model Alignment as Prospect Theoretic Optimization

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.705241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:8aa2bc0288c582e33e4f1aa28374d3b0b606d4ed0d54b8b37b82620230fe9a98

Observation ab189571-d92c-4e31-a563-b8f435f50c8e · outbound

This paper cites Addressing function approximation error in actor-critic methods.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Addressing function approximation error in actor-critic methods

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.223065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:048c2447da16ceda5a8046db2f61b2a53450e6fb468acdaffe89bef17617c3ef

Observation b7bcddd2-4d4b-4d9e-9b28-5725af001341 · outbound

This paper cites Reinforced Self-Training (ReST) for Language Modeling.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Reinforced Self-Training (ReST) for Language Modeling

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.634446Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:2001e0df4b0c535e3241a422c6fe1b0a84362d53d056706efffad05a28bbb69d

Observation 5421bf75-b042-4d23-904e-9e889de9bd6d · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.690186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:cafe8fc76239e2cc9d62d06fec7b5f79e8f1f03ae40d3228a7dfed80c3dbe788

Observation b9a4d2fc-82d9-45f8-b5ea-511557d7374a · outbound

This paper cites Soft Actor-Critic Algorithms and Applications.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Soft Actor-Critic Algorithms and Applications

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.699715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T21:38:16.985704+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:f16c8913b2eed7a40202898452f67e11645ba5691033f0f99677382c3023a33c

Observation 6d86d9e5-fff9-4d18-960b-482f72409ad1 · outbound

This paper cites Rlaif: Scaling reinforcement learning from human feedback with ai feedback.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Rlaif: Scaling reinforcement learning from human feedback with ai feedback

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.255448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:7127e2acfbc5939ce7fd3cb2971b6ca201968d3592b9fe1ba3e6eb7e1d3293e9

Observation 9a230ab0-e798-42e9-805b-69b896b14f7b · outbound

This paper cites Let's Verify Step by Step.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Let's Verify Step by Step

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.695064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:d4c68d2ffc95bfb79fa8f3a02538ea5660fcc2a96882d67adbf909c274b10f1a

Observation d2aa0290-cb5c-4d89-a61d-df36ce13886e · outbound

This paper cites Continuous control with deep reinforcement learning.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Continuous control with deep reinforcement learning

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.648565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:c63e004d39d55f147ffd96f3ebe8b645f29d288a1437a436b57b07c42da80292

Observation aae992a3-4e35-49dd-aeec-e15126a143ae · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Understanding R1-Zero-Like Training: A Critical Perspective

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.670408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:a2fc27389c04718750ebf5c88bf1199681f8e79bcb88a08930d3bf79e1a8f472

Observation f098e854-5555-4e31-88ba-005aabf4d6a1 · outbound

This paper cites Asynchronous methods for deep reinforce- ment learning.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Asynchronous methods for deep reinforce- ment learning

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.243639Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:6e95a1274217f4ae34a347e3287045ee4865d88bf4d1d60df88cb020b9b1f83b

Observation 741670e6-7972-4a48-bedd-1e53fa95df16 · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Playing Atari with Deep Reinforcement Learning

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.679941Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:40e35ef9658d73f6142494694f13ba9d2448f1ec06c15a2b1a3d91e508a06889

Observation 92ac8461-ff0a-4f85-b3c7-8770b39c976e · outbound

This paper cites Tiny-grpo math tasks dataset.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Tiny-grpo math tasks dataset

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.269712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:e765d2ce84fac7d17153d54ac653ad034adc5e955cbd2834227a642fe28379fa

Observation ceaee7c1-da07-431c-ae74-1abfe8fef9fb · outbound

This paper cites Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.234274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:9ffb2509de6b6a9581c265ed3b1b490a254ccd3c60daa86dc68eb05a98fd1f7b

Observation 6c6d88f8-2e9f-492e-840c-505b8c086ef6 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Direct preference optimization: Your language model is secretly a reward model

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.239415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:c2b68cbfeb7a1b010e57dbaa1a6612d075b593a2696d7609a96b33a3b2c11160

Observation 9b90aaba-af82-4e8a-91b9-25e702432640 · outbound

This paper cites Trust region policy optimization.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Trust region policy optimization

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.247515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:e87d402f351839f88e9c6f920bed1ce79e5fceabd015ac471c493fbd8eaefe8c

Observation 3a4c5fa6-4170-486d-839f-aa3baebb32a9 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Proximal Policy Optimization Algorithms

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.665672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:8d536185e7ad12da9d210858e706ff661738095aa287927e634e8edb988fdcec

Observation 098193a6-8410-4310-a8a4-e65b507792d0 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.659957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:a2cf7cbd5757bf26058a95a4c7f33493bd72102949c01e15200e7ab80082daf6

Observation 16cf6ee6-9cb2-46a2-990c-9b69aa0e85bb · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.Advances in neural information processing systems, 12.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Policy gradient meth- ods for reinforcement learning with function approximation.Advances in neural information processing systems, 12

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.215922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:b115ba288782ea6ac84c0a721465b6a4c11eb090d6ef8cdef855afc9df1414bb

Observation b21c3ea2-5585-4556-b2ca-62fa64fd7165 · outbound

This paper cites Mujoco: A physics engine for model-based control.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Mujoco: A physics engine for model-based control

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.211852Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:eceb03545aef418bee300df198fbd83d153c8306c1df71872c7c3d859de2ae82

Observation f2e1eab8-a5dc-448a-9fcc-ecfb27978475 · outbound

This paper cites OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-22T15:51:45.642038Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:5b10f355e82284c59a7ebc86083e4c8a10fbc013021efaace6534a51a8124c99

Observation 3a1261fc-ebbc-4e11-8e24-588501fc336d · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning LLaMA: Open and Efficient Foundation Language Models

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.654922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:1046cf3d374c4021a43332c9092932e29390d2da6deb2c7877b43976c2140117

Observation 3e6a0e3e-d178-4ce9-a48c-e126da7efb4c · outbound

This paper cites Deep reinforcement learning with double q-learning.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Deep reinforcement learning with double q-learning

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.262551Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:968a743107822dd8119ea3f55a3f53309270c528d2c8dc7bcce9479eb42b24c1

Observation 4a369a7f-6f62-4214-ad9c-d5e80188561f · outbound

This paper cites Aime problem set: 1983–2024.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Aime problem set: 1983–2024

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.230411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:068e565a42c1a0b62826ebbddd15cb027c3e4c3f1396507e6873ded132b86b33

Observation 3a51b174-adb8-430c-9b7c-fc2801e4f4fe · outbound

This paper cites Multi-intersection traffic optimisation: A benchmark dataset and a strong baseline.IEEE Open Journal of Intelligent Transportation Systems, 3:126–136.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Multi-intersection traffic optimisation: A benchmark dataset and a strong baseline.IEEE Open Journal of Intelligent Transportation Systems, 3:126–136

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.226713Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:3c93944fc0d2f5d4fce8451099559a369538ba871f03351e90d3865b827f9e3b

Observation c5100b9e-2bab-498c-ab30-b5f518f8c777 · outbound

This paper cites Soft expert reward learning for vision-and-language navigation.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Soft expert reward learning for vision-and-language navigation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.266182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:418d21f26914600f0a8a77c96d51dc9fa8ac8e3a32c404f8dabd226d5c4d65eb

Observation ddf5a0f0-c074-401e-b154-fe352a500b3e · outbound

This paper cites Dueling network architectures for deep reinforcement learning.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning Dueling network architectures for deep reinforcement learning

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.251172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:85b762e4b13bfb71becbe156a26df009d01dc5567fa5fd45dc6a7e1fd29bd3e5

Observation c7cb80a5-9253-417f-a78f-1b3c45744716 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-05-22T15:51:45.685027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:5a4b90c92da4d8e7d101362aff73081da1666c5f9a9b2b0b2c816e73b76baf9d

Observation b2df3508-e3b9-4a0e-ba58-aab5762e3347 · outbound

This paper cites fixed value.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning fixed value

Reference 31

Resolution
malformed identifier
raw_fallback, observed 2026-05-22T15:51:46.219463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:48399aff45e227b1719a6924250fd26579728ded87a23a2ce1b0dd386788bc0c

Observation 1cf9a237-883a-4fc7-abb5-459b8cad96c9 · outbound

This paper cites type": “Algebra.

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning type": “Algebra

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-05-22T15:51:46.258983Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T15:49:44.263123Z digest=sha256:cf74ec33663c67b278e814c5f756ae2dda2ad50aade12b87fe888d25b7ff7b2f

Pith citing papers

Observation 8c11dbf0-e383-4487-848a-3fc79f54b69c · inbound

K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning cites this paper.

K-Score: Kalman Filter as a Principled Alternative to Reward Normalization in Reinforcement Learning Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-05-11T19:21:09.801008Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-08T12:03:27.571169Z digest=sha256:7ad97ce640a6b71971600d3ffe9997996fbe82b875d7ba6e613ac834046908c4

Observation c9146da6-0b66-425c-93b1-55f60eab6a53 · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-05-12T10:16:27.330837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-07T07:00:32.206081Z digest=sha256:a6e50f39a18ebcec36a33f7b97f86130c0f2c6c44661457c70c8015ab63f5508

Observation bc0b0d50-775a-4cc3-95d7-dfcc27783808 · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-05-20T23:49:14.938994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-20T23:47:53.282259Z digest=sha256:ccbf4e65fa45dc02ae94d0147792a9b3157fa8addec27bcbb44501748ea602c0

Observation 80214a48-80f4-4075-b238-ddc558fa6ac7 · inbound

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards cites this paper.

BV-Blend: Uncertainty-Weighted Historical Baselines for Stable Critic-Free RL with Verifiable Rewards Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

Reference 127

Resolution
metadata mismatch
local_arxiv, observed 2026-06-30T12:44:40.166695Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-06-30T10:07:39.554999Z digest=sha256:cc050507833bc8844018a9d3a8e92eb9e657060d6969ee81e407d3036a7bc241