Pith. sign in

Paper Citation Record · LEDGER

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization

As of 18 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2505.17714.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.17714 v1

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:45:01.725671Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

20 of 20 outbound references displayed

  • verified exact0
  • verified fuzzy15
  • unresolved4
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ed48a1ba-0985-4002-8884-99638701bedf · outbound

This paper cites Human-level control through deep reinforcement learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Human-level control through deep reinforcement learning,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T14:44:59.795938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:44:59.795938Z digest=sha256:a455fbba85a4ff0a85ae48f61f49e9a851c0b762cb53e053daefc92158b2f12b

Observation ba071adb-7693-41f6-b689-43307b421dc9 · outbound

This paper cites Benchmarking deep reinforcement learning for continuous control,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Benchmarking deep reinforcement learning for continuous control,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:06.440862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:44:59.896292Z digest=sha256:be29cd483311ed9ddb8c0ba1bd4c4047915aa020f6889a93f25ad62820c60c14

Observation 9fa4db05-1286-48d5-982b-b0542b980360 · outbound

This paper cites Proximal Policy Optimization Algorithms.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Proximal Policy Optimization Algorithms

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:45:00.026191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:45:00.026191Z digest=sha256:e92f3757d53914ab565d7ea8ff84379ce690b506f4a48f6edfaed71a0e82c412

Observation aaea74fd-0dfa-4cf0-80f6-8ce220d945b5 · outbound

This paper cites Discriminator-actor-critic: Addressing sample inefficiency and reward bias in adversarial imitation learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Discriminator-actor-critic: Addressing sample inefficiency and reward bias in adversarial imitation learning,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:06.094173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.118894Z digest=sha256:68262ec2ec0a9329612100fcff0b2dd53d91fff95b266683834adec98bf24c86

Observation af84fa71-8172-418a-a21f-51ccf5973597 · outbound

This paper cites Trust region policy optimization,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Trust region policy optimization,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:05.758067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.173993Z digest=sha256:0cb64feffd6dbc08f26693c9bfad68dc7389996c571bd43a2dc1786b3ca8ed1d

Observation 1ea400c7-b34f-496a-8f83-5b92ddac29bc · outbound

This paper cites Annealed policy optimization for deep reinforcement learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Annealed policy optimization for deep reinforcement learning,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:05.421447Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.226610Z digest=sha256:36b600f50a3cf3d6b7ae993fa000cb2b73a7dccb392fad3fa15d83b3e13ad3a2

Observation e826bed6-4128-40b3-8976-794773bad0f1 · outbound

This paper cites Understanding the impact of entropy on policy optimization,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Understanding the impact of entropy on policy optimization,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:05.066997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.328576Z digest=sha256:fda23c6778c8f91aac7ba7126b981b716ca981cb672e400fc3b37203c94b64f2

Observation 9f4fba45-8f02-4dd0-a811-d838d83d1529 · outbound

This paper cites Normalized policy gradients for reinforcement learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Normalized policy gradients for reinforcement learning,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:04.720748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.425882Z digest=sha256:b0eb6f5bcd46e810cee64ce3b470c408025a9e8f810eae9397354a2f0266675f

Observation d435a8a6-a97a-4815-8819-1cf31dee32e2 · outbound

This paper cites Sutton and A.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Sutton and A

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:04.445147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.489904Z digest=sha256:a5984abfde4defa6a7c80d1f66aa78e8eb7a4fb97ae4bd58d76466f54f6afdcf

Observation db774f95-8495-4d18-87a8-156d86dc4837 · outbound

This paper cites Reinforcement learning: A survey,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Reinforcement learning: A survey,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:04.108939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.593465Z digest=sha256:dfe747d7a8a3306fab5935e4fae5cf0aaccba78e9cf667bfd03e7892f9bb3899

Observation 49f59f67-a684-43b3-9e07-d88295652ad2 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforcement learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Simple statistical gradient-following algorithms for connectionist reinforcement learning,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:03.861939Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.667690Z digest=sha256:2baf26d31a2052890160c5bcf585e673007ad31aafd52e5507c8c6f35df62d2e

Observation ce536db6-f0aa-47ec-bbae-acfece1719f7 · outbound

This paper cites High-dimensional continuous control using generalized advantage estimation,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization High-dimensional continuous control using generalized advantage estimation,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:03.634034Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.768484Z digest=sha256:6a586f771e4560b89ddfd99d80e0b2249271bd498463537e8a87c59ef13953ab

Observation 350014f5-19c8-4dc2-b356-18a77b7a37c4 · outbound

This paper cites Grandmaster level in StarCraft II using multi-agent reinforcement learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Grandmaster level in StarCraft II using multi-agent reinforcement learning,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:03.466030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:00.891898Z digest=sha256:d655792e14f132f5c638d780da5f789ab99f3f3b39fa92eccd9f71da26528fc7

Observation 7dc67ac9-c92c-44ff-88af-46b978cdf3e7 · outbound

This paper cites Annealed policy optimization,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Annealed policy optimization,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:03.117391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:01.006215Z digest=sha256:904226b5b430bfbb25492e18ea65df5de188899a56abd7b64df987c7550ead4e

Observation f77c92cb-f40a-42c5-b9bd-a3ef5461038d · outbound

This paper cites Noisy networks for exploration,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Noisy networks for exploration,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:02.878463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:01.112097Z digest=sha256:51575e7582d69c7b0881b8d7a7c48c7d50fe4f5119f1a32b9ce49057b76ccf88

Observation 725dfd50-53b0-4a33-abe4-67a6f5dbd49b · outbound

This paper cites Deep Reinforcement Learning: An Overview,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Deep Reinforcement Learning: An Overview,

Reference 16

Resolution
metadata mismatch
raw_fallback, observed 2026-08-07T14:45:02.226161Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:01.223279Z digest=sha256:bf9e726e86dc6468a7f06280f141bb30a5c6cd21231b818b93674550b6ab6068

Observation 5a5b95cf-715c-4aaf-8a2d-a4aa84a5f2d4 · outbound

This paper cites Constrained Policy Optimization,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Constrained Policy Optimization,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:02.628187Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:01.373170Z digest=sha256:026d8c47d7f295d0e2cfd17f417049d4dd3da0be3aeb549bf7748b5313534aa1

Observation 6e852697-3be3-4650-a1f9-4a74d4c7c120 · outbound

This paper cites A Study on Overfitting in Deep Reinforcement Learning,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization A Study on Overfitting in Deep Reinforcement Learning,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:45:02.404638Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:45:01.506161Z digest=sha256:98d1030bb5bdbea24402c5ecb9885c82584fa79c4b79f46a0395f5bee28b3d6c

Observation b155d807-98c2-4b2d-967a-679e0e6b73db · outbound

This paper cites Optimizing Customer Satisfaction Through Sentiment Analysis: A BERT-Based Machine Learning Approach to Extract Insights,.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Optimizing Customer Satisfaction Through Sentiment Analysis: A BERT-Based Machine Learning Approach to Extract Insights,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:45:01.598606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:45:01.598606Z digest=sha256:0171ae82b4564b935a334176f2ccee19882b1233aa93a658d181580374dbeb1d

Observation ec1f8a1a-a535-4f03-9ffd-7d932f0ab305 · outbound

This paper cites Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications.

PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:45:01.725671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:45:01.725671Z digest=sha256:6e7a4d99f705f7bd6decba4621c02af27115c677832a37a3f24b2e12b9215155

Pith citing papers

No inbound Pith citation observations are available.