{"as_of":"2026-08-18T23:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f4b53549b79191702987fc7632991274a051ecb3e1ce0586883c5b991372ac1","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:45:01.725671Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17714/citation-record","integrity":"/paper/2505.17714/integrity","json":"/paper/2505.17714/citation-record.json","paper":"/paper/2505.17714"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:59.795938Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:59.795938Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:a455fbba85a4ff0a85ae48f61f49e9a851c0b762cb53e053daefc92158b2f12b","observation_id":"ed48a1ba-0985-4002-8884-99638701bedf","resolution":{"observed_at":"2026-08-07T14:44:59.795938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:06.284278Z","title":"Benchmarking deep reinforcement learning for continuous control,","venue":null,"work_id":"292a0373-fa95-48a9-852d-6f20ee6849b3","year":2016},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:59.896292Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:be29cd483311ed9ddb8c0ba1bd4c4047915aa020f6889a93f25ad62820c60c14","observation_id":"ba071adb-7693-41f6-b689-43307b421dc9","resolution":{"observed_at":"2026-08-07T14:45:06.440862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:45:00.026191Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.026191Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:e92f3757d53914ab565d7ea8ff84379ce690b506f4a48f6edfaed71a0e82c412","observation_id":"9fa4db05-1286-48d5-982b-b0542b980360","resolution":{"observed_at":"2026-08-07T14:45:00.026191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:05.948336Z","title":"Discriminator-actor-critic: Addressing sample inefficiency and reward bias in adversarial imitation learning,","venue":null,"work_id":"b39a2d49-a04b-4a3b-abee-03f0331ac47a","year":2021},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.118894Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:68262ec2ec0a9329612100fcff0b2dd53d91fff95b266683834adec98bf24c86","observation_id":"aaea74fd-0dfa-4cf0-80f6-8ce220d945b5","resolution":{"observed_at":"2026-08-07T14:45:06.094173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:05.619871Z","title":"Trust region policy optimization,","venue":null,"work_id":"04201ddf-b2f7-4796-8a06-afacd490ecaf","year":2015},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.173993Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:0cb64feffd6dbc08f26693c9bfad68dc7389996c571bd43a2dc1786b3ca8ed1d","observation_id":"af84fa71-8172-418a-a21f-51ccf5973597","resolution":{"observed_at":"2026-08-07T14:45:05.758067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:05.216015Z","title":"Annealed policy optimization for deep reinforcement learning,","venue":null,"work_id":"f23de1e7-9b05-4ea0-a0d7-69d3fc28f387","year":2020},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.226610Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:36b600f50a3cf3d6b7ae993fa000cb2b73a7dccb392fad3fa15d83b3e13ad3a2","observation_id":"1ea400c7-b34f-496a-8f83-5b92ddac29bc","resolution":{"observed_at":"2026-08-07T14:45:05.421447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:04.909126Z","title":"Understanding the impact of entropy on policy optimization,","venue":null,"work_id":"63c265cb-da8f-4c55-a8b6-ef5e719fee72","year":2019},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.328576Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:fda23c6778c8f91aac7ba7126b981b716ca981cb672e400fc3b37203c94b64f2","observation_id":"e826bed6-4128-40b3-8976-794773bad0f1","resolution":{"observed_at":"2026-08-07T14:45:05.066997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:04.576743Z","title":"Normalized policy gradients for reinforcement learning,","venue":null,"work_id":"69435361-04ae-46cd-8d7c-f91326b5408c","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.425882Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:b0eb6f5bcd46e810cee64ce3b470c408025a9e8f810eae9397354a2f0266675f","observation_id":"9f4fba45-8f02-4dd0-a811-d838d83d1529","resolution":{"observed_at":"2026-08-07T14:45:04.720748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:04.299690Z","title":"Sutton and A","venue":null,"work_id":"279020ee-aaa0-4149-8f6b-136223f4ba0f","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.489904Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:a5984abfde4defa6a7c80d1f66aa78e8eb7a4fb97ae4bd58d76466f54f6afdcf","observation_id":"d435a8a6-a97a-4815-8819-1cf31dee32e2","resolution":{"observed_at":"2026-08-07T14:45:04.445147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.997383Z","title":"Reinforcement learning: A survey,","venue":null,"work_id":"f6d7e5df-60ef-4bf2-a33a-dbef86509781","year":1996},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.593465Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:dfe747d7a8a3306fab5935e4fae5cf0aaccba78e9cf667bfd03e7892f9bb3899","observation_id":"db774f95-8495-4d18-87a8-156d86dc4837","resolution":{"observed_at":"2026-08-07T14:45:04.108939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.769690Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":"9956aa08-1dcf-45a4-9de7-b28bf70e43af","year":1992},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.667690Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:2baf26d31a2052890160c5bcf585e673007ad31aafd52e5507c8c6f35df62d2e","observation_id":"49f59f67-a684-43b3-9e07-d88295652ad2","resolution":{"observed_at":"2026-08-07T14:45:03.861939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.552166Z","title":"High-dimensional continuous control using generalized advantage estimation,","venue":null,"work_id":"fc91341f-b582-4d83-b3d5-ad29a35af868","year":2016},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.768484Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:6a586f771e4560b89ddfd99d80e0b2249271bd498463537e8a87c59ef13953ab","observation_id":"ce536db6-f0aa-47ec-bbae-acfece1719f7","resolution":{"observed_at":"2026-08-07T14:45:03.634034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.216597Z","title":"Grandmaster level in StarCraft II using multi-agent reinforcement learning,","venue":null,"work_id":"ccb583e4-796a-4fd5-9d6c-ea94a83ebacb","year":2019},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.891898Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:d655792e14f132f5c638d780da5f789ab99f3f3b39fa92eccd9f71da26528fc7","observation_id":"350014f5-19c8-4dc2-b356-18a77b7a37c4","resolution":{"observed_at":"2026-08-07T14:45:03.466030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.024953Z","title":"Annealed policy optimization,","venue":null,"work_id":"5d8e07ae-fcb0-485f-8eb4-ff546558db94","year":2020},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.006215Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:904226b5b430bfbb25492e18ea65df5de188899a56abd7b64df987c7550ead4e","observation_id":"7dc67ac9-c92c-44ff-88af-46b978cdf3e7","resolution":{"observed_at":"2026-08-07T14:45:03.117391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.752826Z","title":"Noisy networks for exploration,","venue":null,"work_id":"57b64826-2268-43cf-a79b-c088cd69752e","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.112097Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:51575e7582d69c7b0881b8d7a7c48c7d50fe4f5119f1a32b9ce49057b76ccf88","observation_id":"f77c92cb-f40a-42c5-b9bd-a3ef5461038d","resolution":{"observed_at":"2026-08-07T14:45:02.878463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.25826","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.152189Z","title":"Deep Reinforcement Learning: An Overview,","venue":null,"work_id":"2b4c2b74-ec24-4a91-a04b-910508b2a9ee","year":2017},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.223279Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:bf9e726e86dc6468a7f06280f141bb30a5c6cd21231b818b93674550b6ab6068","observation_id":"725dfd50-53b0-4a33-abe4-67a6f5dbd49b","resolution":{"observed_at":"2026-08-07T14:45:02.226161Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.534676Z","title":"Constrained Policy Optimization,","venue":null,"work_id":"8a5c0b3a-17c8-4f99-9656-18d9ef77bb40","year":2017},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.373170Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:026d8c47d7f295d0e2cfd17f417049d4dd3da0be3aeb549bf7748b5313534aa1","observation_id":"5a5b95cf-715c-4aaf-8a2d-a4aa84a5f2d4","resolution":{"observed_at":"2026-08-07T14:45:02.628187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.337038Z","title":"A Study on Overfitting in Deep Reinforcement Learning,","venue":null,"work_id":"f71e8fba-4e00-40cc-b438-b55d90b0831a","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.506161Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:98d1030bb5bdbea24402c5ecb9885c82584fa79c4b79f46a0395f5bee28b3d6c","observation_id":"6e852697-3be3-4650-a1f9-4a74d4c7c120","resolution":{"observed_at":"2026-08-07T14:45:02.404638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:01.598606Z","title":"Optimizing Customer Satisfaction Through Sentiment Analysis: A BERT-Based Machine Learning Approach to Extract Insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.598606Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:0171ae82b4564b935a334176f2ccee19882b1233aa93a658d181580374dbeb1d","observation_id":"b155d807-98c2-4b2d-967a-679e0e6b73db","resolution":{"observed_at":"2026-08-07T14:45:01.598606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19276","last_updated":"2025-03-25T02:12:35Z","snapshot_observed_at":"2026-08-16T12:47:08.360468Z","submitted_at":"2025-03-25T02:12:35Z","title":"Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19276","snapshot_observed_at":"2026-08-07T14:45:01.725671Z","title":"Context -Aware Semantic Segmentation: Enhancing Pixel -Level Understanding with Large Language Models for Advanced Vision Applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.725671Z"},"links":{"cited_paper":"/paper/2503.19276","citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:6e7a4d99f705f7bd6decba4621c02af27115c677832a37a3f24b2e12b9215155","observation_id":"ec1f8a1a-a535-4f03-9ffd-7d932f0ab305","resolution":{"observed_at":"2026-08-07T14:45:01.725671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T14:39:46.121312Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2505.17714."}