{"as_of":"2026-08-16T03:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f425139285357a117174f713e2736c334ccd3f5abca7e1f6b14b5e306d95acb","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:58:03.027593Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06700/citation-record","integrity":"/paper/2501.06700/integrity","json":"/paper/2501.06700/citation-record.json","paper":"/paper/2501.06700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.617284Z","title":"Reinforcement learning: An introduction by richards’ sutton,","venue":null,"work_id":"bd8d674c-ac49-4e5a-8b5d-e0ef3d3ba942","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.867946Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:b971d4bdf233e58f9baf9e0605010470974dc3a6f8c5044bba7a93484549a3a0","observation_id":"fe418e7b-8936-457b-be7e-cf0d22d8cbb8","resolution":{"observed_at":"2026-08-10T20:58:03.622682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.600527Z","title":"Average-reward off- policy policy evaluation with function approximation,","venue":null,"work_id":"88442061-9edc-4cef-8fb6-77e729cc6179","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.873578Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:c3a4dd30eac2bb5958993882839da8ab00a76425eaab1dcbccc4a8b3c904b065","observation_id":"63e51f31-3ce3-41dd-a0f5-29f0c4a04cee","resolution":{"observed_at":"2026-08-10T20:58:03.606153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.583853Z","title":"Off-policy average reward actor-critic with deterministic policy search,","venue":null,"work_id":"ba997419-af16-4bd4-96b3-6bdde97b5fa9","year":2023},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.878783Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:c097aba100216e662ded21ec67d22d694585c288e215944469cee8a2a6f6f313","observation_id":"9be1150f-6663-4a75-9b9c-539ee364bde6","resolution":{"observed_at":"2026-08-10T20:58:03.589049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.568020Z","title":"Power control for a network of access points,","venue":null,"work_id":"88695534-f790-48e0-a590-61af53dfac20","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.883865Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:e48b9f78fe32fcda9538d8beefb23db60d1af82ab3283b96b01aa1066e552226","observation_id":"153af67c-6a51-4bce-a795-01b689aa1b11","resolution":{"observed_at":"2026-08-10T20:58:03.573092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.550091Z","title":"Base station employing shared resources among antenna units,","venue":null,"work_id":"a11b965c-8dd5-4b74-a1e5-126ba878b618","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.888817Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:3d0bf05eeccc4537135ad5db51fc1111b14ecc25f72f3eff5be5e89d3e0ce6c4","observation_id":"444c08a9-f2dd-430c-992a-1da342f5233d","resolution":{"observed_at":"2026-08-10T20:58:03.556489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.533275Z","title":"Methods and apparatus for power management in a wireless communication system,","venue":null,"work_id":"117dcf97-e06f-4eef-b9bc-d494524765e3","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.893915Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:d2064af4cbf9ef0c8278eba09e8aa3ba8b5d3350931ba823afb3a8357bdb878a","observation_id":"832225f1-a78d-4760-b37c-37bcf3a5e033","resolution":{"observed_at":"2026-08-10T20:58:03.538941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.516826Z","title":"Generalized global bandit and its application in cellular coverage optimization,","venue":null,"work_id":"13f73749-d819-4bef-8b20-44412a229a1f","year":2018},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.899554Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:45d4ec03e8723ac7de16e7edde40749d0b43ae83ef4c8fc80e82bc93e481ee5a","observation_id":"9b85fed7-2f67-4e5f-a05b-86b4a65ceb9e","resolution":{"observed_at":"2026-08-10T20:58:03.522036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.499191Z","title":"A non-stationary online learning approach to mobility management,","venue":null,"work_id":"eef71d7d-1bef-47f7-a1bf-a3a8a5a60204","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.904069Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:39df664555eb121ead3d615cd391a8a41e5d12208ed31d12f340ade5c7ea0f21","observation_id":"3048fc99-bf64-4f0d-87f0-7383e2230e45","resolution":{"observed_at":"2026-08-10T20:58:03.505499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.13032","last_updated":"2019-04-30T03:18:39Z","snapshot_observed_at":"2026-08-14T16:39:38.855893Z","submitted_at":"2019-04-30T03:18:39Z","title":"A Deep Q-Learning Method for Downlink Power Allocation in Multi-Cell Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.13032","snapshot_observed_at":"2026-08-10T20:58:02.908832Z","title":"A deep Q-learning method for downlink power allocation in multi-cell networks,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.908832Z"},"links":{"cited_paper":"/paper/1904.13032","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:3434557804daaf5bef0dd1f0b6abb4ce7b42a143005ea18355abf8bb468b2d51","observation_id":"8b685e6b-9a91-481d-822e-971cf0f84b39","resolution":{"observed_at":"2026-08-10T20:58:02.908832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.482441Z","title":"Power allocation in multi-user cellular networks with deep Q learning approach,","venue":null,"work_id":"f09de800-56a2-455c-81f8-09e4617c762d","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.914367Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:0154bf64866389c068527b4ede6ed289aa0f7655ebb1c96f410b272f1e3e080d","observation_id":"8f0986a6-d45d-476f-b06d-17ed7a5f424d","resolution":{"observed_at":"2026-08-10T20:58:03.487857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.463117Z","title":"Joint power control and channel allocation for interference mitigation based on reinforcement learning,","venue":null,"work_id":"3eb91c1e-19e7-4bc1-9f24-65d2a0cd5e5f","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.919206Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:69b811df942d4e0198cca149676d757f3422246d22ea74eb6702384e53f60879","observation_id":"d86cf87a-3445-470b-a252-e99e5069f05f","resolution":{"observed_at":"2026-08-10T20:58:03.469648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.441723Z","title":"Deep actor-critic learning for distributed power control in wireless mobile networks,","venue":null,"work_id":"f7b2384c-bc82-47a5-bbb3-ae1bb9c0187e","year":2020},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.923840Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:6863d6df05afb2460ad94eacf8b843e7684ad1d0c0662b9425a1e369291d1232","observation_id":"e896803b-aba4-4573-b966-ed5796e76b39","resolution":{"observed_at":"2026-08-10T20:58:03.447250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.424249Z","title":"Deep reinforcement learning based wire- less network optimization: A comparative study,","venue":null,"work_id":"f398366b-47e3-4a54-8394-51baa779ec12","year":2020},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.928335Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:67c9ff8d929063ae14adbebe425e1032b37c0f9a4a97493676a014f4280bb4a7","observation_id":"a9e7afcb-a20d-4767-806d-f055c673c843","resolution":{"observed_at":"2026-08-10T20:58:03.429992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.407435Z","title":"ColO- RAN: Developing Machine Learning-based xApps for Open RAN Closed-loop Control on Programmable Experimental Platforms,","venue":null,"work_id":"1b09a7ea-1f0a-46f6-b9c2-6f69070bb792","year":2022},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.933233Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:8be31e862d4447ea2e791b4ec19d93cb05be406f6e44c3a3a263c355c8fb7d5e","observation_id":"4a8fb1ba-fd12-4558-8c98-551e9435361f","resolution":{"observed_at":"2026-08-10T20:58:03.412476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.388201Z","title":"FlexRAN: A flexible and programmable platform for software- defined radio access networks,","venue":null,"work_id":"8adbc7b9-3494-4fea-bdad-7d60af4803ec","year":2016},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.938283Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:88e64d6532673099afc3426cd405dd8385ab9d60544d6bda5c6b3dc687c9f9c5","observation_id":"0efcb88b-4d34-4582-8df1-cf93c067722c","resolution":{"observed_at":"2026-08-10T20:58:03.396691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.370718Z","title":"Deep reinforcement learning for joint spectrum and power allocation in cellular networks,","venue":null,"work_id":"a9212b31-e4d2-4b6e-aa5c-47575548c58e","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.943681Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:7f078909be015fd96f48cf4824c05292199d7c1d4534e1515039885ad1f3ca33","observation_id":"04d1d7ad-6a01-41cf-9b35-9849bb3fec9e","resolution":{"observed_at":"2026-08-10T20:58:03.376074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.353879Z","title":"Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,","venue":null,"work_id":"1a4ec6ca-0be9-4c23-84ff-f26153e494e2","year":2019},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.948386Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:cf680e7e54bace83858a818bea6886355e055edfe96d936f6e608be0125e9de4","observation_id":"8c8a43ac-33d9-4d35-aeda-e0329a01963f","resolution":{"observed_at":"2026-08-10T20:58:03.359596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.333671Z","title":"Multi- agent reinforcement learning for wireless user scheduling: Performance, scalablility, and generalization,","venue":null,"work_id":"1e5fa953-2f28-48f1-8a66-33e4529850e1","year":2022},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.953229Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:31714489ba8621d817857777f095f1cf72af68ffa343f7bc91f2121dea794a6d","observation_id":"abbb5159-d0a4-4f5a-a14c-376c7d667aa0","resolution":{"observed_at":"2026-08-10T20:58:03.340416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:02.958639Z","title":"Resource management in wireless networks via multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.958639Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:6e3a098e95083f8b0ad4440fc1d5c468eaae58fad59c461b7de391f8ceca110f","observation_id":"4786d838-3339-4a54-a55a-9d0ad12459ac","resolution":{"observed_at":"2026-08-10T20:58:02.958639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.306766Z","title":"Distributed MARL for scheduling in conflict graphs,","venue":null,"work_id":"0841c7b0-134c-4f97-ad90-451847428faf","year":2023},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.963929Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:416e27c81b32dcd90da1467eb13f0ae6e596d6d485ee88c84e5f10b43d962ed5","observation_id":"9f6fe38c-60b8-4321-a8e6-407c26949b68","resolution":{"observed_at":"2026-08-10T20:58:03.311863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.290014Z","title":"Offline reinforcement learning for wireless network optimization with mixture datasets,","venue":null,"work_id":"20e780a1-0b3d-4f18-bfcb-dbb76fad580d","year":2024},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.970809Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:4a5b9150237ee019ebd095490e8974d7900dd69d09f9733878971607cd9eab35","observation_id":"d2de51e2-2bdd-4ffa-9194-8accdc97981a","resolution":{"observed_at":"2026-08-10T20:58:03.295227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.273761Z","title":"Advancing RAN slicing with offline reinforcement learning,","venue":null,"work_id":"a8214200-8bc0-4262-ac8f-db49c70773eb","year":2024},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.976751Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:1d23fbba8785eabdafc6fbc6cb776309ed4e612938e4cdabdfe72f82cae493db","observation_id":"3daa3c11-e5c9-4b28-bc45-5af3768177b2","resolution":{"observed_at":"2026-08-10T20:58:03.279124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.255846Z","title":"Mean-variance policy iteration for risk-averse reinforcement learning,","venue":null,"work_id":"284c945b-b96e-4589-b20b-343ffdfe3e4d","year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.982057Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:eda54bd3a3ef7a221e5cdf926491ad35e6c9499f2dbfdaba214426241f1f7de2","observation_id":"0fc23e0a-4c89-4b71-abaf-532fb6834614","resolution":{"observed_at":"2026-08-10T20:58:03.261064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.238008Z","title":"Averaged-dqn: Variance reduc- tion and stabilization for deep reinforcement learning,","venue":null,"work_id":"3f2012e6-c3f7-49b7-9292-9c6b5c24b0cc","year":2017},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.987694Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:247be3301d6f14068c6a9eb15ef953ed6c84563afa3786619a40381f6b83eee6","observation_id":"e0aed05d-01fa-49d7-8e9f-d6d13de8f23a","resolution":{"observed_at":"2026-08-10T20:58:03.243701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03442","last_updated":"2021-11-01T03:53:25Z","snapshot_observed_at":"2026-08-13T20:29:37.715438Z","submitted_at":"2021-06-07T09:19:42Z","title":"Average-Reward Reinforcement Learning with Trust Region Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03442","snapshot_observed_at":"2026-08-10T20:58:02.992888Z","title":"Average-reward reinforcement learning with trust region methods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.992888Z"},"links":{"cited_paper":"/paper/2106.03442","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:c3bf6d0663adea7a7e937a0834ffe71c176529a0427715f8eba595de2ceaf485","observation_id":"38faea7d-0567-4d26-9138-308f0ede6ca3","resolution":{"observed_at":"2026-08-10T20:58:02.992888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.219349Z","title":"The NS-3 network simulator,","venue":null,"work_id":"097855d8-9353-4591-b786-c431e277bb39","year":2010},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:02.997779Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:59d6667b68479d8bd31b227382baa0cad24f232634264a1342f7374878329751","observation_id":"79263734-8de1-48bf-9c0d-79864f8f6157","resolution":{"observed_at":"2026-08-10T20:58:03.224731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.201286Z","title":"Network slicing architecture,","venue":null,"work_id":"712e156f-a6b7-41d6-ac2f-e85987e30bfa","year":2017},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.002821Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:c474a81cdd059a318be5913809c02256afd12e807cc6079291988c3578c78fb1","observation_id":"bf85f0c0-a91e-49a3-b59b-75d2d16428ae","resolution":{"observed_at":"2026-08-10T20:58:03.206772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.183198Z","title":"NetworkGym: Democratizing Network AI via Sim-aaS,","venue":null,"work_id":"b99e6ecb-a175-4993-80cd-19978a66668b","year":2023},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.007765Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:1121918f2a5284e9482a6480d8e069b18fe1d16cf30344d6196c9ab42acb1072","observation_id":"a0c4bc3e-559f-45c2-8445-4840f43886d2","resolution":{"observed_at":"2026-08-10T20:58:03.188710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:58:03.012480Z","title":"Soft actor-critic algorithms and applications,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.012480Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:69a320d6aac7c07553c39493e5e4c64c273b9ffbf0c5526109f3134b0d0ba89a","observation_id":"77cd05a6-0482-4fbd-8745-f0df02bb77af","resolution":{"observed_at":"2026-08-10T20:58:03.012480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01069","last_updated":"2022-01-26T18:07:28Z","snapshot_observed_at":"2026-07-06T10:00:59.593985Z","submitted_at":"2020-10-02T15:51:48Z","title":"A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms","version":4},"cited_work":{"arxiv_id":"2010.01069","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.01069","snapshot_observed_at":"2026-08-10T20:58:03.070075Z","title":"A Deeper Look at Discounting Mismatch in Actor-Critic Algorithms","venue":"cs.LG","work_id":"b34d0e74-fad0-48a8-8779-c36b89351e69","year":2020},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.017617Z"},"links":{"cited_paper":"/paper/2010.01069","citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:9c86444f6a1d0acb5778a9b7a2fe9762ec0a711e926f702cd0c459bd50614c06","observation_id":"75f746b8-3394-412e-9bdd-861ba0a638f8","resolution":{"observed_at":"2026-08-10T20:58:03.078406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.166782Z","title":"Revisiting the minimalist approach to offline reinforcement learning,","venue":null,"work_id":"77f08422-ad86-41d5-bc93-9d34d9b00880","year":2024},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.022995Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:3c00924fb0a320619a62d7dea51652fd86b0bee836c7e50b765db7ffea4cc2e2","observation_id":"8a8d116c-0e34-452f-9949-38b760fd7858","resolution":{"observed_at":"2026-08-10T20:58:03.171997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:58:03.148649Z","title":"Supported policy optimization for offline reinforcement learning,","venue":null,"work_id":"0f057723-d00e-427e-b7de-60b35b237da1","year":2022},"citing_paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:58:03.027593Z"},"links":{"citing_paper":"/paper/2501.06700"},"observation_digest":"sha256:552f024a28ff9f86574aaa53aa634c9c7f52ebbeb0f3bdf45a1f893cdcaf07cf","observation_id":"9bc0867d-2531-42e9-b963-a953fdb3ed79","resolution":{"observed_at":"2026-08-10T20:58:03.154181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06700","last_updated":"2025-01-12T03:45:14Z","latest_version":1,"primary_category":"cs.IT","snapshot_observed_at":"2026-08-12T13:22:30.358720Z","submitted_at":"2025-01-12T03:45:14Z","title":"Average Reward Reinforcement Learning for Wireless Radio Resource Management"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2501.06700."}