{"as_of":"2026-08-15T11:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba37d5aacd18e18bd8d3ef8d324067ba21c532963ccedb362f2bba16b437f55e","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:56:30.392172Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.01839/citation-record","integrity":"/paper/2412.01839/integrity","json":"/paper/2412.01839/citation-record.json","paper":"/paper/2412.01839"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.05328","last_updated":"2019-12-10T09:56:14Z","snapshot_observed_at":"2026-08-14T21:21:03.288042Z","submitted_at":"2019-12-10T09:56:14Z","title":"Efficient and Robust Reinforcement Learning with Uncertainty-based Value Expansion","version":1},"cited_work":{"arxiv_id":"1912.05328","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.05328","snapshot_observed_at":"2026-08-12T18:56:30.689613Z","title":"Efficient and Robust Reinforcement Learning with Uncertainty-based Value Expansion","venue":"cs.LG","work_id":"b598429e-d18f-45c7-8fba-d38169d43d04","year":2019},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.314885Z"},"links":{"cited_paper":"/paper/1912.05328","citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:3848d28fa2f66c40a51b13dfb21fc2fc623c7a85f4a0c8c5f6496674b05ebb69","observation_id":"cd416721-352d-4867-b891-c127c9fbb793","resolution":{"observed_at":"2026-08-12T18:56:30.694556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.00156","last_updated":"2022-07-30T07:44:05Z","snapshot_observed_at":"2026-08-14T21:21:03.259305Z","submitted_at":"2022-07-30T07:44:05Z","title":"Reinforcement learning with experience replay and adaptation of action dispersion","version":1},"cited_work":{"arxiv_id":"2208.00156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.00156","snapshot_observed_at":"2026-08-12T18:56:30.666498Z","title":"Reinforcement learning with experience replay and adaptation of action dispersion","venue":"cs.LG","work_id":"3e4e8ca6-9d87-481a-99d1-110239315e0a","year":2022},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.320551Z"},"links":{"cited_paper":"/paper/2208.00156","citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:8c0509bf1a25562d88c5d1915908682103ee22ab7e245ad1047a7401943f24d2","observation_id":"0fcfa08c-5a26-4227-a504-b0665b4626f4","resolution":{"observed_at":"2026-08-12T18:56:30.671695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.819936Z","title":"”A deep reinforcement learning based framework for power- efficient resource allocation in cloud RANs.” In 2017 IEEE International Conference, 2017","venue":null,"work_id":"7f00a64b-6a78-4e6a-9572-84c8a5c14269","year":2017},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.325612Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:ec0af5abbb20e73b425ca78cad6408cf2e8559d55d3aab075534bb04f5c665a7","observation_id":"ef1f2c0b-f410-441f-924a-6cf9e348a814","resolution":{"observed_at":"2026-08-12T18:56:30.824835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.805914Z","title":"Huang, B","venue":null,"work_id":"c230d05b-71f6-461b-a073-6b7c8b926f43","year":2021},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.330427Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:b1c0b3f9e00d4c7d6e65537e06f78930eb8e60b1f9f63ac63f02555d1f5377ce","observation_id":"0a1625fb-1727-4fd6-8a2d-95922ee45882","resolution":{"observed_at":"2026-08-12T18:56:30.810269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.791796Z","title":"”Reinforcement learning-based mobile edge com- puting and transmission scheduling for video surveillance.” IEEE Trans- actions on Emerging Topics in Computing , pages 1–1, 2021","venue":null,"work_id":"4e656bed-941e-4316-89be-7826bfe0eea4","year":2021},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.335265Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:eddbeb38427086932d81fd913bd4e6b65cae8234f248b5b881675ef4abe37605","observation_id":"7acb5b08-fcbb-46d9-a3d5-782b47cfeaca","resolution":{"observed_at":"2026-08-12T18:56:30.796730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.340377Z","title":"Ming et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.340377Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:e8d9af2cc93447b5d44ede6259b0afb216ef61e74aa22809b1b110c5a5d53206","observation_id":"93045c10-bdde-4bca-8474-050d2a607c58","resolution":{"observed_at":"2026-08-12T18:56:30.340377Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.778134Z","title":null,"venue":null,"work_id":"edee115e-d654-43f0-9845-b1b66bd209d2","year":null},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.345356Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:4d26504d897841c4d3779361b55fa7b418303a073826def0e41eb27ba2f0529b","observation_id":"97a220b4-2ac9-4db0-9cc0-f86c95436268","resolution":{"observed_at":"2026-08-12T18:56:30.782448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.764165Z","title":"”On-Policy vs","venue":null,"work_id":"3c6c31ec-b979-404f-871e-b6c0a55621b2","year":2016},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.354825Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:5a10e408502c8ea37b7cac6364c87e05c4b947ec65caf7b87be1681e2f3739c1","observation_id":"e14b7e9d-26d9-49b9-a1e3-60a26da67f7e","resolution":{"observed_at":"2026-08-12T18:56:30.768582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.33378","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.558132Z","title":null,"venue":null,"work_id":"a297b265-22be-4221-8162-aa6b01f573a6","year":2024},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.359413Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:2084c64b7061a7ada320e1acaf36c6e996aa1250fecbc10778a221fcdd6a33cb","observation_id":"f075a297-689f-4821-a92b-af8124ad58f8","resolution":{"observed_at":"2026-08-12T18:56:30.566042Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14355","last_updated":"2023-03-25T04:42:30Z","snapshot_observed_at":"2026-08-15T01:14:28.002992Z","submitted_at":"2023-03-25T04:42:30Z","title":"Intelligent Load Balancing and Resource Allocation in O-RAN: A Multi-Agent Multi-Armed Bandit Approach","version":1},"cited_work":{"arxiv_id":"2303.14355","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.14355","snapshot_observed_at":"2026-08-12T18:56:30.458941Z","title":"Intelligent Load Balancing and Resource Allocation in O-RAN: A Multi-Agent Multi-Armed Bandit Approach","venue":"cs.LG","work_id":"0f1a182f-599d-4b94-bffc-93cccaf410a2","year":2023},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.363871Z"},"links":{"cited_paper":"/paper/2303.14355","citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:1a0a133295c513a1c65636fa59aa55a0eca3b6dd327f2ea92d24263fdd22f892","observation_id":"20e2609f-f719-4c92-8efa-1d3c3d3d5ed1","resolution":{"observed_at":"2026-08-12T18:56:30.466431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.748561Z","title":null,"venue":null,"work_id":"9ede9351-ea12-408b-83c6-c29abb770dd7","year":2017},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.368785Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:b133c4f6be25607f4c0c393a0becb9c554ba0ad3a8b0abb5598a0fbeacfec600","observation_id":"788f4b48-644b-41a5-a48f-19923dce77d4","resolution":{"observed_at":"2026-08-12T18:56:30.753590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.734198Z","title":"”Deep reinforcement learning for resource management in network slicing.” IEEE Access , 6:74429–74441, 2018","venue":null,"work_id":"3bf16171-7290-47bf-96d0-7c147f40af5e","year":2018},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.373322Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:560177e6ef3c8bd9010c1cc8a48c55f78dd0b713f7a04c5f543d7d077b2a01a2","observation_id":"c812f641-fea1-4d54-a396-bf37e692e720","resolution":{"observed_at":"2026-08-12T18:56:30.738756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T18:56:30.378088Z","title":"”Proximal policy optimization algorithms.” ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.378088Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:ac34b1e01ca7c32871c4d8522fbec81425fc2e54f96ac94c51ebc103016cac98","observation_id":"6b812736-7971-481e-9d3f-105cbe8ef72b","resolution":{"observed_at":"2026-08-12T18:56:30.378088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-14T21:32:02.118456Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-08-12T18:56:30.382713Z","title":"”Sample efficient actor-critic with experience replay.” ArXiv, abs/1611.01224, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.382713Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:af94b38e1fc9d060bff8745c0215da46dd663cb6178ee7362b520ef8ce1122b9","observation_id":"3dc1c6dc-a820-4435-b47f-71043dd4002b","resolution":{"observed_at":"2026-08-12T18:56:30.382713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.719283Z","title":"[online] Available: https: //github.com/alibaba/clusterdata/tree/master/cluster-trace-v2018/","venue":null,"work_id":"f007d2da-c59d-47dc-b61e-71aa9aa06a30","year":2018},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.387822Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:25588c559c21e0a28ee39cac13fa14f8b53251eaf37125175b0daa70da6780b9","observation_id":"cfdfc393-8bcd-4cea-af1a-581a1dbc1797","resolution":{"observed_at":"2026-08-12T18:56:30.724188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:56:30.704819Z","title":"”On-policy vs","venue":null,"work_id":"a0da605b-703c-4d52-a328-8d22af9b51b5","year":2021},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.392172Z"},"links":{"citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:d69065959f3e88450dbcaa3aca574f511e1b5478eae3879e4923b2b45108e8b8","observation_id":"afc2e878-93db-4a95-b605-2d01a674f093","resolution":{"observed_at":"2026-08-12T18:56:30.709295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10984","last_updated":"2022-04-23T03:53:37Z","snapshot_observed_at":"2026-08-13T16:40:56.397841Z","submitted_at":"2022-04-23T03:53:37Z","title":"Deep Reinforcement Learning-based Radio Resource Allocation and Beam Management under Location Uncertainty in 5G mmWave Networks","version":1},"cited_work":{"arxiv_id":"2204.10984","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10984","snapshot_observed_at":"2026-08-12T18:56:30.582152Z","title":"Deep Reinforcement Learning-based Radio Resource Allocation and Beam Management under Location Uncertainty in 5G mmWave Networks","venue":"eess.SY","work_id":"759b2fd6-283b-4d73-82d1-33ccb020b2ae","year":2022},"citing_paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:30.349965Z"},"links":{"cited_paper":"/paper/2204.10984","citing_paper":"/paper/2412.01839"},"observation_digest":"sha256:a335bdfe05e75a13c08196889698bac17b5d2aa722ecc47386a3c11e4bbf4cce","observation_id":"6828eea2-8b0f-4de3-a7a6-7e8a442c42b4","resolution":{"observed_at":"2026-08-12T18:56:30.587000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01839","last_updated":"2024-11-17T17:46:40Z","latest_version":1,"primary_category":"cs.NI","snapshot_observed_at":"2026-08-14T21:20:32.032202Z","submitted_at":"2024-11-17T17:46:40Z","title":"Dynamics of Resource Allocation in O-RANs: An In-depth Exploration of On-Policy and Off-Policy Deep Reinforcement Learning for Real-Time Applications"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":4,"verified_fuzzy":7},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2412.01839."}