{"as_of":"2026-08-11T01:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4173149f9457e0843d6ca3aed4501763372fb444f758186fe1cb8d621c7901a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:38:26.733680Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T15:55:04.341082Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-09T15:55:04.398895Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"cited_work":{"arxiv_id":"2501.12991","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.12991","snapshot_observed_at":"2026-08-09T15:55:04.398895Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","venue":"cs.MA","work_id":"83b7d179-8f28-42e9-8b41-c7ca240ed2a6","year":2025},"citing_paper":{"arxiv_id":"2502.01268","last_updated":"2025-02-03T11:39:12Z","snapshot_observed_at":"2026-08-10T02:28:02.062059Z","submitted_at":"2025-02-03T11:39:12Z","title":"Resilient UAV Trajectory Planning via Few-Shot Meta-Offline Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T15:55:04.341082Z"},"links":{"cited_paper":"/paper/2501.12991","citing_paper":"/paper/2502.01268"},"observation_digest":"sha256:0399b6167d8d0cb56f3fdbe34f9ed361a23533d0ba27566782d631a59074bb1c","observation_id":"9f306572-e2e7-414a-83fb-9e47fd72be58","resolution":{"observed_at":"2026-08-09T15:55:04.404438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12991","snapshot_observed_at":"2026-08-04T18:09:30.327529Z","title":"An offline multi-agent reinforcement learning framework for radio resource management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10163","last_updated":"2025-09-12T11:41:40Z","snapshot_observed_at":"2026-08-09T09:44:43.801919Z","submitted_at":"2025-09-12T11:41:40Z","title":"Federated Multi-Agent Reinforcement Learning for Privacy-Preserving and Energy-Aware Resource Management in 6G Edge Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:09:30.327529Z"},"links":{"cited_paper":"/paper/2501.12991","citing_paper":"/paper/2509.10163"},"observation_digest":"sha256:10eda44842df5a0425aaa772422ff472a7b69618e18d94784765ba84cd0ae7b9","observation_id":"1d288dbb-6b10-4364-a3b6-13fe170d96bb","resolution":{"observed_at":"2026-08-04T18:09:30.327529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12991","snapshot_observed_at":"2026-08-02T17:28:25.473170Z","title":"An offline multi-agent reinforcement learning framework for radio resource management,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.25332","last_updated":"2026-07-29T13:02:23Z","snapshot_observed_at":"2026-08-02T17:58:36.026175Z","submitted_at":"2026-03-26T11:20:49Z","title":"DRL-Based Spectrum Sharing for RIS-Aided Local High-Quality Wireless Networks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T17:28:25.473170Z"},"links":{"cited_paper":"/paper/2501.12991","citing_paper":"/paper/2603.25332"},"observation_digest":"sha256:26e1c09a095c324c0d279132c3a6b20817a8286dacc7bc973db6741dc72903dd","observation_id":"9433e9d2-a1c2-42cf-9fbd-a97138cf5e5a","resolution":{"observed_at":"2026-08-02T17:28:25.473170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.12991/citation-record","integrity":"/paper/2501.12991/integrity","json":"/paper/2501.12991/citation-record.json","paper":"/paper/2501.12991"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.377434Z","title":"Applications of deep reinforcement learning in communications and networking: A survey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.377434Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:0c012beecb3ae3c18752c554872573b8593b2a182239e677418de5d619df83cc","observation_id":"7d71513c-9f5f-4a2a-93a2-b3435fb52707","resolution":{"observed_at":"2026-08-10T16:38:26.377434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.349749Z","title":"Machine type communications: key drivers and enablers towards the 6G era,","venue":null,"work_id":"647cc5ef-c2f2-48e5-9ebb-69609f8c00ac","year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.383055Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:9af015b0712de68e568dd7f14d4be39d60c9ec64b8f24e1e533a62a3a6e97829","observation_id":"1fcb869b-748c-4833-8e12-1408e6dd4db3","resolution":{"observed_at":"2026-08-10T16:38:28.353585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.387098Z","title":"Machine learning for large-scale optimization in 6G wireless networks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.387098Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:bf1dd452b8f6838778e67c4d8248306665409874871f96af30a8ea00291edfa9","observation_id":"f89b911a-4939-477b-9955-242340c90f7e","resolution":{"observed_at":"2026-08-10T16:38:26.387098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.391573Z","title":"Traffic prediction and fast uplink for hidden markov IoT models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.391573Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:67e7d6f48c122e354335b862a29c96bd9aa861f745028aaf75fef960da9f1f70","observation_id":"b169aff0-50b1-4008-b570-6194553607b9","resolution":{"observed_at":"2026-08-10T16:38:26.391573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.293754Z","title":"ITLinQ+: An improved spectrum sharing mech- anism for device-to-device communications,","venue":null,"work_id":"27da7df5-aa06-4fdf-9c7c-eb04253f2c26","year":2015},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.396079Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:7b75860d365f2c6c94d3346c17d9d9feabd7bd956f3797edd0ea2d79b80ce166","observation_id":"7bdf73bb-4cb6-4eac-8c3e-31948bd53963","resolution":{"observed_at":"2026-08-10T16:38:28.307166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.234896Z","title":"Binary power control for sum rate maximization over multiple interfering links,","venue":null,"work_id":"f47c82cd-5d58-42bc-9605-65e3499987f0","year":2008},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.400119Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:91ca6b182ee31518fcba5257a0d1a39ff62fa99468fb754b570568cc87428f57","observation_id":"0603d526-e60b-4646-b84b-29890a4a6360","resolution":{"observed_at":"2026-08-10T16:38:28.264891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:28.069800Z","title":"Game-theoretic resource allocation methods for device-to-device communication,","venue":null,"work_id":"9318ccf5-3528-4935-a636-5d29c859b565","year":2014},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.404809Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:fcc69b4f15ee30e5bcb4385fae2eed4cae4a17936573675526e32c8f5819efd9","observation_id":"87163d71-2dde-4d97-bbda-a357717ebbea","resolution":{"observed_at":"2026-08-10T16:38:28.168993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.933815Z","title":"Reinforcement learning for radio resource management in RAN slicing: A survey,","venue":null,"work_id":"738f2a82-656e-4e4f-8849-084d1ead565e","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.409001Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:d9af7152387956c08376936123462c63bc435c750cd27fbbe63eb051a662aba9","observation_id":"43973fb1-4fe0-4d83-8a5f-077d92220f0d","resolution":{"observed_at":"2026-08-10T16:38:27.995236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.834739Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"cedf84da-bd87-4ea1-808d-452fc4af8b28","year":2015},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.412890Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:a52d35709eef141dc8ecdfca8110311262e19df314b0967bc20472b32143b973","observation_id":"735ef8f1-f2dd-4537-8266-e26a3b4cd0a6","resolution":{"observed_at":"2026-08-10T16:38:27.889435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.417654Z","title":"Distributed learning methodologies for massive machine type commu- nication,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.417654Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:2f6cfc2dab7d4c6e5d5e74c08525f6a925612462e437bc7ff974bef0ca5ecfdf","observation_id":"e01f4e44-e7f2-4d5d-af5c-3269828ce5ea","resolution":{"observed_at":"2026-08-10T16:38:26.417654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.422116Z","title":"A review of cooperative multi-agent deep reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.422116Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:18dc9750519e6c02c76e04f91d7a06dd57c4152738b975155668c71ddfd9cb5a","observation_id":"84ac731c-bba5-457c-8881-d00ac52865a6","resolution":{"observed_at":"2026-08-10T16:38:26.422116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.774582Z","title":"Multiagent cooperation and competition with deep reinforcement learning,","venue":null,"work_id":"f30e289a-a235-4a32-852c-178374d66c4f","year":2017},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.426282Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:b59e4785033d47da8b59b64ea19d3f8d2b97ae55e3ebf3e51bd6a770e6a3b23b","observation_id":"d78e7986-f0c9-45e9-ab32-ccbddf6842f3","resolution":{"observed_at":"2026-08-10T16:38:27.778506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.430814Z","title":"Traffic learning and proactive UA V trajectory planning for data uplink in markovian IoT models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.430814Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:07b54a72fbdbbceca65109adeee294c9cfecc44fbd3c017c1fe3c6c6490c02f3","observation_id":"66b0eda9-c64a-4673-a906-3c5990328021","resolution":{"observed_at":"2026-08-10T16:38:26.430814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.732389Z","title":null,"venue":null,"work_id":"ac2f123f-2568-4b94-8b1d-64c29ca519a7","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.434820Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:b5e424cbf138d3ec330e6b6798c51100d724baa7a7ba65c0ff17f44986b1f76c","observation_id":"716a8365-1daa-4776-be8b-39873a992dac","resolution":{"observed_at":"2026-08-10T16:38:27.746843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-10T16:38:26.438685Z","title":"Value-decomposition networks for cooperative multi-agent learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.438685Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:0c126343bf0e062be683726f20602c3e845c56e145b2f3401667cfd2be5b99a8","observation_id":"5b0a152c-e1be-4636-aeea-bc7d40772eb1","resolution":{"observed_at":"2026-08-10T16:38:26.438685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-10T16:38:26.443158Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.443158Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:4e7315826d32aa8f600b8436febf7602dda0bc6762aea2c3a3f43d9f8c90f82f","observation_id":"f004739c-02cf-4384-bba4-f63558092690","resolution":{"observed_at":"2026-08-10T16:38:26.443158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-10T16:38:26.447226Z","title":"Offline reinforcement learning with implicit Q-learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.447226Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:5e6c197bb13bb25b8cc38f016815fbf35a1d74b8b63e68eccae5e290f168b5a4","observation_id":"869719da-66ed-4fbc-964b-b6de49ad4e56","resolution":{"observed_at":"2026-08-10T16:38:26.447226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.451361Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.451361Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:47351439812ef96887ae6691ebf84b41124aa85e806d95cba72a35d0b32e0c02","observation_id":"c9c98b66-7cc4-49e5-8643-b6b6fb8a400d","resolution":{"observed_at":"2026-08-10T16:38:26.451361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.694737Z","title":"Conservative Q-learning for offline reinforcement learning,","venue":null,"work_id":"23e00f73-ef1e-4b04-9bbc-06e6f843c5f0","year":2020},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.454510Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:fe3e1fa17fa1153ed50aaa76300e38fbd36678cc1f47319ba154412f0cf19ece","observation_id":"2f4a169e-6b7d-499d-966b-578772424190","resolution":{"observed_at":"2026-08-10T16:38:27.704739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.457917Z","title":"Self- organization in small cell networks: A reinforcement learning approach,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.457917Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:e054d005e07a593114de04971e5063ea6c0e9fbbffb94081fb59742d35d7fd78","observation_id":"805f3ed8-0c1e-491a-af3a-365dcf7b8bda","resolution":{"observed_at":"2026-08-10T16:38:26.457917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.462158Z","title":"Intelligent power control for spectrum sharing in cognitive radios: A deep rein- forcement learning approach,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.462158Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:fdfb497c44eb7d07c43a24d602c21e3c5feadf5acd8a64574e214aaba2e4de5f","observation_id":"dfce22b9-4928-42d3-a04a-36253c9ef5f3","resolution":{"observed_at":"2026-08-10T16:38:26.462158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.466094Z","title":"Multi-UA V path learning for age and power optimization in IoT with UA V battery recharge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.466094Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:9fc83066cd69d249231bb44c9ff0e85b835cd80cb734755084008d45125acd73","observation_id":"122452db-342a-4b00-ada6-9222e3c3aaea","resolution":{"observed_at":"2026-08-10T16:38:26.466094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.547834Z","title":"GAN-Powered Deep Distributional Reinforcement Learning for Resource Management in Network Slicing,","venue":null,"work_id":"7a78b051-d371-485c-a02d-94a1c924483e","year":2020},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.469760Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:ad26db3b23fafde86c2fbcb7f23ba8c56e70c7f29c592be22280a7697c729114","observation_id":"c93a2828-5430-4f29-b302-506fc9c5988f","resolution":{"observed_at":"2026-08-10T16:38:27.574737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.515044Z","title":"Learning resilient radio resource management policies with graph neural networks,","venue":null,"work_id":"9b8f4778-74ce-4f05-8f91-acb91f960c1c","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.473955Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:433c1ac18e3830bcd83b35581ee1f26e7e0cbc37e1211b20b0716f4620494f5f","observation_id":"af79347b-0df3-4cde-bbca-863a9736d2de","resolution":{"observed_at":"2026-08-10T16:38:27.527007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.472506Z","title":"Age minimization in massive IoT via UA V swarm: A multi-agent reinforcement learning approach,","venue":null,"work_id":"e3de9b75-3322-4116-b44b-2dac9f0cdb2c","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.478001Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:7e26b965676688d10a01c1e8a004ed92a30504bf5f7f27175d374c700fecf0a2","observation_id":"5ff51be5-31b4-4171-89b2-2190470d0289","resolution":{"observed_at":"2026-08-10T16:38:27.488983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.369296Z","title":"Resource management in wireless networks via multi-agent deep reinforcement learning,","venue":null,"work_id":"afd9ee45-9ed9-41dc-82fa-80862c941aa1","year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.503529Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:dee95f8ef108e9718f04f325c967bb6089a2af1079e59404c6e123ae1f728fa8","observation_id":"2564065d-ce49-458e-899d-c1f0ab8a3c46","resolution":{"observed_at":"2026-08-10T16:38:27.434744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.573908Z","title":"Multi-agent deep reinforcement learning for dynamic power allocation in wireless networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.573908Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:f881fe7ca2caa2c82f5dff6decb8577b01fca4c6e1270ee993f0dda29d5f24f5","observation_id":"3cc94fe7-2fb0-46ee-856f-823605af0e3f","resolution":{"observed_at":"2026-08-10T16:38:26.573908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.275014Z","title":"Multi-agent deep reinforcement learning for distributed resource management in wirelessly powered communication networks,","venue":null,"work_id":"dccbdea7-cc78-4cef-9783-2fd2312f38b9","year":2020},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.647441Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:70081369cd7f36f5bf1fd41e41937c08fcb6eb33c737aa8f593cbd249a75b916","observation_id":"6d2a53a4-26ed-458e-b9b5-7d80d3893d86","resolution":{"observed_at":"2026-08-10T16:38:27.316562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.254965Z","title":"Multi-agent reinforcement learning for dynamic resource management in 6G in-X subnetworks,","venue":null,"work_id":"38f236f4-2e10-44fc-9d61-f045885ad430","year":1900},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.679758Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:68a2e8c9175211c67575fd2b102c4d7b699487dee4e8b5e05eabccd8115de467","observation_id":"d1711627-08c0-4e2c-ac39-873f11bc8bcd","resolution":{"observed_at":"2026-08-10T16:38:27.261959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08421","last_updated":"2024-11-16T10:08:06Z","snapshot_observed_at":"2026-08-02T23:25:28.223904Z","submitted_at":"2024-02-13T12:49:22Z","title":"Conservative and Risk-Aware Offline Multi-Agent Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2402.08421","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08421","snapshot_observed_at":"2026-08-10T16:38:26.786020Z","title":"Conservative and Risk-Aware Offline Multi-Agent Reinforcement Learning","venue":"cs.LG","work_id":"5e7349a8-d7c5-41f0-8522-200195aa03b0","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.685726Z"},"links":{"cited_paper":"/paper/2402.08421","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:ea67917a789086f2f3305ff1bce87a870cad6b316896870005f064e800be48ca","observation_id":"941997f2-b1b5-4268-8480-bd88ac62d783","resolution":{"observed_at":"2026-08-10T16:38:26.792615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.236006Z","title":"Offline reinforcement learning for wireless network optimization with mixture datasets,","venue":null,"work_id":"ea3f3dfd-0a0f-4bd0-b452-532c10a7899c","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.696342Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:9f067a8ce4faca38e78f5f5d71ac18a7119ea971322365d5d1312a543ab7b49e","observation_id":"23877ae2-2859-4cca-9cb2-3ebf5db9a51e","resolution":{"observed_at":"2026-08-10T16:38:27.243284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16764","last_updated":"2025-01-23T12:00:38Z","snapshot_observed_at":"2026-08-10T23:28:31.864563Z","submitted_at":"2024-09-25T09:22:23Z","title":"Offline and Distributional Reinforcement Learning for Radio Resource Management","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16764","snapshot_observed_at":"2026-08-10T16:38:26.703308Z","title":"Offline and distributional reinforcement learning for radio resource management,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.703308Z"},"links":{"cited_paper":"/paper/2409.16764","citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:ba106ca7affea15d3b00dc87320a90ceb1d0e1cc6ac3dd45ca763da385c54003","observation_id":"8a07c1c9-3bfd-45a8-bfec-462e9db6398f","resolution":{"observed_at":"2026-08-10T16:38:26.703308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.191765Z","title":"Offline pre-trained multi-agent decision transformer,","venue":null,"work_id":"5289235d-ca21-4e9e-a849-5b46d051dca8","year":2023},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.707643Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:a0fdc759e485e28d095d0e53025f03984c90f5f97729ba9d99afe4e5570b1717","observation_id":"30ffdfdd-7217-40b3-ace4-9eb4ca16137e","resolution":{"observed_at":"2026-08-10T16:38:27.206189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.089624Z","title":"Simulation assumptions and parameters for FDD HeNB RF requirements,","venue":null,"work_id":"47090305-4c8a-47ed-952d-b9d9f3c9200b","year":null},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.711712Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:69f884436678caf56c13663d64c7e1e546477f132ade42001f67e660cb7cd71b","observation_id":"139ee972-80a6-4d0a-84da-5bc13e8c7d67","resolution":{"observed_at":"2026-08-10T16:38:27.113493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:27.045957Z","title":"NR; physical layer measurements,","venue":null,"work_id":"ce7a0719-54c5-43e7-91f3-104f39baa06a","year":2024},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.715180Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:812f9301dffb706e880ea4328e9e2715821d0b8ffff192b3212f312b0ec85e8b","observation_id":"90e2dd4c-342a-47c4-b5b4-1eccae466435","resolution":{"observed_at":"2026-08-10T16:38:27.065394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.960654Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"a7fe19de-aad9-4a4e-a346-4f2d23868f6c","year":2018},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.718994Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:41eb9b328fb1d26f81160f6fb5fe418eeb8ecaffb9a6a71ca7c5f460cc3589a6","observation_id":"a53bb287-3bb2-45dd-a55f-1afc03342f70","resolution":{"observed_at":"2026-08-10T16:38:27.005362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.886380Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"26d67175-d4a2-4d12-840e-c14c1aa032c4","year":2018},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.722492Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:0ac6b558879d6cf9fc5c940f889290a0149583526de97603918d7d31bf145a67","observation_id":"5eb5ba51-366b-4228-9603-4174863e201d","resolution":{"observed_at":"2026-08-10T16:38:26.902181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.865615Z","title":"Value-decomposition multi-agent actor- critics,","venue":null,"work_id":"4e7b14a3-7226-4fe0-9f3c-87b7210b10d3","year":2021},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.726166Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:9e9c0f6f69bdee4406bbe22d19d4ec457432c402cf5b5af3a7a21e019f26d28d","observation_id":"78170cad-effe-4c74-834c-8afe0d12f9ef","resolution":{"observed_at":"2026-08-10T16:38:26.871767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.853127Z","title":"Off-policy deep reinforcement learning without exploration,","venue":null,"work_id":"532e7b9c-0cc5-43ee-85fc-9c854b65ed5c","year":2019},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.729412Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:83951971a4619d0ce9a34d6fbb8d85836fbe394e31c80d2470d27c6b83053f29","observation_id":"b16994bf-91fe-48ee-a830-8f0f3ae11f3e","resolution":{"observed_at":"2026-08-10T16:38:26.857112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:38:26.838910Z","title":"ITLinQ: A new approach for spectrum sharing in device-to-device communication systems,","venue":null,"work_id":"825fd0f3-b27c-4910-8db8-95a07315aa13","year":2014},"citing_paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T16:38:26.733680Z"},"links":{"citing_paper":"/paper/2501.12991"},"observation_digest":"sha256:ebabf44370d7bdafb2a0b79a4b26cd5ed17c1676700395503076886e9516f3e0","observation_id":"0ebd5816-83ba-4ba1-a3a4-e64ec924adce","resolution":{"observed_at":"2026-08-10T16:38:26.843606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.12991","last_updated":"2025-01-22T16:25:46Z","latest_version":1,"primary_category":"cs.MA","snapshot_observed_at":"2026-08-10T16:30:58.340779Z","submitted_at":"2025-01-22T16:25:46Z","title":"An Offline Multi-Agent Reinforcement Learning Framework for Radio Resource Management"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2501.12991."}