{"as_of":"2026-08-08T03:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be5fd841d20c5cfab2e7497f98e934e246130c8d180cb5a11772c8259507368a","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:17:41.302535Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:15:10.107091Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20008","snapshot_observed_at":"2026-08-03T03:15:10.107091Z","title":"Simon, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.08690","last_updated":"2026-06-22T11:24:21Z","snapshot_observed_at":"2026-08-06T10:10:44.062711Z","submitted_at":"2026-02-09T14:12:41Z","title":"SoK: The Pitfalls of Deep Reinforcement Learning for Cybersecurity","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:10.107091Z"},"links":{"cited_paper":"/paper/2509.20008","citing_paper":"/paper/2602.08690"},"observation_digest":"sha256:714c60cf30fb68de6e51f70fc52d756a03401b5cb1295a3499760d94d0a73247","observation_id":"fcd9be66-14d4-4393-9be7-407e6fbfb17b","resolution":{"observed_at":"2026-08-03T03:15:10.107091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.20008/citation-record","integrity":"/paper/2509.20008/integrity","json":"/paper/2509.20008/citation-record.json","paper":"/paper/2509.20008"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.853638Z","title":"Agarwal, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.853638Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:162e830d901624d549893d453126a25b8da862ed9ad42035fb8fd1e46d4c41b4","observation_id":"9c03587f-cd62-46d2-b440-85b222ccc9ea","resolution":{"observed_at":"2026-08-04T15:17:40.853638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.859321Z","title":"Akiba, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.859321Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:3999e4145aec7a7e6580c69339a40139c0e045c838aea57a5bdc95464f91a012","observation_id":"49bedf3e-1cba-41db-b6f0-7d884320023a","resolution":{"observed_at":"2026-08-04T15:17:40.859321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.865679Z","title":"Avalos, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.865679Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:5662e8dea28706950c474d52709f4b6e501ad43e05ea08c274738f232e51b66a","observation_id":"a21679c6-6be6-420d-9162-78096056f9a7","resolution":{"observed_at":"2026-08-04T15:17:40.865679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.871209Z","title":"Algorithmsforhyper-parameter optimization.Advances in neural information processing systems, 24, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.871209Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:9aaf50b40df0d44914ae20521be50393b8c7d552e3769878a6d5f28948691412","observation_id":"e296691a-907d-41f6-a834-d20a92fae4d8","resolution":{"observed_at":"2026-08-04T15:17:40.871209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-04T15:17:40.876898Z","title":"Berner, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.876898Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0df5904d490530a67a4fb67832cbbf71bcb525809ebe1dd7a207d6e317098a99","observation_id":"6d966730-60e6-4c38-9a67-6bed0c793947","resolution":{"observed_at":"2026-08-04T15:17:40.876898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.882716Z","title":"Leveragingproceduralgeneration to benchmark reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.882716Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:6edb963545702898f3e49f04cf7f5b604791d500c735743913e25eddabd2efff","observation_id":"69e4e99d-db93-44ca-87ab-73a3456018e7","resolution":{"observed_at":"2026-08-04T15:17:40.882716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.889168Z","title":"Quantifyinggeneraliza- tion in reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.889168Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:c928470ed2c9ea6dfe8f24893a40b50ffacc02be9229033ee0403e1619311b62","observation_id":"bf416b4e-2a73-4618-b2a4-6cb785d7c7a8","resolution":{"observed_at":"2026-08-04T15:17:40.889168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.894258Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.894258Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:63fb7da13ab00f0bb6d19bc71ff5e2e300228eca7c2311650c859915945613a2","observation_id":"df78588f-6206-4996-84be-181575057466","resolution":{"observed_at":"2026-08-04T15:17:40.894258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.899211Z","title":"Degrave, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.899211Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:6e040b9ff41c2649495d7508adeaf3eaab3c90add7a35049cb14d829496f7ccc","observation_id":"4b1e7abb-4055-446f-91e2-ee33fb0bb19d","resolution":{"observed_at":"2026-08-04T15:17:40.899211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T15:17:40.905001Z","title":"Dosovitskiy, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.905001Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:24ec821baa1db6956ef348bbf9a9bb1d6420dbf92bc12532ae852bda8b569989","observation_id":"4f25d8e3-dd32-4e81-a310-cf8d1c7cb824","resolution":{"observed_at":"2026-08-04T15:17:40.905001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.910536Z","title":"Dulac-Arnold, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.910536Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:800de211106eebd1b54f3daf1d6f500df8a676058f92d251ecb67ca0596d7eb9","observation_id":"1c6db22e-1bfd-479a-916b-4371b0228b12","resolution":{"observed_at":"2026-08-04T15:17:40.910536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.916553Z","title":"Ghosh, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.916553Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f7a9a98b1b5de569153279746a877148acd1881dca3b87b020fabdac26743fd3","observation_id":"2585bacb-d440-4f3a-a92b-fbd2b039682d","resolution":{"observed_at":"2026-08-04T15:17:40.916553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.06527","last_updated":"2017-01-11T20:25:54Z","snapshot_observed_at":"2026-08-03T18:25:04.868564Z","submitted_at":"2015-07-23T15:16:46Z","title":"Deep Recurrent Q-Learning for Partially Observable MDPs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.06527","snapshot_observed_at":"2026-08-04T15:17:40.921740Z","title":"Hausknecht and P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.921740Z"},"links":{"cited_paper":"/paper/1507.06527","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:273507982609cccad6b84a83d498f74df4747c3f7553abe2cf2fed3e07961d9a","observation_id":"f6b14c88-ba9b-497a-a7c6-182b06b9c4d0","resolution":{"observed_at":"2026-08-04T15:17:40.921740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.928240Z","title":"Hochreiter and J","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.928240Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:e345ab77d3699f5684044d1d13eb9cf369e3f4392da7b2bf09824b0a49ab94db","observation_id":"ef9c6021-d62e-43b7-942b-174edf5bb840","resolution":{"observed_at":"2026-08-04T15:17:40.928240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.933614Z","title":"Huang, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.933614Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:1e0d69fa51279459f64b5f3457578b37a4e1db1c8287424a7b0bdd7fa2c847af","observation_id":"5215ac3d-f50d-454a-8268-db30920c14a4","resolution":{"observed_at":"2026-08-04T15:17:40.933614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.938312Z","title":"Hutter, H","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.938312Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:4a79e13fb131e65a835e4a1600330a7a145a05d05ca874623e21ca8d1cfd8bf6","observation_id":"378b322d-cad9-4e9f-b14b-aba407d69a10","resolution":{"observed_at":"2026-08-04T15:17:40.938312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.943272Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.943272Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:6c7beacddc024bbb512b1855d22f96cb66dcfb9380eec72f4b5d9791c59c21c7","observation_id":"680a76b8-48f7-4da3-9c56-34af51d11d90","resolution":{"observed_at":"2026-08-04T15:17:40.943272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.948352Z","title":"Cybersecurity workforce study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.948352Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:df3d95921a8daedabd15ea2dae6113c5991b13a0bf6e8b942fa0bb7874f352bb","observation_id":"bbcab720-7abf-49c9-880e-57e10f2bbee0","resolution":{"observed_at":"2026-08-04T15:17:40.948352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17246","last_updated":"2023-08-18T11:32:44Z","snapshot_observed_at":"2026-07-06T15:34:09.163519Z","submitted_at":"2023-05-26T20:19:09Z","title":"NASimEmu: Network Attack Simulator & Emulator for Training Agents Generalizing to Novel Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17246","snapshot_observed_at":"2026-08-04T15:17:40.953276Z","title":"Janisch, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.953276Z"},"links":{"cited_paper":"/paper/2305.17246","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:4561de5f120eead237677c5b4ff99f7658da221072ca07ba15ebb5f69fcae4ae","observation_id":"be890974-ce76-426e-aa22-2ff732c5acdb","resolution":{"observed_at":"2026-08-04T15:17:40.953276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.958426Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.958426Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:1bbb27addac70a09be2704999420646370ab452dc0c5c9bf57e4e5b47aa54041","observation_id":"af6533b2-f4dc-4823-bb43-c3d5942094af","resolution":{"observed_at":"2026-08-04T15:17:40.958426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.963384Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.963384Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:3ba6cc9849c2ac6fa26807225d8f70a4185f4956c5c75bd1ebf5583b5624ad1e","observation_id":"c2063417-f2a5-43e9-976b-287b76b93851","resolution":{"observed_at":"2026-08-04T15:17:40.963384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.968243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.968243Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:4bce8fe9639700b167ea14d7b0ff012b794a9e9ea5c446ede0a9b9de99bf1827","observation_id":"c686a1b8-9e5f-4370-9642-4bb3c3c3f058","resolution":{"observed_at":"2026-08-04T15:17:40.968243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.972818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.972818Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d75672eb0dca1cc0eb47714dee671b7990d58c252c262fbeb19ad3c544119d53","observation_id":"2f61a012-b49e-48dd-9113-0de08caf5197","resolution":{"observed_at":"2026-08-04T15:17:40.972818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/eng2.12818","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Engineering Reports","work_id":"c2da126d-1850-401e-8229-77d7f6564b59","year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.977798Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d781db22c44c4dcebc40712bdf7b0ade77c92d84b63356d3c4388167baacf7d1","observation_id":"2c93b0e1-4c17-4d7d-9e05-c8bef29f1fdd","resolution":{"observed_at":"2026-08-04T15:19:27.934746Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.983462Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.983462Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d7cf65f2f046e4e75145cefdd9897d2ff7d9cff1acdaeb14511e2c54bd6e65a4","observation_id":"b934f38d-5405-43ec-8b8f-d95724659b2f","resolution":{"observed_at":"2026-08-04T15:17:40.983462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.988633Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.988633Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:2897574fc9dc31d45df899e02b0cb532ad9753766101ae584c5ca072500fc785","observation_id":"6c7f43cd-af3a-434b-a162-697e746ec5a4","resolution":{"observed_at":"2026-08-04T15:17:40.988633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.994639Z","title":"Macaulay","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.994639Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0728032f9ef421bdfa10bcd68e9f56ed27fc706f67f5fa7ec62c9fa3b0b808a5","observation_id":"d45b250d-d372-4043-bc0d-94d3ef81e9ae","resolution":{"observed_at":"2026-08-04T15:17:40.994639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:40.999615Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:40.999615Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0bfabb95f3cdb510de65246e0c1a4a3a0407887ff42c99716eebeccaa9c5b49b","observation_id":"8108e6a3-2ca6-4f01-9551-16cda0bab9a1","resolution":{"observed_at":"2026-08-04T15:17:40.999615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.004504Z","title":"Technical guide to information security testing and assessment","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.004504Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:270adeabfcd07f392b293d54f356412bb3bd85f5e2f975588fb0d53a49ce15da","observation_id":"c0c2d9a0-2bfb-45cb-abf1-d15ddd14a9c6","resolution":{"observed_at":"2026-08-04T15:17:41.004504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.009669Z","title":"Assessing security and privacy controls in information systems and organizations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.009669Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f9cfd38c93cf1e19228cf3bce178314726b98207a2fa095e87590be531a64a3c","observation_id":"da2368d6-0f5c-4b37-b418-1eb2613e3061","resolution":{"observed_at":"2026-08-04T15:17:41.009669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.014343Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.014343Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:048c89c78c1c0acdc43b8ff69045c45783dedf96e2fccece5c0665d20dcdd31d","observation_id":"e2e76536-4b41-48e8-9b76-5adb3d8f272b","resolution":{"observed_at":"2026-08-04T15:17:41.014343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.020267Z","title":"Oesch, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.020267Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:7386ade7d09e91587be096b537086ae5051a11d66f284860ed05e67bca011825","observation_id":"69fc5aa4-7fba-4517-ab64-06911226b6be","resolution":{"observed_at":"2026-08-04T15:17:41.020267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.025029Z","title":"Parisotto, F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.025029Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:f5d248f93cacb0245aad7c66c7137ea63f6f9eff2345d8d9683df5ac0626eb7c","observation_id":"cfb38252-9f68-4735-877f-d6edfc99939c","resolution":{"observed_at":"2026-08-04T15:17:41.025029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.030292Z","title":"Patterson, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.030292Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:781b82e7d1c4be516006c19143fdfe6873bff467e30a46f3db0850271c415244","observation_id":"8e77b001-8872-4ab3-876b-c5520f2a1960","resolution":{"observed_at":"2026-08-04T15:17:41.030292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.035430Z","title":"Pleines, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.035430Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:5555d2c6d98c9528f3abf4f2b404e4258d1d5ec36e4e6380c5a966a54d0ad07f","observation_id":"8640583c-1f9e-4d92-85f5-58ba7cb4b885","resolution":{"observed_at":"2026-08-04T15:17:41.035430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.040622Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.040622Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:3c14c76a5068aec57f20b5d5acb145575c001d78229b91598a0a9485e925419c","observation_id":"23e55b4b-7e3b-44de-bd0a-166ae10eda40","resolution":{"observed_at":"2026-08-04T15:17:41.040622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.046211Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.046211Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:60d21505d8509d2511c5156ceb5e3a619ad523b55de1b73872660c0df7cab9f1","observation_id":"0e4bca46-1403-4038-bf04-f51259144135","resolution":{"observed_at":"2026-08-04T15:17:41.046211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.051965Z","title":"Raffin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.051965Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:e776088a24005e8e9dd94bd18a3c8aed17386247242cc449d61036e3088d3ade","observation_id":"ee5c287d-6ac4-45d8-880a-15369729d2f9","resolution":{"observed_at":"2026-08-04T15:17:41.051965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.057452Z","title":"Automatedpenetrationtestingbasedonlstm and advanced curiosity exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.057452Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:688ceff4867155420db80444616721d89f8d97cc2ba61144d7f3b92494a853f1","observation_id":"86bd93f7-8500-41e5-8d32-b857f82b498e","resolution":{"observed_at":"2026-08-04T15:17:41.057452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.4714","last_updated":"2013-06-19T22:39:20Z","snapshot_observed_at":"2026-07-06T03:16:20.483507Z","submitted_at":"2013-06-19T22:39:20Z","title":"Penetration Testing == POMDP Solving?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.4714","snapshot_observed_at":"2026-08-04T15:17:41.062384Z","title":"Sarraute, O","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.062384Z"},"links":{"cited_paper":"/paper/1306.4714","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:c9465a81c0d8d1d3258c18b53c23545d30f6c22ba4797a51b10539666d6717b5","observation_id":"529d35b1-a25a-4617-b55e-90b5a857de53","resolution":{"observed_at":"2026-08-04T15:17:41.062384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.067599Z","title":"Schulman, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.067599Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:4f333a64b5d0b1ca89e3651b7f9f0a77015224ea18c20f6ae3a1fcb01b85ca05","observation_id":"fad18a99-ec48-4443-8b72-943fa1d8ac6b","resolution":{"observed_at":"2026-08-04T15:17:41.067599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T15:17:41.072922Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.072922Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:2654ca7017ee4a43f67f32b63a6683d0ebc8f08d6abb3c0063a9669bcbf3f094","observation_id":"dd98381a-f26d-48c7-a3fa-3a1cfdc6f22e","resolution":{"observed_at":"2026-08-04T15:17:41.072922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.077640Z","title":"Schwartz and H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.077640Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:1f3f325619454d82208c8fab4dd3e9fbc7c1beb63b5ee9d46a7cb39a6fa77516","observation_id":"1e6b992e-e622-4a17-92fb-cd232e079c4f","resolution":{"observed_at":"2026-08-04T15:17:41.077640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.082547Z","title":"Silver, J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.082547Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0b0251f223af8edbe2ae284dbdd0bc33219f2ca6527aaf4d14e430dfdb460860","observation_id":"2b8d6001-ed72-43a8-afbe-2dedfc2ff1a7","resolution":{"observed_at":"2026-08-04T15:17:41.082547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.09118","last_updated":"2021-08-20T11:32:23Z","snapshot_observed_at":"2026-07-06T11:40:04.439507Z","submitted_at":"2021-08-20T11:32:23Z","title":"CybORG: A Gym for the Development of Autonomous Cyber Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.09118","snapshot_observed_at":"2026-08-04T15:17:41.087188Z","title":"Standen, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.087188Z"},"links":{"cited_paper":"/paper/2108.09118","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:a6c19df9c49fe26677283be6f2b3973c2a06ceb561d336225ddf7c4f16ed3b9f","observation_id":"26c6e678-b3e7-4ae0-a20c-7523bcc2a080","resolution":{"observed_at":"2026-08-04T15:17:41.087188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.092323Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.092323Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:1b59caf00ef4656fb5d27606f2b41ab4df771041b12946dab7f7fa3bc61085a5","observation_id":"8760bd91-8f8d-4f25-b47b-89bdc24c06ce","resolution":{"observed_at":"2026-08-04T15:17:41.092323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.096981Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.096981Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d7df442c678b6cd476e5e428e88e325900657d54bd0bae2156c2f7524e77f9e3","observation_id":"dfeb21ad-55d5-46ca-a2b1-bbe6dd84e728","resolution":{"observed_at":"2026-08-04T15:17:41.096981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.101651Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.101651Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:e9ff1e24b7816eb26fd760874acb953a634eb181d8124c6ddea5b4d6f17d686e","observation_id":"8b5d5ef6-d802-406b-98c4-fa6f8de25d0f","resolution":{"observed_at":"2026-08-04T15:17:41.101651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.106454Z","title":"Terranova, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.106454Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:ade65a65013bb923c6a816a6b1d1226e85df0930f03c17ade8a700ecc8a53cd7","observation_id":"abe9022e-9c4f-40b7-8417-a9dd012a201a","resolution":{"observed_at":"2026-08-04T15:17:41.106454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.112986Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.112986Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:d8ce382b8bef79db63793bcb26be4e11096bcc748016968db6641fdd290286b6","observation_id":"7c050729-9864-4b22-a692-59ada23c098e","resolution":{"observed_at":"2026-08-04T15:17:41.112986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.117933Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.117933Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:18e66ecf310f83bd44a0baf2e82ab8df360779521e9962a1a71049b943d6d78c","observation_id":"7bb3ba7d-f30e-4797-9a28-dba28c9705b4","resolution":{"observed_at":"2026-08-04T15:17:41.117933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.124022Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.124022Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:559d3006b405d08be5c19933e14603edd354c1345558386aceccb8dbcf713fd4","observation_id":"487e9c21-ba1f-43ad-b643-bf34232ef265","resolution":{"observed_at":"2026-08-04T15:17:41.124022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.129479Z","title":"Global cybersecurity outlook 2023.Insight Report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.129479Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:0be1cca0fe9dcf29e0854052451848f1c1897c6fbd910f5c175ac35334da397c","observation_id":"9f2d09b9-074d-4cff-b24c-0035460a1dd3","resolution":{"observed_at":"2026-08-04T15:17:41.129479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.136192Z","title":"Yang and X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.136192Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:aed0a84797dd12bcf6847a664b6db5fe69159f7508a877532853386ec3d14099","observation_id":"c2b508a2-308e-4114-83f9-8d00c3a7b74b","resolution":{"observed_at":"2026-08-04T15:17:41.136192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06893","last_updated":"2018-04-20T16:49:52Z","snapshot_observed_at":"2026-08-04T06:10:10.723883Z","submitted_at":"2018-04-18T19:49:13Z","title":"A Study on Overfitting in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06893","snapshot_observed_at":"2026-08-04T15:17:41.150060Z","title":"Zhang, O","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.150060Z"},"links":{"cited_paper":"/paper/1804.06893","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:27e4918bf5bc750a5b5dec306f832bad64a07d6a209349b7853f9227271edf4f","observation_id":"9cb9216d-e9d0-460d-b1e8-06268bc07c28","resolution":{"observed_at":"2026-08-04T15:17:41.150060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.155716Z","title":"Zhang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.155716Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:647bb3988e396efcbde77179cfbd37dc24223b75afa70853d852cd12841a6dce","observation_id":"284a1faa-5b62-4786-8ad5-0b3198941490","resolution":{"observed_at":"2026-08-04T15:17:41.155716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.160405Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.160405Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:74f9fd434ed9baf793754da9e246dc651136a203b3ffd4c61978657be8605a53","observation_id":"77f777e9-2310-46b4-93b4-2084c75bc8be","resolution":{"observed_at":"2026-08-04T15:17:41.160405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.165469Z","title":"23 Table 2: Hyperparameter search ranges for PPO, PPO-FS and PPO-AO","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.165469Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:5fa9ae2b634cc72245042305ddebe0ffb5b2e13f141c064240edab8cac748302","observation_id":"2a46e996-baa1-454e-a247-bbf80bf5a09a","resolution":{"observed_at":"2026-08-04T15:17:41.165469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10630","last_updated":"2022-02-22T02:34:16Z","snapshot_observed_at":"2026-08-02T20:52:12.697422Z","submitted_at":"2022-02-22T02:34:16Z","title":"Behaviour-Diverse Automatic Penetration Testing: A Curiosity-Driven Multi-Objective Deep Reinforcement Learning Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10630","snapshot_observed_at":"2026-08-04T15:17:41.144781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.144781Z"},"links":{"cited_paper":"/paper/2202.10630","citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:c13d14f8af65c607678862d97e3b3e5e6719c17f741ec63b63d78343d530c4cc","observation_id":"f9f3d008-a026-4ce2-8099-b3a8898ef15b","resolution":{"observed_at":"2026-08-04T15:17:41.144781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:17:41.302535Z","title":"The specific version we used for thestable-baselines3 framework is 2.4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation","version":2},"reference_index":7602,"source":"pdf_text","source_observed_at":"2026-08-04T15:17:41.302535Z"},"links":{"citing_paper":"/paper/2509.20008"},"observation_digest":"sha256:936f132f5a0b9da8cc2bb9b610243cf975eb051aa514713cb2362c202f0e7b6f","observation_id":"cf8f1b00-68f3-4d41-872b-3c835127b37a","resolution":{"observed_at":"2026-08-04T15:17:41.302535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.20008","last_updated":"2026-06-25T15:07:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T15:17:39.967453Z","submitted_at":"2025-09-24T11:27:54Z","title":"Learning Robust Penetration Testing Policies under Partial Observability: A systematic evaluation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2509.20008."}