{"as_of":"2026-08-09T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f5d482b6343556b67b2bd20987d6780ad4ddca9aaec84d9e44c24a63f61469f","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:58:17.376083Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04317/citation-record","integrity":"/paper/2608.04317/integrity","json":"/paper/2608.04317/citation-record.json","paper":"/paper/2608.04317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.294729Z","title":"https://www.atomicredteam.io/","venue":null,"work_id":"38195466-b005-461a-aa77-a0f1b6adb4c1","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.162099Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:252633ae146556940c28133dee85bf4c72a3c47ac78c5b6abe46a8cc0a5c881c","observation_id":"e9e9ffb8-750e-4b83-8c2f-bd45f20644c3","resolution":{"observed_at":"2026-08-08T19:58:18.297825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.285332Z","title":"https://aicyberchallenge.com/ overview/","venue":null,"work_id":"250ad4f6-871a-4986-a8a2-3c1c700dd6d7","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.166233Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6792be2b799cf5e3365b2c48adf35288bbb3fc908883ea5fe8ac02a53a04ef03","observation_id":"55d89643-12c0-4fe2-b587-e12a11e90d67","resolution":{"observed_at":"2026-08-08T19:58:18.288443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.275844Z","title":"https://attack.mitre.org/","venue":null,"work_id":"3b52ad85-58c1-46dc-be4b-675234471641","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.169561Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:fcd758476a5a898181160a156413827ceb235d2f63d746e2114ff4d5a8c5e40d","observation_id":"01e142a8-f26c-45f9-9bbe-4eb79a5a53e1","resolution":{"observed_at":"2026-08-08T19:58:18.279178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.266657Z","title":"EnIGMA: Interactive tools substantially assist LM agents in finding security vulnerabilities","venue":null,"work_id":"a1630aa5-5d4e-494c-a3fb-6a7a3eaee805","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.173238Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:e4b9b703f67fbd7c524b8ecb976b0cfd532ad30a0b3fbdf6d2085fcad72b27ac","observation_id":"79f9f41b-f184-4565-abc2-5c6a8e94bdcd","resolution":{"observed_at":"2026-08-08T19:58:18.270066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.176790Z","title":"Back to basics: Revisiting REINFORCE-style optimization for learning from human feedback in LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.176790Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:544fd324170a46716a52733a2c6d18447013033eb8c5819b9edf62a1925bb6c6","observation_id":"067df76b-02b2-4127-a1bc-ba247e54a6f4","resolution":{"observed_at":"2026-08-08T19:58:17.176790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.251999Z","title":"Ctibench: a benchmark for evaluating llms in cyber threat intelligence","venue":null,"work_id":"bf9c441b-f6f8-4d31-b8ea-9099bd5872c1","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.180734Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:35d25c78669074dc04fb7f9ac4c1728ea7982e2605a7efffbce00fda348bdd9a","observation_id":"141545ae-3ce0-4a1b-9c95-bb69a16af683","resolution":{"observed_at":"2026-08-08T19:58:18.255302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.242715Z","title":"Claude Mythos Preview red.anthropic.com — red.anthropic.com","venue":null,"work_id":"174c4cd3-5fe7-4d29-ba65-1d473ff6fdec","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.185307Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:1f86ba26350d0f94669051256d2c898589f518cd6c2926238f1297c39b8c79c7","observation_id":"489af948-f565-4c76-9a3a-e2ed8ea9bf0b","resolution":{"observed_at":"2026-08-08T19:58:18.245978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13161","last_updated":"2024-04-19T20:11:12Z","snapshot_observed_at":"2026-08-07T13:01:36.699787Z","submitted_at":"2024-04-19T20:11:12Z","title":"CyberSecEval 2: A Wide-Ranging Cybersecurity Evaluation Suite for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13161","snapshot_observed_at":"2026-08-08T19:58:17.189295Z","title":"Cyberseceval 2: A wide-ranging cybersecurity evaluation suite for large language models.arXiv preprint arXiv:2404.13161, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.189295Z"},"links":{"cited_paper":"/paper/2404.13161","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b19eeb8ab9206d248e2cd2444e8eca2a39eb41b8b59f8d3de41d1bf115381b83","observation_id":"a94a278f-1b97-4c27-a052-f8d65eea29d9","resolution":{"observed_at":"2026-08-08T19:58:17.189295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04724","last_updated":"2023-12-07T22:07:54Z","snapshot_observed_at":"2026-08-06T10:04:24.134088Z","submitted_at":"2023-12-07T22:07:54Z","title":"Purple Llama CyberSecEval: A Secure Coding Benchmark for Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04724","snapshot_observed_at":"2026-08-08T19:58:17.193944Z","title":"Purple llama cyberseceval: A secure coding benchmark for language models.arXiv preprint arXiv:2312.04724, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.193944Z"},"links":{"cited_paper":"/paper/2312.04724","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:02e897506bf2a8db57167c22fd2a3089368e450425df3dfd2264f6e548bb51a7","observation_id":"7cdc2bd7-d8d6-4bb1-8996-da6ea68649a7","resolution":{"observed_at":"2026-08-08T19:58:17.193944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.233415Z","title":"Large language models are autonomous cyber defenders","venue":null,"work_id":"a7e6cb2d-a7a5-4a71-b7d2-f6492eaa0401","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.197620Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:2150341b68ec70755a2789870f865997c9d92a3355cbd1d2f322e11493ba44e3","observation_id":"66b4479a-f346-4677-b5e0-5a1b4346697f","resolution":{"observed_at":"2026-08-08T19:58:18.236818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.200744Z","title":"Agentverse: Facilitating multi-agent collaboration and exploring emergent behaviors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.200744Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:af1d5d75265dc75d31859ba3b68978c2bb77bebd32adaa0a7e0f91ba44f4f1f2","observation_id":"eafcbef2-bf1a-42ce-8839-962fd2b7ef32","resolution":{"observed_at":"2026-08-08T19:58:17.200744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T19:58:17.203952Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.203952Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:e657e937eca7727f4e573a4d8addd60734111eb32810340814369c7a865c3869","observation_id":"f56c22bb-c346-46b6-a51d-8999397414a7","resolution":{"observed_at":"2026-08-08T19:58:17.203952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.219184Z","title":"PentestGPT: Evaluating and harnessing large language models for automated penetration testing","venue":null,"work_id":"57a39ed8-ff73-414d-b22c-623a614f6e5c","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.207606Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:07cde88d3d41dbc58087cd1c1069ae9e3f36b5c5d8caa962b86213599eda2a69","observation_id":"c44250ce-64e6-41b6-9e34-c9837de6b25f","resolution":{"observed_at":"2026-08-08T19:58:18.222351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08144","last_updated":"2024-04-17T04:34:39Z","snapshot_observed_at":"2026-08-08T10:18:09.304124Z","submitted_at":"2024-04-11T22:07:19Z","title":"LLM Agents can Autonomously Exploit One-day Vulnerabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08144","snapshot_observed_at":"2026-08-08T19:58:17.210586Z","title":"Llm agents can autonomously exploit one-day vulnerabilities.arXiv preprint arXiv:2404.08144, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.210586Z"},"links":{"cited_paper":"/paper/2404.08144","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b86a7c4726d54a89c9f3d224d51581cc8f3ed497c80b791e8ec7e462e3937190","observation_id":"20e8ebcb-43a6-4c2f-9524-793b567730e6","resolution":{"observed_at":"2026-08-08T19:58:17.210586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06664","last_updated":"2024-02-16T04:02:51Z","snapshot_observed_at":"2026-08-07T10:02:21.156103Z","submitted_at":"2024-02-06T14:46:08Z","title":"LLM Agents can Autonomously Hack Websites","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06664","snapshot_observed_at":"2026-08-08T19:58:17.213871Z","title":"Llm agents can autonomously hack websites.arXiv preprint arXiv:2402.06664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.213871Z"},"links":{"cited_paper":"/paper/2402.06664","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:af0f2602a924a8e975f0ae48ba7435f17f20e93bf88de8fa19e9ece58b6903f9","observation_id":"8d7de844-f4f5-43d7-aa20-28fb6659842a","resolution":{"observed_at":"2026-08-08T19:58:17.213871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.210043Z","title":"Graphplanner: Graph- based agentic routing for LLMs","venue":null,"work_id":"38eebba8-0d3b-4362-a409-21f5d2fcb7e2","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.217256Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:897abf3450b3f1c884cf1d25988657df8cf16f088550ca6ce6f9816824e724fe","observation_id":"537a98f3-3e25-4ac9-9f28-20ec16beef8b","resolution":{"observed_at":"2026-08-08T19:58:18.213523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.200237Z","title":"Redcode: Risky code execution and generation benchmark for code agents","venue":null,"work_id":"e046bb4a-713f-4e05-b0ee-f7bde5590d0b","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.220501Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:386a9f6c150b6dcb53c874c20e22ce511b8309858ae2d95b1c16d7d9c92ebf40","observation_id":"8d073036-155f-4786-b95f-11dcadf22c59","resolution":{"observed_at":"2026-08-08T19:58:18.203990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-08T19:58:17.223565Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.223565Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:4f76e412619c91ed876afbc272126dea34b32a9ec216302c2e3b5e8760da0a5e","observation_id":"39a0136a-f926-47b7-a4fa-5a049b9ef4b5","resolution":{"observed_at":"2026-08-08T19:58:17.223565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.190393Z","title":"Getting pwn’d by ai: Penetration testing with large language models","venue":null,"work_id":"7844d8eb-efc3-461a-bc30-7907f465ed31","year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.227059Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:a7b3410822e3cce5bd1c8b2254319a3b8b1558f7230f69ad3ddefc285360eb63","observation_id":"392eb2c5-267a-48d7-8cfd-b33f5b60f0b6","resolution":{"observed_at":"2026-08-08T19:58:18.193871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.179836Z","title":"Llms as hackers: Autonomous linux privilege escalation attacks.Empirical Software Engineering, 31(3):70, 2026","venue":null,"work_id":"7aaa88ef-cb4e-4034-804c-20e03ce38005","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.230065Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:217e258d0b6ca95f3da23b1b68f3c74c488d45b1c9ca2617f6bd1038e7687a02","observation_id":"c775929a-b989-4410-9ac8-1cc62c818250","resolution":{"observed_at":"2026-08-08T19:58:18.183206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.168292Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":"ef63b1be-f1bc-43ef-a1a6-c5d906c6d058","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.233285Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:afa686326f3b44db386b782618b4abbdcd00941db1e9e9640c1193516244a156","observation_id":"a9a08bcc-f95d-4e36-9e3e-b8c4f572151a","resolution":{"observed_at":"2026-08-08T19:58:18.173065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-08T19:58:17.236382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.236382Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6e92f5519f0324d1365c9f0911f26a2e7ff8133579c5cdfcfe362a09c7b034e0","observation_id":"c10c72e4-b6db-44d3-b056-381995d46494","resolution":{"observed_at":"2026-08-08T19:58:17.236382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-08T19:58:17.239797Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.239797Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6c66fcd66ea783fa046de1f6156e3b9ead84d010bbc341dcfe113d44ce34d925","observation_id":"84a5e156-aac6-4e3a-88ed-2c2efa7cef9b","resolution":{"observed_at":"2026-08-08T19:58:17.239797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.155008Z","title":"Agentic ai for cyber defense: Llm-guided hierarchical multi-agent reinforcement learning","venue":null,"work_id":"a1d5114b-2de5-4cb8-aa06-4b1f27b4730d","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.243121Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:bc36b428e74170e886c8a72561fef5fa71989e8b8aa5ae0087a991aff3ce90e2","observation_id":"28054fda-b27f-4aaf-8f4b-81dd9ae96b37","resolution":{"observed_at":"2026-08-08T19:58:18.160033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:18.144891Z","title":"Search-r1: Training LLMs to reason and leverage search engines with reinforcement learning","venue":null,"work_id":"6ab48f04-bdd5-4fb8-95bc-7deddf491585","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.246095Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:f9c6d105822d1feec4ab6f14c715feca55f899db2ebfc5ae78105314b58752d8","observation_id":"828afaeb-c042-4d3c-8910-8c58d6057b1c","resolution":{"observed_at":"2026-08-08T19:58:18.148367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.249096Z","title":"Exploring the efficacy of multi-agent reinforcement learning for autonomous cyber defence: A cage challenge 4 perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.249096Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:8539112abd07a7c9b4970c430b47ef2696b16fb6f730473cf25109f91be0554a","observation_id":"5157025d-7461-46e7-b441-5d66539fec3a","resolution":{"observed_at":"2026-08-08T19:58:17.249096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.252347Z","title":"Automated cyber defense with generalizable graph-based reinforcement learning agents.arXiv preprint arXiv:2509.16151, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.252347Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:8dd9b4f419c97e4550681fbe22ffd5d05f188372b45ac58e35d4bce10906bafc","observation_id":"e6e1b05a-f842-4dbb-b1e7-d144c3b9786f","resolution":{"observed_at":"2026-08-08T19:58:17.252347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.255777Z","title":"Large language models are zero-shot reasoners.Advances in neural information processing systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.255777Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:285478821b8e10ef8cbb7f5214480a68561bd00d33f41787a9fea457c3c56770","observation_id":"eea105c7-6006-490e-be8b-80e29d897860","resolution":{"observed_at":"2026-08-08T19:58:17.255777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.258881Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.258881Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:bbcecc06f7a373450280d759e410ac938de120d046d90bd23dc8a614102bf56d","observation_id":"002fa239-7cad-40a3-9abc-bd5b8d3cfe68","resolution":{"observed_at":"2026-08-08T19:58:17.258881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.907291Z","title":"In-the-flow agentic system optimization for effective planning and tool use","venue":null,"work_id":"6f05c939-066e-42ea-bdc6-6c6035209e32","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.261962Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:cce9a64c9f68e8880ad9fd4414d368978da1f84949025b43e4eec014ecf7ce2a","observation_id":"e9181f4b-d3ac-47de-9116-2de7e18ab6a0","resolution":{"observed_at":"2026-08-08T19:58:17.910451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.264984Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.264984Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:84f10c12715290070468f99c50455ac878a7d51e44c7594c9078cdc9e477cd76","observation_id":"122e0f90-d9be-4245-9c27-eee78120d9bd","resolution":{"observed_at":"2026-08-08T19:58:17.264984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.892830Z","title":"Et-bert: A contextualized datagram representation with pre-training transformers for encrypted traffic classification","venue":null,"work_id":"b673d63a-cf56-4319-9ef9-b4dc23ac49da","year":2022},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.267969Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:be44e7de8e630e8b36be86943d551228c7782bfe0886e9453a16d3d9e568d86c","observation_id":"74634654-66b4-4099-b9a5-9ac2f6dd52b0","resolution":{"observed_at":"2026-08-08T19:58:17.896149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.883263Z","title":"Cyberbench: A multi-task benchmark for evaluating large language models in cybersecurity","venue":null,"work_id":"10ea75ff-f95a-4574-86f7-9b5068ed371b","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.271027Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:8770e9b73c05ace5e937b2e202d3b83b51e0fb0a628295d43d01e795e62054f8","observation_id":"602324bb-d5ad-459d-9e75-1357f935d447","resolution":{"observed_at":"2026-08-08T19:58:17.886939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.273922Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.273922Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:2f734aa30951da8558f83d2db14b28f33d28df9c02ae4d90223e588d4a183584","observation_id":"7addd55e-ce6c-400f-837c-9d12548168d0","resolution":{"observed_at":"2026-08-08T19:58:17.273922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.869351Z","title":"Contrasting centralized and decentralized critics in multi-agent reinforcement learning","venue":null,"work_id":"2fa5d8f8-b4fb-4658-af11-ce0837ba0128","year":2021},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.276936Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:fc94ba0fa32ca3cbec6c3645ecd7a9b4cf2798aabfe174122508e8946765fb23","observation_id":"fe77814f-b49e-4ca1-a9d0-27a9fc5cc743","resolution":{"observed_at":"2026-08-08T19:58:17.872569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.279999Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.279999Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:a77da0aa431c715ff78310b137c0aded74a1953cf54cd73efc0944a497974577","observation_id":"3113a622-7603-43f8-a95c-d5faabd251b3","resolution":{"observed_at":"2026-08-08T19:58:17.279999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.283080Z","title":"Ray: A distributed framework for emerging {AI} applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.283080Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:e6c7e3ab8d98525c24d5a73804dea48a07ff14cd34d8c07032c3c8313a5854f4","observation_id":"19bfc18e-0300-400e-9f37-06b0db33acbd","resolution":{"observed_at":"2026-08-08T19:58:17.283080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.850124Z","title":"Experience with emerald to date","venue":null,"work_id":"c69a603d-6642-4d36-b6e1-f63a303cee95","year":1999},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.285979Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:eeee7a574452d72f8918e3f777c4b2c249e1e7285ee279cb2a06cf17d147dd53","observation_id":"3457e4e5-f661-4b23-8580-db69c17dbeaf","resolution":{"observed_at":"2026-08-08T19:58:17.853501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.840407Z","title":"Towards a high fidelity training environment for autonomous cyber defense agents","venue":null,"work_id":"458279ee-dd1b-4b1a-9c14-b92eeae5ac0b","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.289324Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:4419c4ecb515c70d3faceca56db1bbcd8bbe8ce2add1534f9c59fdc538221d20","observation_id":"bbccf353-cf5e-42ab-b437-e87fa106e2e5","resolution":{"observed_at":"2026-08-08T19:58:17.843871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T19:58:17.292586Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.292586Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:cb8b478bdfd81f0968918cd3d715e4e2ecc7df43dbf62b384479318da53dd1fd","observation_id":"6de97952-a83d-4464-a26e-8cf90eb500df","resolution":{"observed_at":"2026-08-08T19:58:17.292586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.830867Z","title":"Nyu ctf bench: A scalable open-source benchmark dataset for evaluating llms in offensive security","venue":null,"work_id":"ed06122d-bb90-4756-ae98-6a941b8eef01","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.295843Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:235c334679b2ffd03ddd18915ae01fe8f4a72a0727e92510bf1737f3647fb9bc","observation_id":"a004ecfb-09e6-44c3-986f-43b6cbf9ea81","resolution":{"observed_at":"2026-08-08T19:58:17.834168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T19:58:17.298765Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.298765Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:74732a4f51630c2460a84fb206afd3e24b162ab9cdf6dccf1e498e85d1de8249","observation_id":"3a10cc6c-cbfd-46c2-a99b-629db9076462","resolution":{"observed_at":"2026-08-08T19:58:17.298765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.301997Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.301997Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:1d3954d090249f4a83a4cc2f3790ab14e1d5643ae8732cbc74452cf1719df21d","observation_id":"97c601a8-7810-4d7f-93d1-c46ca867f66b","resolution":{"observed_at":"2026-08-08T19:58:17.301997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.816272Z","title":"Hierarchical multi-agent reinforcement learning for cyber network defense.Reinforcement Learning Journal, 6:790–810, 2025","venue":null,"work_id":"0ca51d85-0136-4d83-b297-417d20b373ed","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.305358Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:4b2321c037616f9e239f5d47609cbcebd17e731544ae80dac65fb0e1bed9c9cc","observation_id":"b6fbeb53-181b-4e61-9d1c-dbe37dd0d1ce","resolution":{"observed_at":"2026-08-08T19:58:17.819801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.806875Z","title":"A taxonomy of intrusion response systems","venue":null,"work_id":"396cd778-5fc5-4131-b61f-298d6e030251","year":2007},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.308716Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:5b89df6a87aa59145d9e3d8f4b50a6062629ab4f946038eab4f753ce231cdc93","observation_id":"0d1bded1-97d5-40eb-8495-315f36c22d2b","resolution":{"observed_at":"2026-08-08T19:58:17.810253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.797317Z","title":"Redsage: A cybersecurity generalist LLM","venue":null,"work_id":"ea5084db-21ee-4c7e-bd25-1c103a1e1a91","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.311692Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6df67bbe30845c549881700ed5bc7b4d67abb9c78c22302aa4e0a025f2b14508","observation_id":"2f99b4cb-176e-44b6-8d9e-9af9daa5eac8","resolution":{"observed_at":"2026-08-08T19:58:17.800806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.787004Z","title":"Cyberbattlesim, 2021","venue":null,"work_id":"71c9d4be-6271-4c08-8930-ecd2c2cd43bf","year":2021},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.314759Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:632010723e65166851ba83a97cfe6aecab46f684f4f72af74bbab1946b8be19e","observation_id":"294053bb-943e-470b-9ada-fd18ddb5bad4","resolution":{"observed_at":"2026-08-08T19:58:17.791420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.317755Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.317755Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:8188a556d6b8fcd9424ddf136a289e0e2f1077e19c36d4d5f252ba857d6c2c5c","observation_id":"1782e2f7-4dd3-4e2a-9cab-129cb7519f89","resolution":{"observed_at":"2026-08-08T19:58:17.317755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01605","last_updated":"2024-09-06T18:17:07Z","snapshot_observed_at":"2026-08-09T15:49:58.734883Z","submitted_at":"2024-08-02T23:47:27Z","title":"CYBERSECEVAL 3: Advancing the Evaluation of Cybersecurity Risks and Capabilities in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01605","snapshot_observed_at":"2026-08-08T19:58:17.320654Z","title":"Cyberseceval 3: Advancing the evaluation of cybersecurity risks and capabilities in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.320654Z"},"links":{"cited_paper":"/paper/2408.01605","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:3419cfd93e427e284298d1f2c769a8655daac0fbd27727d51615c9b61bcce54b","observation_id":"52f80ab4-0d91-46e9-be5e-44d05215a9f5","resolution":{"observed_at":"2026-08-08T19:58:17.320654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08865","last_updated":"2026-04-10T01:58:21Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T01:58:21Z","title":"SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08865","snapshot_observed_at":"2026-08-08T19:58:17.324049Z","title":"Sppo: Sequence-level ppo for long-horizon reasoning tasks.arXiv preprint arXiv:2604.08865, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.324049Z"},"links":{"cited_paper":"/paper/2604.08865","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b2268ec4de011424d65a62889b93370d9fd53422a0abbf02528be0d1d9f40a03","observation_id":"c66d7f38-f65f-4667-bcd0-2e9622ff5b4e","resolution":{"observed_at":"2026-08-08T19:58:17.324049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.772919Z","title":"SymRTLO: Enhancing RTL code optimization with LLMs and neuron-inspired symbolic reasoning","venue":null,"work_id":"286bb86c-583d-4240-9f99-c862b5d8ade2","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.327331Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:4a4eef6d2e1afe4ab4351fe5c98fee3927d2ecb5e9ee2396136468dc7cb4c195","observation_id":"2c23d796-9356-45ec-a517-60c7e6bfa970","resolution":{"observed_at":"2026-08-08T19:58:17.776191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.330596Z","title":"Cyber- gym: Evaluating AI agents’ real-world cybersecurity capabilities at scale","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.330596Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:cde61673077ab7d592429bdb4bc314ef4bb34f6c67c6ccad8fa5128bc74d6b83","observation_id":"5dfeadbe-4bab-4196-a7e0-b38991215f8c","resolution":{"observed_at":"2026-08-08T19:58:17.330596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.758962Z","title":"SWE-RL: Advancing LLM reasoning via reinforcement learning on open software evolution","venue":null,"work_id":"762b8752-83b5-4ddc-925d-1b24efce1cb0","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.333659Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:f30e99f1c907d8697f667e18e3ba88611a1cb0acc5b9fc8ec7a8a3a834626edd","observation_id":"7d765deb-4598-47d6-9abe-0b9c9fe38835","resolution":{"observed_at":"2026-08-08T19:58:17.762294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.749698Z","title":"Autogen: Enabling next-gen LLM applications via multi-agent conversations","venue":null,"work_id":"9b993ee4-272a-451e-bcb3-830ff0ee5da5","year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.336740Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:f497e2c21a9dc1386a113e584a618a416903935514e82032ed67f1af762046ed","observation_id":"7967ed37-304e-4d30-8fef-a0d5f8595db7","resolution":{"observed_at":"2026-08-08T19:58:17.752947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-08T19:58:17.339747Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.339747Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:c815275310e74d2883ebe0c8256647461cae5ce569705f0387ccd9150ecf69f7","observation_id":"eee7a847-1c5c-464e-8a27-af119d650e66","resolution":{"observed_at":"2026-08-08T19:58:17.339747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.343099Z","title":"Intercode: Standardizing and benchmarking interactive coding with execution feedback.Advances in Neural Information Processing Systems, 36:23826–23854, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.343099Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:7c7df2be94ef54e82de4b024071b1547407291a4ee7cc338dd8e289a3e4cfe62","observation_id":"c3698d0f-5488-44a5-81a1-c9642f22a97c","resolution":{"observed_at":"2026-08-08T19:58:17.343099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.346037Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.346037Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:6f21843401d93016826ce6bbf3dc1ee2f6e89b6edf6824157228e1ca4c5c2504","observation_id":"f1dc883e-3319-46a9-bdee-54080f81ded9","resolution":{"observed_at":"2026-08-08T19:58:17.346037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.730744Z","title":"Primus: A pioneering collection of open-source datasets for cybersecurity LLM training","venue":null,"work_id":"df7ea47e-91ad-4266-b1e4-607be8c3df74","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.348903Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:f5b31250e086b684af0b73953b85f330d43cfedbb492e3f7b81ee698363ab2ad","observation_id":"1e522d46-fdde-43c2-bcf0-37c6e7d88933","resolution":{"observed_at":"2026-08-08T19:58:17.734052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.721614Z","title":"ACECODER: Acing coder RL via automated test-case synthesis","venue":null,"work_id":"cdf74e3c-2a29-4aa8-be5a-425b3b5b3938","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.351778Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:c91bdb3c0a90663206faa75c1bb154128905fa1139e13687580ef4a9dac1edb8","observation_id":"1caec6f9-8983-4b60-8d5d-737a854fc042","resolution":{"observed_at":"2026-08-08T19:58:17.724919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.354780Z","title":"Ho, and Percy Liang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.354780Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b0913a4caf48dd9fc3bddd9014501ccc36d0dc9ee2fc03b8a13707561306ecdb","observation_id":"367b9b5e-445a-46ef-b1b6-e52272cd4fa2","resolution":{"observed_at":"2026-08-08T19:58:17.354780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.707098Z","title":"Abdi, William Blum, and Muhammad Abdul-Mageed","venue":null,"work_id":"b9fba59f-b636-4e6c-8fd0-01b14c947a1e","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.357824Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:78e43804efc1c0ef6e50c67a9de5da68f3132724a59a2c34978399ae2e7887ff","observation_id":"13fc7108-c6b0-42d2-9814-7d4992243321","resolution":{"observed_at":"2026-08-08T19:58:17.710547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.697553Z","title":"Yet another traffic classifier: A masked autoencoder based traffic transformer with multi- level flow representation","venue":null,"work_id":"1e3345fa-9be8-4862-a409-0b27b131f5a4","year":2023},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.360906Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:41a8c6b1c259bd9060127f468b1313f21919ab8fc3c8059c3419e92b19d6c0fc","observation_id":"e13e38df-282a-43f7-a6e7-425f58fe3047","resolution":{"observed_at":"2026-08-08T19:58:17.700836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.687793Z","title":"Curran Associates Inc., Red Hook, NY , USA, 2019","venue":null,"work_id":"32cc2d5f-9394-4551-84e3-8763c6cfa585","year":2019},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.363877Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:247e791681746f41126f224ceb45ad7b3693890957d137e4de00d9ffba1276e2","observation_id":"0ad2c876-7da4-447a-9c50-02f548644f98","resolution":{"observed_at":"2026-08-08T19:58:17.690889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.678020Z","title":"More than just functional: LLM-as-a-critique for efficient code generation","venue":null,"work_id":"bc47210f-ca11-43bf-b6de-995596ed6b13","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.366857Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:b9c545e1b571a006d598a25b1e4530714e693632d0a3adb13e633939f4bfa1e9","observation_id":"7c3dd15d-4a6b-4b36-974e-70e9254d75d6","resolution":{"observed_at":"2026-08-08T19:58:17.681374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.668040Z","title":"CVE-bench: A benchmark for AI agents’ ability to exploit real-world web application vulnerabilities","venue":null,"work_id":"fe767653-df9e-4ee3-9c6a-9e164cf337a0","year":2025},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.369963Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:91ae267727cec86bb22a330a67b7581ee38b65ef883315f65d8357fd8b63685c","observation_id":"9750a2ff-fd21-4e2c-8c61-455322623ec2","resolution":{"observed_at":"2026-08-08T19:58:17.671444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.658247Z","title":"Teams of LLM agents can exploit zero-day vulnerabilities","venue":null,"work_id":"5e9e50e1-40f5-4e53-a093-61fe0c2a9d22","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.372961Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:5eea872f9573ab828048d2aafa0ffc41348e79015f7051b4fb543bd7df46f16e","observation_id":"bf259fbf-ae1a-4a4e-8ced-017136dbe910","resolution":{"observed_at":"2026-08-08T19:58:17.661621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2950.9540","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T19:58:17.469874Z","title":"Cyber-zero: Training cybersecurity agents without runtime","venue":null,"work_id":"a6d3395c-1ef9-40aa-9aa8-99b13a13411c","year":2026},"citing_paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T19:58:17.376083Z"},"links":{"citing_paper":"/paper/2608.04317"},"observation_digest":"sha256:737bb14cb4e1a2411e6fe5bbe8dfe84467b7453751b8b19f1087d819d95ad14c","observation_id":"c46cf609-583b-4ba5-b8a1-54ebd9e9fbf7","resolution":{"observed_at":"2026-08-08T19:58:17.476910Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04317","last_updated":"2026-08-05T00:54:57Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-09T15:50:35.566554Z","submitted_at":"2026-08-05T00:54:57Z","title":"Trident : How to Break Deep Reinforcement Learning Cyber Defenses (Agentic)"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":37},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2608.04317."}