{"as_of":"2026-08-07T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b210f2e47041a9d36453e7f0cba8bb032fc704ea227a49f7a2bfce1555d80aaf","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:52:47.229805Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06891/citation-record","integrity":"/paper/2506.06891/integrity","json":"/paper/2506.06891/citation-record.json","paper":"/paper/2506.06891"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.732334Z","title":null,"venue":null,"work_id":"a0d8948c-30be-4406-8318-70d78084956d","year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.229805Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:fb3e1937fb4ba33e7b4dcb6c8009ce4a033aef964a4729d1a76c4245ec221c4a","observation_id":"27025b2e-4e77-40d8-91c3-85fba343b45f","resolution":{"observed_at":"2026-08-07T05:52:47.735305Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15143","last_updated":"2025-05-21T06:00:41Z","snapshot_observed_at":"2026-08-07T15:20:56.416242Z","submitted_at":"2025-05-21T06:00:41Z","title":"Filtering Learning Histories Enhances In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.15143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15143","snapshot_observed_at":"2026-08-07T05:52:47.715498Z","title":"Filtering Learning Histories Enhances In-Context Reinforcement Learning","venue":"cs.LG","work_id":"4ad771b9-41b0-4439-89b9-778c11f94864","year":2025},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.144755Z"},"links":{"cited_paper":"/paper/2505.15143","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:15fa142da1a4abbef499c2047bba41433bf17eefb65877f42225baf52356c3ae","observation_id":"df4ff8b2-7fdb-4e63-aeb8-5e4697426ef1","resolution":{"observed_at":"2026-08-07T05:52:47.718666Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.748167Z","title":"We chose the α-trimmed variant, which performs best empirically","venue":null,"work_id":"df14705e-ab63-4ad9-a197-2d6965185612","year":2020},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.224237Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:de92bdebf4742e5684c244b83c7fd6030582065eb6c7c2f0a673609016c47fcb","observation_id":"99f4c225-b51a-4a8e-ad62-0a2e1285aa00","resolution":{"observed_at":"2026-08-07T05:52:47.750820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:52:47.158998Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.158998Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:da3d91ccb13f69d8910624f918666907172c97f43c91d890f0900705a4eab557","observation_id":"1f6ff6e3-61c7-44a2-8c64-88ae69ffeb6d","resolution":{"observed_at":"2026-08-07T05:52:47.158998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02160","last_updated":"2025-06-02T02:16:50Z","snapshot_observed_at":"2026-08-05T13:50:40.591900Z","submitted_at":"2024-02-03T14:20:20Z","title":"Data Poisoning for In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02160","snapshot_observed_at":"2026-08-07T05:52:47.165231Z","title":"Data poisoning for in-context learning.arXiv preprint arXiv:2402.02160,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.165231Z"},"links":{"cited_paper":"/paper/2402.02160","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:7e36ff8ebb97ba474def86eff0f309f0e4bd7d6a030ee0924b8a14106d075efa","observation_id":"12a8d48f-d0b8-4feb-ab1a-2cba963e91e1","resolution":{"observed_at":"2026-08-07T05:52:47.165231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03391","last_updated":"2023-03-03T14:56:36Z","snapshot_observed_at":"2026-08-07T17:12:45.218003Z","submitted_at":"2023-03-03T14:56:36Z","title":"Decision Transformer under Random Frame Dropping","version":1},"cited_work":{"arxiv_id":"2303.03391","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03391","snapshot_observed_at":"2026-08-07T05:52:47.665713Z","title":"Decision Transformer under Random Frame Dropping","venue":"cs.LG","work_id":"6e323343-173e-49ed-98a2-59f6b2810b93","year":2023},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.167875Z"},"links":{"cited_paper":"/paper/2303.03391","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:6d904f2d7598ce2b00b7c835d37de4625f3eaa10e365abb4d12eb2ea28bf8fb0","observation_id":"5d2781a7-4306-49a4-af79-d29143ccc42e","resolution":{"observed_at":"2026-08-07T05:52:47.668693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.02284","last_updated":"2017-02-08T04:33:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-02-08T04:33:55Z","title":"Adversarial Attacks on Neural Network Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.02284","snapshot_observed_at":"2026-08-07T05:52:47.170551Z","title":"Adversarial attacks on neural network policies.arXiv preprint arXiv:1702.02284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.170551Z"},"links":{"cited_paper":"/paper/1702.02284","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:84a1314e9df1ab8f81964aa949e80367ad697696c9100f06b4cfc1acf32fde48","observation_id":"ca54a501-c1f5-4e85-8943-89d798fbda97","resolution":{"observed_at":"2026-08-07T05:52:47.170551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.788987Z","title":"Thodoris Lykouris, Vahab Mirrokni, and Renato Paes Leme","venue":null,"work_id":"3b8f8f69-f272-4b86-80a4-01b6e2d0f0de","year":2023},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.180533Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:758cf8660b25220ade0996b93d0739a916d7a1a4e835abf0a1a1422dcc00f29a","observation_id":"65ddb73e-84f5-45ce-93fe-72119da406e3","resolution":{"observed_at":"2026-08-07T05:52:47.791720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07978","last_updated":"2025-02-11T21:52:19Z","snapshot_observed_at":"2026-07-06T20:35:02.935416Z","submitted_at":"2025-02-11T21:52:19Z","title":"A Survey of In-Context Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07978","snapshot_observed_at":"2026-08-07T05:52:47.188471Z","title":"A survey of in-context reinforcement learning.arXiv preprint arXiv:2502.07978,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.188471Z"},"links":{"cited_paper":"/paper/2502.07978","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:5623b0fecdb67fadafa8be9b770d79a6fc39b25d41201f6ef150ca41fdc601f1","observation_id":"1746c1c3-08e4-4fab-af78-76e71a11315e","resolution":{"observed_at":"2026-08-07T05:52:47.188471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13851","last_updated":"2023-02-27T14:52:15Z","snapshot_observed_at":"2026-08-04T17:15:04.052083Z","submitted_at":"2023-02-27T14:52:15Z","title":"Implicit Poisoning Attacks in Two-Agent Reinforcement Learning: Adversarial Policies for Training-Time Attacks","version":1},"cited_work":{"arxiv_id":"2302.13851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.13851","snapshot_observed_at":"2026-08-07T05:52:47.453690Z","title":"Implicit Poisoning Attacks in Two-Agent Reinforcement Learning: Adversarial Policies for Training-Time Attacks","venue":"cs.LG","work_id":"124f163b-e4a1-4766-b56b-d9a38f166e14","year":2023},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.191020Z"},"links":{"cited_paper":"/paper/2302.13851","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:3c010d70713ff7645cb721cecbe23bf323516ac4d0699ee35f6621b72a6a1b57","observation_id":"3997a93b-b66b-40db-8f6b-7a90da0c71ba","resolution":{"observed_at":"2026-08-07T05:52:47.456709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.11347","last_updated":"2019-02-27T19:23:41Z","snapshot_observed_at":"2026-08-07T15:15:34.263627Z","submitted_at":"2018-03-30T05:47:11Z","title":"Learning to Adapt in Dynamic, Real-World Environments Through Meta-Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.11347","snapshot_observed_at":"2026-08-07T05:52:47.193639Z","title":"Learning to adapt in dynamic, real-world environments through meta-reinforcement learning.arXiv preprint arXiv:1803.11347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.193639Z"},"links":{"cited_paper":"/paper/1803.11347","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:cb13aad423475f3b1c85a6a601c8bca78d68cb9a7807b4b14d235c61dc62c248","observation_id":"1a6ce69d-45fd-4d9f-9e92-77ff00cc3797","resolution":{"observed_at":"2026-08-07T05:52:47.193639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.772509Z","title":"Practical black-box attacks against machine learning","venue":null,"work_id":"b4211f03-ce68-4fd8-b176-81c3a100e885","year":2017},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.196137Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:47dc2c42713a93b49a70152b142516830b4d3d078d20ce67c9144c9c2bbee363","observation_id":"e1883a44-6921-4c55-96f1-c3ca9f319d51","resolution":{"observed_at":"2026-08-07T05:52:47.775957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13663","last_updated":"2022-08-29T15:10:14Z","snapshot_observed_at":"2026-07-06T13:46:29.896484Z","submitted_at":"2022-08-29T15:10:14Z","title":"Understanding the Limits of Poisoning Attacks in Episodic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.13663","snapshot_observed_at":"2026-08-07T05:52:47.198902Z","title":"Understanding the limits of poisoning attacks in episodic reinforcement learning.arXiv preprint arXiv:2208.13663,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.198902Z"},"links":{"cited_paper":"/paper/2208.13663","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:3f9305c3ebd9bf8d81ee1dd10d6bfc5315ef2cf4a5e6a60703836476c1345b76","observation_id":"51b86397-76fc-4f7f-ac2f-48a0ea11e66f","resolution":{"observed_at":"2026-08-07T05:52:47.198902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i04.6047","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.264448Z","title":"URLhttps://ojs.aaai.org/index.php/AAAI/article/view/6047","venue":null,"work_id":"f8b8082d-2962-4d7b-8bba-811968672765","year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.201561Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:03f9c04befcc0f9b7b81525184747b0191f7ba290bbd50b35ba36d388b72c020","observation_id":"7e0fc685-3e21-458d-a5f1-e300e5ef0ef7","resolution":{"observed_at":"2026-08-07T05:52:47.268078Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.764064Z","title":"Christopher JCH Watkins and Peter Dayan","venue":null,"work_id":"f8e78acf-a9ba-429c-b976-95d92238e2a7","year":2017},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.209368Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:f07e2bd7444410098ea4784d8186ac4f627bc869eb656b953041ec7d6dbea06c","observation_id":"f136a351-c851-4d85-97ec-01aa741e0cc0","resolution":{"observed_at":"2026-08-07T05:52:47.766759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i14.29529","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.254338Z","title":"URL https://ojs.aaai","venue":null,"work_id":"ef78e1e0-4c33-4310-ab31-32d247d8f5a6","year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.211768Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:c4fc7161a388b734cc8019cbe9124a24723a033a26752c546948d8383cd774d4","observation_id":"e49cd421-c9de-4350-85c8-d7651e67ca60","resolution":{"observed_at":"2026-08-07T05:52:47.258152Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19705","last_updated":"2024-10-25T17:27:58Z","snapshot_observed_at":"2026-07-31T06:15:34.869052Z","submitted_at":"2024-10-25T17:27:58Z","title":"Robust Thompson Sampling Algorithms Against Reward Poisoning Attacks","version":1},"cited_work":{"arxiv_id":"2410.19705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19705","snapshot_observed_at":"2026-08-07T05:52:47.293053Z","title":"Robust Thompson Sampling Algorithms Against Reward Poisoning Attacks","venue":"cs.LG","work_id":"54cae0b4-14c4-4691-bab1-6f4df724e6a7","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.214169Z"},"links":{"cited_paper":"/paper/2410.19705","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:bbc5d1da4c74d457020a5bec06fd9042ba8e75eeacf45a393c1bbb6e9e613ac4","observation_id":"28009646-614a-4c3d-b7a0-c37f2050d375","resolution":{"observed_at":"2026-08-07T05:52:47.296109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12955","last_updated":"2024-03-09T17:46:44Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:54:39Z","title":"Towards Robust Offline Reinforcement Learning under Diverse Data Corruption","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12955","snapshot_observed_at":"2026-08-07T05:52:47.216750Z","title":"Towards robust offline reinforcement learning under diverse data corruption.arXiv preprint arXiv:2310.12955,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.216750Z"},"links":{"cited_paper":"/paper/2310.12955","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:8fff3e1bbe8ac01b3a365a882950063bde37d4d54800d2b74605ec10bae16907","observation_id":"fe2de193-e9e5-4310-9462-b571e2eb62ef","resolution":{"observed_at":"2026-08-07T05:52:47.216750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05949","last_updated":"2024-10-09T11:46:24Z","snapshot_observed_at":"2026-07-06T17:14:19.624035Z","submitted_at":"2024-01-11T14:38:19Z","title":"Universal Vulnerabilities in Large Language Models: Backdoor Attacks for In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05949","snapshot_observed_at":"2026-08-07T05:52:47.219188Z","title":"Universal vulnerabilities in large language models: In-context learning backdoor attacks.arXiv preprint arXiv:2401.05949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.219188Z"},"links":{"cited_paper":"/paper/2401.05949","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:c5e53cff2337546ea3cf07078f54577eb42150f08f77dd82394e9ca444203d46","observation_id":"e5d1c826-323a-4a57-b213-bcdb645d0471","resolution":{"observed_at":"2026-08-07T05:52:47.219188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.756282Z","title":"17 A.2 crUCB","venue":null,"work_id":"30786fa8-099c-41ed-83f5-568835602899","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.221741Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:8b4bb3c18fba78aded4aa0cee8247415d89736d09d9f87fa33467909b10fef71","observation_id":"892269cb-bfc4-41fc-8ca9-6c840a8957cf","resolution":{"observed_at":"2026-08-07T05:52:47.758795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.740531Z","title":"A.3 CRLINUCB We source the CRLinUCB algorithm from Ding et al","venue":null,"work_id":"496b1bbb-94d0-476f-8bcc-071e7bded273","year":2022},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.227370Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:1bfcd717a295deb122b29c33232278078bc4ca6444cea3fc9b78bca0cfd0b46e","observation_id":"2d271eeb-7d20-4bda-8555-70f2b8f207c6","resolution":{"observed_at":"2026-08-07T05:52:47.743153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.206980Z","title":"URL http://www.jstor.org/stable/2332286","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":1933,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.206980Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:50070adf5da36f7fe6892862886c94acc7a3b06cbd6481faac957784646a493a","observation_id":"2687ddba-a36d-4d36-ac32-b92a22a65b81","resolution":{"observed_at":"2026-08-07T05:52:47.206980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.173278Z","title":"URL https://doi.org/10.1214/ aoms/1177703732","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":1964,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.173278Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:66c3fde0165eac718a2996d0f2d45392e99e4eca000202169c1151a6de53062f","observation_id":"fa42f0e6-444b-44d2-80b2-e2ce2d03bcbe","resolution":{"observed_at":"2026-08-07T05:52:47.173278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-07-06T14:10:20.983444Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-07T05:52:47.175619Z","title":"Michael Laskin, Luyu Wang, Junhyuk Oh, Emilio Parisotto, Stephen Spencer, Richie Steigerwald, DJ Strouse, Steven Hansen, Angelos Filos, Ethan Brooks, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.175619Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:3690fc03d9be675cf9339ebd4eb2246cebb06ededfa82fe92f5893cf95cd2846","observation_id":"a0692b87-26f3-4328-a687-d52ad9c61d5a","resolution":{"observed_at":"2026-08-07T05:52:47.175619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-06T07:16:48.853653Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-07T05:52:47.134864Z","title":"doi: 10.1023/A: 1013689704352","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.134864Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:f9bdea4cee872ef27f3eba712fccd36a8ca7cc2442d1a13b8ca9a3be9ab41daf","observation_id":"60c842f6-b19c-4219-8770-a2d2879e6b58","resolution":{"observed_at":"2026-08-07T05:52:47.134864Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.178059Z","title":"ISBN 9781605587998","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.178059Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:fe58f8138991ed1251ac9ca59ac1ccb84fc858c21e30c2029332fd4a9f0d8466","observation_id":"0df5aec3-4b63-4980-bee9-bf6e870e2ec2","resolution":{"observed_at":"2026-08-07T05:52:47.178059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.06733","last_updated":"2019-03-11T20:45:33Z","snapshot_observed_at":"2026-07-06T05:56:16.413472Z","submitted_at":"2017-08-22T17:31:54Z","title":"BadNets: Identifying Vulnerabilities in the Machine Learning Model Supply Chain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.06733","snapshot_observed_at":"2026-08-07T05:52:47.161755Z","title":"Badnets: Identifying vulnerabilities in the machine learning model supply chain.arXiv preprint arXiv:1708.06733,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.161755Z"},"links":{"cited_paper":"/paper/1708.06733","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:e0e1b1f6cb53327149def920d4362e961dc94ac6440f88317cb471725e954b57","observation_id":"54ab52f4-e511-484c-b98f-671b9e56d912","resolution":{"observed_at":"2026-08-07T05:52:47.161755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.804893Z","title":"Improved corruption robust algorithms for episodic reinforcement learning","venue":null,"work_id":"442c88ca-9ce5-470d-a54d-2c201103ab08","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.150844Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:b54e6674f4d657fa97d498c3a53e93888f00381d9009f4f6f4908d2dc417bfcb","observation_id":"b52de5ab-0527-471e-9505-869efaeb9556","resolution":{"observed_at":"2026-08-07T05:52:47.807523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.183209Z","title":"ISBN 9781450355599","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.183209Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:1f4dec41167b8af1d74c85afbf40c5ccec5931e881e8b63c756335da393d97d1","observation_id":"786c1c23-1392-4f09-99dd-e3e8f2b540e6","resolution":{"observed_at":"2026-08-07T05:52:47.183209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.781267Z","title":"Shike Mei and Xiaojin Zhu","venue":null,"work_id":"ee943f67-b136-41fd-a77b-053a31ec8c70","year":2019},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.185916Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:d5aecb91143610a883202499a939673e8ac98c372fa85a462e239be2b4305f00","observation_id":"41d83310-d62f-46ec-8bfd-c2e59c2c330e","resolution":{"observed_at":"2026-08-07T05:52:47.783983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.142043Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.142043Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:b6acdaa04499612841455713f7bc93cfb26cf7f39e531148a4502246690205e5","observation_id":"19a3987a-b618-4194-8dd8-91f026d85e9c","resolution":{"observed_at":"2026-08-07T05:52:47.142043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-07T05:52:47.204252Z","title":"Intriguing properties of neural networks.arXiv preprint arXiv:1312.6199,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.204252Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:d9ede27960df2b8f14930f3add0620b4e5f10dfae55f242a7446f75997968b61","observation_id":"66563669-82bd-45bf-8186-546ab5f6f483","resolution":{"observed_at":"2026-08-07T05:52:47.204252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.797133Z","title":"Juncheng Dong, Moyang Guo, Ethan X Fang, Zhuoran Yang, and Vahid Tarokh","venue":null,"work_id":"460c682b-c92f-459c-a708-0b31219f349a","year":2024},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.153537Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:bcb9ee8e702c758248ad07eebe29933f813a29d586c30ddf5a7a71ec2b3f1808","observation_id":"f273fc84-7c3c-4e86-8f73-f360b450647c","resolution":{"observed_at":"2026-08-07T05:52:47.799877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:47.818117Z","title":"Evasion attacks against machine learning at test time","venue":null,"work_id":"0ece1ba7-1381-4ea8-8809-ffb1c71d4907","year":2013},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.138951Z"},"links":{"citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:1453f8b6108d411b060e480fa335acba39f0bc8aaa0f85d77939b4c7d49e19fd","observation_id":"b66940f3-31ae-45c0-951c-119617dbbb3e","resolution":{"observed_at":"2026-08-07T05:52:47.820843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-07T05:52:47.156119Z","title":"RL2: Fast reinforcement learning via slow reinforcement learning.arXiv preprint arXiv:1611.02779,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.156119Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:70df0656415e6b7464305c0d765ee48977227222b7fd066d4f9050b59fb12749","observation_id":"ec03edf5-12fe-4e40-bbcc-cbc5698483f0","resolution":{"observed_at":"2026-08-07T05:52:47.156119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05526","last_updated":"2017-12-15T04:26:26Z","snapshot_observed_at":"2026-07-06T06:14:30.795326Z","submitted_at":"2017-12-15T04:26:26Z","title":"Targeted Backdoor Attacks on Deep Learning Systems Using Data Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05526","snapshot_observed_at":"2026-08-07T05:52:47.147789Z","title":"Targeted backdoor attacks on deep learning systems using data poisoning.arXiv preprint arXiv:1712.05526,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:47.147789Z"},"links":{"cited_paper":"/paper/1712.05526","citing_paper":"/paper/2506.06891"},"observation_digest":"sha256:67b81163a55de3c1dce3ca27a18433a44fec3da4c3e3f08f392f3129c080bba1","observation_id":"30bce87b-27c9-463b-937a-9e95f4799bbd","resolution":{"observed_at":"2026-08-07T05:52:47.147789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06891","last_updated":"2026-06-05T23:54:28Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:44:34.375758Z","submitted_at":"2025-06-07T18:39:47Z","title":"Robust In-Context Reinforcement Learning Under Reward Poisoning Attacks"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2506.06891."}