{"as_of":"2026-08-13T12:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3032c16805a16c15541adc2a98d88b9788750aea0ed17446e9bc031ba2b1173c","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:06:17.785227Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.00797/citation-record","integrity":"/paper/2412.00797/integrity","json":"/paper/2412.00797/citation-record.json","paper":"/paper/2412.00797"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.07798","last_updated":"2021-06-14T23:16:41Z","snapshot_observed_at":"2026-08-13T01:29:24.632756Z","submitted_at":"2021-06-14T23:16:41Z","title":"Poisoning Deep Reinforcement Learning Agents with In-Distribution Triggers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07798","snapshot_observed_at":"2026-08-12T05:06:17.702243Z","title":"Poisoning deep reinforcement learning agents with in-distribution triggers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.702243Z"},"links":{"cited_paper":"/paper/2106.07798","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:9bd9dba72dabece7cbfceecf03f12a33175c51da3f99bda7b87432d3c8ecd63c","observation_id":"2ff4956e-cf40-4681-81ca-f49ab971a10c","resolution":{"observed_at":"2026-08-12T05:06:17.702243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.053452Z","title":"Generative adversarial user model for reinforcement learning based recommendation system","venue":null,"work_id":"2e6fadee-d434-4bf8-8c81-22c88b1c9074","year":2019},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.707053Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:a7126fc3c79ac89c42eb52bec9140d76b466234f605d83d189b12b8bdd0917bc","observation_id":"c68d1b09-12d3-4888-aaae-d2393111f98e","resolution":{"observed_at":"2026-08-12T05:06:18.057832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.041373Z","title":"Badrl: Sparse targeted backdoor attack against reinforcement learning","venue":null,"work_id":"d5227a56-68bb-4a64-a3ce-af36d67aa6b6","year":2024},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.710925Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:128d9ba159a8a9c0233f4c2ab34fbad88ee592b8d7faff4779190d8890e2d32f","observation_id":"704bf826-e375-4c48-b521-d22a1e19098b","resolution":{"observed_at":"2026-08-12T05:06:18.045521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.028528Z","title":"Sbeed: Convergent reinforcement learning with nonlinear function approximation","venue":null,"work_id":"71461459-7695-4f7d-86db-dd6a5aac94d0","year":2018},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.715067Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:2fee4dc166b1b70ce686bdb5a752a9b56acf28fb29aaab51efd3a81674cf4d3e","observation_id":"a871d55a-873a-4269-a5d4-a37e1ffb337c","resolution":{"observed_at":"2026-08-12T05:06:18.032843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00762","last_updated":"2022-07-28T17:30:20Z","snapshot_observed_at":"2026-08-13T10:21:44.276661Z","submitted_at":"2022-01-03T17:09:32Z","title":"Execute Order 66: Targeted Data Poisoning for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00762","snapshot_observed_at":"2026-08-12T05:06:17.719254Z","title":"Execute order 66: targeted data poisoning for reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.719254Z"},"links":{"cited_paper":"/paper/2201.00762","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:82c6e2bdaa938fb59f41a577d396e5d39edb687ac9033ad562e7fce324f843e6","observation_id":"13d8d294-c30b-45fa-8541-a0a169c0fe0e","resolution":{"observed_at":"2026-08-12T05:06:17.719254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.02246","last_updated":"2018-02-06T22:10:14Z","snapshot_observed_at":"2026-07-06T06:22:08.261855Z","submitted_at":"2018-02-06T22:10:14Z","title":"Approximation Methods for Bilevel Programming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.02246","snapshot_observed_at":"2026-08-12T05:06:17.723470Z","title":"Approximation methods for bilevel programming","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.723470Z"},"links":{"cited_paper":"/paper/1802.02246","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:e86bda4bda5732d90c49f80b1f023a037efe18bdf61305f15ea53c0047da764f","observation_id":"5c54d4ff-aa9e-4904-816b-60c18f990911","resolution":{"observed_at":"2026-08-12T05:06:17.723470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.00633","last_updated":"2016-11-23T10:23:25Z","snapshot_observed_at":"2026-08-09T04:57:35.375130Z","submitted_at":"2016-10-03T16:52:10Z","title":"Deep Reinforcement Learning for Robotic Manipulation with Asynchronous Off-Policy Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.00633","snapshot_observed_at":"2026-08-12T05:06:17.728031Z","title":"Deep reinforcement learning for robotic manipulation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.728031Z"},"links":{"cited_paper":"/paper/1610.00633","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:426bc52f78f56aa6b6a87396cba93abb1fff6579053d88ffa4546f4d4a0568c0","observation_id":"29d0671b-1e8d-4027-b350-22a82b9471e7","resolution":{"observed_at":"2026-08-12T05:06:17.728031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.732094Z","title":"A two-timescale stochastic algorithm framework for bilevel optimization: Complexity analysis and application to actor-critic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.732094Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:57d9bd822265576849fb27575af73c07572286766a1512d06a9563cef991ac04","observation_id":"9d6f5cf8-2cfb-4436-9391-8fd2eed573ec","resolution":{"observed_at":"2026-08-12T05:06:17.732094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:18.008544Z","title":"Trojdrl: evaluation of backdoor attacks on deep reinforcement learning","venue":null,"work_id":"b11917a1-7068-45a0-8a34-11487115b6c7","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.735722Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:e391fb7df7b4b951b4b3f4b55548beaa5bce211a2772d10aa02545030ad1964d","observation_id":"d9c94093-48fe-47ca-a667-d55e4d4d7001","resolution":{"observed_at":"2026-08-12T05:06:18.012764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.996425Z","title":"Provably efficient black-box action poisoning attacks against reinforcement learning","venue":null,"work_id":"881c33f9-467d-4134-aa80-0fd33c39ec71","year":2021},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.739222Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:1408ccf7c0b3c4a6a67c0cd0736590fa232c647635de02306d2ef2d695682c01","observation_id":"f5eb3cf2-a93c-4ec8-8f91-56c54c51dad3","resolution":{"observed_at":"2026-08-12T05:06:18.000623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.983528Z","title":"Efficient adversarial attacks on online multi-agent reinforcement learning","venue":null,"work_id":"812fd2ec-3d6a-493b-8335-01bd2e8ca6c3","year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.742890Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:94f1ca301a155ee86f2c25b7088cf803151ba10ecb2d71c6f153dc6f598dd429","observation_id":"a2fabc64-2446-4206-8a12-9b7eaa5b83d4","resolution":{"observed_at":"2026-08-12T05:06:17.988384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.972410Z","title":"Policy poisoning in batch reinforcement learning and control","venue":null,"work_id":"8cc39e31-1216-402b-9d5a-253c529bc3ca","year":2019},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.746457Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:4da9242c15bc6502872d5e067841924f157c5d9ec69b1ef820138a8d62e90bf2","observation_id":"e6c6f464-8ad7-41a7-ae5a-cef4bfc6b3eb","resolution":{"observed_at":"2026-08-12T05:06:17.976154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.961127Z","title":"Convergence rate of a penalty method for strongly convex problems with linear constraints","venue":null,"work_id":"79b13fb6-a2b8-41a5-81f2-60a479c2d7cb","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.751168Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:4d0464077659c310362fc0cfb00ccca5e24bb189f2cdefc2a4eed698727bc15e","observation_id":"f1c55176-5fd0-4294-891c-62c35bb6c369","resolution":{"observed_at":"2026-08-12T05:06:17.964954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.949404Z","title":"Talking to bots: Symbiotic agency and the case of tay","venue":null,"work_id":"e8c4204d-dd6d-49bd-aaa2-d4b0e18c5d32","year":2016},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.754766Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:69b47b5b359613e9dc58c386671ac9cfa80ad2c28f4822eeb64210c162793481","observation_id":"b7ee0310-a4c2-4cf3-8400-043d11d4804e","resolution":{"observed_at":"2026-08-12T05:06:17.953542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.937261Z","title":"Scalable end-to-end autonomous vehicle testing via rare-event simulation","venue":null,"work_id":"0ad1cf85-36b4-4005-ab21-675e485e4dfa","year":2018},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.758392Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:c91bcea42f747b8098421d663ceb96049ff0b3bd641009d050063e76f964f7cf","observation_id":"fdf0f1bc-cf60-400f-95e1-1f900bd8543b","resolution":{"observed_at":"2026-08-12T05:06:17.941219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.925261Z","title":"Policy teaching via environment poisoning: Training-time adversarial attacks against reinforcement learning","venue":null,"work_id":"b3406745-aa89-4afd-b716-5a5f6013c418","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.761981Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:0df7d6108830d2ac4aa9042129cc7e56e78fecf660a49eeceaa324fd3110e422","observation_id":"56475e9b-693a-456c-9ad2-867ea7de038f","resolution":{"observed_at":"2026-08-12T05:06:17.929152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08492","last_updated":"2021-02-16T23:20:15Z","snapshot_observed_at":"2026-07-06T10:41:59.836258Z","submitted_at":"2021-02-16T23:20:15Z","title":"Reward Poisoning in Reinforcement Learning: Attacks Against Unknown Learners in Unknown Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08492","snapshot_observed_at":"2026-08-12T05:06:17.765785Z","title":"Reward poisoning in reinforcement learning: Attacks against unknown learners in unknown environments","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.765785Z"},"links":{"cited_paper":"/paper/2102.08492","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:3843b34920e833c63a9fa08b19d920766b9820378c362de9f8b252b6e0f76977","observation_id":"4cc6e3a0-a54c-4803-91a9-6ba3571ffe9e","resolution":{"observed_at":"2026-08-12T05:06:17.765785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.13663","last_updated":"2022-08-29T15:10:14Z","snapshot_observed_at":"2026-08-10T11:00:18.694777Z","submitted_at":"2022-08-29T15:10:14Z","title":"Understanding the Limits of Poisoning Attacks in Episodic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.13663","snapshot_observed_at":"2026-08-12T05:06:17.769893Z","title":"Understanding the limits of poisoning attacks in episodic reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.769893Z"},"links":{"cited_paper":"/paper/2208.13663","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:1ca321d22b3d22fd3c0ddacb0666df4ac9a87b46314d50b583cb6093172abb33","observation_id":"97552221-9bfa-4bb2-aece-d0d53118d6b5","resolution":{"observed_at":"2026-08-12T05:06:17.769893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.913405Z","title":"Reward poisoning attacks on offline multi-agent reinforcement learning","venue":null,"work_id":"ede7bf39-2a5f-4389-91a8-7136160de6b8","year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.774031Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:e0278986fb67137ba447df17cd7b5653e9c45d18babb57ba0475a47625c2de80","observation_id":"be65d024-5bbe-40a7-8513-44b8efcb0216","resolution":{"observed_at":"2026-08-12T05:06:17.917456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.901349Z","title":"Spiking pitch black: Poisoning an unknown environment to attack unknown reinforcement learners","venue":null,"work_id":"6d63bebe-4e6d-4e92-944a-79e0eac6084b","year":2022},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.777486Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:31299eb2b7f96239ab08152a85e88e428fd455d2f5c3e6887e25ea6872f8b3d5","observation_id":"d8c94cc8-9b3d-49eb-b627-4ca583954b65","resolution":{"observed_at":"2026-08-12T05:06:17.905837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10681","last_updated":"2023-05-18T03:37:29Z","snapshot_observed_at":"2026-08-13T11:39:47.651396Z","submitted_at":"2023-05-18T03:37:29Z","title":"Black-Box Targeted Reward Poisoning Attack Against Online Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10681","snapshot_observed_at":"2026-08-12T05:06:17.781396Z","title":"Black-box targeted reward poisoning attack against online deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.781396Z"},"links":{"cited_paper":"/paper/2305.10681","citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:b16bdcbe829aa6f36ad2052c2684ebf76747f3f1a000bb4e7fe651c277c068ba","observation_id":"cb5ed119-5c80-4f61-a445-b92930e51152","resolution":{"observed_at":"2026-08-12T05:06:17.781396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:06:17.887645Z","title":"Adaptive reward-poisoning attacks against reinforcement learning","venue":null,"work_id":"915de3c9-2e37-46ab-a677-78d6d1058b58","year":2020},"citing_paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T05:06:17.785227Z"},"links":{"citing_paper":"/paper/2412.00797"},"observation_digest":"sha256:3ca0da69dd4edca97c44ab5a25469293765ed83100837ac5d2277d56ae1ff792","observation_id":"54323036-961a-496b-8822-2da88b6a6027","resolution":{"observed_at":"2026-08-12T05:06:17.893439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00797","last_updated":"2024-12-01T12:43:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T01:29:47.450312Z","submitted_at":"2024-12-01T12:43:23Z","title":"Online Poisoning Attack Against Reinforcement Learning under Black-box Environments"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2412.00797."}