{"as_of":"2026-07-21T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:668d8155eeafc118ab69cb227e6ccc31bf4a6cf7d1db227811da506103445cb3","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T10:57:45.056957Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:55:38.554161Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T04:06:00.153706Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"cited_work":{"arxiv_id":"1907.01475","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.01475","snapshot_observed_at":"2026-07-04T23:45:52.995688Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","venue":null,"work_id":"d3bd5daf-5ccd-40ed-97dd-3a819324a6dd","year":1907},"citing_paper":{"arxiv_id":"2605.06992","last_updated":"2026-05-07T22:16:03Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T22:16:03Z","title":"Why Does Agentic Safety Fail to Generalize Across Tasks?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T01:55:38.554161Z"},"links":{"cited_paper":"/paper/1907.01475","citing_paper":"/paper/2605.06992"},"observation_digest":"sha256:598058199d4e94f594a4b4df113084415aeab979ead8a730a52ce1b31c0f5031","observation_id":"8a6ec8de-5328-49be-be50-5ecd91801781","resolution":{"observed_at":"2026-07-04T23:45:52.995688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1907.01475/citation-record","integrity":"/paper/1907.01475/integrity","json":"/paper/1907.01475/citation-record.json","paper":"/paper/1907.01475"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2e404039-798f-43b9-8402-7629f6bd9460","year":2015},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:071614035c6d5e1fb2c51b98c244832833e0d21651aade73adbd3ca4f91b7124","observation_id":"ace697f5-a5ff-48f0-aa33-81a072063867","resolution":{"observed_at":"2026-05-25T11:00:41.425104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.00177","last_updated":"2019-01-18T23:26:53Z","snapshot_observed_at":"2026-07-06T06:53:26.207924Z","submitted_at":"2018-08-01T06:02:36Z","title":"Learning Dexterous In-Hand Manipulation","version":5},"cited_work":{"arxiv_id":"1808.00177","doi":"10.48550/arxiv.1808.00177","metadata_source":"pith","pith_arxiv_id":"1808.00177","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Learning Dexterous In-Hand Manipulation","venue":"cs.LG","work_id":"389579f0-1ebf-484d-b67d-d8239d049ece","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1808.00177","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:9cebd1dc28cf74f0634a77216156408fa3dcca60c5772fb784118c35d801d627","observation_id":"ba89d78e-80c0-47f4-a82b-16ddcff20de1","resolution":{"observed_at":"2026-05-25T11:00:40.111131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4919.94494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Using conﬁdence bounds for exploitation-exploration trade-offs.J","venue":null,"work_id":"ef24a055-6a2d-48e5-a06c-b99cc46da368","year":2003},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:21c2f5e1cdec6cebc35516d8c39003e27fd252c628bb6bc3798121ff448cf992","observation_id":"8b07aa43-0892-438b-a908-c9a377d76961","resolution":{"observed_at":"2026-05-25T11:00:40.143521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the optimization of a synaptic learning rule","venue":null,"work_id":"4e121d05-d610-49fe-911c-7b91fe810039","year":1992},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:e49159a8d7cafe5316378a66aa045075b50854a563895a4b818f5d014316eb86","observation_id":"b6ac8dc2-cf47-48bd-bdff-32914053b6ae","resolution":{"observed_at":"2026-05-25T11:00:41.407692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02341","last_updated":"2019-07-14T17:49:51Z","snapshot_observed_at":"2026-07-06T07:19:27.732247Z","submitted_at":"2018-12-06T04:29:29Z","title":"Quantifying Generalization in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1812.02341","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.02341","snapshot_observed_at":"2026-07-04T14:09:52.692054Z","title":"Quantifying Generalization in Reinforcement Learning","venue":"cs.LG","work_id":"e20151be-234c-4ae5-aa0d-774648c4b18b","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1812.02341","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:af45accf386a9beb63ab7f1417db746a17bc06fdd3158270096e07ced21fc3ae","observation_id":"e4f6e77c-4937-46e6-9261-1cdbda152809","resolution":{"observed_at":"2026-05-25T11:00:40.180526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ensemble methods in machine learning","venue":null,"work_id":"647ed9c1-6832-4c02-be34-2f8899b386c3","year":2000},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:82cc0617366f536b46059ed58af1fa94f8b7419b20ec8c9e6d9a7939d933b802","observation_id":"0e28254e-a8a4-48b1-930b-afbe521085b0","resolution":{"observed_at":"2026-05-25T11:00:41.419915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-07-06T05:17:56.287788Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1611.02779","doi":"10.48550/arxiv.1611.02779","metadata_source":"pith","pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","venue":"cs.AI","work_id":"f9b75698-414f-456e-a2e6-dbe568b2693d","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:75b8e265c1f2210f425d3b24866c20f3ff7c2ff8a36aa1ae3a202757ebea60b3","observation_id":"9b492b63-79cf-4529-b311-21e1036bac03","resolution":{"observed_at":"2026-05-25T11:00:40.118463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Impala: Scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"09b3101e-0aa8-4a19-8b24-94fb0d811e2e","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:7b63db7e92bcdec195b290bc9564ac27df2b5746b6c32ce648bfd7adb24d355d","observation_id":"f2377845-2651-4e65-b59c-4953a600dbbf","resolution":{"observed_at":"2026-05-25T11:00:41.415929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.00123","last_updated":"2020-01-17T23:25:22Z","snapshot_observed_at":"2026-07-06T07:05:02.417291Z","submitted_at":"2018-09-29T00:52:34Z","title":"Generalization and Regularization in DQN","version":3},"cited_work":{"arxiv_id":"1810.00123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1810.00123","snapshot_observed_at":"2026-07-04T14:09:52.653481Z","title":"Generalization and regularization in dqn","venue":null,"work_id":"89196e62-7877-42fe-8d8e-bb80a12850ee","year":2020},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1810.00123","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:4e2f51265796ec062bbc45f1137609d474f261231cd995a1a92afa96923a8df8","observation_id":"a9fc6219-3c8c-4ac1-a151-91cc96beb823","resolution":{"observed_at":"2026-05-25T11:00:40.168151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-agnostic meta-learning for fast adap- tation of deep networks","venue":null,"work_id":"3c594e08-08e5-4c63-abf1-230f514ce873","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:d4977824ce3c7f9b08bd2fa830e44d5653a89afaad4d4743fde4edbab162def1","observation_id":"aaeb6f5b-3b16-4dc5-9c76-469e97411a32","resolution":{"observed_at":"2026-05-25T11:00:41.403860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":"ecf2b33a-d8b5-4795-8646-57bad435acc6","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:04e265415fb7dedb68af3f4aef0c015db6b6477f41ebb742302cec1d8df4217e","observation_id":"f84add05-a7cb-4f9c-a22f-09d48f7f7f0f","resolution":{"observed_at":"2026-05-25T11:00:41.387236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":"f3ea8d36-accf-4354-b4e5-6f397569e33d","year":2015},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:2d605138d7b597aef99673f3935a18f645b9f40ce8fa838f7a90e4d58970a9e6","observation_id":"f3a85e15-9a8b-472c-a4d7-51a0c9a19224","resolution":{"observed_at":"2026-05-25T11:00:41.395915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"4f3f28fc-6520-4d61-825e-3f27ac58b6fa","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:6d0a2f858d01b38093f300587a3194d25902a859b945e41eeb1fadfc30efbdd5","observation_id":"5812775e-ecb4-4db0-9c21-5146b374519f","resolution":{"observed_at":"2026-05-25T11:00:41.381674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.90","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:16:59.350888Z","title":"Deep residual learning for image recognition","venue":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","work_id":"b353bda2-591d-479a-9c8b-22dfcba12431","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:09f46cdcf5a3b8566eefab82d6246272f327f36f3201cabd87a2b7e72e8b4392","observation_id":"eb961da4-30f8-4c9d-b932-91b19aeb16c6","resolution":{"observed_at":"2026-05-25T11:00:39.895883Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:04.715508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:04.715508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to learn using gradient descent","venue":null,"work_id":"7c0ccde5-a079-4d2b-a438-937e4ab281e0","year":2001},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:3a7f94077a8fecc0786cce5c2440482f11a3fdda2fdc0a55bbc50a29c04e22c7","observation_id":"c609889b-df76-4bb5-9840-0b9818e3c0b4","resolution":{"observed_at":"2026-05-25T11:00:41.377769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-07-06T04:08:54.419941Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":"1502.03167","doi":"10.48550/arxiv.1502.03167","metadata_source":"pith","pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","venue":"cs.LG","work_id":"05484516-8937-4cdf-9176-7f8329ef0221","year":2015},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:6e93ff429b45c37a36ae05f130bdf30ff284bd2e092604437d1fa1fe797ec8e9","observation_id":"e796d3c7-486d-402d-9682-368ed5c4ffc8","resolution":{"observed_at":"2026-05-25T11:00:40.192110Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:08.990281+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:08.990281+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01182","last_updated":"2017-02-03T21:57:13Z","snapshot_observed_at":"2026-07-06T05:28:44.704796Z","submitted_at":"2017-02-03T21:57:13Z","title":"Uncertainty-Aware Reinforcement Learning for Collision Avoidance","version":1},"cited_work":{"arxiv_id":"1702.01182","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.01182","snapshot_observed_at":"2026-06-29T18:43:50.889842Z","title":"Uncertainty-Aware Reinforcement Learning for Collision Avoidance","venue":"cs.LG","work_id":"9f3798bc-ff6b-4ff1-ae7e-f22cf48b248d","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1702.01182","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:330a8a3be3a8b1aabab89a6d84db64e85a8a95dbed5698c6ad6306adab07c76b","observation_id":"33b91704-c959-4409-a1e1-7041f15d3bd5","resolution":{"observed_at":"2026-05-25T11:00:40.149786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:7d175305004158fd836896adee688d54515c8be83b33c20b5da7bac44db008bf","observation_id":"9eea0137-9b9a-48ef-b7b7-1a2a89ac5477","resolution":{"observed_at":"2026-05-25T11:00:40.124658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":"cfffc309-deee-4b51-ac8d-a59a23bdab43","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:32d3dfb22e126b870ae6c40bf94c6546948c02d59c12de4cbad018d99bae5a93","observation_id":"819d5d52-be80-4d90-8625-9c69663277a6","resolution":{"observed_at":"2026-05-25T11:00:41.411711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09883","last_updated":"2017-11-28T17:40:36Z","snapshot_observed_at":"2026-07-06T06:11:24.949724Z","submitted_at":"2017-11-27T18:57:13Z","title":"AI Safety Gridworlds","version":2},"cited_work":{"arxiv_id":"1711.09883","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.09883","snapshot_observed_at":"2026-07-04T17:29:59.631746Z","title":"AI Safety Gridworlds","venue":"cs.LG","work_id":"fb942fdb-357d-4552-9f90-40d861ef6569","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1711.09883","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:c7bb6dba61cd6a3ab2f81c3bea3434352d8ca7782e0d226d54f66f7bbbdb6cd4","observation_id":"8675d013-b092-4961-b0c8-e6aa96409b3b","resolution":{"observed_at":"2026-05-25T11:00:40.155281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end training of deep visuomotor policies","venue":null,"work_id":"34187dba-e718-4a9d-99c0-1b205f8c5187","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:e78e208351290798de16e00373f5bf990e70636eb417d5bc89fe08caa4a5419f","observation_id":"b1a621cb-991e-4af2-9c61-3b288350a317","resolution":{"observed_at":"2026-05-25T11:00:41.430779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01008","last_updated":"2018-02-11T23:19:21Z","snapshot_observed_at":"2026-07-06T05:32:10.485822Z","submitted_at":"2017-03-03T01:29:11Z","title":"End-to-End Task-Completion Neural Dialogue Systems","version":4},"cited_work":{"arxiv_id":"1703.01008","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.01008","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-End Task-Completion Neural Dialogue Systems","venue":"cs.CL","work_id":"4f0e6eff-eca0-4cf0-a179-523a8bf7515a","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1703.01008","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:8f732960e56cf812b82783c05ce78caf68f62d371006625643a229cb99882942","observation_id":"ee5a0c67-f611-4f5f-a074-45735ceb60a5","resolution":{"observed_at":"2026-05-25T11:00:40.130771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01211","last_updated":"2018-03-13T21:24:47Z","snapshot_observed_at":"2026-07-06T05:17:20.642708Z","submitted_at":"2016-11-03T22:30:10Z","title":"Combating Reinforcement Learning's Sisyphean Curse with Intrinsic Fear","version":8},"cited_work":{"arxiv_id":"1611.01211","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.01211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Combating Reinforcement Learning's Sisyphean Curse with Intrinsic Fear","venue":"cs.LG","work_id":"ba24a2eb-0979-47b8-94c6-aed79a0ceb14","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1611.01211","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:2b8f6fd343f746c5476ee8078af4367642e5489a77fc0063833b570552cca20d","observation_id":"f8d3f6ab-ba35-480e-a989-7fdb773a3041","resolution":{"observed_at":"2026-05-25T11:00:40.174534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating uncertainty quantiﬁca- tion in end-to-end autonomous driving control","venue":null,"work_id":"a4b0c9aa-63a9-42ab-ac7b-5ddef23677b3","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:38299d82cf408cf90f9835e001caa39a9aa866a0936ebc6b95f204033765aac0","observation_id":"cc4dbb46-5c76-4601-8fce-5774da23a8d4","resolution":{"observed_at":"2026-05-25T11:00:41.399964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"ec5bb2d3-8cbc-435d-9538-51e1ab16ca1e","year":2015},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:2337fd3d192a00a8f1e33b99c4b1a8e1664337781f3bd10205d03a2e7e9f7517","observation_id":"1cddda87-137a-4e17-a438-30e7be8bba6f","resolution":{"observed_at":"2026-05-25T11:00:41.391600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"c4cd3fc4-65b9-4fc4-bf9f-9f5dde08ae8c","year":1928},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:a9dd037f928ba7df44ab86f67947901527692d303c87e4bb01994fb10e88ccbb","observation_id":"709abace-055f-4d15-a79c-441e6860b4df","resolution":{"observed_at":"2026-05-25T11:00:41.373816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic differentiation in PyTorch","venue":null,"work_id":"6dbcebe5-befb-4741-8072-efce8bae64cb","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:f2d4616405a21b4faead92222f8441096b2dfbcdfbf623866db1473bb6ab0fb9","observation_id":"26c2877a-0319-4e5c-83d8-52401f47e49f","resolution":{"observed_at":"2026-05-25T11:00:41.370096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.10662","last_updated":"2019-05-27T14:07:49Z","snapshot_observed_at":"2026-07-06T06:41:27.660649Z","submitted_at":"2018-05-27T17:50:22Z","title":"Fingerprint Policy Optimisation for Robust Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1805.10662","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.10662","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fingerprint Policy Optimisation for Robust Reinforcement Learning","venue":"cs.LG","work_id":"b9162c18-4a73-4967-9302-79a125628906","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1805.10662","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:b52f07abf0cbf70ac8a25e04dd37d77483d25b04ad51b6b046d3e28832f85a7d","observation_id":"489e8c78-4b89-4f74-85a8-fd7a3a31f23c","resolution":{"observed_at":"2026-05-25T11:00:40.186205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trial without error: Towards safe reinforcement learning via human intervention","venue":null,"work_id":"20c0fc8c-167e-437e-9605-bf691d7c9ea7","year":2067},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:cc2a303f215200b22217730daf88755dd636a7b2b9d122e05d738daa880c72bc","observation_id":"efcb173d-4b0f-4870-b240-ac0695b60fbe","resolution":{"observed_at":"2026-05-25T11:00:41.362655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evolutionary principles in self-referential learning, or on learning how to learn: the meta-meta-","venue":null,"work_id":"af58c563-1ce0-40b7-94b5-40f5668af9ab","year":1987},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:2a6d01501af1f8398f98ab81c128c0c0716850545adeae4798212c8b5510d426","observation_id":"afa4a596-4181-44d6-a929-252416bf7cd7","resolution":{"observed_at":"2026-05-25T11:00:41.358900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:06:10.239871Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":"3fd006b3-ce9f-4777-887c-2e1b5edfdf04","year":2017},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:7df35066bb712dc72e0a05335c503736efc9c11d739a92f10caeed4cf9f3a704","observation_id":"7e746f95-03dd-4a61-a4f1-f349f8a2d306","resolution":{"observed_at":"2026-05-25T11:00:41.437103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":"e110b285-03f7-40e4-85bb-772990a21fb7","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:904eb487d3897b1d347b761abde77b73f15bdf3be5d63d2b65af3e38a8e149d1","observation_id":"3109f077-a562-4d89-b8e8-2fa97a321aee","resolution":{"observed_at":"2026-05-25T11:00:41.350523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dropout: a simple way to prevent neural networks from overﬁtting.The Journal of Machine Learning Research, 15(1):1929–1958","venue":null,"work_id":"dd5cf18d-8cb0-471f-a1a6-e14925655739","year":1929},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:22ac43b657f409eb47bdef34f4c89a50563601dba785bb25a0df0f0e2fb78a6a","observation_id":"1aebcc8b-9e85-4627-83c3-c2f72aae08d5","resolution":{"observed_at":"2026-05-25T11:00:41.354835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":"19b67df4-a83c-4cd0-a8e2-44b5f39f192e","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:33d5a3240075ad012da7b34466a4905c98f10331b4681737304e7bd1d5a957d9","observation_id":"9fa94293-6ea6-4e4f-b68d-68baefb22cff","resolution":{"observed_at":"2026-05-25T11:00:41.366229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to learn","venue":null,"work_id":"ffaa3b23-fe27-46a1-9b53-eea617868594","year":2012},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:2a1b22ff42829348885f2db92a957d59e8abf71eb369f6344b401c6e693cd8b9","observation_id":"b9100708-9646-448d-80a3-acd5b4716e66","resolution":{"observed_at":"2026-05-25T11:00:41.341698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","venue":null,"work_id":"c2162c07-48b4-41de-a069-9d4f51226022","year":2012},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:d9b28fce59d96a8b10d676a10e65134a695b7666a462029834ded81d62cc5803","observation_id":"732fcf5c-48ed-4c98-92ba-c38fdd3dfba9","resolution":{"observed_at":"2026-05-25T11:00:41.345626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05763","last_updated":"2017-01-23T12:38:24Z","snapshot_observed_at":"2026-07-06T05:19:05.390653Z","submitted_at":"2016-11-17T16:29:11Z","title":"Learning to reinforcement learn","version":3},"cited_work":{"arxiv_id":"1611.05763","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.05763","snapshot_observed_at":"2026-07-04T12:59:52.876443Z","title":"Learning to reinforcement learn","venue":"cs.LG","work_id":"e21e57e3-1065-4e26-9ca2-e5893603d6b4","year":2016},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1611.05763","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:4f5f04096d41b97f007eb6a877f5f7624a5d11549e2d959b8ba9c7de4f5513dc","observation_id":"bd6ea575-9e6a-47ea-8d6f-ec74e1fabdb6","resolution":{"observed_at":"2026-05-25T11:00:40.161709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q-learning","venue":null,"work_id":"7fa6f1f3-97cb-41f2-9840-5c2fb2cd3bc3","year":1992},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:ef209fefe2f9bf3ee59ea28f84c06d9e9b687743977964d95f68ef7fa5714f8b","observation_id":"329ed4e3-01d9-4993-8114-cf7e5652fb4a","resolution":{"observed_at":"2026-05-25T11:00:41.441134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06893","last_updated":"2018-04-20T16:49:52Z","snapshot_observed_at":"2026-07-06T06:34:12.309939Z","submitted_at":"2018-04-18T19:49:13Z","title":"A Study on Overfitting in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1804.06893","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.06893","snapshot_observed_at":"2026-07-04T14:09:52.678187Z","title":"A Study on Overfitting in Deep Reinforcement Learning","venue":"cs.LG","work_id":"ad4a8362-13d5-469b-8172-f2849f83d0b1","year":2018},"citing_paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T10:57:45.056957Z"},"links":{"cited_paper":"/paper/1804.06893","citing_paper":"/paper/1907.01475"},"observation_digest":"sha256:7e527fddf6ea3b7136baecdbf7f7220b3461d79c9c07bec0e4c190390a26d1bf","observation_id":"ce48b6c7-135f-4183-a1e3-48c26b143b65","resolution":{"observed_at":"2026-05-25T11:00:40.136485Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1907.01475","last_updated":"2019-07-02T16:12:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-02T16:12:34Z","title":"Generalizing from a few environments in safety-critical reinforcement learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":24},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 21 July 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:1907.01475."}