{"as_of":"2026-08-16T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f89bc233a4cf135045bf3d0992c41fc98bc0fc0faaca1019caed84d2ecc2f7e2","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:25:39.636614Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T11:33:20.892688Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T11:33:21.562600Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"cited_work":{"arxiv_id":"1908.03263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.03263","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc99cad6-0314-4dd9-9507-efcc7c36cf7a","year":2019},"citing_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"reference_index":282,"source":"arxiv_source","source_observed_at":"2026-05-11T11:33:20.892688Z"},"links":{"cited_paper":"/paper/1908.03263","citing_paper":"/paper/2005.01643"},"observation_digest":"sha256:75980b67b5516fec4193a409277bea1c2de6d2491239aecfa730d61477964acb","observation_id":"2ac05bc8-c0f4-4185-b19b-7e362f2cf794","resolution":{"observed_at":"2026-05-11T11:33:21.565277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.03263/citation-record","integrity":"/paper/1908.03263/integrity","json":"/paper/1908.03263/citation-record.json","paper":"/paper/1908.03263"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.917248Z","title":null,"venue":null,"work_id":"c3e900f3-77c9-4792-8846-952a3d457ecb","year":1992},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.177695Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:5aca783fa25b742bf618301b04fb8245a79617246428ab946f8f66ef29c3cb3c","observation_id":"191a5e9e-b75f-46ec-943b-b200e16d508c","resolution":{"observed_at":"2026-08-14T14:25:40.924948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.889425Z","title":null,"venue":null,"work_id":"6ad4e1ea-04dd-45ab-a09e-3e671a82a4fe","year":2000},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.187513Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:41f2f0c98539393f684146a646137775427be245150c0f7fab45522acb952c36","observation_id":"7da8213a-70aa-4ee0-829a-f224c1aae600","resolution":{"observed_at":"2026-08-14T14:25:40.897151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.864441Z","title":null,"venue":null,"work_id":"9b97a60e-98ef-40f1-b92d-9572a18db56a","year":2002},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.196950Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:3b740267cac3e7eb30e39b9b77c57f77fcc4cdff40ee629668ae609333b418a7","observation_id":"b3ca9d18-1357-4dfd-a6ee-27d6b2e53085","resolution":{"observed_at":"2026-08-14T14:25:40.869973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.838366Z","title":"Peters and S","venue":null,"work_id":"c4299828-2b02-4d69-9633-19f6c2cbf127","year":2008},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.206498Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:b42577287d4e05aab89ac144fcc0878f3e084a12c29343b3157815ceffe7bd71","observation_id":"cc2a877b-8086-408d-9614-bd9979352332","resolution":{"observed_at":"2026-08-14T14:25:40.847301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.213978Z","title":"Schulman, S","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.213978Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:bd2d6f28e17b8be79bf733e507cd51079b997c4080ae6d05f922577ff8339e99","observation_id":"34cf5d5e-26cf-4e57-a13e-f01d62e27c77","resolution":{"observed_at":"2026-08-14T14:25:39.213978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.799543Z","title":"Cheng, X","venue":null,"work_id":"4bd3a116-06ad-40c6-a5a5-d2cf0e8e759c","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.222566Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:ed1a0999db9f318c488f8a578454efc0484bafe18762871f9b541c704976241c","observation_id":"57f71c96-e1ba-4f92-a4ec-cdf0b63a3ba2","resolution":{"observed_at":"2026-08-14T14:25:40.804769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.776117Z","title":null,"venue":null,"work_id":"e663e8f6-71a1-4165-a950-4e09e26c06f2","year":2000},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.234559Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:9ee3f4839ea08f0cd5da2a2829e577f15c4a73398f6da494fc297ee0206682c4","observation_id":"d31b7ebf-c3c0-4b7f-a6d5-0fa7aa35bdee","resolution":{"observed_at":"2026-08-14T14:25:40.784745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.740796Z","title":"Cheng, X","venue":null,"work_id":"42560f0b-0e37-4646-988c-291d13378ce5","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.245548Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:5a6fcf58a9b117bd7e6b7081be4a5c634d8cae9828bed30c06840cde3d85e60a","observation_id":"71803ba2-1efc-48fb-bd61-c9da035f4473","resolution":{"observed_at":"2026-08-14T14:25:40.750048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10462","last_updated":"2022-02-09T16:18:53Z","snapshot_observed_at":"2026-08-14T16:11:43.828282Z","submitted_at":"2019-06-25T11:36:18Z","title":"Policy Optimization with Stochastic Mirror Descent","version":5},"cited_work":{"arxiv_id":"1906.10462","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.10462","snapshot_observed_at":"2026-08-14T14:25:39.856362Z","title":"Policy Optimization with Stochastic Mirror Descent","venue":"cs.LG","work_id":"e3ee5ae9-8c5e-49f5-bf49-026dd223d124","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.260813Z"},"links":{"cited_paper":"/paper/1906.10462","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:7e9db5e6684b07cc097e4fdb2485ed4499fbe765ac802cc945dcd7d3fb67f997","observation_id":"09f63648-3278-48c7-8939-de72168efcb4","resolution":{"observed_at":"2026-08-14T14:25:39.867071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.719801Z","title":"Ghadimi, G","venue":null,"work_id":"480c527f-22bf-4a61-b93d-2c903dc0a6c6","year":2016},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.274695Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:ce2970c9cad881ea31fb253de43c356d7f8f92ad1ae3ec6c0dfaf5ba4f180612","observation_id":"d626b641-55e4-4d66-892f-f924b8a01997","resolution":{"observed_at":"2026-08-14T14:25:40.725517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.696676Z","title":"Kimura, S","venue":null,"work_id":"e3f631f1-a5a2-495e-8c54-a541120c50e5","year":2000},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.282947Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:ec567491cabf70c4025b83801bff8d3e784cd0aa71317474a847f008e5c17cee","observation_id":"a671989a-ef87-46c2-8c7c-a3c28e61d926","resolution":{"observed_at":"2026-08-14T14:25:40.702491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.666863Z","title":null,"venue":null,"work_id":"e2fcaef7-ceff-4f70-bb09-963b81b4dd12","year":2014},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.291379Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:cd1ddefa31b028bf88a140d353c4cc1f56107ea01823f25c5469e1f1b3b475bd","observation_id":"5c46c7f7-eb94-4c5f-bd5e-6990e74346a4","resolution":{"observed_at":"2026-08-14T14:25:40.676747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.641227Z","title":"Silver, G","venue":null,"work_id":"82a8773d-ba18-4061-a1d2-9eea7e5098c2","year":2014},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.300911Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:170c3c34e69834c16c2729892f52d204ad082212462b86e4c17ac14826cfde54","observation_id":"9aa4f302-9e25-4fe3-a30e-1ca7475dc66a","resolution":{"observed_at":"2026-08-14T14:25:40.650996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.609221Z","title":"Schulman, P","venue":null,"work_id":"83d1eb60-f8e1-48af-87c8-295adaa68094","year":2016},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.306683Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:f39623cc9b32ec9df21c3d77eeb2a05505025cc7fd4296982cfe9151fec4e97d","observation_id":"a7042fe8-6800-4ca3-9fbb-cd57f2745822","resolution":{"observed_at":"2026-08-14T14:25:40.616211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.585809Z","title":null,"venue":null,"work_id":"15dc54e7-af12-401b-97de-369af1c831a9","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.315864Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:af294b2fe262c70ad8a7bf29dae5f9010dff841bc75cfcb72b6ab962c778558f","observation_id":"c6273e3d-8564-4baf-a028-7b905328105e","resolution":{"observed_at":"2026-08-14T14:25:40.593088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.564356Z","title":"Efroni, G","venue":null,"work_id":"76931f2b-bfc9-43fc-9eb8-6eae48945c80","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.322420Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:a9b016329de58ff40d3d7b3b19e53cde9dbd697bf4aa85828d555452c58076f4","observation_id":"80be2f38-460e-4332-b502-7de517abca12","resolution":{"observed_at":"2026-08-14T14:25:40.570376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.545110Z","title":null,"venue":null,"work_id":"59400d4c-2b53-4504-a7f5-2ceb3edd9e13","year":1999},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.328381Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:a73f586efaef9e32170689c8787ed6e6a3d33e315d961914709f20a0f585b7bc","observation_id":"f8d14759-c79d-4cfd-910c-c571bb326be1","resolution":{"observed_at":"2026-08-14T14:25:40.551194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.525460Z","title":"Greensmith, P","venue":null,"work_id":"caaf4fc2-39c5-4764-b839-8c7a4918dab4","year":2004},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.337728Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:94730194f28604d8e64ad6ff1642cff7aee989861cbd313c4b0ef8699b32c5f2","observation_id":"dd6fce16-93ba-4e1f-8598-cb6ec1a9da50","resolution":{"observed_at":"2026-08-14T14:25:40.531336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.497424Z","title":"Jie and P","venue":null,"work_id":"f953465f-c51d-4bbe-999f-3cc1bcff263f","year":2010},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.346992Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:72561108ce0158f98b2372851ad7f5f8d6180f9b9e52669cf58b9182b0327902","observation_id":"e1079437-cff7-41ef-9154-0d8c8d1d818d","resolution":{"observed_at":"2026-08-14T14:25:40.508191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.477474Z","title":null,"venue":null,"work_id":"4559ca49-4305-44f2-82ec-9bf260a1a777","year":2017},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.363164Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:7c314e0d4225d25af45004238363b44e15608fabb9479ca10906365b2a421e9f","observation_id":"24bf1f2f-8d04-49fe-b23c-be04665ed17b","resolution":{"observed_at":"2026-08-14T14:25:40.483707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.455281Z","title":null,"venue":null,"work_id":"b6e1011e-6815-4e2b-a46f-1727203bf9cb","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.370748Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:de43c0d9fc5eaa5a5bacead0e9a4a0b9d48c002c2826e61dba1180ef27a66ceb","observation_id":"7ee92dd1-df7f-4d7e-a123-7650d1098d6d","resolution":{"observed_at":"2026-08-14T14:25:40.462850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.432082Z","title":"Grathwohl, D","venue":null,"work_id":"8a479bd7-ecfc-41c2-b9e5-b7654368939f","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.386784Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:9319a152d2d403242b2d99f397a93ebbb32f799cae1c2db6840036acb853a6b5","observation_id":"f864052a-b272-4a22-885e-ba3824d912c0","resolution":{"observed_at":"2026-08-14T14:25:40.441686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10031","last_updated":"2018-11-19T18:57:02Z","snapshot_observed_at":"2026-08-14T19:41:32.684847Z","submitted_at":"2018-02-27T17:16:48Z","title":"The Mirage of Action-Dependent Baselines in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10031","snapshot_observed_at":"2026-08-14T14:25:39.395346Z","title":"Tucker, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.395346Z"},"links":{"cited_paper":"/paper/1802.10031","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:0d4029fdf256e5104331b38ae51a534dd53a86293dc9ba1a616c2a6de58dcbb8","observation_id":"8a087b20-2c97-45a4-8fed-e943814e64e2","resolution":{"observed_at":"2026-08-14T14:25:39.395346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06225","last_updated":"2018-11-15T08:18:33Z","snapshot_observed_at":"2026-08-14T17:58:54.861799Z","submitted_at":"2018-11-15T08:18:33Z","title":"Reward-estimation variance elimination in sequential decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.06225","snapshot_observed_at":"2026-08-14T14:25:39.404839Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.404839Z"},"links":{"cited_paper":"/paper/1811.06225","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:11b13725194f2c4a81192eab8a12ce74a09a5d620ee56120f3c6b14d9d88fb2b","observation_id":"371e0090-7036-4b0c-a91b-ec496ff7e2e3","resolution":{"observed_at":"2026-08-14T14:25:39.404839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.411836Z","title":null,"venue":null,"work_id":"1c5ed930-69bb-4b53-ad54-ff3ff076be09","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.418128Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:e246bead4862de4fdc19e5e6af62215ae9d6895ec51a25846bb2b9075f60d8ca","observation_id":"a2db03ec-246c-485a-a25c-17b62980cfc2","resolution":{"observed_at":"2026-08-14T14:25:40.417372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.389732Z","title":null,"venue":null,"work_id":"a12aa5d3-c660-40e4-b17c-1a0ab6d51597","year":1957},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.425024Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:d6999dc0d4d50f5cd55b13567ecb27785dcdcc8eba81299e85057f1a98a21ede","observation_id":"c8c16567-bff4-4ed4-a284-9f49c2b7c3b5","resolution":{"observed_at":"2026-08-14T14:25:40.397483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.351596Z","title":null,"venue":null,"work_id":"4a87e3db-e2c9-4bae-babc-fa0481c9d647","year":1995},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.434584Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:9463be4e326b20ef2cf2a4b6a81d3e5616d7421262c701d72a4202c03837f438","observation_id":"83f44b55-f1fe-4b9b-9aac-c46a2fb6e61b","resolution":{"observed_at":"2026-08-14T14:25:40.365337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.440612Z","title":"Beck and M","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.440612Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:a7bfb161bf04fd0fb20253ae468e347d3ffa4dc1db889bc78a4758c28bfd4570","observation_id":"b4090b9c-e85c-46ae-a45d-ddb4d4f6ca6b","resolution":{"observed_at":"2026-08-14T14:25:39.440612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.304803Z","title":null,"venue":null,"work_id":"706a38df-3146-42f3-8cab-f26fd9806db7","year":2003},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.449838Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:68b4d3df4ffda6310df8d7dba4cd8ab39b253efa6eeb891e3b003c17432c447f","observation_id":"07ba154f-3f7f-4ce6-831b-813832b46c4f","resolution":{"observed_at":"2026-08-14T14:25:40.317137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.276837Z","title":"Vemula, W","venue":null,"work_id":"b029991e-9a25-423f-b783-46ee45afdf22","year":2019},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.464991Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:0cd76314da77486bb6dfae504a498b897992ac738fb711e8f3fb6e6ec0935a75","observation_id":"2c2a25d3-496d-4314-be2d-c416db887245","resolution":{"observed_at":"2026-08-14T14:25:40.284582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.247337Z","title":null,"venue":null,"work_id":"ac8b37e4-7e18-43d0-98c3-51865d3b29fa","year":1990},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.482592Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:72b7974dca69789527f3543862558383fda17b60d4ffc0e4abfeea45aace0d87","observation_id":"38408601-f664-4a24-bb12-efedbf9cadeb","resolution":{"observed_at":"2026-08-14T14:25:40.258593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.491821Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.491821Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:751aff8d931821e8f41a14847255464de50ebf9aeb5cc53eae87a905016daccf","observation_id":"895ec48f-b0a8-4842-8570-d3adb223217c","resolution":{"observed_at":"2026-08-14T14:25:39.491821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.499332Z","title":"Schmidt, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.499332Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:1dde0ea3cbc010e4833a0e11d9f730a138909cd9ffff952d15ca3e51e8916e2d","observation_id":"90fad94f-fd03-4d05-a2a9-3772dacca61f","resolution":{"observed_at":"2026-08-14T14:25:39.499332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.191108Z","title":"Johnson and T","venue":null,"work_id":"2469f6ed-f30f-4b1f-ae34-61865f07b800","year":2013},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.506390Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:45d8d6296447cd126269f295a862ad66a098011aef12b02fb7c61e8854a99c9f","observation_id":"bceff0ea-6228-4960-823e-e87165ca94b5","resolution":{"observed_at":"2026-08-14T14:25:40.199064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.155461Z","title":"Defazio, F","venue":null,"work_id":"450f35a3-55fc-4440-8d7f-0e5a191ab3cc","year":2014},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.514204Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:18762625f8027b663b013fe7b70141928eb7ee1f31a3127235c7af4d2dc647a2","observation_id":"3b37b103-d5da-4510-b3d3-50c58d4bc5b0","resolution":{"observed_at":"2026-08-14T14:25:40.168026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.126058Z","title":null,"venue":null,"work_id":"de287e2e-73f4-4e59-a777-48bdf7333d21","year":2013},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.520508Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:335639875380899ae4212c701aebcd40a6c514f04bbd77d79a59feb6008193af","observation_id":"1df63345-774d-44a6-8c82-8065e0835dd4","resolution":{"observed_at":"2026-08-14T14:25:40.132969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03326","last_updated":"2020-05-02T07:20:30Z","snapshot_observed_at":"2026-08-14T19:56:21.658192Z","submitted_at":"2018-01-10T11:59:59Z","title":"Expected Policy Gradients for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1801.03326","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.03326","snapshot_observed_at":"2026-08-14T14:25:39.744855Z","title":"Expected Policy Gradients for Reinforcement Learning","venue":"stat.ML","work_id":"9782d341-bc6f-4930-a929-27e6a3d326b1","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.540027Z"},"links":{"cited_paper":"/paper/1801.03326","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:4330b027b0e169832449c55c14270cc396245e8d4f316cb8ad28035876bfb3f7","observation_id":"9627ad71-871a-4bb5-8b6f-3f4df6e5262a","resolution":{"observed_at":"2026-08-14T14:25:39.759551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.095463Z","title":null,"venue":null,"work_id":"aefd3b2c-652b-4a23-9c82-2b5e6d3638c0","year":1996},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.547750Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:328d5473e3c5fcc3e8b5b07951e7bd0ff4c3efd1703e0dc9dc30c02f2756e40b","observation_id":"14a9e677-16d0-4d01-9b91-5cb3b06f84c7","resolution":{"observed_at":"2026-08-14T14:25:40.105382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.060748Z","title":null,"venue":null,"work_id":"2592fe24-abdd-472f-89b9-68e7156f816f","year":2001},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.568347Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:c416d7822fc4eeb797cf143e4b5577c4911d4a72bc1d78c86108e12e36a85189","observation_id":"6716a93d-b318-4de0-9902-a434c6d3db5a","resolution":{"observed_at":"2026-08-14T14:25:40.069970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:40.027709Z","title":"Baxter and P","venue":null,"work_id":"d734a099-fe21-4b33-85be-c8bbdb035afd","year":2001},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.579352Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:cdfc82f1eb2c86ae9336dc9de505ff523ae8d40efda015f73357f96dbd0a1bc7","observation_id":"af4d472a-85e8-4970-b13a-003c7530376e","resolution":{"observed_at":"2026-08-14T14:25:40.038358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.995088Z","title":"Landau and E","venue":null,"work_id":"ddf54e6a-c6ec-4a7b-84bb-39eb1d5d035d","year":1958},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.593945Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:b92d506bdaeaa21caa6a0261e3c5ecddb5768c660e7cb2a71280a02310b93c46","observation_id":"0985f900-b8ab-4169-88f1-305275137236","resolution":{"observed_at":"2026-08-14T14:25:40.000894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-14T14:25:39.601235Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.601235Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:050654b575146903e5c3c79b71558b468ef7d3554c9496bf7d3a9b7a757c12de","observation_id":"9e8624c0-204f-46eb-b5ab-034b6abb15d3","resolution":{"observed_at":"2026-08-14T14:25:39.601235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.968140Z","title":null,"venue":null,"work_id":"b2be4e59-f83a-4a52-8609-2a9178dc36ff","year":2018},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.612620Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:1294e4fb52abc8f8f0aae43df759e3332b956542194ad073ec29cf6d6de01711","observation_id":"62138545-a281-4e10-87c7-5e8f3b0c6a9a","resolution":{"observed_at":"2026-08-14T14:25:39.977301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.938179Z","title":null,"venue":null,"work_id":"7109f243-31ad-493a-8034-b92a968877c3","year":2006},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.619676Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:1763b1512ccc2f64f9d7ca0c8aef25f1f6d881e65e66949bcc16da812e006934","observation_id":"bba63ec3-e7a8-4190-8c9d-92853e5157e5","resolution":{"observed_at":"2026-08-14T14:25:39.946075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.915130Z","title":"That is, a feasible ordering must be causal at least in actions: the action randomness that causes a state must be arranged before that state in the ordering","venue":null,"work_id":"c5f8545a-c3f8-409a-b582-f5f0008b8f57","year":null},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.627640Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:be6d568ec185e62bb63890a8c724af4bd2886e09bdbcb60f2cc845e9dc423e4f","observation_id":"b27d937a-603c-4b9d-bc23-642f3b55db4b","resolution":{"observed_at":"2026-08-14T14:25:39.922455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:25:39.884976Z","title":"We consider the following operations (a) Suppose, in an ordering, there isSv→Su,v >u, then we can exchange them without affecting residue","venue":null,"work_id":"ba6c4216-23e7-4e5e-9d7f-b2711bd1afc8","year":null},"citing_paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:25:39.636614Z"},"links":{"citing_paper":"/paper/1908.03263"},"observation_digest":"sha256:236c04f6384662e7fd705da21ca745d8ac4c0c8e4b6a03f4d8c027e932584ff8","observation_id":"4d2ba498-63b1-4513-bc65-d36c41ce8afb","resolution":{"observed_at":"2026-08-14T14:25:39.894577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.03263","last_updated":"2019-08-08T20:35:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T03:25:04.417904Z","submitted_at":"2019-08-08T20:35:53Z","title":"Trajectory-wise Control Variates for Variance Reduction in Policy Gradient Methods"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:1908.03263."}