{"as_of":"2026-08-06T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33c0649b416d1610f3c137921b0e74cb99001a0cfca23bd163d12859de5f0793","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:43:27.794855Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":366,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T01:48:10.689906Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/1801.01290"},"observation_digest":"sha256:c3bd2257d90a1817402513b785226817aad3907edbdeda4d154daf3e58d6d27c","observation_id":"b4b9ea1a-2cf5-4ec2-a603-c88bd4c641f5","resolution":{"observed_at":"2026-05-13T01:48:10.739212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T14:32:41.948156Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/1812.05905"},"observation_digest":"sha256:6c9a74aec9195980a1c0048222755fd8d33601ca6b62b37b716ead5be4805b59","observation_id":"4d1bfb09-22c5-4c4d-9d21-488274632bc0","resolution":{"observed_at":"2026-05-13T14:32:42.027745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"1907.01463","last_updated":"2019-07-02T15:46:46Z","snapshot_observed_at":"2026-07-06T08:04:26.492137Z","submitted_at":"2019-07-02T15:46:46Z","title":"Reproducibility in Machine Learning for Health","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T11:03:15.737223Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/1907.01463"},"observation_digest":"sha256:511487d1b2568b29375c848fe775be8c7239fa771cc8ff74f69e50dbfdfda424","observation_id":"ea5dab91-6196-4c2c-8df0-1b8cd61dfcf0","resolution":{"observed_at":"2026-05-25T11:05:40.127539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-03T22:43:27.794855Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.11703","last_updated":"2026-05-27T22:45:09Z","snapshot_observed_at":"2026-08-03T22:43:24.680683Z","submitted_at":"2025-11-12T14:28:46Z","title":"Enhancing Reinforcement Learning in 3D Environments through Semantic Segmentation: A Case Study in ViZDoom","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:43:27.794855Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/2511.11703"},"observation_digest":"sha256:03f879842c9c2df57ac2596aa2e74f5db3c96f25dfa46aaec96cd229499afea5","observation_id":"a9eeaa5e-8e8c-4253-8604-2d5bf0bf0ae8","resolution":{"observed_at":"2026-08-03T22:43:27.794855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"2604.06000","last_updated":"2026-04-07T15:28:25Z","snapshot_observed_at":"2026-08-05T15:56:05.114408Z","submitted_at":"2026-04-07T15:28:25Z","title":"Regimes of Scale in AI Meteorology","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T19:17:52.935347Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/2604.06000"},"observation_digest":"sha256:8af6f33a8ee6cdf9aa9991c4a21836d444462f1cb3e4afca12ddd712bd6c84c3","observation_id":"75750cd0-2c0d-46aa-8205-b3d9a8f037e5","resolution":{"observed_at":"2026-05-10T19:20:44.962186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"2605.01567","last_updated":"2026-05-02T18:37:36Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T18:37:36Z","title":"Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T13:59:40.638085Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/2605.01567"},"observation_digest":"sha256:817effd7224aeadb56f09495a0e367cfe2264f79eb93295a5b94da516d5d5ec7","observation_id":"02d3754b-0679-4dd9-8385-0dfd5b4748dd","resolution":{"observed_at":"2026-05-09T22:29:06.418008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"2605.04243","last_updated":"2026-05-05T19:30:06Z","snapshot_observed_at":"2026-07-06T23:17:04.200299Z","submitted_at":"2026-05-05T19:30:06Z","title":"Temporal Reasoning Is Not the Bottleneck: A Probabilistic Inconsistency Framework for Neuro-Symbolic QA","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T17:45:44.270122Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/2605.04243"},"observation_digest":"sha256:bd1a6b7a9ca3dc5d582ff8d26498be03b99652479d51649c6b7630b4fb447e65","observation_id":"42fd072f-03fe-4584-a842-ce4a5d844f3b","resolution":{"observed_at":"2026-05-11T17:16:07.897798Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"2605.13434","last_updated":"2026-05-13T12:27:22Z","snapshot_observed_at":"2026-07-06T23:25:01.951546Z","submitted_at":"2026-05-13T12:27:22Z","title":"Rescaled Asynchronous SGD: Optimal Distributed Optimization under Data and System Heterogeneity","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-14T19:31:12.149482Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/2605.13434"},"observation_digest":"sha256:6550e243bad9338e31b521f89deaa9f49fafef0199c11033b8c860d41f979a31","observation_id":"e4590b28-abec-49b3-b43f-d28a15d96b44","resolution":{"observed_at":"2026-05-14T19:32:51.156278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters","version":3},"cited_work":{"arxiv_id":"1709.06560","doi":"10.48550/arxiv.1709.06560","metadata_source":"pith","pith_arxiv_id":"1709.06560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Reinforcement Learning that Matters","venue":"cs.LG","work_id":"aaf8cbbc-43f9-41cb-be22-4ed140b3a2dd","year":2017},"citing_paper":{"arxiv_id":"2606.08803","last_updated":"2026-06-07T19:46:48Z","snapshot_observed_at":"2026-07-06T23:48:16.585598Z","submitted_at":"2026-06-07T19:46:48Z","title":"Some Essential Constructive Foundations for Systems and Control","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T17:48:35.402903Z"},"links":{"cited_paper":"/paper/1709.06560","citing_paper":"/paper/2606.08803"},"observation_digest":"sha256:ca4f8107ae54c913162906317dd304c388d30aabb67e659de0637cede761c985","observation_id":"c6e3f277-1583-475f-9ee6-c12680adcf98","resolution":{"observed_at":"2026-07-02T23:47:28.421001Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1709.06560/citation-record","integrity":"/paper/1709.06560/integrity","json":"/paper/1709.06560/citation-record.json","paper":"/paper/1709.06560"},"outbound":[],"paper":{"arxiv_id":"1709.06560","last_updated":"2019-01-30T04:21:41Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T06:00:20.967053Z","submitted_at":"2017-09-19T06:09:47Z","title":"Deep Reinforcement Learning that Matters"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:1709.06560."}