{"as_of":"2026-08-17T04:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cefe32e1201125e0c6b772c0a548cfddd5143ee0673f856125675f58f4b08dc","coverage":[{"denominator":6,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:15:27.229715Z","state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:43:00.121084Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:43:00.548193Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"cited_work":{"arxiv_id":"2512.14617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.14617","snapshot_observed_at":"2026-08-15T15:43:00.548193Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","venue":"cs.LG","work_id":"e8a68655-a7f1-4810-9ce6-2841326d80f2","year":2025},"citing_paper":{"arxiv_id":"2607.17823","last_updated":"2026-07-20T11:11:55Z","snapshot_observed_at":"2026-08-17T01:58:36.348085Z","submitted_at":"2026-07-20T11:11:55Z","title":"Theoretical Foundations of $\\max$@$k$ Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:43:00.121084Z"},"links":{"cited_paper":"/paper/2512.14617","citing_paper":"/paper/2607.17823"},"observation_digest":"sha256:6af680bc69678189a167785a001de954c7cfa3be4d7a6ced26ee069a51290d7a","observation_id":"a3287bdd-5ede-4ab7-bf89-b864090bc05b","resolution":{"observed_at":"2026-08-15T15:43:00.554958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2512.14617/citation-record","integrity":"/paper/2512.14617/integrity","json":"/paper/2512.14617/citation-record.json","paper":"/paper/2512.14617"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:15:26.838755Z","title":"simulation-lemma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T16:15:26.838755Z"},"links":{"citing_paper":"/paper/2512.14617"},"observation_digest":"sha256:212bf38cec998d3b3ca10f9b9f199fa2dd411567b94ead8df8f5f185cbef124c","observation_id":"68411146-cfa5-4866-8cda-884838c60776","resolution":{"observed_at":"2026-08-03T16:15:26.838755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:15:27.021872Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T16:15:27.021872Z"},"links":{"citing_paper":"/paper/2512.14617"},"observation_digest":"sha256:d2ff54b9e75a1ec7783aef51f8d63b21386a22722397e2857b69b1ec9cb51e42","observation_id":"b9c49a03-2702-4384-8c3a-d6b0f4079b78","resolution":{"observed_at":"2026-08-03T16:15:27.021872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:15:27.229715Z","title":"error + V πt ¯M (b, q)−V ∗ ¯M (b, q) | {z } est","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T16:15:27.229715Z"},"links":{"citing_paper":"/paper/2512.14617"},"observation_digest":"sha256:06890868a0898c50914d95a4a7792c75e230415d178c237b448ac42fb1c1afa5","observation_id":"fecd9376-00bc-4af6-8f2f-2ba42e1f7d61","resolution":{"observed_at":"2026-08-03T16:15:27.229715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1403.3741","last_updated":"2014-10-31T23:34:32Z","snapshot_observed_at":"2026-08-15T12:36:29.035090Z","submitted_at":"2014-03-15T01:56:02Z","title":"Near-optimal Reinforcement Learning in Factored MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1403.3741","snapshot_observed_at":"2026-08-03T16:15:26.717241Z","title":"Journal of Artificial Intelligence Research, 19: 399–468","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-03T16:15:26.717241Z"},"links":{"cited_paper":"/paper/1403.3741","citing_paper":"/paper/2512.14617"},"observation_digest":"sha256:292d0bd26974df335588e5af0ede50232e6c2293b4b0696c2a3693388ab7995a","observation_id":"706d583f-ad28-4a7d-ae7d-d56150517726","resolution":{"observed_at":"2026-08-03T16:15:26.717241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:15:26.591251Z","title":"InProc, ICAPS, volume 34, 13659–13662","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T16:15:26.591251Z"},"links":{"citing_paper":"/paper/2512.14617"},"observation_digest":"sha256:0ddd916580dc24c5cdb505e1a529efbc94b75f9a61d361882106c3b546a572d9","observation_id":"4bfe4a1d-56f7-4b16-a973-fa577001f1b7","resolution":{"observed_at":"2026-08-03T16:15:26.591251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:15:26.476410Z","title":"InInternational Conference on Artificial Intelligence and Statistics (AISTATS), 4114–4146","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T16:15:26.476410Z"},"links":{"citing_paper":"/paper/2512.14617"},"observation_digest":"sha256:2de62109a31a0b2d2c21f3da1b76dc3ffc8be77d886e4e771efed789b426c106","observation_id":"a0d59e86-7840-4126-bf1b-495cf87f8e6e","resolution":{"observed_at":"2026-08-03T16:15:26.476410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.14617","last_updated":"2026-06-08T23:20:57Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T16:15:24.039864Z","submitted_at":"2025-12-16T17:26:24Z","title":"Model-Based Reinforcement Learning in Discrete-Action Non-Markovian Reward Decision Processes"},"reference_resolution":{"displayed":6,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":6},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 6 of 6 outbound references and 1 inbound Pith citation observation for arXiv:2512.14617."}