{"as_of":"2026-08-22T15:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1d5446a887c0d16e152afeb1970cc55065adad9b7bc39a78072a203929ca7ba","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:45:13.631540Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T01:06:07.789346Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T01:06:57.322870Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"cited_work":{"arxiv_id":"2506.24026","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.24026","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In Reinforcement Learning Conference","venue":null,"work_id":"f9d1efce-199d-44e5-b462-bc033eeeeae7","year":2012},"citing_paper":{"arxiv_id":"2508.04282","last_updated":"2026-04-14T17:18:39Z","snapshot_observed_at":"2026-07-06T22:08:40.965707Z","submitted_at":"2025-08-06T10:13:17Z","title":"Synthetic POMDPs to Challenge Memory-Augmented RL: Memory Demand Structure Modeling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T01:06:07.789346Z"},"links":{"cited_paper":"/paper/2506.24026","citing_paper":"/paper/2508.04282"},"observation_digest":"sha256:18ea0a2131f52850c9217ee23e59a25b91b5ad49517d1d0f801df88c402e5707","observation_id":"96355ccc-13e6-45c0-b9b1-5503b98c3f7c","resolution":{"observed_at":"2026-05-19T01:06:57.326486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.24026/citation-record","integrity":"/paper/2506.24026/integrity","json":"/paper/2506.24026/citation-record.json","paper":"/paper/2506.24026"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2003.01008","last_updated":"2020-03-02T16:36:16Z","snapshot_observed_at":"2026-08-11T02:24:03.986660Z","submitted_at":"2020-03-02T16:36:16Z","title":"Learning and Solving Regular Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.01008","snapshot_observed_at":"2026-08-06T21:45:11.780663Z","title":"Learning and solving regular decision processes","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:11.780663Z"},"links":{"cited_paper":"/paper/2003.01008","citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:1a9199f3a801cc0163edc4262c5bf3c33cb15fde35966de079af68fe73d321ec","observation_id":"57842640-8dd7-4525-87e7-f169d00bfbec","resolution":{"observed_at":"2026-08-06T21:45:11.780663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:17.928059Z","title":"Regular decision processes: A model for non-markovian domains","venue":null,"work_id":"79011f3b-8e5c-4a66-905f-5808dbdbf309","year":2019},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:11.863655Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:e9f2cda61dea18431457730154271c6cc0c53acfe8999d9d11864eb73f7a30b8","observation_id":"7b9c6881-b6a1-4201-96b8-00a6ca652048","resolution":{"observed_at":"2026-08-06T21:45:18.034528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:17.781570Z","title":"Ltl and beyond: Formal languages for reward function specification in reinforcement learning","venue":null,"work_id":"f3b1b2c4-12ee-486f-8964-af99970667b8","year":2019},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:11.945712Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:c205a52ca764e0c88f6de420c1431f0b9c092be6ec5496a9eabea42b1640caf9","observation_id":"2ab29340-30e6-4d0b-a13b-9c267846545d","resolution":{"observed_at":"2026-08-06T21:45:17.842948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:17.630506Z","title":"Reinforcement learning in non-markovian environments","venue":null,"work_id":"2a56bfc0-c685-4124-a9b7-4b6786b71ad3","year":2024},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.034868Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:d8c09f03ed237fe5ce606cd0d97bf7f729001d07f6a7ea40815820912af01309","observation_id":"a07341f1-0e74-4c57-a9db-2e180f9b549b","resolution":{"observed_at":"2026-08-06T21:45:17.703454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:17.496091Z","title":"Dynamics of non-markovian open quantum systems","venue":null,"work_id":"2aab852a-7d7f-44de-b924-cf54f74daa86","year":2017},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.188498Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:1f3530aacf3ec302e9188672b040e63f0c7454f11fe199a3a95efa488d700a22","observation_id":"edce5df5-7ec1-427d-9b57-9a77aa77d334","resolution":{"observed_at":"2026-08-06T21:45:17.561257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:17.249343Z","title":"Rl-baselines3-zoo, 2024","venue":null,"work_id":"a8013fc3-8a73-4cc8-a2cc-3b4358041a62","year":2024},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.287244Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:9ed0aa19d4c9cb7a992afcc506f66ef888df720b6c92d9e3047be9eae0d36566","observation_id":"c32cec99-76c3-43f8-8239-5a053ddb37f3","resolution":{"observed_at":"2026-08-06T21:45:17.382502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:17.091370Z","title":"Stable-baselines3, 2024","venue":null,"work_id":"4bf541f0-d34a-4631-b102-2141c400b618","year":2024},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.356057Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:a253277a7655c91ad8c1c2c4f40cf96138cf8fe2de882578a925832a93f51e9f","observation_id":"2af57d71-dbd3-447a-b4a2-fff599cefa49","resolution":{"observed_at":"2026-08-06T21:45:17.159616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:16.939950Z","title":"Inferring probabilistic reward machines from non-markovian reward signals for reinforcement learning","venue":null,"work_id":"f33c5f7a-22d2-4773-9524-64e941e34ea1","year":2022},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.437165Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:419c1d69b07123619c2280211e399ad66cfa334e5a85d244e9b8435d841886de","observation_id":"f2317c3c-95ff-4179-9cf0-61f1cad90578","resolution":{"observed_at":"2026-08-06T21:45:17.004282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:16.708616Z","title":"Gymnasium, 2023","venue":null,"work_id":"8feb1ab1-4844-48a0-9ef5-4b2ca38833c8","year":2023},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.521547Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:fa863a8e0fb4840327132ae919e66c83fa8580d9357e083ed8802ec257e44b79","observation_id":"7d324916-2cda-442e-8ac6-6e3b63818d84","resolution":{"observed_at":"2026-08-06T21:45:16.808415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:16.422386Z","title":"Reinforcement learning with non-markovian rewards","venue":null,"work_id":"d631fada-ee18-499a-ac1e-75ce035fd46d","year":2020},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.600611Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:be68382e4bbba9e16e731f22aa69eb3eaf38144d3a90d432ffdaf5c9320ba039","observation_id":"6e2dc753-940e-4593-a543-b6fcb5137829","resolution":{"observed_at":"2026-08-06T21:45:16.569043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:16.089780Z","title":"Non-markovian reinforcement learning using fractional dynamics","venue":null,"work_id":"5672f96c-de17-41af-b3ab-83ff5e3be7b1","year":2021},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.678946Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:523fd468e2eb02ec948768a600624eb7a36850b546e1ec9390249f0c5155766e","observation_id":"0e10c117-b73c-4caa-8a8b-298cdef37d22","resolution":{"observed_at":"2026-08-06T21:45:16.256984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:15.809967Z","title":"Feature reinforcement learning: Part i","venue":null,"work_id":"eda91e5a-aaf7-449b-bc6a-0bf0f7d87862","year":2009},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.773516Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:6917b47ad5b05639725857fc97403d006f14c081a3b5bb810b5192c09be5caa3","observation_id":"a88bcad1-5b00-4f06-abbb-79e56b382f31","resolution":{"observed_at":"2026-08-06T21:45:15.925816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:15.509376Z","title":"The sample-complexity of general reinforcement learning","venue":null,"work_id":"265de604-5866-4b7a-89fc-9099c9f22063","year":2013},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.864855Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:d84347e34ededb18cf15ff3d030308fd7eaf8e5d0c7e4657a25ea34b401b9d30","observation_id":"10dcacb8-d487-4619-8191-02492f15add6","resolution":{"observed_at":"2026-08-06T21:45:15.641125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:12.926925Z","title":"Basic category theory , volume 143","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.926925Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:ffb849814de5b49b3748fec64e1b5d7414f99345542c30833eb7dbb73de83598","observation_id":"e83c53f6-c243-47e2-9261-f29434b67da6","resolution":{"observed_at":"2026-08-06T21:45:12.926925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:15.296072Z","title":"Selecting the state-representation in reinforcement learning","venue":null,"work_id":"649a4337-5b69-4d1e-887d-8e3666b1842e","year":2011},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:12.995606Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:ddde937f706e281461cf8f9b475c071675e1b9cd3d4119a736f3a525481f95f8","observation_id":"9f8318c8-35ba-4a53-b448-af111fcf08d6","resolution":{"observed_at":"2026-08-06T21:45:15.406162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:15.139131Z","title":"On q-learning convergence for non-markov decision processes","venue":null,"work_id":"88b22cf2-cf14-4db9-9177-0fce270d6c6d","year":2018},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.063997Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:2231107db768ebacae8554880c702eb8b50bb4a4f7836d65f582b6dbea9851ab","observation_id":"2d76b730-ceca-49d8-9f27-c9349100913b","resolution":{"observed_at":"2026-08-06T21:45:15.216850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:14.871849Z","title":"Competing with an infinite set of models in reinforcement learning","venue":null,"work_id":"23822e8d-a125-4ccf-b90d-088bf6e50a67","year":2013},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.117734Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:0356913dbd414c65d1064c26d40d80334e600ad11ee691b5f70822178a02684b","observation_id":"4c8a0e3a-3efc-4bb2-94e7-97ec9a671b95","resolution":{"observed_at":"2026-08-06T21:45:15.045137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:14.709253Z","title":"Learning non-markovian decision-making from state-only sequences","venue":null,"work_id":"0cfe3b80-f0ad-4605-bb11-f8ba4e5609a1","year":2024},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.165978Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:2e2be7b163c4451e0f7407badf98fa5a114fe52d249fa099b0c39b2b463c9a7a","observation_id":"22601f24-f5c4-4472-811a-9cedb1d65401","resolution":{"observed_at":"2026-08-06T21:45:14.789269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09293","last_updated":"2020-01-25T10:51:42Z","snapshot_observed_at":"2026-08-22T06:29:26.755552Z","submitted_at":"2020-01-25T10:51:42Z","title":"Learning Non-Markovian Reward Models in MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09293","snapshot_observed_at":"2026-08-06T21:45:13.232447Z","title":"Learning non-markovian reward models in mdps","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.232447Z"},"links":{"cited_paper":"/paper/2001.09293","citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:2f4f754bbf572c52162c254f3255fae05eaa9999d46507130839cc33e2ce0d04","observation_id":"93124684-39be-43f0-a505-9e378793009e","resolution":{"observed_at":"2026-08-06T21:45:13.232447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01053","last_updated":"2022-05-18T09:10:54Z","snapshot_observed_at":"2026-08-16T17:03:38.190766Z","submitted_at":"2022-04-29T16:53:00Z","title":"Markov Abstractions for PAC Reinforcement Learning in Non-Markov Decision Processes","version":2},"cited_work":{"arxiv_id":"2205.01053","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.01053","snapshot_observed_at":"2026-08-06T21:45:13.749539Z","title":"Markov Abstractions for PAC Reinforcement Learning in Non-Markov Decision Processes","venue":"cs.LG","work_id":"b0da689f-435f-4666-82c5-dde44be1da4e","year":2022},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.324290Z"},"links":{"cited_paper":"/paper/2205.01053","citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:9a930cb466a3115e234ca236b4e07817c2d98a36859789e132705b87a921e649","observation_id":"77a9e218-83dd-4d5b-bdb8-84e5b42ce8b8","resolution":{"observed_at":"2026-08-06T21:45:13.804821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:14.436856Z","title":"Stable-baselines3-contrib, 2024","venue":null,"work_id":"9d15c890-bf29-4454-94e7-b0bbe88e2c66","year":2024},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.408775Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:289044914660bc85c138e13dfc0bde9279b59e5b9422cd26f4a300fcb3342e98","observation_id":"62617c73-04cc-45be-ad57-7150db73969e","resolution":{"observed_at":"2026-08-06T21:45:14.516273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:14.231529Z","title":"A monte-carlo aixi approximation","venue":null,"work_id":"f08c237f-b4bc-4931-8964-8df71ef31c5f","year":2011},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.472802Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:ea27126f6dc8ca344596227d4cfcb4b51843740b6e11e31c9b6f77cfe0e047e7","observation_id":"ebbbcfef-5172-4254-981d-1cde572d1d98","resolution":{"observed_at":"2026-08-06T21:45:14.337391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:13.949348Z","title":"Reinforcement learning of non-markov decision processes","venue":null,"work_id":"9ac28534-be26-4a4d-be26-3761e9d5d56e","year":1995},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.565879Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:4af71e509a8e795ccca0f5857c02792a8504538361d9510c45615a75ea3d951d","observation_id":"869dd012-a7e2-4b45-9e83-b552b3df264b","resolution":{"observed_at":"2026-08-06T21:45:14.065279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:45:13.631540Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:13.631540Z"},"links":{"citing_paper":"/paper/2506.24026"},"observation_digest":"sha256:f2a3575f08836dc5f8d46eca38d7d4a3db31fea6bd38cf70debc04f398264a93","observation_id":"a38ea7d9-f9b3-405a-87c3-9406a96e2d1c","resolution":{"observed_at":"2026-08-06T21:45:13.631540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.24026","last_updated":"2025-06-30T16:32:31Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T06:00:57.787361Z","submitted_at":"2025-06-30T16:32:31Z","title":"Constructing Non-Markovian Decision Process via History Aggregator"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2506.24026."}