{"as_of":"2026-08-13T06:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d135ee83b3f82869450592789e73eb8326ef271bcb2a9d858b4f84238ec5943","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:52:46.731946Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:28:06.474838Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T20:28:07.394748Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"cited_work":{"arxiv_id":"2411.17861","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17861","snapshot_observed_at":"2026-08-10T20:28:07.394748Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","venue":"cs.LG","work_id":"6fc21331-d95f-4875-90a4-6d07a82b2e8b","year":2024},"citing_paper":{"arxiv_id":"2501.08561","last_updated":"2026-07-25T18:09:57Z","snapshot_observed_at":"2026-08-13T03:21:20.343051Z","submitted_at":"2025-01-15T04:04:57Z","title":"ANSR-DT: A Neuro-Symbolic Framework for Adaptive and Explainable Digital Twins","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:28:06.474838Z"},"links":{"cited_paper":"/paper/2411.17861","citing_paper":"/paper/2501.08561"},"observation_digest":"sha256:bed0ef6578c1afd08af9baf9ab3a1ad9dfa7b93722f90a4f4027ed203caa239c","observation_id":"8ff85624-1885-40b4-9c98-286e164ae58a","resolution":{"observed_at":"2026-08-10T20:28:07.444921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17861/citation-record","integrity":"/paper/2411.17861/integrity","json":"/paper/2411.17861/citation-record.json","paper":"/paper/2411.17861"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.556072Z","title":"Robustness measures and monitors for time window temporal logic","venue":null,"work_id":"32ec234d-4b4d-41e5-9ad5-58444466b859","year":2023},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.484155Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:a079ba7b5529bd631fae6d58cb4675775175b3dee40e8bd6c7ecaa19a076dce8","observation_id":"26a01fb4-8144-45d4-b498-45d2635589e9","resolution":{"observed_at":"2026-08-12T11:52:47.562833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.528865Z","title":"Q-learning for robust satisfaction of signal temporal logic specifications","venue":null,"work_id":"b68b42a9-4474-4fe1-b924-80167752820e","year":2016},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.493814Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:aa9cac30037e53a77c575686eada61adea4a320ed0c87012ab7c52f2ca100112","observation_id":"b831f535-cec6-4552-8dd3-5d889cac1b20","resolution":{"observed_at":"2026-08-12T11:52:47.535758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.495273Z","title":"u diger Ehlers, Bettina K \\","venue":null,"work_id":"2ec61693-6d9f-4163-8a38-209aa6449cb9","year":2018},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.501307Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:c15715560d358c1b0bd6c53ece66ccb32affddf452d9edfa2d03d1c8df906c0c","observation_id":"02c8c338-4d29-4487-baa7-c5d32e88ac3b","resolution":{"observed_at":"2026-08-12T11:52:47.502104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.471085Z","title":"Temporal-logic-constrained hybrid reinforcement learning to perform optimal aerial monitoring with delivery drones","venue":null,"work_id":"569fa511-d640-4999-b4f9-d65d46062662","year":2021},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.512189Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:95900523c58bddf620681e8d95101e8dde32bb61f12ed5b41e32f03573d287bc","observation_id":"575564f0-34d5-4a2b-a6cb-eb8881e3f4d3","resolution":{"observed_at":"2026-08-12T11:52:47.478714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.448473Z","title":"Principles of model checking","venue":null,"work_id":"ccc31364-96be-4bdf-8cf6-3e6d9fabad9b","year":2008},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.532382Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:52dfbef42f60050ee01425bd831e53fd4fa3bc4766fce59f59fce454b88bee3f","observation_id":"4f82c5e7-bdc9-4640-ba75-73677b8c7b4c","resolution":{"observed_at":"2026-08-12T11:52:47.455806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.425590Z","title":"Structured reward shaping using signal temporal logic specifications","venue":null,"work_id":"15d24f17-4272-447d-81ef-994e01638c96","year":2019},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.554330Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:fe0db0021f6511d3d56c79a9b2a9c769503fd8c87174fa0f3beddfca92a41344","observation_id":"46279274-41d4-4a85-be1c-63164cd10115","resolution":{"observed_at":"2026-08-12T11:52:47.431795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.561945Z","title":"Efficient online reinforcement learning with offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.561945Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:55a20a999e355a62db3f4a44e98764110b8074ddfd29ed1344e1be89cc913fd9","observation_id":"507a73d9-7d7b-45a8-961e-1653a957f7cb","resolution":{"observed_at":"2026-08-12T11:52:46.561945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.383357Z","title":"Overcoming exploration: Deep reinforcement learning for continuous control in cluttered environments from temporal logic specifications","venue":null,"work_id":"b695c43b-b374-4f90-87be-a42a548f2b3b","year":2023},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.571214Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:e6cdd924df7abc18709c21881b7febe2cc6244d10514ce7fc1b57871dd6f3469","observation_id":"140370b8-4ab6-4a8c-bfd8-1f734537dc12","resolution":{"observed_at":"2026-08-12T11:52:47.392580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.358370Z","title":"Provably efficient exploration in policy optimization","venue":null,"work_id":"47890ef6-7c72-4db5-a456-fd1e8a9af590","year":2020},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.579436Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:25382f3c3e9109f54d80507c66c6fbf4e6afb66becc3e76d9caca00c7c7e84f2","observation_id":"4f49832c-82b9-4a68-8481-deeebed5c022","resolution":{"observed_at":"2026-08-12T11:52:47.365131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.586476Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.586476Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:b5e51081742226f1e263416bbf33ab48d509a25b9c611b43d367ff0db9cc4b34","observation_id":"074d7896-4186-4531-a08c-f8cb89d001db","resolution":{"observed_at":"2026-08-12T11:52:46.586476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.318944Z","title":"Mirror learning: A unifying framework of policy optimisation","venue":null,"work_id":"b4704aad-a873-47da-ab8c-0cb32349134d","year":2022},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.591702Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:3b98e2717dc2fc1a0655abe2774c9684c8d6430bd905d00df833de436e63c775","observation_id":"a71427fb-82c6-4d19-a888-d51377e037bc","resolution":{"observed_at":"2026-08-12T11:52:47.325509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02198","last_updated":"2024-05-20T20:09:24Z","snapshot_observed_at":"2026-08-13T05:33:10.798511Z","submitted_at":"2023-11-03T19:03:20Z","title":"Imitation Bootstrapped Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02198","snapshot_observed_at":"2026-08-12T11:52:46.600129Z","title":"Imitation bootstrapped reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.600129Z"},"links":{"cited_paper":"/paper/2311.02198","citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:1476512df89c720c23a8395e3a6578187dc7297fa7596d12f92666d848cab73a","observation_id":"a537d976-ec31-47ec-a8b5-e08437152fc5","resolution":{"observed_at":"2026-08-12T11:52:46.600129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.295678Z","title":"A tutorial on mm algorithms","venue":null,"work_id":"b78fdd1d-aeb6-4885-82a5-5c3e764d011a","year":2004},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.606014Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:1fbed3b9166d9e233f1933ed04da3e448f4a3a47db2dd472362411a293fc5902","observation_id":"315a9cc6-2786-4d74-b15d-c7d494085f9f","resolution":{"observed_at":"2026-08-12T11:52:47.300989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.612212Z","title":"Reward machines: Exploiting reward function structure in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.612212Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:87b2cc11dd2f03ee4f1fe4e326e69d956c126c3b7e031af77c17408e5423cb45","observation_id":"abb12aef-0a87-4c8d-8847-37421b20b81b","resolution":{"observed_at":"2026-08-12T11:52:46.612212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.617397Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.617397Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:da8e1c29ff0ca41fbb3e00a04a8077deced72b2858dfcb607f950910d896fbb1","observation_id":"19539de4-6464-4d0d-917a-110a92845c3b","resolution":{"observed_at":"2026-08-12T11:52:46.617397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.624935Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.624935Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:58009d424f49e4a83c73150d16077033eec28d7f61897f3aeb5591b4092984ec","observation_id":"c99c3e8f-28c8-4e46-b47c-e89d8c6d131c","resolution":{"observed_at":"2026-08-12T11:52:46.624935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.213971Z","title":"Reinforcement learning with temporal logic rewards","venue":null,"work_id":"db91970c-f590-4952-b158-36711d2eeb41","year":2017},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.630179Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:8adeaecefc592d83422f3bfd9599c2e7b86076ab906314b076a4e10eac853eae","observation_id":"35a87e66-ffdd-4134-b9d5-5cb559e10415","resolution":{"observed_at":"2026-08-12T11:52:47.229610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-12T11:52:46.637160Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.637160Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:061e78a4ebdd90648e3a0f7090f6275df7bc78ad5477e8f11ae3531076d3ff61","observation_id":"70a1a7f9-d3d9-4b9e-a01d-af8814f4e334","resolution":{"observed_at":"2026-08-12T11:52:46.637160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.183881Z","title":"Advice-guided reinforcement learning in a non-markovian environment","venue":null,"work_id":"bf90e223-07c0-4939-a287-437f998fde69","year":2021},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.644641Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:55384af25cf2d550fab8a69a11739234488ddba07f272d53e2d1300da9a69dd8","observation_id":"0547adb5-2f2c-43f0-a5c7-d748303d54f0","resolution":{"observed_at":"2026-08-12T11:52:47.193723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.152503Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"d844224e-7865-4c59-abbc-c8ad2d22e937","year":1999},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.651318Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:6ab02cd18b074bc446cb60ac53130bcabf7c01010ac4707f6394cfdb211b653c","observation_id":"ba6f8e0c-4952-4f05-bafb-8bad039f17c5","resolution":{"observed_at":"2026-08-12T11:52:47.163130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.121174Z","title":"Implicit human perception learning in complex and unknown environments","venue":null,"work_id":"076ce02c-5b27-4cbf-8a00-c86d5b036e0e","year":2024},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.658404Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:73fb031985d72328796ba4b5e1e39343666482c84303f5b153bed472f1f534a8","observation_id":"9675e615-6219-4b16-8b3d-31c0b35025b3","resolution":{"observed_at":"2026-08-12T11:52:47.129012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.097617Z","title":"Agnostic system identification for model-based reinforcement learning","venue":null,"work_id":"dd7f8156-2454-453b-aacd-129db0d0f85a","year":1905},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.663767Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:723ac0b105b27e86a7cd3877a11ee04548ccf381cf69f1c6ada235c9f1928467","observation_id":"d61732d2-32ce-49e4-ab93-009ff1927aae","resolution":{"observed_at":"2026-08-12T11:52:47.106305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.076583Z","title":"Trajectron++: Dynamically-feasible trajectory forecasting with heterogeneous data","venue":null,"work_id":"2c25192b-a1d1-47b5-8a43-2e80cfc0d7fe","year":2020},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.669943Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:283051cdbd079c05fbf16e1e7bccb6cd025472237ce3f718de4ffc3f0a43c245","observation_id":"4932ad35-cd2e-4111-a6f4-7adc7d0841c7","resolution":{"observed_at":"2026-08-12T11:52:47.083880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-07-06T06:27:37.630587Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-12T11:52:46.677141Z","title":"Kickstarting deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.677141Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:f1f21d907dc3750eaf1e321977ced1daa289a4261734143c777dbd6bc76e7f09","observation_id":"c8228c20-aed5-48aa-86a2-167f48d9e72f","resolution":{"observed_at":"2026-08-12T11:52:46.677141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:47.052799Z","title":"Trust region policy optimization","venue":null,"work_id":"5423e4a3-f475-49b1-8a06-f393697954fa","year":2015},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.683744Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:f1631c3c2698db08a32e0e3eb0e93bb8d86be85f49eca39642fa7ace6fb46a87","observation_id":"5cfa168b-e794-4500-9c49-3ef6bf4068e7","resolution":{"observed_at":"2026-08-12T11:52:47.060838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-12T21:29:36.308819Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-12T11:52:46.695180Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.695180Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:0b1c8ff71964f4dd5087d99ea5b113f0fb87cd84decb58cd4059ac52c6a50ddc","observation_id":"c9d8d462-38ba-43fd-9fda-13a0da0b570a","resolution":{"observed_at":"2026-08-12T11:52:46.695180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T11:52:46.701697Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.701697Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:5febb28d66f07f2b6d00eb503c87718c920bb78ad274a6f7312da416baec139d","observation_id":"9734904f-ca20-45c8-9a93-1ba29d8df102","resolution":{"observed_at":"2026-08-12T11:52:46.701697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.714546Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.714546Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:48d83d81d7d7a870d1d3f910d6c387be8db5f52cd5c6be7b42d19e8fbde3ff7f","observation_id":"af193ef4-b9b9-412f-aea1-c2643a4c53c6","resolution":{"observed_at":"2026-08-12T11:52:46.714546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.995622Z","title":null,"venue":null,"work_id":"e4f42e17-7266-40d4-9d28-65d767bca6be","year":2023},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.720242Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:d2c22e16f7a2db726783bc595d07aaee6a7ced5786ca0aa2f86e8aec80de8926","observation_id":"1c0d99f7-56a0-45ca-af40-07e6a58348ca","resolution":{"observed_at":"2026-08-12T11:52:47.005125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.944353Z","title":"Time window temporal logic","venue":null,"work_id":"02d1fc2c-fce7-4970-a65a-fb8fb1b86604","year":2017},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.726539Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:52e446b01e3fe7d0f3ea57275efd714c145810039d402a9d563193085a5024f6","observation_id":"0b05f1c8-2b1c-425d-b52e-2168edbf0018","resolution":{"observed_at":"2026-08-12T11:52:46.971335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:52:46.916735Z","title":"Joint inference of reward machines and policies for reinforcement learning","venue":null,"work_id":"3485dc45-9fde-405e-9030-65ab8f7fedf2","year":2020},"citing_paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T11:52:46.731946Z"},"links":{"citing_paper":"/paper/2411.17861"},"observation_digest":"sha256:cbb2c3197317d76bfc42ed31cb668da1f6af5ba83f35ad272e4964be80f9ab6e","observation_id":"970abbdd-c3a1-4355-b40e-bdf92c9c81c6","resolution":{"observed_at":"2026-08-12T11:52:46.925300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.17861","last_updated":"2024-12-05T02:30:43Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T11:43:40.219257Z","submitted_at":"2024-11-26T20:22:31Z","title":"Accelerating Proximal Policy Optimization Learning Using Task Prediction for Solving Environments with Delayed Rewards"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2411.17861."}