{"as_of":"2026-08-21T15:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:10aa8bb8f64969e30182d5a7b95b6e51f2178ec423ec99feb6555cf828376cf4","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:37:34.393318Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.14093/citation-record","integrity":"/paper/2508.14093/integrity","json":"/paper/2508.14093/citation-record.json","paper":"/paper/2508.14093"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2003.02189","last_updated":"2020-03-04T17:03:56Z","snapshot_observed_at":"2026-08-17T19:21:23.120847Z","submitted_at":"2020-03-04T17:03:56Z","title":"Exploration-Exploitation in Constrained MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02189","snapshot_observed_at":"2026-08-15T17:37:34.343026Z","title":"Exploration-exploitation in constrained MDPs","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.343026Z"},"links":{"cited_paper":"/paper/2003.02189","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:da6c66bff433f6ae23e1d78a2675b9748d7f2004376afaa28bd95a354cfdda44","observation_id":"6f9a8e0a-14ec-47f4-a953-c1bdae50b6ff","resolution":{"observed_at":"2026-08-15T17:37:34.343026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.7073","last_updated":"2014-04-30T17:20:57Z","snapshot_observed_at":"2026-08-18T17:09:49.448017Z","submitted_at":"2014-04-28T17:57:48Z","title":"Probably Approximately Correct MDP Learning and Control With Temporal Logic Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.7073","snapshot_observed_at":"2026-08-15T17:37:34.348100Z","title":"Probably approximately correct MDP learning and control with temporal logic constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.348100Z"},"links":{"cited_paper":"/paper/1404.7073","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:b835a1b8c8049919c0a4ec8db660969bb13c1a2fba012d0178b9f964b18368f7","observation_id":"dca5cba7-30dd-4c3a-b991-858643da6feb","resolution":{"observed_at":"2026-08-15T17:37:34.348100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:37:34.619989Z","title":"Formal controller syn- thesis for continuous-space MDPs via model-free reinforcement learning","venue":null,"work_id":"10d34cc6-f7cc-47f4-8a91-fc8c92db8254","year":2020},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.374103Z"},"links":{"citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:19247219494d73bf268a45477351e7b7baceb453682f9f8a555b8295d5010edd","observation_id":"ea60b857-45d7-41bb-88d7-c9c7427b33cd","resolution":{"observed_at":"2026-08-15T17:37:34.624934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00237","last_updated":"2023-02-01T04:33:06Z","snapshot_observed_at":"2026-08-16T15:58:37.219527Z","submitted_at":"2023-02-01T04:33:06Z","title":"Bridging Physics-Informed Neural Networks with Reinforcement Learning: Hamilton-Jacobi-Bellman Proximal Policy Optimization (HJBPPO)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00237","snapshot_observed_at":"2026-08-15T17:37:34.383833Z","title":"Bridging physics-informed neural networks with reinforcement learning: Hamilton- Jacobi-Bellman Proximal Policy Optimization (HJBPPO)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.383833Z"},"links":{"cited_paper":"/paper/2302.00237","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:576281a008550b5d17fa69dab2ee056e2bd0e448e910662bd65dacaa9ba9ae2c","observation_id":"925c596c-fe02-4af5-947a-88720bda8870","resolution":{"observed_at":"2026-08-15T17:37:34.383833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:37:34.604333Z","title":"Active finite reward automaton inference and reinforcement learning using queries and counterexamples","venue":null,"work_id":"77b9e0a6-5aa0-4925-baa9-630a16142514","year":2021},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.393318Z"},"links":{"citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:31992171a3c5e1380bb3a749630ecca76c21d92d62b3ce731c3e730152210e1e","observation_id":"c98ab608-bc42-47f5-88f1-0aca93ff3346","resolution":{"observed_at":"2026-08-15T17:37:34.609457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:37:34.358033Z","title":"Reinforcement learning for temporal logic control synthesis with probabilistic satisfaction guarantees","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.358033Z"},"links":{"citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:7ebb25ee72ea6a9f551716626c8aafe8d7bb7d4176f44f9c3b862c8a568d451c","observation_id":"b7f0c960-62a6-4061-9503-e85ec4073ba0","resolution":{"observed_at":"2026-08-15T17:37:34.358033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01909","last_updated":"2023-09-05T02:45:18Z","snapshot_observed_at":"2026-08-16T15:03:20.710987Z","submitted_at":"2023-09-05T02:45:18Z","title":"A Survey on Physics Informed Reinforcement Learning: Review and Open Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01909","snapshot_observed_at":"2026-08-15T17:37:34.327506Z","title":"A survey on physics informed reinforcement learning: Review and open problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.327506Z"},"links":{"cited_paper":"/paper/2309.01909","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:ae82112841fd7f01005dd5b4befe6856eb21d6829318f80e210400362fc1ccc4","observation_id":"a0c990af-c85c-495b-b88c-814d09cd46a0","resolution":{"observed_at":"2026-08-15T17:37:34.327506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10381","last_updated":"2024-08-19T19:51:53Z","snapshot_observed_at":"2026-08-16T13:25:24.032696Z","submitted_at":"2024-08-19T19:51:53Z","title":"Efficient Reinforcement Learning in Probabilistic Reward Machines","version":1},"cited_work":{"arxiv_id":"2408.10381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10381","snapshot_observed_at":"2026-08-15T17:37:34.460870Z","title":"Efficient Reinforcement Learning in Probabilistic Reward Machines","venue":"stat.ML","work_id":"0a64f0bf-0cb4-4f91-bf09-a5fa15100204","year":2024},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.379130Z"},"links":{"cited_paper":"/paper/2408.10381","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:c6d9fc214881ca4c709b9ab00dc72a7528b07cdd2e72bd12466244e897eabad3","observation_id":"a8710dab-ae79-46a8-9368-693876445fb5","resolution":{"observed_at":"2026-08-15T17:37:34.468216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-15T17:37:34.368652Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.368652Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:b70da237793cc99b4ef15d42b6fb1897bbc61a184621433b1f5ae4ade513a806","observation_id":"6b973915-72d7-4e0c-8f14-415d818fd143","resolution":{"observed_at":"2026-08-15T17:37:34.368652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11830","last_updated":"2022-11-21T19:52:06Z","snapshot_observed_at":"2026-08-16T16:14:24.135306Z","submitted_at":"2022-11-21T19:52:06Z","title":"PhysQ: A Physics Informed Reinforcement Learning Framework for Building Control","version":1},"cited_work":{"arxiv_id":"2211.11830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.11830","snapshot_observed_at":"2026-08-15T17:37:34.500557Z","title":"PhysQ: A Physics Informed Reinforcement Learning Framework for Building Control","venue":"eess.SY","work_id":"a28e3999-119b-4c66-b5f7-113e1800c99b","year":2022},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.353011Z"},"links":{"cited_paper":"/paper/2211.11830","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:b04343151a6fc44fb8ffbe9db02f2d120795808ff43ff32b2afdd44678f84644","observation_id":"6e4eebab-56aa-44ed-a669-76e5a2cc58a2","resolution":{"observed_at":"2026-08-15T17:37:34.505892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09293","last_updated":"2020-01-25T10:51:42Z","snapshot_observed_at":"2026-08-14T03:29:55.911744Z","submitted_at":"2020-01-25T10:51:42Z","title":"Learning Non-Markovian Reward Models in MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09293","snapshot_observed_at":"2026-08-15T17:37:34.388699Z","title":"Learning non-Markovian reward models in MDPs","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.388699Z"},"links":{"cited_paper":"/paper/2001.09293","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:76656279f71879954ad2b0d96a8a6e7ea8398a35ec10b9d4c46f14de0dbfcbaa","observation_id":"6148e142-cc46-4273-b43c-dc9cb513a1cc","resolution":{"observed_at":"2026-08-15T17:37:34.388699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.02785","last_updated":"2018-05-17T15:55:27Z","snapshot_observed_at":"2026-08-16T07:34:02.505879Z","submitted_at":"2018-05-08T00:12:43Z","title":"Fast Online Exact Solutions for Deterministic MDPs with Sparse Rewards","version":3},"cited_work":{"arxiv_id":"1805.02785","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.02785","snapshot_observed_at":"2026-08-15T17:37:34.554087Z","title":"Fast Online Exact Solutions for Deterministic MDPs with Sparse Rewards","venue":"cs.LG","work_id":"bbffe15c-dbae-45cf-8212-d1383c97bc99","year":2018},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.337626Z"},"links":{"cited_paper":"/paper/1805.02785","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:daddbf15893b6aaae98905d86b749302f9df1529fdb357bad0003b958c5b4070","observation_id":"311df833-1bcb-496f-9ba4-5dba6fbfd00b","resolution":{"observed_at":"2026-08-15T17:37:34.559440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:37:34.634864Z","title":"Physics informed intrinsic rewards in reinforcement learning","venue":null,"work_id":"8dfa0624-a45f-47c6-867e-76ca5863286f","year":2022},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.363563Z"},"links":{"citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:20d27b6ec75b03808d5ac1c2a0f20d6a808775523e37ac32b8f736b96908d119","observation_id":"1c09ba70-160b-46ba-b061-a852b014e6ca","resolution":{"observed_at":"2026-08-15T17:37:34.639791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08497","last_updated":"2025-02-21T23:41:03Z","snapshot_observed_at":"2026-08-20T11:57:24.363003Z","submitted_at":"2024-08-16T02:42:17Z","title":"Data-driven Construction of Finite Abstractions for Interconnected Systems: A Compositional Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08497","snapshot_observed_at":"2026-08-15T17:37:34.317082Z","title":"Data-driven construction of finite abstractions for interconnected systems: A compositional approach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.317082Z"},"links":{"cited_paper":"/paper/2408.08497","citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:94789b648196d82b61c1c4946ebaddd067ea4e5cb7cd8e90b989102c0fe35b2c","observation_id":"f5548230-3b2e-495c-8ac5-77e8259fd1c8","resolution":{"observed_at":"2026-08-15T17:37:34.317082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:37:34.658709Z","title":"Control synthesis from linear temporal logic specifications using model-free reinforcement learning","venue":null,"work_id":"2f52e890-e342-4e48-b40a-f9f2cf3c3f60","year":2020},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.333000Z"},"links":{"citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:7973305fb9d75990160324d254eca0066e59ee135cba49ced3e74c9144fc1d7d","observation_id":"f435f4dc-4ff8-43c4-9c0b-60e13b11b16c","resolution":{"observed_at":"2026-08-15T17:37:34.663923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:37:34.674325Z","title":"Verification of Markov decision processes using learning algorithms","venue":null,"work_id":"61125ed1-a680-4798-9d47-b1bd7af8076f","year":2014},"citing_paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:37:34.322588Z"},"links":{"citing_paper":"/paper/2508.14093"},"observation_digest":"sha256:15965dc386cccd60e0cdbb9c3a16eff56a30c6e1c03e1b220eb11d922014544d","observation_id":"ae0d34d5-82ce-44ed-bef3-b80459e3e912","resolution":{"observed_at":"2026-08-15T17:37:34.679160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.14093","last_updated":"2025-08-14T18:46:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T17:26:58.154476Z","submitted_at":"2025-08-14T18:46:54Z","title":"Physics-Informed Reward Machines"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2508.14093."}