{"as_of":"2026-08-08T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:66e223c04c916ffabfaa55d2fc7d8e1dba7fd98d76894c972ed3d1a3cd09f802","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:22:05.850923Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.27329/citation-record","integrity":"/paper/2510.27329/integrity","json":"/paper/2510.27329/citation-record.json","paper":"/paper/2510.27329"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.494820Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.494820Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:8a9811ac721e6a1065e938c410e1c6aeafe67c9c31232985918c0d5c6034c37e","observation_id":"60ee38ad-b93b-4efd-8f98-9f12364ac080","resolution":{"observed_at":"2026-08-04T07:22:01.494820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.586456Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.586456Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:0b3a1559569c37cb467710446d03303bee19624b8f4afbaf47233f3a6136c71b","observation_id":"30bda6a6-0968-4f15-8700-8ad14a231a66","resolution":{"observed_at":"2026-08-04T07:22:01.586456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.703857Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.703857Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:40039ba43f1f8ed917fd0b281bd18f33225b157bac869bae1d2b94bdb17af52e","observation_id":"f31762de-a072-4e3b-b41b-3d34d19637e7","resolution":{"observed_at":"2026-08-04T07:22:01.703857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:01.849683Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:01.849683Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:162d04d815af5eea91dd96755f904a5bcc32b5db3e182e0b668932c51df325a0","observation_id":"aadc17ee-3eb9-4797-96b6-2d16f121f947","resolution":{"observed_at":"2026-08-04T07:22:01.849683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.084791Z","title":"T.; Klassen, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.084791Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:fb4a3bc3b7b5da43515941940f6fb510b8daf9274232898c8ce4e2fc87eae37e","observation_id":"aef4d452-0092-4735-bcf7-9098b23185e2","resolution":{"observed_at":"2026-08-04T07:22:02.084791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.205642Z","title":"C.; Di Nunzio, L.; Fazzolari, R.; Giardino, D.; Re, M.; and Span \\`o , S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.205642Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:f49c2242f2d47823f2e77d1b958f10b9f1f469327bc4158e4013cd67099f789c","observation_id":"8121e214-7a63-4f95-8f5d-b2dc1bddcee6","resolution":{"observed_at":"2026-08-04T07:22:02.205642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.415694Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.415694Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:2a7db6831163fee2fc03bf8757c24de9a4850b83a85c73cd50f72364cbd15f81","observation_id":"67150340-0d77-4d8d-87a6-f3759208b471","resolution":{"observed_at":"2026-08-04T07:22:02.415694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.495764Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.495764Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:5cf983263d1fb4e58fa68758ff1d7fb545ea1204d67bbf998cba50f02bc0d5a6","observation_id":"8f39e8e8-14ef-4155-9bad-0c927ae9bbef","resolution":{"observed_at":"2026-08-04T07:22:02.495764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.660494Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.660494Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:8ac998aa3b2ee145d298d16ec405885ad8cf421624ab6161fca7c32850afd0d4","observation_id":"aa8173e9-45f2-43ba-92cc-575d2b078851","resolution":{"observed_at":"2026-08-04T07:22:02.660494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.818652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.818652Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:4f5c3cd32d5ae56d72966ad34d4f8b32fb59c9c8b0dc218cd742731daf68a3a1","observation_id":"ee9f5f3c-eb77-44be-9239-1f44cd14990a","resolution":{"observed_at":"2026-08-04T07:22:02.818652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:02.916971Z","title":"T.; Klassen, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:02.916971Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:460c1eaa2a67c36b3c17375ea3604bb16bce6f6e110df4c966c7fb7e9c91ddc2","observation_id":"fc0c8680-36dd-4408-b954-6eef134a1d82","resolution":{"observed_at":"2026-08-04T07:22:02.916971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.044745Z","title":"T.; and McIlraith, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.044745Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:039ded7900ca65b01364b7157d23efbcc8584bbb46f138ccaecc82411bbe6659","observation_id":"b6a00321-4b07-469f-ad4d-d5a62f03555c","resolution":{"observed_at":"2026-08-04T07:22:03.044745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.193495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.193495Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:15fb7b08f6a451c4cab3b83ef78061c53e9bc2fd7b398094c1ca6a5135fe33e5","observation_id":"fc329aa7-9d90-40ef-b5ce-ddb038df35f0","resolution":{"observed_at":"2026-08-04T07:22:03.193495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.345637Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.345637Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:f888eeb10a11f84eb3e3c08e8bc09d18eebfedf55c6299ae6e17ea14e2837d72","observation_id":"083b3ea7-e1c8-4d7d-aae4-d34ee71ce940","resolution":{"observed_at":"2026-08-04T07:22:03.345637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.512091Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.512091Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:c25a49b7fcba31d933f0ebc24b6215a1cab4298ff027e9a49dccee328809bf84","observation_id":"84981524-30f8-4d08-9227-ec83e1aa7956","resolution":{"observed_at":"2026-08-04T07:22:03.512091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.617089Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.617089Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:1ee1d97499a4f98c3e3c55986087b17197d5fce11eea0ba685a92bd715bc8b5f","observation_id":"b64f9050-e377-4f55-bedd-d05e37f11c32","resolution":{"observed_at":"2026-08-04T07:22:03.617089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.688661Z","title":"u ller, M.; Sch \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.688661Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:61ea88a51203dfce4f330ed60adeead967458ec712cdaba862ab529e54883410","observation_id":"92dd31f8-f461-4f07-a689-c3250bebce7d","resolution":{"observed_at":"2026-08-04T07:22:03.688661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:03.757028Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.757028Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:25cb385d8052c8fa1af17120ef3d7725b5241031205b989aeeba557061f65961","observation_id":"a47a56e2-2645-4730-b5e7-c336bbeb6242","resolution":{"observed_at":"2026-08-04T07:22:03.757028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-04T07:22:03.852431Z","title":"P.; Hunt, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:03.852431Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:7e5f827a0986e7814013583488bb7a38143ec599f86f292861127ff92c45c952","observation_id":"d58323c4-33dc-4f76-b6ab-18a439dda81c","resolution":{"observed_at":"2026-08-04T07:22:03.852431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00429","last_updated":"2022-07-01T13:48:29Z","snapshot_observed_at":"2026-07-06T13:26:52.235619Z","submitted_at":"2022-07-01T13:48:29Z","title":"Modular Lifelong Reinforcement Learning via Neural Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00429","snapshot_observed_at":"2026-08-04T07:22:04.013797Z","title":"A.; van Seijen, H.; and Eaton, E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.013797Z"},"links":{"cited_paper":"/paper/2207.00429","citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:fde4c438569c0467ac7f7846f54a8fe817413af094d2a26dd8e6012dada81a6e","observation_id":"3bf465c4-6af0-4a52-8f38-abea83477fb3","resolution":{"observed_at":"2026-08-04T07:22:04.013797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.220326Z","title":"A.; Veness, J.; Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.220326Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:4f57f8810b7ad26552d556be48a32a3708b9845d5a15d48a867dfeb59963272b","observation_id":"75f463ab-039e-419b-9ae6-1fc17d476b98","resolution":{"observed_at":"2026-08-04T07:22:04.220326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.368793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.368793Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:0b5e1883eeb501fd2fac8e3189050a5a12bf16b247560867c953a8f72f07e4e0","observation_id":"d62438cc-deb9-4392-9457-6de9dd91da95","resolution":{"observed_at":"2026-08-04T07:22:04.368793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.512375Z","title":"Y.; Harada, D.; and Russell, S","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.512375Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:2104f111f4900edc13c8a94d4e3c709ba9777b5074be78fef1ce18f8a8a3cddd","observation_id":"088352b7-6e21-4fac-bd70-e1b01fc23d4c","resolution":{"observed_at":"2026-08-04T07:22:04.512375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.654376Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.654376Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:5cca3b3caacc9f666d08e5650d0038c3e8b4aa7551764f7942e79f7a6f4502df","observation_id":"0ca057a4-3a4d-40ce-b829-8733ff2092aa","resolution":{"observed_at":"2026-08-04T07:22:04.654376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:04.859930Z","title":"N.; Wright, R.; Velasquez, A.; and Sinapov, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:04.859930Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:aa188005a65b8d13ce0a0ee5758b1fa78fc51a15e7fcba23f1267b4b8a3a3d2f","observation_id":"b9a5b734-d376-496d-856e-0e7f65fa0f4a","resolution":{"observed_at":"2026-08-04T07:22:04.859930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.019402Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.019402Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:bd64db752b70ee2754279aef9043d280ba48d2ecbba212a46ff9076ec4ae986f","observation_id":"1c8d9118-9459-46d6-ac0f-2f204ff6216a","resolution":{"observed_at":"2026-08-04T07:22:05.019402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.203791Z","title":"B.; Talbert, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.203791Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:34b09f3881575d61f6196fc8ab00d688ef75d55f5cea8e03719c55b9174aa5c9","observation_id":"4bfa9be9-6269-4a47-b9d2-1010079e5e65","resolution":{"observed_at":"2026-08-04T07:22:05.203791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.367931Z","title":"S.; and Barto, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.367931Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:5ec2a40ea350f08e50c18239a1304e4c9aeab41f9d45b3075dd9f7e90ec9a22d","observation_id":"7f36fb87-e2bb-49c3-933b-744a217b44ae","resolution":{"observed_at":"2026-08-04T07:22:05.367931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.518457Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.518457Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:a10ba306627f5658dbb3d74c0fe5475e7a9c9a1f55ff19d701b72b74053582af","observation_id":"2a49a3c4-083a-4f66-a534-5d853fbb78c2","resolution":{"observed_at":"2026-08-04T07:22:05.518457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.695724Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.695724Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:c3535cb9ad7943e142abf10520beb92d58630d05d05dbdb33fc44bf101ad9683","observation_id":"08e497c5-5e88-40c2-af1a-71c957a70d89","resolution":{"observed_at":"2026-08-04T07:22:05.695724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T07:22:05.850923Z","title":"J.; and Dayan, P","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:05.850923Z"},"links":{"citing_paper":"/paper/2510.27329"},"observation_digest":"sha256:294ea2d164364f9e2c2664fbeee1455f670c59c3c2a0fb7a59fdb297bcf725d6","observation_id":"d414bbdf-1bf4-4d45-86d6-aaa5d4020e3f","resolution":{"observed_at":"2026-08-04T07:22:05.850923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.27329","last_updated":"2026-06-21T10:37:57Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:32:44.013499Z","submitted_at":"2025-10-31T10:00:57Z","title":"Reinforcement Learning for Long-Horizon Unordered Tasks: From Boolean to Coupled Reward Machines"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2510.27329."}