{"as_of":"2026-08-15T16:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24190fcf40457651e7cf278ca8334d54d7b95ff9bd52ca2cbef5c2f6b5ea34d6","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:20:04.901141Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.18848/citation-record","integrity":"/paper/2501.18848/integrity","json":"/paper/2501.18848/citation-record.json","paper":"/paper/2501.18848"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.804315Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.804315Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:53d966bbea8223785f5bbc2c43afbec7708c319570c257c5e5d75c6c8ee85ce4","observation_id":"dab0460f-32a5-4dda-a7f1-8c7bc5d6e6b1","resolution":{"observed_at":"2026-08-09T22:20:04.804315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.184071Z","title":"Brachman and H","venue":null,"work_id":"85bfb7a0-a71a-4b12-b44c-6d8929046cd1","year":2004},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.811786Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:859f3bf6bfd1eeab68469aed0cc1ea10c1e5d79781b98c5486beba1e395c97f6","observation_id":"14c4420c-ebbb-4d2d-9281-222bd12bfa79","resolution":{"observed_at":"2026-08-09T22:20:05.187117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.175537Z","title":"SDRL: interpretable and data-efficient deep reinforcement learning leveraging symbolic planning,","venue":null,"work_id":"75cf4101-62f2-44ee-8e6e-48990c4a1c42","year":2019},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.815040Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:d82f8c76c7851893a8f23400e6c9b0669f658f97204c5fa692bb05b7ec544f9c","observation_id":"b9eec02a-95ea-43e9-8beb-4c2f51ddfbaa","resolution":{"observed_at":"2026-08-09T22:20:05.178778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.160228Z","title":"Symbolic plans as high-level instructions for reinforcement learning,","venue":null,"work_id":"9982d2a1-52de-4e17-aff1-b8443169d3c2","year":2020},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.818444Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:99986f280fe52d76980610ef90ed2d7da6e476fdba6cf9c3cb541345445d3839","observation_id":"5663ffd4-274e-4257-b260-3c6b75924eea","resolution":{"observed_at":"2026-08-09T22:20:05.163545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.151097Z","title":"Creativity of ai: Automatic symbolic option discovery for facilitating deep reinforcement learning,","venue":null,"work_id":"0ff2a744-16d1-4e06-ab96-e85911cd8405","year":2022},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.821753Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:efe04ff18dd51a6374fea35bdcc64fd6005212a241305b5a7f1b7971c741817d","observation_id":"3c2d4ba6-4ab3-44f0-a69d-8a2746246a33","resolution":{"observed_at":"2026-08-09T22:20:05.154658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.142184Z","title":"A survey on interpretable reinforcement learning,","venue":null,"work_id":"a50e8da1-2be9-478c-b97b-aaf50d583c81","year":2024},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.825307Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:fc8ede63f4062c206b3873dd4d3cab943189e5637a4d2f13a879d61bd9c79a55","observation_id":"4b3ce914-0173-4cb9-bab0-9efeda2b1380","resolution":{"observed_at":"2026-08-09T22:20:05.145459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.133223Z","title":"PDDL-the planning domain definition language,","venue":null,"work_id":"e1867b56-8ef5-4c1c-9c44-d49e11d18131","year":1998},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.828795Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:4251af4d5ce90f01cf720b0529aff95241ea43362ad9fd4e5f98c6a0159183c4","observation_id":"69741356-fb86-4f7f-9c02-15387fa8bb38","resolution":{"observed_at":"2026-08-09T22:20:05.136651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.124861Z","title":"The temporal logic of programs,","venue":null,"work_id":"0b5b142b-cdaa-4062-af18-b0d949b837df","year":1977},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.831679Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:644b787cebda2e45e83111b76949b2ec36ad10689be1eaa3823068db2fbda355","observation_id":"eb99c8a1-735b-417e-879e-971c24a1d126","resolution":{"observed_at":"2026-08-09T22:20:05.127823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.115915Z","title":"Teaching multiple tasks to an RL agent using LTL,","venue":null,"work_id":"fc4da85a-6a96-4a63-ad26-6d62a892fa3e","year":2018},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.835085Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:01fe0b0e30511ce5a4f436f2e860422d7463bf3c73e9520fd5960defba0a1b83","observation_id":"0fa259e7-0277-45e8-b95a-4c9011229480","resolution":{"observed_at":"2026-08-09T22:20:05.119309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.106083Z","title":"Using reward machines for high-level task specification and decomposition in reinforcement learning,","venue":null,"work_id":"957ce906-3bfc-4abb-8ee8-a3bca155ddec","year":2018},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.838076Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:70171fe974f2d8f1eaf88da161463461fff9f6e56864b74be2227c562bc0f6fe","observation_id":"aa02727c-571c-458b-bb58-be9a635169a7","resolution":{"observed_at":"2026-08-09T22:20:05.109270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.097020Z","title":"LTL and Beyond: Formal languages for reward function specification in reinforcement learning","venue":null,"work_id":"bdacb528-7c35-415d-8b7d-e3e0e26394c9","year":2019},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.841072Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:ab5b83617a0a64b6aae8974d0957f955e25de72d6a66ad8f22612d5c48810d9a","observation_id":"d9ae4d23-fc77-4d4d-abf8-a622162be668","resolution":{"observed_at":"2026-08-09T22:20:05.100247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.088131Z","title":"LTL2Action: Generalizing LTL instructions for Multi-Task RL,","venue":null,"work_id":"57c7e252-42ff-49f1-8e76-9f5a9c1a758a","year":2021},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.844377Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:d1e11992606df5cf3702d9fd443719cc326a0baba033238a445b961547b001c5","observation_id":"6f3d96e1-6c58-47e3-8116-61eb21b5fc59","resolution":{"observed_at":"2026-08-09T22:20:05.091359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.079432Z","title":"Reinforcement learn- ing of action and query policies with LTL instructions under uncertain event detector,","venue":null,"work_id":"4868c28c-ff26-43d3-b9b6-6d1beb369c41","year":2023},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.847503Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:25099fe304ea069e80ac39eee7c6ee4623ec31ffe4fc4fb4ac8223a841c08023","observation_id":"d882dbd8-d7da-4a10-8bf2-54b082ee18dd","resolution":{"observed_at":"2026-08-09T22:20:05.082681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.069262Z","title":"A composable specification language for reinforcement learning tasks,","venue":null,"work_id":"440b1074-b355-4384-b473-567ed70e5bd5","year":2019},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.850362Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:f510ee94c794185741bfb3d1b9960cf694dc4e6b00d5dcc65d61409a09f27a37","observation_id":"4fda7d4e-4ac6-4292-9cdb-cc3dea326dbf","resolution":{"observed_at":"2026-08-09T22:20:05.072798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.059770Z","title":"Context-aware temporal logic for probabilistic systems,","venue":null,"work_id":"c857d46e-8ed8-4ab0-b6df-d1fcb4bf170d","year":2020},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.853333Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:adba4bd2620dd3ff5d2ce2203f8fd7eb93eb9e081ecb5c5165c06206838b05e1","observation_id":"1d2c4ee2-8947-4085-9429-9bdb589e8f48","resolution":{"observed_at":"2026-08-09T22:20:05.063078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.050397Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":"3fccce05-d522-4338-afed-68708ad004b6","year":2020},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.856373Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:60209058a0c0fabbcf246da9a4ea83a49ce3ff0a7b0c0d4a60909dcd9330dd49","observation_id":"70844f87-6416-4ad5-b884-3c65ebbed6b3","resolution":{"observed_at":"2026-08-09T22:20:05.053799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.041045Z","title":"Multi-task reinforcement learning with soft modularization,","venue":null,"work_id":"a0059af1-6ee2-4589-9665-a1b2ce0e58fd","year":2020},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.860067Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:b4900abeb8a8f69822c7fbe725a637615342871766d7299ec96517d028a6d3bd","observation_id":"84fe28b2-77e6-4781-8610-b178a51f425e","resolution":{"observed_at":"2026-08-09T22:20:05.044673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.032089Z","title":"Multi-task reinforcement learn- ing with context-based representations,","venue":null,"work_id":"b5478f5d-d397-42b0-861c-f24c659c6bfb","year":2021},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.862928Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:34ecb75f9ec71c6c377f50bc9ce1ac719e140764368c9264372b5ce2065a6788","observation_id":"fdbfaffa-bc61-4bed-ae95-568dc7e412d9","resolution":{"observed_at":"2026-08-09T22:20:05.035339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.022640Z","title":"Perceiver-actor: A multi- task transformer for robotic manipulation,","venue":null,"work_id":"17f22005-a261-488d-af52-4357b51ac14b","year":2023},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.865890Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:d53837916cd09eb1154de6c0f02815490c592cb60e1ab9002fb7f0374f809eb0","observation_id":"300beee1-907d-4a55-ba42-994337d64086","resolution":{"observed_at":"2026-08-09T22:20:05.025911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.869217Z","title":"Baier and J.-P","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.869217Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:e651c96c60c7fe74268479f0fd77d12a0f16eaaf0b8da9a65e5ddb001670928f","observation_id":"6883746d-5fe6-4acb-b1e7-64d8571d98b5","resolution":{"observed_at":"2026-08-09T22:20:04.869217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:05.007591Z","title":"Model checking of safety properties,","venue":null,"work_id":"2b1266eb-ce66-4a13-a681-a0dd26e76edf","year":2001},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.872310Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:64d9f3fe64c46b957dd1412617c80870a52d6c4b4b08d2b59ab8ef581da07663","observation_id":"afbe5d86-f379-408d-945a-6aa33951174e","resolution":{"observed_at":"2026-08-09T22:20:05.011532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.998408Z","title":"Optimal policy generation for partially satisfiable co-safe LTL specifications,","venue":null,"work_id":"545fc248-7629-4375-9cd3-59704b052885","year":2015},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.875360Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:5014db1740be491ba96a41d85b04ddfa5ed8d0d63d63caee0695fbba457c5930","observation_id":"df999ba8-c686-4928-983f-4cb7237a9b64","resolution":{"observed_at":"2026-08-09T22:20:05.001726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.988110Z","title":"Using temporal logics to express search control knowledge for planning,","venue":null,"work_id":"f1f71571-7072-4fc5-b9cf-352968f57daa","year":2000},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.878455Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:45ba0a3c838fd5243647feda9d688de086978481e1164684cde4e6713d2f1971","observation_id":"6f27ca28-1f9b-485f-ab0b-e920d52b3bb1","resolution":{"observed_at":"2026-08-09T22:20:04.991581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.978140Z","title":"Provably efficient RL with rich observations via latent state decoding,","venue":null,"work_id":"0573bf65-9f1c-4a02-b1bf-6e9a4de3c499","year":2019},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.881159Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:52bca675e3586a144660e74a373cf1b74ab58e28424c93d26ce2ce9c4f58d1c1","observation_id":"d613d888-7f5d-459f-8d51-83743210837f","resolution":{"observed_at":"2026-08-09T22:20:04.982204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.884048Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.884048Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:aebb6e7ff599f8108b4e8063cb859e84fa18909bbb37f2f3e9617cec125383f7","observation_id":"291c9de8-ff4a-463d-b0a6-36c4d9b94e97","resolution":{"observed_at":"2026-08-09T22:20:04.884048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:20:04.963576Z","title":"A survey on curriculum learning,","venue":null,"work_id":"fffec170-c5b2-4206-be3e-24e6751c8dea","year":2022},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.887197Z"},"links":{"citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:be411d0e4aa26feceae07d7f6f56235c0477b93732b9227722a183fe4cddef41","observation_id":"ce031c10-1d67-46eb-81af-bffd82e76de9","resolution":{"observed_at":"2026-08-09T22:20:04.966722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T22:20:04.890155Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.890155Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:363838970147ec6f94564443e2ff253760bedb37878aaa4df8ad37f7e1118205","observation_id":"1c98549b-888f-40b8-afcc-01aad1e4e3f6","resolution":{"observed_at":"2026-08-09T22:20:04.890155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13831","last_updated":"2023-06-24T01:16:07Z","snapshot_observed_at":"2026-08-15T10:16:02.189582Z","submitted_at":"2023-06-24T01:16:07Z","title":"Minigrid & Miniworld: Modular & Customizable Reinforcement Learning Environments for Goal-Oriented Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13831","snapshot_observed_at":"2026-08-09T22:20:04.893504Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.893504Z"},"links":{"cited_paper":"/paper/2306.13831","citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:0cf5f940d770de26e27624fe3b65224d3d8fa436db5e164e8bd1bc757a30c03c","observation_id":"b0c901bf-0618-4309-8938-32634bdd20f6","resolution":{"observed_at":"2026-08-09T22:20:04.893504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-09T22:20:04.896956Z","title":"Isaac gym: High performance gpu-based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.896956Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:8333a72a755db3b7e8d9646c782051fd15aa3aa35659a68c7dceb3df46554055","observation_id":"36a1f04e-283d-40c1-8c2a-3ba8835468a5","resolution":{"observed_at":"2026-08-09T22:20:04.896956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.15799","last_updated":"2021-10-23T21:34:09Z","snapshot_observed_at":"2026-08-15T15:16:12.286614Z","submitted_at":"2021-10-23T21:34:09Z","title":"Guided Policy Search for Parameterized Skills using Adverbs","version":1},"cited_work":{"arxiv_id":"2110.15799","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.15799","snapshot_observed_at":"2026-08-09T22:20:04.926288Z","title":"Guided Policy Search for Parameterized Skills using Adverbs","venue":"cs.AI","work_id":"9335bd43-d8f8-4a4f-861f-7e5356d8cee8","year":2021},"citing_paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T22:20:04.901141Z"},"links":{"cited_paper":"/paper/2110.15799","citing_paper":"/paper/2501.18848"},"observation_digest":"sha256:de68f312030cfc8b33756b813e6c4da27bf8e689eb664bc52b7fcdf084fa7aff","observation_id":"b72f5c24-6d8e-4d1b-b76e-5a8f737ee845","resolution":{"observed_at":"2026-08-09T22:20:04.932332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18848","last_updated":"2025-01-31T02:02:40Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-15T13:55:40.959732Z","submitted_at":"2025-01-31T02:02:40Z","title":"Reinforcement Learning of Flexible Policies for Symbolic Instructions with Adjustable Mapping Specifications"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2501.18848."}