{"as_of":"2026-08-10T07:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d15338e0dcb03f392d57e7ff108aadb264b494942c66a614af3efd628c3ee0f","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:22:57.334192Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06491/citation-record","integrity":"/paper/2502.06491/integrity","json":"/paper/2502.06491/citation-record.json","paper":"/paper/2502.06491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.739142Z","title":null,"venue":null,"work_id":"b51c6c1c-316d-43ae-90cb-1c2bf7504c06","year":2018},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.203760Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:e330b7e603ceca12df68f698c678772c95da2fbe0968b8e41b8c10289ee39e1f","observation_id":"026cb979-7686-4b92-8880-2ee95fe78810","resolution":{"observed_at":"2026-08-08T15:22:57.743081Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.702173Z","title":"De- cision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"6b20ecf6-9ef2-4e5b-a29c-55b447a129ff","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.216414Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:0ca70230d35ebe723995e6f9d68fe28c4c2714582ad824f3595701637a382610","observation_id":"55d23ecb-21c4-4d8d-989e-ef35a4696425","resolution":{"observed_at":"2026-08-08T15:22:57.705723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11097","last_updated":"2022-06-28T09:54:03Z","snapshot_observed_at":"2026-07-06T12:10:46.147640Z","submitted_at":"2021-11-22T10:37:52Z","title":"UMBRELLA: Uncertainty-Aware Model-Based Offline Reinforcement Learning Leveraging Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11097","snapshot_observed_at":"2026-08-08T15:22:57.223190Z","title":"UMBRELLA: uncertainty-aware model-based offline re- inforcement learning leveraging planning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.223190Z"},"links":{"cited_paper":"/paper/2111.11097","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:f6bbb70222f1a1315c74979de1fc2aa84fe1d7490f1a29bb939264185aea2649","observation_id":"4269d9f1-b62e-46d1-bdca-f7fb7b3a5dd8","resolution":{"observed_at":"2026-08-08T15:22:57.223190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-08T15:22:57.226625Z","title":"D4RL: datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.226625Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:f8e8d63146b7506bdbf2d39029603471bffca211ed00857caabaf5f3927e2eb9","observation_id":"70be4e63-6abf-45d9-ab32-ecd9e84a69c1","resolution":{"observed_at":"2026-08-08T15:22:57.226625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.667285Z","title":"Bridging the data gap between training and inference for unsupervised neural machine translation","venue":null,"work_id":"efe39693-7644-4c79-b703-ced28054c3d3","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.235914Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:124eb7e8d23fa48069e0fa0973d399647b002375044816f6256bc5196be3e270","observation_id":"29e74946-14b7-4ce1-95f6-9cd394fd2d09","resolution":{"observed_at":"2026-08-08T15:22:57.670597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.642128Z","title":"Offline reinforcement learning as one big se- quence modeling problem","venue":null,"work_id":"32c01905-4eb6-4a21-a184-047bd87df364","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.245241Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:b1e0070859c6f55f99b3ec2a5df8509d6cc0139594ef1b7abc06e19a651fd870","observation_id":"18f60e09-4984-470e-b489-ca6c1d27ce53","resolution":{"observed_at":"2026-08-08T15:22:57.645403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.05858","last_updated":"2019-09-20T20:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-11T17:57:18Z","title":"CTRL: A Conditional Transformer Language Model for Controllable Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.05858","snapshot_observed_at":"2026-08-08T15:22:57.248534Z","title":"Varshney, Caiming Xiong, and Richard Socher","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.248534Z"},"links":{"cited_paper":"/paper/1909.05858","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:a6a5fed44d8d303f6b0f1ab518252a690fa035973f07787aaf9f70f11780b355","observation_id":"6280b86b-f4ff-4442-9386-8508074da6a1","resolution":{"observed_at":"2026-08-08T15:22:57.248534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.633420Z","title":"Morel: Model-based offline reinforcement learning","venue":null,"work_id":"a1ec1000-8f81-4bd9-be94-41b8241f523c","year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.252753Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:5b7b49a56e6f9334571aac2e7a6e146fe79edb6e99ca97d90019f8eb9e1f278e","observation_id":"7f3a3ed9-5e91-4949-9333-ac83f829dc08","resolution":{"observed_at":"2026-08-08T15:22:57.636829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.624746Z","title":"Offline reinforcement learning with im- plicit q-learning","venue":null,"work_id":"574779c9-25b1-4e18-8d5c-861a2233e64f","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.256445Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:65b5802419b84ab049c110601e448516d6d21baad95ff9e620cd9d22a642cc1b","observation_id":"5c4afab4-e449-4a73-9b09-458d5cbbe853","resolution":{"observed_at":"2026-08-08T15:22:57.627969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.616343Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"2551aef2-baa8-4c24-84fb-56c7b350006e","year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.259885Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:da80abe815ea8944e57a8e3882b41dd5f5f08b9fc8af120aeef41620d37ed65d","observation_id":"41586ed2-9973-4f06-a537-f562519308fd","resolution":{"observed_at":"2026-08-08T15:22:57.619426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.607596Z","title":"Multi-game decision transformers","venue":null,"work_id":"59e66619-ad5c-4845-bd18-ca33de6ab55a","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.263329Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:8ddc95dab0fc8a466bcfc6ee6da2584e3bcd721e83d743e5715682075b7519f3","observation_id":"9a951ff5-7ddd-471d-a61b-333113962602","resolution":{"observed_at":"2026-08-08T15:22:57.611076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.598504Z","title":"Distribution- conditioned adversarial variational autoencoder for valid instrumental variable generation","venue":null,"work_id":"db12743e-550e-4302-80d9-f188bcc79c1f","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.266857Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:39a3cc8f1e4b06e2ad5d47d10a01b66f0223fede2bae6a24d4d3a284adef1f86","observation_id":"717ee278-1cab-4ba7-832c-ac210c4d99b9","resolution":{"observed_at":"2026-08-08T15:22:57.601910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.589400Z","title":"Diffstitch: Boosting of- fline reinforcement learning with diffusion-based trajec- tory stitching","venue":null,"work_id":"6e9a686b-7186-42de-9bd6-b077515ddf66","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.270618Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:0e79bc7e0c01b8e74ffd984869040058668313997f84cd726834f95ca06da896","observation_id":"92cd01e8-920c-40c4-be8c-f1d1247e33d2","resolution":{"observed_at":"2026-08-08T15:22:57.592871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.580620Z","title":"Ball, Yee Whye Teh, and Jack Parker-Holder","venue":null,"work_id":"48fa827c-8ede-451d-ba97-5e72f95cfcab","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.273848Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:040a2a60d53947a803322a12fd51b07f75916fe2fe14181bc107996f0134a19d","observation_id":"c7f7a13b-1aec-4776-9d28-dcef19612457","resolution":{"observed_at":"2026-08-08T15:22:57.583625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.572111Z","title":"Luis, Alessandro G","venue":null,"work_id":"f4731067-e0af-4323-83ae-4a6c60cc10fc","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.277371Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:520cfe49cc73da8c5bb92d06f57fd35d12006598440b1f186226b0dee1a6adf4","observation_id":"fe2073c9-2ccb-4673-8f77-654dfba6d71c","resolution":{"observed_at":"2026-08-08T15:22:57.575212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.562372Z","title":"Double check your state before trusting it: Confidence- aware bidirectional offline model-based imagination","venue":null,"work_id":"97fd56b6-81f0-4658-8567-091970caf715","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.280821Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:ce957cc4a9e9290240f667f423551a1bb385622433501866b2e191a0dc63db4d","observation_id":"1950a005-210e-4aeb-96cf-7037685de849","resolution":{"observed_at":"2026-08-08T15:22:57.566186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.552895Z","title":"Reining generalization in offline re- inforcement learning via representation distinction","venue":null,"work_id":"42927bfa-42af-46f2-bc07-a1ac4e028122","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.284177Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:8f9eb91c140b53c55e0fee5e546854c492e0ea3c97872a2943c13d027ee09238","observation_id":"61e7ecd6-f73c-4b00-9986-25798328309e","resolution":{"observed_at":"2026-08-08T15:22:57.556304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12550","last_updated":"2024-06-18T12:27:02Z","snapshot_observed_at":"2026-07-06T18:32:57.295918Z","submitted_at":"2024-06-18T12:27:02Z","title":"Offline Imitation Learning with Model-based Reverse Augmentation","version":1},"cited_work":{"arxiv_id":"2406.12550","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12550","snapshot_observed_at":"2026-08-08T15:22:57.362446Z","title":"Offline Imitation Learning with Model-based Reverse Augmentation","venue":"cs.LG","work_id":"683db442-877b-4d37-9062-36595d53cb1f","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.287578Z"},"links":{"cited_paper":"/paper/2406.12550","citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:3400dea26381bcdc09b6a43ad31fd00455d360feccd51d6e6570c46d661a5835","observation_id":"8c61a2e2-8a3a-498f-9eed-d19572ee22c4","resolution":{"observed_at":"2026-08-08T15:22:57.369429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.544020Z","title":"Model-bellman in- consistency for model-based offline reinforcement learn- ing","venue":null,"work_id":"b378e6bc-a04b-43e2-bdb2-ffd204cabdb3","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.291356Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:2cb49df4b25cc4f318f5c1893750318a19344f015b9eb5a6d5baa37619f495a4","observation_id":"01e72fb7-2537-4b69-8fa2-00159d6e4547","resolution":{"observed_at":"2026-08-08T15:22:57.547316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.535108Z","title":null,"venue":null,"work_id":"d32d96ca-e928-4754-9747-da8d04014a9e","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.294834Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:439d21283cae569d2c6c950da4d36adc443dea0ea63ece5301b127b3804d4561","observation_id":"c2d81fe2-a9c1-4f6d-8151-5914df624f47","resolution":{"observed_at":"2026-08-08T15:22:57.538430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.526017Z","title":"Self-correcting models for model-based reinforcement learning","venue":null,"work_id":"c827e6cc-fc1d-4514-aac9-79715743d9d6","year":2017},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.298237Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:54980ba33a468f562dca4855459f6247ca80dc4fcdc41b1bcc3b1dd7e9e5285c","observation_id":"15d7fb2a-a021-40a5-b218-a061e4b2056b","resolution":{"observed_at":"2026-08-08T15:22:57.529437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.304653Z","title":"Visualizing data using t-sne.Journal of machine learning research, 9(11),","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.304653Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:a0c571370647c5c0891607b8504861db0e5e80a2b2a36e7de3ec0da95939774f","observation_id":"b78e3e17-89ba-4638-b1eb-edf7f8c15c02","resolution":{"observed_at":"2026-08-08T15:22:57.304653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.491089Z","title":"Offline reinforcement learning with reverse model-based imagination","venue":null,"work_id":"42c79fc5-3d21-4858-8011-de342ba87143","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.310939Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:bb6161727a1e9f3bb7be4a0ab1157e5394aee59281158543775a0c9717215a9d","observation_id":"56d541da-ebea-4604-b467-bd85d01fe907","resolution":{"observed_at":"2026-08-08T15:22:57.495528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.481319Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional se- quence modelling in offline RL","venue":null,"work_id":"6c01552d-ede1-4870-8fce-eb0c538a4726","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.313868Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:67f4671909a8b36b342352e4dc4b144b95d294c32149129d137df290842f7af4","observation_id":"c4cb93a7-0fb8-41f1-81f3-58e809ab790d","resolution":{"observed_at":"2026-08-08T15:22:57.484638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.471670Z","title":"Pareto policy pool for model-based offline reinforcement learning","venue":null,"work_id":"09967b1a-a86f-451a-9553-278acd9fa3ed","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.316920Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:ce8cd4d25e38f25d710fc4694c76cce917dc002ec10aa5489fcdf879d425726b","observation_id":"d188fd78-b098-42f4-8718-2de07b8da280","resolution":{"observed_at":"2026-08-08T15:22:57.475757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.460170Z","title":"Zou, Sergey Levine, Chelsea Finn, and Tengyu Ma","venue":null,"work_id":"dc67eedd-29be-45c2-8909-44e61a86afd6","year":2020},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.320106Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:6afc3aa4934282463bc32754fb3a0ce86eca2e3c26d401b769d26043a7661c85","observation_id":"cde9e3bd-eef7-43ed-8821-d20a5a4b7949","resolution":{"observed_at":"2026-08-08T15:22:57.464744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.448810Z","title":"Combo: Conservative offline model-based policy opti- mization","venue":null,"work_id":"5a9c9961-08af-4c01-91d0-706bfad77557","year":2021},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.322865Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:f14c6d22fec888e933d47cefa0c93edb1dbca1ad3f9eb8fb6b70513e54f88005","observation_id":"0a3006d4-6613-4f3f-91c4-5dfd042a72a8","resolution":{"observed_at":"2026-08-08T15:22:57.453045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.438009Z","title":"Model-based offline planning with trajectory prun- ing","venue":null,"work_id":"c66704fe-f6c4-4538-bb00-0c6b53fbb6aa","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.325731Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:0906521b77684b95bcd1a982de8384b02116eff9725062a165f061aba7505c65","observation_id":"4ec02951-1bfa-467f-8cb0-8740c0533f86","resolution":{"observed_at":"2026-08-08T15:22:57.442149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.426422Z","title":"Uncertainty-driven trajectory truncation for data augmen- tation in offline reinforcement learning","venue":null,"work_id":"428c5662-ff1d-47af-a0aa-d916b62f9348","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.328642Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:016fa8cf6e6773ffa6b7df6b9a8192c9b75da2ae6e956401245376f3394c9ffc","observation_id":"c8406b5e-fd84-4b11-90de-47f9c3e0f528","resolution":{"observed_at":"2026-08-08T15:22:57.430685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.415092Z","title":"Conditional vari- ational autoencoder for sign language translation with cross-modal alignment","venue":null,"work_id":"5bd2b30c-4fdb-4caf-961b-3ded23482234","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.331555Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:481588f7baffd9edab4f5047682958fce3444754ee45465a62c806fb092ca6fc","observation_id":"c1b29786-5bdb-4317-9ae6-90c9dca0a147","resolution":{"observed_at":"2026-08-08T15:22:57.419360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.403406Z","title":"Is model ensemble necessary? model- based RL via a single model with lipschitz regularized value function","venue":null,"work_id":"826e846c-e19b-44aa-b8b8-dee8a4deacc3","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.334192Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:a4ed19db7dbdbc1a87d6749e26f6d09d833a952baca71d77b07e81b8b05029cd","observation_id":"13d9d2d0-9298-4b86-92c8-54bdfe8e946b","resolution":{"observed_at":"2026-08-08T15:22:57.407879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.501972Z","title":"Jamieson","venue":null,"work_id":"51d43929-7c73-450e-ad7e-e724d8af7514","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.307781Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:50f81e12cf6737ec08325d5a0060161bc0d6a5f852be3bdee98a69437c567f17","observation_id":"556ad3d2-8dce-4ba1-b319-0d167b3e30f2","resolution":{"observed_at":"2026-08-08T15:22:57.505853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.650592Z","title":"When to trust your model: Model-based policy optimization","venue":null,"work_id":"5096a2ca-03bf-4163-aac3-9cb2dd6bc53c","year":2019},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.242035Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:9b5904b20f939136d3f3783f8ff84d601d49789b42fcf0209d9e2c2d14e5f27d","observation_id":"a880dac2-8a39-4295-ad3c-93c285a6fd89","resolution":{"observed_at":"2026-08-08T15:22:57.653888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.516720Z","title":"Behavioral cloning from observation","venue":null,"work_id":"57518cb2-d296-457e-8467-c7d0a30737c3","year":2018},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.301527Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:1ff47293d0758741ed9252fdb4b92ee94ff6090398f44590ffe87fed3d7bda8f","observation_id":"fc4a1364-2801-4845-9c84-56e87ae577b8","resolution":{"observed_at":"2026-08-08T15:22:57.520050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.729905Z","title":"Waypoint trans- former: Reinforcement learning via supervised learning with intermediate targets","venue":null,"work_id":"a53df1e9-6c9e-49b7-a660-29fe4d6fe0c1","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.207356Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:bbd8d6904fde2decd2fee4718109a901817928931ea4dede9ed8c203f114bdc2","observation_id":"8c6bcd7a-3cab-481b-92bc-ee2992815790","resolution":{"observed_at":"2026-08-08T15:22:57.733466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.675637Z","title":"ACT: empowering decision transformer with dynamic program- ming via advantage conditioning","venue":null,"work_id":"07c8913e-c95d-413c-92fe-27ab0dcd2375","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.232925Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:8fbd587e24fcf0e34c71666d8ba7a843345a596e7eb59a6a1763b4c72eb035d9","observation_id":"166a5bd9-fec1-4769-959d-2c9967232283","resolution":{"observed_at":"2026-08-08T15:22:57.679007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.683855Z","title":"Off-policy deep reinforcement learning without exploration","venue":null,"work_id":"604090a4-cdd3-49f0-80b8-0c4f928bf145","year":2019},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.230025Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:4a241954720f8edfe2aff0e55f979dd4514e9fdd5b2465a0d6369f181e49189a","observation_id":"96854808-e76e-48ee-a68b-f5274a2c64e7","resolution":{"observed_at":"2026-08-08T15:22:57.687089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.692308Z","title":"Lapo: Latent-variable advantage-weighted policy optimization for offline rein- forcement learning","venue":null,"work_id":"6186806f-84c7-4541-b93a-ceec3af967dd","year":2022},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.219766Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:d785d4d4ce72630014da92374db2dead8ba5aa1a5d56105f22fbb6f09adbb856","observation_id":"31eb5e0d-8161-47fc-a12a-57f08cbf02b9","resolution":{"observed_at":"2026-08-08T15:22:57.695616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.659177Z","title":null,"venue":null,"work_id":"150696f5-268f-4f96-b14b-9a707a7966b3","year":2010},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.239136Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:04f6eca766cbbade48ac54c0b60f8444f3278492d50029043983d407bc60b1bc","observation_id":"f3934870-e60d-4ca6-bc41-691e8e65e092","resolution":{"observed_at":"2026-08-08T15:22:57.662108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.721047Z","title":"Data-efficient task generalization via probabilistic model-based meta reinforcement learn- ing","venue":null,"work_id":"c063627f-6199-4d2f-bd01-a07732a9943d","year":2024},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.210404Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:14293e5e00698bcb4689002566f3cf6c3b69a9b9ed26c83abf5acbb66009ffd2","observation_id":"56ec4d35-2a57-4f8c-8796-f22eeffb4fc8","resolution":{"observed_at":"2026-08-08T15:22:57.724076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:22:57.711740Z","title":"Blanchet, Miao Lu, Tong Zhang, and Han Zhong","venue":null,"work_id":"97cffed0-31e2-44be-ac53-96a4e3db198e","year":2023},"citing_paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T15:22:57.213411Z"},"links":{"citing_paper":"/paper/2502.06491"},"observation_digest":"sha256:de1bea32a686678957627f6e923d3e7997be2950f1c604314251deb42ab8ab60","observation_id":"4b3ba3be-fe11-49f6-9117-8c0278e0b5c8","resolution":{"observed_at":"2026-08-08T15:22:57.715280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06491","last_updated":"2025-05-03T07:43:43Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T06:23:47.779338Z","submitted_at":"2025-02-10T14:08:55Z","title":"Model-Based Offline Reinforcement Learning with Reliability-Guaranteed Sequence Modeling"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2502.06491."}