{"as_of":"2026-08-05T12:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa6b3fe91063e265893ed8b53df45be6967c4f895435d6136e6f1c32c681c359","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:37:48.385697Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.03494/citation-record","integrity":"/paper/2510.03494/integrity","json":"/paper/2510.03494/citation-record.json","paper":"/paper/2510.03494"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.505697Z","title":"Learning theory from first principles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.505697Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:123f681bd5d2ecc1e1d410a10dfb0301560ec40bfc0345273b40e493704b32bb","observation_id":"851be0ef-d974-4bbf-abc2-9b2e0931a8ac","resolution":{"observed_at":"2026-08-04T12:37:47.505697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.544687Z","title":"Provably efficient exploration in policy optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.544687Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:274b318248308f4e33e724cec645b15484e3989b6db795f949b8c18c44f234ac","observation_id":"6930e05b-caa4-4e09-abdd-419b03b77900","resolution":{"observed_at":"2026-08-04T12:37:47.544687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.591936Z","title":"Information-theoretic considerations in batch reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.591936Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:52a50c7acb45dbd35ae825e7661395592662dc57ee7dd1ecc90ba96777c0aaca","observation_id":"cbb3904c-6608-4d62-a8d1-ea626d1bdb0c","resolution":{"observed_at":"2026-08-04T12:37:47.591936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10919","last_updated":"2022-08-30T17:57:33Z","snapshot_observed_at":"2026-07-06T12:10:39.369364Z","submitted_at":"2021-11-21T23:22:37Z","title":"Offline Reinforcement Learning: Fundamental Barriers for Value Function Approximation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10919","snapshot_observed_at":"2026-08-04T12:37:47.612684Z","title":"Offline reinforcement learning: Fundamental barriers for value function approximation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.612684Z"},"links":{"cited_paper":"/paper/2111.10919","citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:0ae7427d987eb8757493d72dcd0045a737dd4e526ab7569b206fa126e3c091fe","observation_id":"47090f8a-d141-4495-95f3-40951e0db31b","resolution":{"observed_at":"2026-08-04T12:37:47.612684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.658083Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.658083Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:c465465b12a7417b3b4dd5d3918de6b98e66a3f77787bc6aa47e3b1c05b3ee24","observation_id":"36eca9eb-7f0b-4190-86dd-dab045312fec","resolution":{"observed_at":"2026-08-04T12:37:47.658083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.702880Z","title":"Random design analysis of ridge regression","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.702880Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:240d1d6a8c9ff03805b6082507e267389557fa4840378bb781ac45cb414c6c07","observation_id":"2075fb25-b8e9-4e80-b20f-abd240864aca","resolution":{"observed_at":"2026-08-04T12:37:47.702880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17091","last_updated":"2024-03-25T18:28:45Z","snapshot_observed_at":"2026-07-30T19:43:46.871059Z","submitted_at":"2024-03-25T18:28:45Z","title":"Offline Reinforcement Learning: Role of State Aggregation and Trajectory Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17091","snapshot_observed_at":"2026-08-04T12:37:47.745008Z","title":"Offline reinforcement learning: Role of state aggregation and trajectory data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.745008Z"},"links":{"cited_paper":"/paper/2403.17091","citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:49a55bf73cbbf57d7cf70552e99616a556cf61f8f2c1d22fa0a59e7913b807c7","observation_id":"49916fad-ed64-4902-8810-cd297c9ea285","resolution":{"observed_at":"2026-08-04T12:37:47.745008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.788708Z","title":"Offline reinforcement learning in large state spaces: Algorithms and guarantees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.788708Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:d96a99d4660a96f16446114a625abdcfd8cc4809e6a9f4d44c48bc93c62c7d8d","observation_id":"565e0fc1-2104-4e50-8ede-a1781cd62515","resolution":{"observed_at":"2026-08-04T12:37:47.788708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.833062Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.833062Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:cd82a5a5b5485ca321e3616a4f75dcc91a55b963538009da35648cf44b8ef451","observation_id":"2f57979a-9ecb-4f3a-87e4-68a6747ccf42","resolution":{"observed_at":"2026-08-04T12:37:47.833062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:47.906821Z","title":"Batch policy learning under constraints","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.906821Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:34cddee405ec74738dd8d11a0a4430a9dba93ad88fdee9dd8023f55457abb2cf","observation_id":"18238f8f-0713-410c-9592-c9032ac99a42","resolution":{"observed_at":"2026-08-04T12:37:47.906821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04840","last_updated":"2024-10-03T16:23:07Z","snapshot_observed_at":"2026-08-05T12:18:43.626181Z","submitted_at":"2024-09-07T14:38:05Z","title":"Sample and Oracle Efficient Reinforcement Learning for MDPs with Linearly-Realizable Value Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04840","snapshot_observed_at":"2026-08-04T12:37:47.941595Z","title":"Sample and oracle efficient reinforcement learning for mdps with linearly-realizable value functions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:47.941595Z"},"links":{"cited_paper":"/paper/2409.04840","citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:560918c015a57db700abc6b8127cc3bd90dee6c52de2233458de24f5de590f43","observation_id":"96ece97d-2dd6-4469-9d6f-de5a07d6b671","resolution":{"observed_at":"2026-08-04T12:37:47.941595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:48.007752Z","title":"Finite-time bounds for fitted value iteration","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.007752Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:d22e015c75133c010b8dd61584e4276aa46a6389b4f8d1a9237c7353c983f5d4","observation_id":"3db25f7a-4f60-42d8-a3c1-9b52724f9e93","resolution":{"observed_at":"2026-08-04T12:37:48.007752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:48.113390Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.113390Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:a1ac21de4b3ff1bde6d07f1367176e5c85079dfbc4cacf12f8eee415a9c01b65","observation_id":"fd5f4d3b-e3bf-45de-a3ad-2fc950e22232","resolution":{"observed_at":"2026-08-04T12:37:48.113390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:48.192979Z","title":"Trajectory data suffices for statistically efficient learning in offline rl with linear qpi-realizability and concentrability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.192979Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:29c4674ec76c22abeb487ea6c0175c5cf479b149e563f8009bbe7b3ffa675148","observation_id":"2cd1b858-0f0a-40de-ab6c-d0b1bc2bb3eb","resolution":{"observed_at":"2026-08-04T12:37:48.192979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:48.256135Z","title":"Minimum-volume ellipsoids: Theory and algorithms","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.256135Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:90550d2ca8f3f3a1b69857fa51cf98947fd4fc8fde99550fe756674bc391b340","observation_id":"492e7b46-22a4-4905-a156-40eac738b4c2","resolution":{"observed_at":"2026-08-04T12:37:48.256135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:48.289220Z","title":"High-dimensional probability: An introduction with applications in data science, volume 47","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.289220Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:45baddcf5745bc57f8c62e4687ea2e0edaba5ddc532493cfd91d52674b7f284f","observation_id":"c2c93dcc-69ed-427b-9172-539d2db59dca","resolution":{"observed_at":"2026-08-04T12:37:48.289220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07811","last_updated":"2023-12-20T18:09:29Z","snapshot_observed_at":"2026-07-06T16:31:29.379540Z","submitted_at":"2023-10-11T18:50:25Z","title":"Online RL in Linearly $q^\\pi$-Realizable MDPs Is as Easy as in Linear MDPs If You Learn What to Ignore","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07811","snapshot_observed_at":"2026-08-04T12:37:48.336588Z","title":"Online rl in linearly qpi-realizable mdps is as easy as in linear mdps if you learn what to ignore","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.336588Z"},"links":{"cited_paper":"/paper/2310.07811","citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:3f2d34769569d4a8c10a7b8a843024bbd13c81ea6a472a8a338b800071a1272c","observation_id":"ad74ca0a-a1c0-4f24-b752-a3918b30bff1","resolution":{"observed_at":"2026-08-04T12:37:48.336588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:37:48.385697Z","title":"Learning near optimal policies with low inherent bellman error","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T12:37:48.385697Z"},"links":{"citing_paper":"/paper/2510.03494"},"observation_digest":"sha256:59cef77228eda7314f7aba966bc15da292d91569c69a71e8705c49be7fdddecb","observation_id":"5c4022cb-3c3a-4401-a892-d7974d5cb265","resolution":{"observed_at":"2026-08-04T12:37:48.385697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03494","last_updated":"2026-05-31T00:15:42Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T12:37:45.532870Z","submitted_at":"2025-10-03T20:18:35Z","title":"Trajectory Data Suffices for Statistically Efficient Policy Evaluation in Fixed-Horizon Offline RL with Linear $q^\\pi$-Realizability and Concentrability"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2510.03494."}