{"as_of":"2026-08-08T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a549bcb945610b071f80db1240ed5cd37d505f0fadaa0d7859f7e8e0baa7dc7","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T15:00:44.145471Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T21:23:27.894346Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.18763","snapshot_observed_at":"2026-07-30T21:23:27.894346Z","title":"Gaussian-mixture-model Q-functions for policy iteration in reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.894346Z"},"links":{"cited_paper":"/paper/2512.18763","citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:f7d27c2f1a122e6cc90cf624be5bd23eda80211e3914043543d13a4479d289bf","observation_id":"ef344002-af4d-4b95-a275-c1b983409b7e","resolution":{"observed_at":"2026-07-30T21:23:27.894346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.18763/citation-record","integrity":"/paper/2512.18763/integrity","json":"/paper/2512.18763/citation-record.json","paper":"/paper/2512.18763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:37.980651Z","title":"Bertsekas,Reinforcement Learning and Optimal Control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:37.980651Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:8814f5f7f4346198a56343a0dc0d432c7e2ac75e4363cf4a6f30511dfeb32b2e","observation_id":"cccccf50-b56f-46a0-a4af-9b92bbb9f1e5","resolution":{"observed_at":"2026-08-03T15:00:37.980651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.103352Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.103352Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:61f74397e6ae31d04428b66384d71dfe06fe53ee324d05123c23f73a7ebf284c","observation_id":"dd8b8b4b-c79d-4b77-9c8d-62f8a1846ec4","resolution":{"observed_at":"2026-08-03T15:00:38.103352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.162131Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.162131Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:b9658c71999aed567f21095ce9509b3b682b4bef5d64b6b006848bbbd17e89cc","observation_id":"45e33159-f696-47b5-8a06-47aee17f0c0c","resolution":{"observed_at":"2026-08-03T15:00:38.162131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.229895Z","title":"Convergence results for single-step on-policy reinforcement-learning algorithms,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.229895Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:d48d882707ed4c88cbcc9ce6d1ccbbf7e5baeb5c3078b34428b7b60d8b9fb495","observation_id":"538eac2f-24f4-4606-bc6e-41ac1b2b4d77","resolution":{"observed_at":"2026-08-03T15:00:38.229895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.299601Z","title":"Kernel-based reinforcement learning,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.299601Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:3e0234f04292b82ddc4fcf4950185dcf43cb1e1e295ba81c871ec0eecd321be9","observation_id":"1923cd9a-ca93-42dd-8144-06fcdc64dcbe","resolution":{"observed_at":"2026-08-03T15:00:38.299601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.389699Z","title":"Kernel-based reinforcement learning in average-cost problems,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.389699Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:84ecfd754d37944c1070bc664932e0d37940c4b229e1916ceb826065d846fa35","observation_id":"3e1b635c-5caa-4c83-af7e-65dabe41ad6d","resolution":{"observed_at":"2026-08-03T15:00:38.389699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.457558Z","title":"Stochastic kernel temporal difference for reinforcement learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.457558Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:c60c47da06da728e721bbd14151859982a4a1cc4a04d66855ff128f7619586e9","observation_id":"6085959e-d528-487c-8c1f-b659e5943ad8","resolution":{"observed_at":"2026-08-03T15:00:38.457558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.540910Z","title":"Learning to predict by the methods of temporal differ- ences,","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.540910Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:a60e73f00afbdc819e776f3f198ce9fcdfb40e072e2e1fcffec664ed31b46b5c","observation_id":"800e07e6-e3f2-4c7a-8bb0-b8602b0f40a4","resolution":{"observed_at":"2026-08-03T15:00:38.540910Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.636891Z","title":"Least-squares policy iteration,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.636891Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:47f1de7f892016198b52fc78ff8392476cbebbda20b4e57340ecfa26179f8b67","observation_id":"4d186437-b2a4-478e-aaa4-f711b997671c","resolution":{"observed_at":"2026-08-03T15:00:38.636891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.701511Z","title":"Regularized policy iteration with nonparametric function spaces,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.701511Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:bc9b7e8fa727296f77958d584420efe610d37e9d9c40c0714826425e9e1e6d69","observation_id":"4b082f3d-7235-4fc0-bf83-0d76c3ac3e68","resolution":{"observed_at":"2026-08-03T15:00:38.701511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.782560Z","title":"Kernel-based least squares policy iteration for reinforcement learning,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.782560Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:198f40d350d29c36e429e8b502a6dd341997a30b0e49129ef321359613c06d48","observation_id":"122b5260-d903-4da2-b62a-8355c89fdfc9","resolution":{"observed_at":"2026-08-03T15:00:38.782560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.878074Z","title":"Online Bellman residual and temporal difference algorithms with predictive error guarantees,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.878074Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:20b8f669323d4f2b485440ebfc25d9ba4b7df9fe80da19b5a4c6aeb552c8b4a8","observation_id":"e01dbce6-101e-4ce9-8287-40eb7d39c3e7","resolution":{"observed_at":"2026-08-03T15:00:38.878074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.929115Z","title":"Dynamic selection of p- norm in linear adaptive filtering via online kernel-based reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.929115Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:55eaf4dcdcbbe463cc441eea26afd03310b5d88c44af2c8c5d2f885071ad5602","observation_id":"aa52abcf-19fd-439a-9829-4646586fa9a6","resolution":{"observed_at":"2026-08-03T15:00:38.929115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:38.992047Z","title":"Proximal Bellman mappings for rein- forcement learning and their application to robust adaptive filtering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:38.992047Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:fe08379322ccd134011d59c162c1c2d7fe54afc2c5ad7d1899c38dabd843da24","observation_id":"e16d4662-b278-4b2a-9eb6-f5db820748dc","resolution":{"observed_at":"2026-08-03T15:00:38.992047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.052473Z","title":"Nonparametric Bellman map- pings for reinforcement learning: Application to robust adaptive filter- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.052473Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:4b831a87761f72d0824a1d2ad579151efa7a85446d295a54647d3368bc1dabe2","observation_id":"cbe271ff-fb7e-4a15-ba2e-fe620db329fa","resolution":{"observed_at":"2026-08-03T15:00:39.052473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.161258Z","title":"Theory of reproducing kernels,","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.161258Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:abf0680568d795b184ea6152c4f2a00e9aebbebc3ce89de61a63f94f292c9b76","observation_id":"8355b67a-2076-4a1a-966c-419ac7be4d1f","resolution":{"observed_at":"2026-08-03T15:00:39.161258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.247832Z","title":"Schölkopf and A","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.247832Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:9c3ceb926eca6c4510af635ab063ba23b93f343b38f49a71a090b6e86aea50ae","observation_id":"64edac9f-38ac-4f7a-8ed2-2d8dd09b363d","resolution":{"observed_at":"2026-08-03T15:00:39.247832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-03T15:00:39.340137Z","title":"Playing Atari with deep reinforce- ment learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.340137Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:cbde400ad3edf1b8cd8f1823cc890cf6b9d30457f5f3630851fcfd1d1e64fda6","observation_id":"a1df23fc-7010-44a7-8e20-25959e1f79bc","resolution":{"observed_at":"2026-08-03T15:00:39.340137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.427371Z","title":"Deep reinforcement learning with double Q-learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.427371Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:cf1f444ec3ce6df9fc086300a4be284c937ce9db186c270a0bc494197a0d8353","observation_id":"c4ee15a5-c33f-4700-95f4-5bdba6824f16","resolution":{"observed_at":"2026-08-03T15:00:39.427371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.491581Z","title":"Reinforcement learning for robots using neural networks,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.491581Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:318439962105d7cc6b9f0878e95cffcfd960fc442333aa61ccce633f4d6df718","observation_id":"d9356b85-9b00-4db6-8eae-84ddc859700d","resolution":{"observed_at":"2026-08-03T15:00:39.491581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.633347Z","title":"Reinforcement learning based on on-line EM algorithm,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.633347Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:a537c05f9baf46597bf5256f1a9e422a268ecd96792ca654913c0bb20ba42b23","observation_id":"dae98b34-96ee-4f01-978d-cf256a871126","resolution":{"observed_at":"2026-08-03T15:00:39.633347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.769068Z","title":"Reinforcement learning with Gaussian processes,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.769068Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:856923774d72704cdacf3aecb4dd3e69be132614d87faf4d53ab38346dd6e1a4","observation_id":"f6440d4f-45bc-4ef7-981b-274b00adca48","resolution":{"observed_at":"2026-08-03T15:00:39.769068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:39.932136Z","title":"Reinforcement learning with a Gaussian mixture model,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:39.932136Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:5d35aa7adfc983b5b7889db603f379893dec01d9560918b07809cc31da5dcec5","observation_id":"5d3ac583-5915-4746-96ae-a69f00277375","resolution":{"observed_at":"2026-08-03T15:00:39.932136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.039043Z","title":"Online reinforcement learning using a probability density estimation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.039043Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:e9843e954ca9464756f1b13f902982ed6dc5d57247d27dbbdc4bbe72b1636646","observation_id":"bf0cbf36-bf79-4a11-a559-3dab74876e60","resolution":{"observed_at":"2026-08-03T15:00:40.039043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.154676Z","title":"Distributional deep reinforcement learning with a mixture of Gaussians,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.154676Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:3a0ffd2383c10c453a22cac3c8e4ad3d0873e510da270db5c5dd4ba7c9223979","observation_id":"3a6e18fd-5c8e-48d7-9a55-d43fb261ac90","resolution":{"observed_at":"2026-08-03T15:00:40.154676Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.278616Z","title":"Gaussian mixture models,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.278616Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:c845a6b82fe9329fe0a68f72ff3c2ca0742998b0d2bb280b558c25b1166aada4","observation_id":"dfd0886f-550f-4e81-a439-d071fa951ad9","resolution":{"observed_at":"2026-08-03T15:00:40.278616Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.442616Z","title":"McLachlan and D","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.442616Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:d7063e8ae419f3575ef2caf48d1eb18ab2b1a51c85ceef88295bdbcb215b634a","observation_id":"2890067a-993b-464f-abfc-6c15bd6fc123","resolution":{"observed_at":"2026-08-03T15:00:40.442616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.604180Z","title":"Maximum likelihood from incomplete data via the EM algorithm,","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.604180Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:395ca2b707090e6229777bd339cc948d8828f333ee9c242d1430d5ef83b0c63b","observation_id":"b75c20cd-f5d4-4155-975e-fe69a9d7b030","resolution":{"observed_at":"2026-08-03T15:00:40.604180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.682353Z","title":"Unsupervised learning of finite mixture models,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.682353Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:2814a41d9b075b31fbebc16cd038fc5b41374fe53ae339369a97cd21855d3067","observation_id":"f83b8f9d-cd82-4272-a975-2eb15470fcee","resolution":{"observed_at":"2026-08-03T15:00:40.682353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.760731Z","title":"Absil, R","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.760731Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:18148c3711892a02a8031763fb98efdb64553ce9503538d6ae5a2a5ec79ff6d8","observation_id":"33994f8a-b74d-48a4-8b2a-30324f61a1e1","resolution":{"observed_at":"2026-08-03T15:00:40.760731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.850046Z","title":"Rie- mannian proximal policy optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.850046Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:54383354d4a7b226129edc9526c9918fc4c22178174e81b4711d73edd906b9ed","observation_id":"8bce3830-30bc-433a-9a26-5895c20fae36","resolution":{"observed_at":"2026-08-03T15:00:40.850046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:40.914933Z","title":"Policy gradient methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.914933Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:de0e3457df5ef70f91391e6c829d3217ee0e67dcd95dbb4ef3afe223c4e59240","observation_id":"61fabfe3-29af-44f3-8604-fb0d6711790c","resolution":{"observed_at":"2026-08-03T15:00:40.914933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco.1993.5.2.305","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Approximation and radial-basis-function networks,","venue":"Neural Computation","work_id":"b009ac2d-706b-4cc1-8af9-6bcd60ee7373","year":1993},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:40.976534Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:f2686b5f978ad18462a0a2dda006f3c0c5f6694a29b24f08602c59f5b4f3d05f","observation_id":"d87b11ec-d658-4798-9d20-1193cf6bd2d6","resolution":{"observed_at":"2026-08-03T15:04:08.482603Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.075599Z","title":"Riemannian Q-functions for policy iteration in reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.075599Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:036029ea0f1c1589ec6eb1cdd62c97da6c3651f40979d47c9da1b095418bd31f","observation_id":"a34a34e6-1758-4b25-8245-c31e18a4b42b","resolution":{"observed_at":"2026-08-03T15:00:41.075599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.172037Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.172037Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:937175970d293745783c4d77ed439974aaf383d0b18afba40df6e79117763a4b","observation_id":"3ceed7cb-9bdc-4899-b6c0-de888843039d","resolution":{"observed_at":"2026-08-03T15:00:41.172037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.309276Z","title":"Tight performance bounds on greedy policies based on imperfect value functions,","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.309276Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:df7a9aace47778f7cb652270ad582d63d65feee730ac9f937fadd843e4bbfe4f","observation_id":"299d50ca-68bc-4bf7-8b48-5f25f371a6b8","resolution":{"observed_at":"2026-08-03T15:00:41.309276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.377606Z","title":"A correspondence between Bayesian estimation on stochastic processes and smoothing by splines,","venue":null,"work_id":null,"year":1970},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.377606Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:ee333eb887bd0ca2ebba47367523454edac7e78adfc857f1078f1ce264d5ccb4","observation_id":"d6a478d8-e42e-4032-9dfd-7eb9999ae22c","resolution":{"observed_at":"2026-08-03T15:00:41.377606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.493294Z","title":"Universal approximation capability of EBF neural networks with arbitrary activation functions,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.493294Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:dfbef10d4044a68376f38bdbd28cf948ca5d07e5c14790c9a8265ae2f946a045","observation_id":"1044a165-ffc6-4346-9b63-74a4326bb042","resolution":{"observed_at":"2026-08-03T15:00:41.493294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.597574Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.597574Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:c5eb8fabaa3dd5f0c7ee213db442fdbb2ebdb2fff5cc71956b4aba789f04d2c7","observation_id":"bfb26320-5c77-4a12-b487-70a56b7d1fb9","resolution":{"observed_at":"2026-08-03T15:00:41.597574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.778407Z","title":"Williams,Probability with Martingales","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.778407Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:0141a30f82836bad32a93cc30ef7ab9194fdb81b1daa380585a588efcc6f7424","observation_id":"32153aa7-e41c-4793-a8ea-64a7c885a306","resolution":{"observed_at":"2026-08-03T15:00:41.778407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:41.921653Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:41.921653Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:36b6c1fdcbb283dd6dc7af90ef1cfc713b41372d273bc03ca9b8f4c94a1ab356","observation_id":"bcf3dbe5-4f35-4d4c-85f1-42e801afae75","resolution":{"observed_at":"2026-08-03T15:00:41.921653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.036054Z","title":"Rudin,Real and Complex Analysis, 3rd ed","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.036054Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:00f446b6e8a101b8c4399f596eb3f70c03bc86781e7ed8697fc08b59d401055e","observation_id":"190f0118-1b9d-4d9a-bf30-c465cafb6e52","resolution":{"observed_at":"2026-08-03T15:00:42.036054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.261238Z","title":"Wasserstein Riemannian geometry of Gaussian densities,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.261238Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:3ffa9ed31f529771f23d7765b73329929ba629d4145d6e70e662668c533b0f25","observation_id":"a42f425f-f0e7-4518-807f-819e714a0b7a","resolution":{"observed_at":"2026-08-03T15:00:42.261238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.382131Z","title":"A sampling approach to finding Lyapunov functions for nonlinear discrete-time systems,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.382131Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:3ffb0c75b241afe5ad13d6646f00afc670557c5e6bcc8c4fa4adb451e4bedf1c","observation_id":"d2a32366-ddf7-4e9a-a8fa-cb5ca0bb7bf5","resolution":{"observed_at":"2026-08-03T15:00:42.382131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.546000Z","title":"Boumal,An Introduction to Optimization on Smooth Manifolds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.546000Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:1b24da579aafa57dad355219f89ce4133b529086e603eb60a60ab154b98074a1","observation_id":"ccb3f4e8-2daf-48ef-8b40-fb6155c7b56b","resolution":{"observed_at":"2026-08-03T15:00:42.546000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.672251Z","title":"Early stopping—but when?","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.672251Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:e6aec5d6ec8e508e5fe447f0bcb1b6fa295d4d9e281fcf77905f1d0956df8524","observation_id":"9b0c3880-bc09-43f4-a4fe-b2edee3979d9","resolution":{"observed_at":"2026-08-03T15:00:42.672251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.814788Z","title":"Learning near-optimal poli- cies with bellman-residual minimization based fitted policy iteration and a single sample path,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.814788Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:427523d22e87686519ce9941a87fdd34c0b123b3feaa0f0f969c760e8eb332e8","observation_id":"d10912af-6da8-4f2e-97ba-1343143a56f5","resolution":{"observed_at":"2026-08-03T15:00:42.814788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:42.924151Z","title":"Deterministic Bellman residual minimization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:42.924151Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:fd75794dc634ee49f53e141321bab3d2feed0b7f2b09293fa5bb9eee88ec0fa6","observation_id":"65a8e296-ff23-403a-942e-ee2cbd1726d3","resolution":{"observed_at":"2026-08-03T15:00:42.924151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.034296Z","title":"Big Omicron and big Omega and big Theta,","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.034296Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:124be68fc786eb8c36cdab753f330f28926c0ab140ffa724c5e0293af8dd10a2","observation_id":"4f0b9e33-f2f4-4e64-ad0c-6e5d7e05978e","resolution":{"observed_at":"2026-08-03T15:00:43.034296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.137851Z","title":"Reinforcement learning in continuous time and space,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.137851Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:d361d16f077049bb9949f222b2fcfec7fb5cab0d393bbb12816867d77cfbb626","observation_id":"259417fb-cbfb-4951-b447-39aa192f71d2","resolution":{"observed_at":"2026-08-03T15:00:43.137851Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.266206Z","title":"Efficient memory-based learning for robot control,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.266206Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:deb7cc103da493a7540e93bfbeb8b1def512775b9c8604980bc6e2d00bd71873","observation_id":"d99ac932-6bb8-435e-8319-4bcf81e86838","resolution":{"observed_at":"2026-08-03T15:00:43.266206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.428927Z","title":"The swing up control problem for the acrobot,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.428927Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:926b62b2e0c126c04d07eeee2aed1a7658198119afcc573a9eb5ceff4ed699b4","observation_id":"4a065fd9-f530-4c43-a003-d986e25616de","resolution":{"observed_at":"2026-08-03T15:00:43.428927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.546416Z","title":"Dueling network architectures for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.546416Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:cff1bb6c993370862ec8a759e7257ec060f5c8e7c398f98b5d0a372d4d9e5d74","observation_id":"dbe09ffb-b129-46ca-85df-6ce287e156c6","resolution":{"observed_at":"2026-08-03T15:00:43.546416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T15:00:43.650378Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.650378Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:b85f47403f2df574da8e8ccefff52c6a26427908da7d42c19175c20dc1394584","observation_id":"eb698973-f46e-4815-8eed-74d5a33ce3cd","resolution":{"observed_at":"2026-08-03T15:00:43.650378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.812659Z","title":"Julia: A fresh approach to numerical computing,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.812659Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:6b7fb3820b6301e4d7d1030c8d3377c7095c67bacd779d2b30905dc1a18f0a29","observation_id":"fd934d2d-3976-49cb-8954-c613fe2fbaac","resolution":{"observed_at":"2026-08-03T15:00:43.812659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.900090Z","title":"Robust reinforcement learning using least squares policy iteration with provable performance guarantees,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.900090Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:6e092683edb2ed4f332ae1c341cc2dbb7f70e995e917bcdb224a9248375f77c9","observation_id":"d31ccf1c-9e64-4f23-b859-fa24d7b7b9c6","resolution":{"observed_at":"2026-08-03T15:00:43.900090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:43.968185Z","title":"Geron,Tiny-dqn, https://github.com/ageron/tiny-dqn, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:43.968185Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:ea9d74268f9f4eaa8f0c211b1707757d0c68ef77f8871db2469efefa4e7bbb09","observation_id":"a3fc58a1-2470-4994-a10b-ca3c41af1a21","resolution":{"observed_at":"2026-08-03T15:00:43.968185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:44.063603Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:44.063603Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:dd2585528c1a9ffab86c15483bb8c4da3e80a7029d77a0216da13cd94ec07dca","observation_id":"b819367f-3f15-46ff-ae46-43a413d06ed2","resolution":{"observed_at":"2026-08-03T15:00:44.063603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:00:44.145471Z","title":"Density in approximation theory,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T15:00:44.145471Z"},"links":{"citing_paper":"/paper/2512.18763"},"observation_digest":"sha256:90ba2279c4b396e8d5411fd69f32460a2bb62dd75440083207465abe3b816da0","observation_id":"59f12b05-1702-4d05-8162-2e080e7b0234","resolution":{"observed_at":"2026-08-03T15:00:44.145471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2512.18763."}