{"as_of":"2026-08-07T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0126c427a875e33c3e2dbcbdac9bb47298f28ab97a2e1e51e2db98475721643","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T21:23:27.954131Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23474/citation-record","integrity":"/paper/2607.23474/integrity","json":"/paper/2607.23474/citation-record.json","paper":"/paper/2607.23474"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.776821Z","title":"Bertsekas, Reinforcement Learning and Optimal Control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.776821Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:56f979e27517bfe50cacfb9940131a3f48b165eae494fe04b3058854f60713e9","observation_id":"77c12d37-8911-494d-8297-b17d53feba0e","resolution":{"observed_at":"2026-07-30T21:23:27.776821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.780872Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.780872Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:226fc3f5305005b52e3621882b7daf4de3318d55c0fa1b13f9a556d85a1b0190","observation_id":"1ad43a1f-d9cc-4f0f-a7ea-b4de001dfeda","resolution":{"observed_at":"2026-07-30T21:23:27.780872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.784296Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.784296Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:d0fdff5a5909d000ee8c2fea2b0711fcab3aaa806d2bdca9c14c48e0ec544af4","observation_id":"cf49d3f1-281d-4e9c-a6da-bf60913fa2e3","resolution":{"observed_at":"2026-07-30T21:23:27.784296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.787786Z","title":"Convergence results for single-step on-policy reinforcement- learning algorithms,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.787786Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:9f53e0d4dc9a94c1e152fac7a287edaf9bffc67fa18d31ec682cc0bc0d480215","observation_id":"35cc8e5e-47a9-4267-b6a8-27afae3842c2","resolution":{"observed_at":"2026-07-30T21:23:27.787786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.791318Z","title":"Kernel-based reinforcement learning,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.791318Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:e181f65c090ca8a969e797779b092f79c88858ca14b6b67a2c28e776f410d26d","observation_id":"26c8c95d-9053-4144-a4de-60890fd23a2a","resolution":{"observed_at":"2026-07-30T21:23:27.791318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.794675Z","title":"Kernel-based reinforcement learning in average-cost problems,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.794675Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:f230e01646114dfd760dafc00183bf70aad29af33d1fc8087b9da5700fcf4585","observation_id":"533c9c6a-d1c8-4e9e-a70d-52821b04da3a","resolution":{"observed_at":"2026-07-30T21:23:27.794675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.798468Z","title":"Stochastic kernel temporal difference for reinforcement learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.798468Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:423198a0671914c48fae01f99ae1ee965530ff573a123716ed66af037f3a0bbf","observation_id":"6bcdd20f-96dd-4427-bf08-f95054fb6296","resolution":{"observed_at":"2026-07-30T21:23:27.798468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.801875Z","title":"Learning to predict by the methods of temporal differences,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.801875Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:63bce786247dbab97e49ad6ef42e345a5b26515293a1598e29e94ab9adff2400","observation_id":"98d13e7e-248f-46e2-be78-54768fec6a00","resolution":{"observed_at":"2026-07-30T21:23:27.801875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.808956Z","title":"Kernel-based least squares policy iteration for reinforcement learning,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.808956Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:fd5443bf09dfaf644e103acf59b9085612940ab7ec7952da25a6b3dc8d33c666","observation_id":"ae29eda7-2102-4473-b8ec-9f8e0ef627fe","resolution":{"observed_at":"2026-07-30T21:23:27.808956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.811883Z","title":"Least-squares policy iteration,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.811883Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:8c7d3dd4318d41ccd8ca4403f413424f3747620901e7cdbad937a9a95df29614","observation_id":"798b4b9f-d558-4ee9-8b6a-ff2d570a82fb","resolution":{"observed_at":"2026-07-30T21:23:27.811883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.815423Z","title":"Regularized policy iteration with nonparametric function spaces,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.815423Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:05207bb908bec2df10c3bdeb6a07e9a44c889cac3b98aca6b5847524fdaa5a14","observation_id":"a2b41a20-6a42-477a-824f-dd79b4be21fa","resolution":{"observed_at":"2026-07-30T21:23:27.815423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.818374Z","title":"Online Bellman residual and temporal difference algorithms with predictive error guarantees,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.818374Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:b5b8f886604aa97918559e72fc8061540c26b4792515c5977987853e90fc44d2","observation_id":"93b0cb23-28f7-40e3-8132-6485576ce3c6","resolution":{"observed_at":"2026-07-30T21:23:27.818374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.822771Z","title":"Dynamic selection of p-norm in linear adaptive filtering via online kernel-based reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.822771Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:4ac1b603e30ba4078c33d627dcebcff39b6cb25d5ff2f8b714ceefe832a79edf","observation_id":"c6f8070b-b679-4b39-868e-5af43c7f1e56","resolution":{"observed_at":"2026-07-30T21:23:27.822771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.826157Z","title":"Proximal Bellman mappings for reinforcement learning and their application to robust adaptive filtering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.826157Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:8c40fb1059cf8f8ac23d814538bc28fdc745986c179a4eeb803a46974f69a124","observation_id":"16222bec-4d3a-492b-b0d8-85f35b65bc69","resolution":{"observed_at":"2026-07-30T21:23:27.826157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.829293Z","title":"Nonparametric Bellman mappings for reinforcement learning: Application to robust adaptive filtering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.829293Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:ff0bf910c37b514f95b9679e6137e73dc418b80f9d6bf318a99d092f643b48b8","observation_id":"7d09d2e9-0b93-4f53-a016-b3bee09b914d","resolution":{"observed_at":"2026-07-30T21:23:27.829293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.832179Z","title":"Theory of reproducing kernels,","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.832179Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:8c5046832990a4eda9989d8a80861ecd96ab4004d778462ce0ae9a3e15254de5","observation_id":"fc67cfa5-10f4-41a5-8333-7a81d5649a92","resolution":{"observed_at":"2026-07-30T21:23:27.832179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.835099Z","title":"Schölkopf and A","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.835099Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:f315da8dd99fdd8694e4a1f1d419505915be93382fa2ab50dd40f32480cc5bb7","observation_id":"ec04fdbe-2319-46f9-86aa-922b94be3e9a","resolution":{"observed_at":"2026-07-30T21:23:27.835099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.838125Z","title":"Reinforcement learning based on on-line EM algorithm,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.838125Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:b30f4e873e4d52572957aef5e4890b217b0fa1fc869dbe5367d873eee7dff1a2","observation_id":"19a2e99e-9693-4694-b39e-d8c08b193b06","resolution":{"observed_at":"2026-07-30T21:23:27.838125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco_a_00906","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Online reinforcement learning using a probability density estimation,","venue":"Neural Computation","work_id":"36e36a37-90d2-406a-9fd3-cd84d5a58471","year":2017},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.841331Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:0e79cd174cf0aa96ccb67a5fc9d2d3163a364946914ce5c9167ef080e0f0b0cb","observation_id":"5545eaf4-8f8f-4c27-83b7-ac236a443f65","resolution":{"observed_at":"2026-07-30T21:26:21.579620Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.844509Z","title":"Distributional deep reinforcement learning with a mixture of Gaussians,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.844509Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:4bc0d56e3ee60ffd2f269956c45740f08051fa493f242e193728511e08555b60","observation_id":"4c0e7827-f597-4888-bf2b-4a25750c81ef","resolution":{"observed_at":"2026-07-30T21:23:27.844509Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.847692Z","title":"Reinforcement learning with Gaussian processes,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.847692Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:dd596dc9413dd49cef1ea8cf1f90f147274f2cb9d99baa045b80e117c4bce653","observation_id":"582bc176-f243-4b3d-b862-9345b9a7625c","resolution":{"observed_at":"2026-07-30T21:23:27.847692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.850760Z","title":"A distributional perspective on reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.850760Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:c7ebb4f688cb742c47a4d10445a7040e7d91b0da4c244d88227725999fc8795b","observation_id":"29d33cde-b3dc-42fe-81a2-c1fcf9863636","resolution":{"observed_at":"2026-07-30T21:23:27.850760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.853697Z","title":"Distributional reinforcement learning with quantile regression,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.853697Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:b8448d0023e2ff3f203f4dcfb9dd03da6b21770368e76996cb40a11ad8414dd7","observation_id":"371ffe96-2ff4-43b9-a075-dd1d13922346","resolution":{"observed_at":"2026-07-30T21:23:27.853697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.856916Z","title":"Gaussian mixture models,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.856916Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:334c4eabf0b715b8a2d68726719b6d3a1ede5ccdfa5dbf94593d1319e23f25e8","observation_id":"f01fccfa-f9a0-40a6-a85d-0f2b393f6221","resolution":{"observed_at":"2026-07-30T21:23:27.856916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-07-30T21:23:27.859979Z","title":"Playing Atari with deep reinforcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.859979Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:34582c589a74c9f6bca0d802bee80ea4d468f88afe2fbd3e395cbc765280ebc4","observation_id":"1116c1cc-6296-452b-b057-3ffb457f3730","resolution":{"observed_at":"2026-07-30T21:23:27.859979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.863171Z","title":"Deep reinforcement learning with double Q-learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.863171Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:8dd5a751172956d2ce67b766baa97c64587e23682bd2f88990943d44a72e9ea2","observation_id":"d503793d-63cf-4718-9163-cd73e2692798","resolution":{"observed_at":"2026-07-30T21:23:27.863171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.866467Z","title":"Dueling network architectures for deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.866467Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:da3eaa7774c52ecf43f9cb7891c20f6116a0c973e1e29bcae7baf8225e3aec3b","observation_id":"4a52929e-a757-4c3b-84b1-e5a3a323f45c","resolution":{"observed_at":"2026-07-30T21:23:27.866467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.869777Z","title":"Reinforcement learning for robots using neural networks,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.869777Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:bb0275e51cb05d2f5d73d7f6cdcfd4e4436fab6f36947c24a4e20fac4ee8c191","observation_id":"415709e9-e300-46f9-b812-8c225a7480b2","resolution":{"observed_at":"2026-07-30T21:23:27.869777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.872661Z","title":"Prioritized experience replay,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.872661Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:c1de58f95510873a78f1d1f6db335621a7086d94ee7c0a4382df2abb3f28fc4d","observation_id":"4bd00049-b866-4b41-a80c-cb82455e1731","resolution":{"observed_at":"2026-07-30T21:23:27.872661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.875711Z","title":"The state of sparse training in deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.875711Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:96056a765a3504c77ff7ecbb8d8b0ce51e2727a93e0340683fcc6903a56230fb","observation_id":"fa56eb76-77b4-42f9-ac18-f8f567ac2c82","resolution":{"observed_at":"2026-07-30T21:23:27.875711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.878651Z","title":"EIE:Efficientinferenceengineoncompressed deep neural network,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.878651Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:ba19bcee3e135d099b1c2520760874b1b5cdcc91d1669a6ab7922f4294463402","observation_id":"c51e858e-a674-4271-b613-2cbb6b1706b7","resolution":{"observed_at":"2026-07-30T21:23:27.878651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.882050Z","title":"Scalable training of artificial neural networks with adaptive sparse connectivity inspired by network science,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.882050Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:ad76cfa17ad59935bc0b53e932223845a950651ff1787c99cce04fb56312e967","observation_id":"1a88e84f-6ee9-47f3-b54e-54563e5d686b","resolution":{"observed_at":"2026-07-30T21:23:27.882050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04840","last_updated":"2019-08-23T18:30:16Z","snapshot_observed_at":"2026-07-06T08:06:52.501752Z","submitted_at":"2019-07-10T17:40:20Z","title":"Sparse Networks from Scratch: Faster Training without Losing Performance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04840","snapshot_observed_at":"2026-07-30T21:23:27.884957Z","title":"Dettmers and L","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.884957Z"},"links":{"cited_paper":"/paper/1907.04840","citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:187c45adee938ea309785fcbe214c67416c0f19880ef7330ea97d8b2d3f75da2","observation_id":"4664cd13-8524-4b23-b102-b47e66835fe2","resolution":{"observed_at":"2026-07-30T21:23:27.884957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.888403Z","title":"Rigging the lottery: Making all tickets winners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.888403Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:3faa6e980a4d81def7f4c98608eaa5925a3977529e70f59dac85abc099f8a52d","observation_id":"9e0f4f7b-1e8f-4815-8495-f93fc71ba53c","resolution":{"observed_at":"2026-07-30T21:23:27.888403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.891475Z","title":"Riemannian Q-functions for policy iteration in reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.891475Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:57ec6c45ba9650cd573cbc163f5552a525c22bf0888382a2450b9f057a167e03","observation_id":"310d5134-f31a-4498-b0cb-74753f10ee9e","resolution":{"observed_at":"2026-07-30T21:23:27.891475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.18763","last_updated":"2026-07-21T09:25:48Z","snapshot_observed_at":"2026-08-03T15:00:35.352087Z","submitted_at":"2025-12-21T15:00:32Z","title":"Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.18763","snapshot_observed_at":"2026-07-30T21:23:27.894346Z","title":"Gaussian-mixture-model Q-functions for policy iteration in reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.894346Z"},"links":{"cited_paper":"/paper/2512.18763","citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:f7d27c2f1a122e6cc90cf624be5bd23eda80211e3914043543d13a4479d289bf","observation_id":"ef344002-af4d-4b95-a275-c1b983409b7e","resolution":{"observed_at":"2026-07-30T21:23:27.894346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.897445Z","title":"Towards continual reinforcement learning: A review and perspectives,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.897445Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:30dd8bcda1f600a02aec17582717dfad69762b7fb5a91a49bd7f55b8c8f683fb","observation_id":"eac5bebf-6c9b-4151-b7dc-b33eab3352e5","resolution":{"observed_at":"2026-07-30T21:23:27.897445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.900206Z","title":"Online reinforcement learning via sparse Gaussian mixture model Q-functions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.900206Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:897d1a95dad7408535aad9faccfdfe3f3081e92b80165e3518a8cd31d1160ed0","observation_id":"bd1db37f-eafd-4cde-80ad-90830dfba664","resolution":{"observed_at":"2026-07-30T21:23:27.900206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.903022Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.903022Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:bb46d8a3cd9894d8fef13f6f2c367afb68257f3c5cf7583e92200cd6118cfa73","observation_id":"2e5bcb90-36d8-49f8-9ba0-2a9cf4f7fa98","resolution":{"observed_at":"2026-07-30T21:23:27.903022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-30T21:23:27.906216Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.906216Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:8b0b4100c3281405883077a117c43512b0a0f9eafe8c7d8e2e4914bae0222c70","observation_id":"bf199750-85fe-4310-b16e-7b82217994ec","resolution":{"observed_at":"2026-07-30T21:23:27.906216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.909559Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.909559Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:238bb0181de4273dbc00c0a6e777d80d987fd9314e218aa4f581de8bbb211cdf","observation_id":"f0fb4e78-d713-4a9a-a5ae-7678e80b7462","resolution":{"observed_at":"2026-07-30T21:23:27.909559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.912555Z","title":"Absil, R","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.912555Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:005577d9bfc74c5bf019da8f5d3a75eebeca02c16eeb39b423da1e048203aa84","observation_id":"3e418a3f-3ab4-4556-a558-58ebae2d974e","resolution":{"observed_at":"2026-07-30T21:23:27.912555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.915728Z","title":"Riemannian adaptive optimization methods,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.915728Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:01b6489562e998b30a40ec6339dbae5c210c6a8738b1d8ee47624d964d1d3530","observation_id":"151febf3-d10f-44fc-9c25-2bafaf6c2ee0","resolution":{"observed_at":"2026-07-30T21:23:27.915728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.918594Z","title":"Actor-critic algorithms,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.918594Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:1b9fa8b14400fbaf441d620c62a64e6efbc3e79ff84e31b81747d158bc81bc91","observation_id":"d8fa565b-41a6-4011-af03-24cd10bcfd3a","resolution":{"observed_at":"2026-07-30T21:23:27.918594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.921369Z","title":"Smoothing the edges: Smooth optimization for sparse regularization using Hadamard overparametrization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.921369Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:e45ae149931e926105ad0b1cfecc3691eb2d1a20f060bbb5bf176576d48129d3","observation_id":"dbc7c59e-21a8-4d95-b38c-9cb73654dbb5","resolution":{"observed_at":"2026-07-30T21:23:27.921369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.924239Z","title":"Loss landscapes and optimization in over-parameterized non-linear systems and neural networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.924239Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:08f0ac15559560f260b5378768ed87c4fbf47394041bf9852a3c857c609b54e8","observation_id":"37b5846c-60cb-4369-9e02-e0afbe3519fa","resolution":{"observed_at":"2026-07-30T21:23:27.924239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.927181Z","title":"LASSO, fractional norm and structured sparse estimation using a Hadamard product parametrization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.927181Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:5d3a338238bf2369eb24404629b9babdf61cb81d93f776f2a2984e5f83f5b258","observation_id":"c91e458c-4c0f-427a-a9f9-23f8b49fc5c1","resolution":{"observed_at":"2026-07-30T21:23:27.927181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.929994Z","title":"The tail-Hadamard product parametrization algorithm for compressed sensing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.929994Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:678e48a368e25332cb3971b2af65dc44fa3b72153207aee46ae328a64cca347c","observation_id":"d7918145-12b1-4279-bc57-be17fc63a54a","resolution":{"observed_at":"2026-07-30T21:23:27.929994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.933007Z","title":"Spred: Solving L1 penalty with SGD,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.933007Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:3798a84bb398a75bab5d8c56a06589cc6af001a1bbd53e8cb8fb2c61b47f3ce3","observation_id":"46eb3f11-04d3-4bc9-b664-ad189ea2350f","resolution":{"observed_at":"2026-07-30T21:23:27.933007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.935801Z","title":"Pennec, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.935801Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:77850d09f6d05861add9737a0606fb15803d13f3d2e7d775b8afb374b596d75d","observation_id":"f21a8951-2273-4c96-879e-8962adb4bb47","resolution":{"observed_at":"2026-07-30T21:23:27.935801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.938903Z","title":"Hall, Lie Groups, Lie Algebras, and Representations: An Elementary Introduction(Graduate Texts in Mathematics)","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.938903Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:156fa45166e1f16932dfa9b6ba5fbaac919fc082cb072c0b1dab10d77b801554","observation_id":"3f7f8aa6-4a07-4587-9bfc-40ef591cfa83","resolution":{"observed_at":"2026-07-30T21:23:27.938903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.941801Z","title":"Efficient diversity-based experience replay for deep reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.941801Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:3f557f6b74a4f6171dc0ad81ea41411107b8dbef5af3741ef5001ed78b39c9c9","observation_id":"3a5cf5a1-fe5c-4dd6-8f89-141480a610b8","resolution":{"observed_at":"2026-07-30T21:23:27.941801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.948063Z","title":"Determinantal point processes for machine learning,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.948063Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:94aeacc3911a2a54485031a2be06dc2905d5532ef1fc96c65e6cf5794a2d50aa","observation_id":"4f5cc512-9dea-4d29-ada0-ab4343e4f6d1","resolution":{"observed_at":"2026-07-30T21:23:27.948063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.950945Z","title":"Clustering experience replay for the effective exploitation in reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.950945Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:de2636c8f92bcb96bbcc5dfcbb0db94792cd8e7933e90a5350d297a57d190c53","observation_id":"0c6d8f07-ad42-4e24-b77a-b0c4d353fc2d","resolution":{"observed_at":"2026-07-30T21:23:27.950945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.954131Z","title":"Explainable reinforcement learning: A survey and comparative review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.954131Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:818ef30feb44cdf9397e869ae415b294cded4c03d999d2f44e281113beb22658","observation_id":"3cbf4609-7d5b-480e-af9e-3ea45855a0de","resolution":{"observed_at":"2026-07-30T21:23:27.954131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T21:23:27.805211Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":1988,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.805211Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:b7e3b24632d78f35b230fb084630fd1f7a45d4a948ef1995f836e8e2a24893a4","observation_id":"ea4e6171-5a7a-46ed-84c3-60a362ed8d00","resolution":{"observed_at":"2026-07-30T21:23:27.805211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2025/788","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"cdedcc2e-f627-4e1c-a0e2-8dbda95f3d4b","year":2025},"citing_paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-30T21:23:27.945260Z"},"links":{"citing_paper":"/paper/2607.23474"},"observation_digest":"sha256:1357558a8637d93b0e3e4d78dc4da4c9233601dfd90dee5bf4161c890fc4b031","observation_id":"9f618f70-1dd7-4860-b3e8-82124708ac9e","resolution":{"observed_at":"2026-07-30T21:26:21.325397Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.23474","last_updated":"2026-07-26T05:58:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T02:48:41.426922Z","submitted_at":"2026-07-26T05:58:23Z","title":"Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.23474."}