{"as_of":"2026-07-22T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ba519b49d5a4c9ce3daaf9c8c193747802886bf7912fe216d8ead1ff283390e","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T02:16:04.596951Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-22T06:31:00.163083+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:45:48.543849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T23:36:38.356022Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"cited_work":{"arxiv_id":"2404.14442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[26]Levine, S., Kumar, A., Tucker, G., and Fu, J.Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643(2020)","venue":null,"work_id":"308efb39-776a-4c0e-8e94-4681ddd14c65","year":2024},"citing_paper":{"arxiv_id":"2604.06837","last_updated":"2026-04-08T08:58:30Z","snapshot_observed_at":"2026-07-06T22:55:15.791334Z","submitted_at":"2026-04-08T08:58:30Z","title":"Contraction-Aligned Analysis of Soft Bellman Residual Minimization with Weighted Lp-Norm for Markov Decision Problem","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:45:48.543849Z"},"links":{"cited_paper":"/paper/2404.14442","citing_paper":"/paper/2604.06837"},"observation_digest":"sha256:f93d36f102971568caedf687f99d852586ee084c5b2807a14c217ca69f67893e","observation_id":"eeed0fd3-3546-4dcc-8add-dfbd564138a0","resolution":{"observed_at":"2026-05-12T03:41:43.130250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"cited_work":{"arxiv_id":"2404.14442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14442","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"[26]Levine, S., Kumar, A., Tucker, G., and Fu, J.Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643(2020)","venue":null,"work_id":"308efb39-776a-4c0e-8e94-4681ddd14c65","year":2024},"citing_paper":{"arxiv_id":"2604.25379","last_updated":"2026-04-28T08:43:39Z","snapshot_observed_at":"2026-07-06T23:11:16.247497Z","submitted_at":"2026-04-28T08:43:39Z","title":"Safe-Support Q-Learning: Learning without Unsafe Exploration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:36:35.746034Z"},"links":{"cited_paper":"/paper/2404.14442","citing_paper":"/paper/2604.25379"},"observation_digest":"sha256:e7e7dbf28e38ab71b145bb02199bbb21c7572379aaa5b05ad828f8a8e2c2b13d","observation_id":"624a9226-b504-4f17-9350-74df4165231b","resolution":{"observed_at":"2026-05-12T03:41:43.130250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.14442/citation-record","integrity":"/paper/2404.14442/integrity","json":"/paper/2404.14442/citation-record.json","paper":"/paper/2404.14442"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68050586-33ba-433a-8147-f23aa6030a40","year":1998},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:ff8d5f2f698b3b041afd669fdad46ffec68183ae4f337bc9d7c5b1add518e526","observation_id":"28cc24c6-c65a-486a-85fa-197fe053a6ce","resolution":{"observed_at":"2026-05-24T02:18:46.397653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-level control through deep rein- forcement learning","venue":null,"work_id":"8cdcccc4-6a9b-48b6-885b-7f7c21df5d7a","year":2015},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:2dead17e98bfc13fd194ef4b0457cddbbf0b02c311d1fe847e323bc8ae010390","observation_id":"97aacc98-5917-43ab-8f17-ce5e51f28664","resolution":{"observed_at":"2026-05-24T02:18:46.292830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q-learning","venue":null,"work_id":"741a140c-f71d-441f-af75-35faa8bd2cdc","year":1992},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:0ac0755f90596842fc30b5c7faf7bc863cec35a9a2247acc00ec24e5e436b979","observation_id":"3cc5354f-bf5f-4605-92aa-a3b3884f803e","resolution":{"observed_at":"2026-05-24T02:18:46.296427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convergence of st ochastic iterative dynamic programming algorithms","venue":null,"work_id":"0428d9ef-2fef-4195-977e-c43a7e05dbc3","year":1994},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:9936aff5d1f0dbde735857677632e8fc00499607f12be69754e34e640985e0ef","observation_id":"af840059-9b62-4580-bd77-db791cf081e8","resolution":{"observed_at":"2026-05-24T02:18:46.300384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The ODE method for convergence of stochastic approximation and reinforcement learning","venue":null,"work_id":"01f7511b-1d44-4fc8-b505-4bc5ecb250f2","year":2000},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:7edf209f81c036fa9ddb3f65b24f16b18cf9278bca4af36aae59a4aae8ec3c75","observation_id":"e79e4f8b-0f33-47c4-a390-8f4b462ea87f","resolution":{"observed_at":"2026-05-24T02:18:46.311443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A uniﬁed switching system perspective and con vergence analysis of Q- learning algorithms","venue":null,"work_id":"630a2098-1431-495f-959e-b19245b3d011","year":2020},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:4d74955db8ef0cc0100e475f50f34b3276fa21d87394ea71f9706fd498439565","observation_id":"6f1771e3-8a63-461b-8875-d4a6458d8872","resolution":{"observed_at":"2026-05-24T02:18:46.281535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous stochastic approximation and Q- learning","venue":null,"work_id":"265856f8-64c4-46a8-bf55-ea89f96885e8","year":1994},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:3ce8db0796d9d38669d2b7b9a0fa49d2090bdd0be743c8a3ac416bf2723eb212","observation_id":"940e2db8-f018-4452-a4d3-d18c1d92a81c","resolution":{"observed_at":"2026-05-24T02:18:46.285313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conv ergence results for single-step on-policy reinforcement-learning algorithms","venue":null,"work_id":"fc1591b3-db6d-4904-ab01-c821abcbb397","year":2000},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:85d07a0858b2dbde0e169424af60a0cb33e94fbca339233c3606c9a02d0a29aa","observation_id":"183a7283-d48a-4457-8366-773752a8d3e1","resolution":{"observed_at":"2026-05-24T02:18:46.270691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The asymptotic convergence-rate of Q-lear ning","venue":null,"work_id":"5866f293-48e9-41d9-94af-eeb4903dfee9","year":1998},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:0300a0de258b4a5e3638047485a524fd690ff15bee84c2ea2ace701ddc6858b2","observation_id":"f7574daf-02c6-4a4f-b65f-4bfe96c4dde6","resolution":{"observed_at":"2026-05-24T02:18:46.274225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning rates for Q-learning","venue":null,"work_id":"308a2473-8005-4850-a748-93b4448a90ca","year":2003},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:4d410843157299e16a4f5d092dcde8381d2ad70751d76f50dd3d0fc18edb6ad0","observation_id":"ec2fd1a0-1e56-461f-92f9-b5246cd4e3c8","resolution":{"observed_at":"2026-05-24T02:18:46.265922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error bounds for constant step- size Q-learning","venue":null,"work_id":"a19dd793-d88c-490c-92b5-540d3f014e83","year":2012},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:5c3b27bf4f0de6c18269f106f7db59ededffcb873fd14fc87e9279acee6d7656","observation_id":"143ef549-f556-4ede-bd22-6b3cb1548ee3","resolution":{"observed_at":"2026-05-24T02:18:46.363059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06265","last_updated":"2019-06-24T17:09:55Z","snapshot_observed_at":"2026-07-06T07:53:15.177000Z","submitted_at":"2019-05-15T16:06:30Z","title":"Stochastic approximation with cone-contractive operators: Sharp $\\ell_\\infty$-bounds for $Q$-learning","version":2},"cited_work":{"arxiv_id":"1905.06265","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.06265","snapshot_observed_at":"2026-07-09T22:56:37.754397Z","title":"Stochastic approximation with cone-contractive operators: Sharp $\\ell_\\infty$-bounds for $Q$-learning","venue":"cs.LG","work_id":"493446c0-0206-4c59-8a76-c5c0886192b1","year":2019},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"cited_paper":"/paper/1905.06265","citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:434f179172aeba28f19c7db7e6d90f5d079a8353e2a8b174f7c282d4b97164e8","observation_id":"cab0cf58-eaa2-4bbc-8c10-2ea6b677ea25","resolution":{"observed_at":"2026-05-24T02:18:44.883030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.00260","last_updated":"2020-02-01T19:20:01Z","snapshot_observed_at":"2026-07-06T08:54:14.623788Z","submitted_at":"2020-02-01T19:20:01Z","title":"Finite-Time Analysis of Asynchronous Stochastic Approximation and $Q$-Learning","version":1},"cited_work":{"arxiv_id":"2002.00260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.00260","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-time analysis of asynchronous sto chastic approximation and Q-learning","venue":null,"work_id":"c2cd5eb3-07e9-4231-8641-92f1061d1af5","year":2002},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"cited_paper":"/paper/2002.00260","citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:7f0f0306e750798523d5c5f0e8f6fe1d55f77955e63a11d994668d1c8f7878e7","observation_id":"09b93c36-6021-4eba-827f-4b394ae47756","resolution":{"observed_at":"2026-05-24T02:18:44.877485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03041","last_updated":"2021-08-08T03:42:12Z","snapshot_observed_at":"2026-07-06T09:26:07.670750Z","submitted_at":"2020-06-04T17:51:00Z","title":"Sample Complexity of Asynchronous Q-Learning: Sharper Analysis and Variance Reduction","version":3},"cited_work":{"arxiv_id":"2006.03041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample complexity of asy nchronous Q-learning: Sharper analysis and variance reduction","venue":null,"work_id":"ccfaf98f-0e08-491a-ac13-aca0f92e9c0a","year":2006},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"cited_paper":"/paper/2006.03041","citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:916e8f1ba409c7029b4c5846d8b63e46662700bf2c7774ca096f91ff7246957d","observation_id":"3480e319-29f3-457a-a428-e5f7bc10fc2b","resolution":{"observed_at":"2026-05-24T02:18:44.857935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01567","last_updated":"2023-09-04T20:15:15Z","snapshot_observed_at":"2026-07-06T10:37:50.467703Z","submitted_at":"2021-02-02T15:48:19Z","title":"A Lyapunov Theory for Finite-Sample Guarantees of Asynchronous Q-Learning and TD-Learning Variants","version":4},"cited_work":{"arxiv_id":"2102.01567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2102.01567","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A L yapunov theory for ﬁnite- sample guarantees of asynchronous Q-learning and TD-learning va riants","venue":null,"work_id":"bd38b0b4-16c7-4276-935e-bae98b7f23c2","year":2021},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"cited_paper":"/paper/2102.01567","citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:e6ca2fb499a219753198a1ca83051f539dcf52adf430b3cef360f3f7efa984db","observation_id":"886d6936-c725-4e7f-8730-96008331033e","resolution":{"observed_at":"2026-05-24T02:18:44.890270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-sample analysis of contractive stochastic approxim ation using smooth convex envelopes","venue":null,"work_id":"d3b7ac59-03f1-4f74-a28b-9b5dce7747ef","year":2020},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:55467aed4f515a6a4432f6cd0fd3b68f85b4ffcaba764f6d3c276362c777a11e","observation_id":"476ec9ca-3f23-4922-9344-d2f89aa69f06","resolution":{"observed_at":"2026-05-24T02:18:46.367176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Final iteration convergence of Q-learning: Switching s ystem approach","venue":null,"work_id":"f0bde42a-768b-4959-a9bb-98faf547baca","year":2024},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:64d9436ae34ace169e50ad815979d89e025946dd51df64f059cad12c3b9c3511","observation_id":"abfdc2e7-f26b-4d39-870d-914537ff166b","resolution":{"observed_at":"2026-05-24T02:18:46.348068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A convergento(n) temporal-diﬀerence algorithm for oﬀ-policy learning with linear function approximation","venue":null,"work_id":"ce6c0ec1-df99-4a5e-8856-fcda5f2a1d53","year":2009},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:bb53f007d93fb45d57fa9e85b7bec2be55ed01b11d360afdb6fe498eb06c7daa","observation_id":"5cabdf23-b006-4da3-9391-af2b85ac67a8","resolution":{"observed_at":"2026-05-24T02:18:46.250979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast gradient-descent methods for temporal-diﬀerence learnin g with linear function approx- imation","venue":null,"work_id":"1a7a6c6b-d5c1-4d1f-ba0c-a29ea64ded44","year":2009},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:69cfcf734f4cc0810c37a8246b88c1e76ddc1f1bfcf34f5498803bfdc718f20d","observation_id":"7a3deb8f-347d-4773-bf42-85f8de6abaa5","resolution":{"observed_at":"2026-05-24T02:18:46.255130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient temporal- diﬀerence learning with regularized corrections","venue":null,"work_id":"7cedfc65-10a5-43fc-b19f-c099b9eb437a","year":2020},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:e656140539cc4dc77563ac2af51729f6a19c4965af3d3619de65567d5d5c7f4e","observation_id":"693dfff2-9f50-4540-880a-b40f038321cf","resolution":{"observed_at":"2026-05-24T02:18:46.328433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"New versions of gradien t temporal diﬀerence learning","venue":null,"work_id":"21e11bc0-9ffb-4e74-b401-3a4d9083a8b1","year":2022},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:7d68adab56d3415092d695c8020fbcf2194b5b08783a04d29f51924e61493ce9","observation_id":"204f6c31-5ca5-4b2d-b4b6-72f465bb9dee","resolution":{"observed_at":"2026-05-24T02:18:46.243220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis of reinforc ement learning with function approximation","venue":null,"work_id":"e79b5cee-cb9f-41ef-ae9f-9cc34a10bebd","year":2008},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:6aa1d9354d231b84b28dc8f24a5d9342e070de408c01805e14b5f94c5244393c","observation_id":"4aba900d-c1bd-4a37-9a71-398796c44c6e","resolution":{"observed_at":"2026-05-24T02:18:46.343943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bhatnagar, H","venue":null,"work_id":"69830950-c3ea-4d53-b67f-1d35d5a282aa","year":2012},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:1d36f2c34bd9555b063c62e5f7a6b928c1af67114dfedcce5e37ce652104e72b","observation_id":"6d5195b9-accc-45cb-8d72-6cac39780f78","resolution":{"observed_at":"2026-05-24T02:18:46.340034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforceme nt learning with deep energy- based policies","venue":null,"work_id":"676200d6-1d62-46d2-935c-e2e6773082d7","year":2017},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:fb1c4caf474dcb15636b4e11bf4a49f459522789375c7706d781257d7568177d","observation_id":"b73ef3ca-4540-4b9d-accf-a535f093520c","resolution":{"observed_at":"2026-05-24T02:18:46.239204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting the softmax Bellman o perator: New beneﬁts and new perspective","venue":null,"work_id":"e7c52320-9990-47fc-a479-013e7036f9d4","year":2019},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:cb806100c28925eea5a00d90367583d3fe050139edd39f8e8bf4755bbe2681c9","observation_id":"caac22d1-c0e6-4d43-8d40-de4bfbb0653e","resolution":{"observed_at":"2026-05-24T02:18:46.246923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcemen t learning with dynamic Boltzmann softmax updates","venue":null,"work_id":"bbe787f9-29d9-4899-ba33-83cf8348bc25","year":2020},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:447032f15f63bb9460a5683f0232b032291eb98e4de1bed731ffb261606867ca","observation_id":"17a14c53-3214-4ba0-8949-8cb9d795d29f","resolution":{"observed_at":"2026-05-24T02:18:46.258916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An alternative softmax operator for reinforcement learning","venue":null,"work_id":"e7bd81b1-1ac9-4d53-b730-7a086e8ed764","year":2017},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:0d116e62c4ba2283be5fe7c0363036c013725b63c4080b20fe10562d57a4a36a","observation_id":"1433e224-7f39-4771-875b-1805dec87a05","resolution":{"observed_at":"2026-05-24T02:18:46.289210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08631","last_updated":"2023-03-15T13:58:07Z","snapshot_observed_at":"2026-07-06T15:03:42.770608Z","submitted_at":"2023-03-15T13:58:07Z","title":"Smoothed Q-learning","version":1},"cited_work":{"arxiv_id":"2303.08631","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.08631","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smoothed Q-learning","venue":null,"work_id":"f7ec2f8c-f12b-4022-b6e4-a10789aefd09","year":2023},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"cited_paper":"/paper/2303.08631","citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:a21349f3d7b2fce8be93fda6d45298a1459ea2d635e077018825e1d3b770475d","observation_id":"c9cbe175-75fe-4ad1-9b5a-0807d9c9e361","resolution":{"observed_at":"2026-05-24T02:18:44.864713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analog scheme for ﬁxed point computation. i. theory","venue":null,"work_id":"c9b3d4ba-63ef-4a0b-b225-3c64e423abac","year":1997},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:a8edfe3d985d90ed392b2c917abbed05fc49b86d43633ca5ca4d88fe87a9ca41","observation_id":"c3c3ef14-6946-4d41-a43a-5a3413f9668f","resolution":{"observed_at":"2026-05-24T02:18:46.223591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liberzon, Switching in systems and control","venue":null,"work_id":"033ac284-6b45-44da-9a96-f4b48c1cc993","year":2003},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:e36a5b9b253c5d4a2b63baf1bbd4686ae50792579e5d53e6407a52142f940d7b","observation_id":"4ccd7d8d-3fc9-4caf-8f24-dc6aee59cf7a","resolution":{"observed_at":"2026-05-24T02:18:46.227607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniﬁed ﬁnite-time error analysis of soft q -learning","venue":null,"work_id":"64ffb7e7-7003-43a5-9e22-30952705d5cf","year":2025},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:c64eb9b39a7f71840f3e45faeed003e35c67250118f205baafb13cd418eee20f","observation_id":"c4216a61-52e0-47cb-99a4-797ce582ce96","resolution":{"observed_at":"2026-05-24T02:18:46.231158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SBEED: Convergent reinforcement learning with nonlinear function approximation","venue":null,"work_id":"09841115-f667-4dc2-8508-7291d2ac1b07","year":2018},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:e39c6248d4a6636a1616ab7ec992cddf8fcee373315e71296a19c391d268d6ca","observation_id":"cd0296a3-0135-48af-8b76-e08200c65e47","resolution":{"observed_at":"2026-05-24T02:18:46.393955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00805","last_updated":"2018-08-21T00:02:44Z","snapshot_observed_at":"2026-07-06T05:36:24.195368Z","submitted_at":"2017-04-03T20:50:29Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1704.00805","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.00805","snapshot_observed_at":"2026-06-29T00:02:50.326473Z","title":"On the Properties of the Softmax Function with Application in Game Theory and Reinforcement Learning","venue":"math.OC","work_id":"9c212edc-125f-4fbf-84ea-a495bf87b6e6","year":2017},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"cited_paper":"/paper/1704.00805","citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:ba24cf8b1bf88a6a7e38b85317ecc2fd313dab8ec89017915dbbe04667f129d5","observation_id":"e7867490-3ee2-4be7-bba1-08f01f5863cf","resolution":{"observed_at":"2026-05-24T02:18:44.871063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonlinear systems","venue":null,"work_id":"b5302d51-6157-47af-9fbd-902d61f4e445","year":2002},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:2528abd915611c5af69b50436da87aa07a93131fa0ebdbc012d5758391b2bb8a","observation_id":"c7906621-92a0-4863-9e1e-4e29722253d2","resolution":{"observed_at":"2026-05-24T02:18:46.215869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"090a6ed2-79b3-4ae4-b925-613a6dd22367","year":2009},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:70bc64f8431e8ec7e55402f4961c6bfcf561cd31c60b153a9a87a5ab1e0ffa24","observation_id":"735754e0-fd8d-4e28-9998-1128d45754de","resolution":{"observed_at":"2026-05-24T02:18:46.207860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-time analysis of asynchronous q-lea rning under diminishing step-size from control-theoretic view","venue":null,"work_id":"cd2cf82b-f823-4254-82a9-c1ca39977a95","year":2024},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:eae0d3311c81cb13e82f2b77bea16583dd3c34b0aca8a02a5007d1f37def5b5a","observation_id":"24dc0017-51c2-4ee4-b328-425d730c6cd4","resolution":{"observed_at":"2026-05-24T02:18:46.378810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kushner and G","venue":null,"work_id":"b624765d-2315-4ad5-8765-71bb7a2844e4","year":2003},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:e49b7658bf7ae88171d913e819f15e5c820b6359ffcbfc90f36309960e4829d2","observation_id":"050e7beb-d5ec-420e-9067-70bae24944e8","resolution":{"observed_at":"2026-05-24T02:18:46.262508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A stochastic approximation method","venue":null,"work_id":"159800ce-5c85-4bda-a7e2-628be6ac2896","year":1951},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:6c81bff92c14f2478231db9b9771a94076edc1e78ae8f61b585a7eb71fbcf1bc","observation_id":"32c53f3e-5a1b-4ad3-b662-a2f586b033a8","resolution":{"observed_at":"2026-05-24T02:18:46.277565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Note on the derivatives with respect to a param eter of the solutions of a system of diﬀerential equations","venue":null,"work_id":"77918cc1-209e-40df-846b-4217abdc22fa","year":1919},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:b1bbb0580abe7216a5b67f939e623e65a8a772c0bc04cb48ec172e2bf51e9050","observation_id":"c172d941-e6d5-42d4-87ed-2fa7b06a56d8","resolution":{"observed_at":"2026-05-24T02:18:46.382288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aaa084e1-d502-4435-bc7e-57f8b391d2d1","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:0cb5e710cf8848ecde35fee9434513e5b4e7158c83698a884e6c6288215e949d","observation_id":"95d2fe58-6c54-4e9e-a64a-e294ae96110a","resolution":{"observed_at":"2026-05-24T02:18:46.390422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b4bbb90a-9fd2-4fbb-88f4-b1ce8499ce3b","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:3d1766251e165330ba731dd373b61e4e8b165eec64b4f12602194d65283c1fb7","observation_id":"cef9e683-cc38-4edf-8937-083424958d00","resolution":{"observed_at":"2026-05-24T02:18:46.375125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9ec3ac89-2a1c-43dd-ba88-e2cbfb4bec59","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:9ca42bac2896130d616ff87211b39080856cc9c3e06ee2881b27e0dce4efe8e8","observation_id":"57f7574a-3fbe-4ece-924f-b63212d35649","resolution":{"observed_at":"2026-05-24T02:18:46.371153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In addition, there exists a constant C0 < ∞ such that for any initial θ0 ∈ Rn, we have E[∥εk+1∥2 2|Gk] ≤ C0(1 + ∥θk∥2 2), ∀k ≥ 0","venue":null,"work_id":"827f75de-4c1c-4125-9831-2cdb44c36c0f","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:5be21a617afd63b46d6cd2737ca15b13d6bf452504eb06d873d033364b020aff","observation_id":"0d6a051b-712a-4517-a989-a9d2cc61b94b","resolution":{"observed_at":"2026-05-24T02:18:46.386309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"(17) Lemma 2 ( [5, Borkar and Meyn theorem])","venue":null,"work_id":"29a8aabd-8618-4d59-b0c2-4c571dba11aa","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:7a06a6df7f37d69a9c4d51f6ea6bb7f6b48666771d1252ecd4a30dfa2eecebf1","observation_id":"2a9b36a8-47c3-4aaa-950e-ec246c9e1213","resolution":{"observed_at":"2026-05-24T02:18:46.356212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2fdc036e-1908-4b34-a84a-5a682a5d6ed5","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:ad181cc2a098f3dcaf61a0acdfa09bc50fe2ec2c3ba84007f4dbab117c76149e","observation_id":"17ef970e-76f9-4dba-9839-10f99c0c24c1","resolution":{"observed_at":"2026-05-24T02:18:46.332290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"e., xt → H as t → ∞","venue":null,"work_id":"de75c928-f4f9-425a-8454-5d23d7f7c347","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:81545b64a7b3e8189d6ab6155cd55e3bc0f794bdaf57f7016a2db27584b1ba8a","observation_id":"bd502002-6b8c-4ffb-93ce-801bda678d54","resolution":{"observed_at":"2026-05-24T02:18:46.351917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b4cb1074-c252-4063-a9cd-86a499bcd7b1","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:7ca812d3b82970257c7b599f585d03ac727f41c05af04b716647d85679c9439f","observation_id":"953d76c0-123b-4329-9b10-d072fc4b4707","resolution":{"observed_at":"2026-05-24T02:18:46.318953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In addition, there exists a constant C0 < ∞ such that for any initial θ0 ∈ Rn, we have E[∥εk+1∥2 2|Gk] ≤ C0(1 + ∥θk∥2 2), ∀k ≥ 0 with probability one","venue":null,"work_id":"1cc7c6e8-7a54-4ac1-b0c0-eab233726d3f","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:b77a1f2b223b3cb37ef70215e852deee01510abc6ca482a2af1cbc801d259db9","observation_id":"847b5ecc-aada-4ca9-a4a9-3bfd396e8cfb","resolution":{"observed_at":"2026-05-24T02:18:46.323053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lemma 3 ( [38, Robbins and Monro theorem])","venue":null,"work_id":"f1c89fc3-0213-484a-98ee-01d359a6c5d3","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:390f6f668725ba8206e133be72b921f6d17bd13aed75f5bdd268a113c9dda25e","observation_id":"fedb40c7-9b3e-4a52-a6c6-962792dfecda","resolution":{"observed_at":"2026-05-24T02:18:46.304156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f6638668-b96c-42c4-bafe-f4dd5df3db3f","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:907759bb678f36835772d1def0180b49be75a2bbf0a4e59dcc8f842e331dd8e0","observation_id":"bf4b9f89-163f-47a2-b39c-5d7cd9189a5d","resolution":{"observed_at":"2026-05-24T02:18:46.307533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f7074329-fbf9-4ecc-9fcb-a799baeb413c","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:052b716f119eef748f8b4f2fed92b7ec08770935b7db03b70a6090d08eda39c2","observation_id":"bab10916-60a6-4e11-8ef4-d5546f33dcde","resolution":{"observed_at":"2026-05-24T02:18:46.211937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"340980e3-22cd-411c-a068-80f1a0cfed8b","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:caf1c2521b171c0fcff2599b35e2cf7ed1a93917baf44a5df311c8460f34a243","observation_id":"6ab92562-9ef0-4b49-a867-6ad80717bbd4","resolution":{"observed_at":"2026-05-24T02:18:46.219677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f0f7d345-0be4-47d1-ac31-f7ace4162378","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:ccb48cbad8a0f38db390c6f05ef0cc1324e1b4798854d4a582735f1608eec74c","observation_id":"81f93788-b4a2-4b42-bc07-c7a8f24104bc","resolution":{"observed_at":"2026-05-24T02:18:46.235369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f08ebf7-b6e4-4f46-857d-8587953885b7","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:7b86d420fdeb6db0071e4037618007c9600cc08ac235d563636dad57754cf166","observation_id":"957cb86b-a636-4770-9002-2d478f663253","resolution":{"observed_at":"2026-05-24T02:18:46.359694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e384075-a713-4561-a1f0-4798176806ba","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:43d156dca0b47150de71260e164f19c8cfec263aadc0925d26959c5123d4a919","observation_id":"ba9ee95d-defb-4058-8cb7-b920533667ff","resolution":{"observed_at":"2026-05-24T02:18:46.199127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4509bc0d-2c99-4267-8f12-f9f4d61844e5","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:fe69916c7b848ef4f064877f0d9925e3b9a0276198f0219ce9899c8ac7f69edd","observation_id":"88507e15-fe43-4157-9df0-a16ac61a0deb","resolution":{"observed_at":"2026-05-24T02:18:46.203427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4eeeb03f-b27e-4511-afab-c4a55ad63345","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:b17843faf6eeaf9577dae6ce1341277e49b0186c589a293b44ce57bc67e75979","observation_id":"c3e5cecb-3e8e-476f-9c74-c433b45fc8f4","resolution":{"observed_at":"2026-05-24T02:18:46.193553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f2d5d19b-6ae0-4c71-a4a1-a4a79912b462","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:cbaafb8a5555b4adcf45379a95b1dd1634158be53bb0d1cb1b7b431abdda3e5b","observation_id":"1cebaad9-9ca5-4902-849a-8696c85bcc4a","resolution":{"observed_at":"2026-05-24T02:18:46.336276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6f4ea44b-1bc7-41db-9c2c-46788a99034e","year":null},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:58003f8357a280410f25cb1dc949a18750bf8ecd161d8848e0840904ad714f3d","observation_id":"0d384e2e-326c-4254-8c83-ed913515de1b","resolution":{"observed_at":"2026-05-24T02:18:46.189893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Similar to the ODE case, the ﬁrst three rows (max, L SE, and mellowmax) show that the trajectories converge toward their ﬁxe d points as proved in Theorem 5","venue":null,"work_id":"810e4ccb-e654-4db5-944c-e99c7dfc5c96","year":2000},"citing_paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms","version":7},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-24T02:16:04.596951Z"},"links":{"citing_paper":"/paper/2404.14442"},"observation_digest":"sha256:9aad9de28b84e09109647ad60ffea746deb3f62c433f52117886b81ed323b8df","observation_id":"eebe205d-ebd2-4f70-bb88-8a39c3398e8c","resolution":{"observed_at":"2026-05-24T02:18:46.315604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-22T06:31:00.163083+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.14442","last_updated":"2026-05-11T13:49:35Z","latest_version":7,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T18:03:55.981890Z","submitted_at":"2024-04-20T01:16:27Z","title":"Toward a Unified Lyapunov-Certified ODE Convergence Analysis of Smooth Q-Learning with p-Norms"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":54},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-22T06:31:00.163083+00:00","source":"crossref"},{"observed_at":"2026-07-22T06:30:55.410749+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2404.14442."}