{"as_of":"2026-08-08T00:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a50d3cae1aef68fc2d41eca8021dd99bb3f882582859df586ea825182cd0cccf","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:19:48.526180Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05968/citation-record","integrity":"/paper/2506.05968/integrity","json":"/paper/2506.05968/citation-record.json","paper":"/paper/2506.05968"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:45.614896Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:45.614896Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:37aa4b9eceec589084116349c9f640ad2dac73419fc5134e32a9279d666a58f3","observation_id":"74e6c653-6a1b-4973-b4a1-9294f7e4089e","resolution":{"observed_at":"2026-08-07T10:19:45.614896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:53.316314Z","title":"S., Courville, A., and Bellemare, M","venue":null,"work_id":"eed46b21-dfd9-4d7a-80fd-d21a9d29f5de","year":2021},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:45.701112Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:5607dd4b56913fed0631cff5deae3df3a9bf544eee915e6d998dc40adbe9f299","observation_id":"5a08e0af-1b8e-48e7-b92f-3e42aa666699","resolution":{"observed_at":"2026-08-07T10:19:53.429166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:53.039426Z","title":"P., Piot, B., Kapturowski, S., Sprechmann, P., Vitvitskyi, A., Guo, Z","venue":null,"work_id":"e005ac7d-f835-4ff7-8c2b-6deffd1e475f","year":2020},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:45.756172Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:1a5ec5373fa28a5bad282a84ec7cca65296873db71cbcc4bcc0df761824d3a64","observation_id":"45079820-dde8-4551-8f97-e5219b05fda6","resolution":{"observed_at":"2026-08-07T10:19:53.179191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:52.835232Z","title":null,"venue":null,"work_id":"51c977c2-1b3f-43b1-8292-9068c8172edb","year":2021},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:45.842821Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:40e9d81bd18526dc9acd75c663a680dc36e62f39dda9b3b2c848e4a07c755cfe","observation_id":"b45f3e0e-0cd1-46ca-9229-5a4b4b04e45e","resolution":{"observed_at":"2026-08-07T10:19:52.930988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:52.681372Z","title":"G., and Courville, A","venue":null,"work_id":"1d20b9cc-de17-4027-9ad5-4638c070c44a","year":2023},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:45.953313Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:cfdd83a5d94438e9405e4997632d00167af685fa4114aaf8c4d46bf3bfe3ffa2","observation_id":"1013eb96-90e9-44e8-9bf9-e923536a9d37","resolution":{"observed_at":"2026-08-07T10:19:52.768549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:52.383425Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"923446f3-afb2-4511-be69-c60a0514a392","year":2018},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.036985Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:ee21a661ceb0c4c8e431ba0a4b544d934ff7bf71940fbf23e693566c0fe92f31","observation_id":"c5e87e7c-7cf3-4f7a-acd6-c4e0c3a5e466","resolution":{"observed_at":"2026-08-07T10:19:52.533275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:52.017475Z","title":"Extreme q-learning: Maxent RL without entropy","venue":null,"work_id":"b101232c-6895-4da5-96ed-cca55772dab6","year":2023},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.160570Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:4a883d4e8ed1b0eecdf0de3e4602fd01abe40757b1324eb355fcf9a81a83504d","observation_id":"615f40d1-1469-45de-88b2-87b8ae539466","resolution":{"observed_at":"2026-08-07T10:19:52.217667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:51.807042Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"8c6ef3c4-e99c-44ce-a837-4bd8157ac4db","year":2017},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.253819Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:220aebcafa4bf1a2941c7cec1aa71f145a340590a0a7e6055880799c1df86ad8","observation_id":"f268b2a8-9a3c-48e5-ac1e-0112a52da0c5","resolution":{"observed_at":"2026-08-07T10:19:51.890421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:51.511254Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"7411e531-59ab-47f2-ad78-d1567ce3cbf6","year":2018},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.332706Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:b56da77a92fc29de41dd032d9a9bb8a74d7e47a1c05806a5640e43a01c39ee98","observation_id":"5ce08810-5d86-4fcd-880d-ab9041f99c4f","resolution":{"observed_at":"2026-08-07T10:19:51.632867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:51.235655Z","title":"and Montana, G","venue":null,"work_id":"83a1bb03-2377-4697-a080-d6ee2e35a6c9","year":2024},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.423189Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:e17728e17ea96127310c3f80a2b2caea21411036b9b7641f08ee7521dbdcaeca","observation_id":"de6e7585-9838-4414-8067-1fdabd457bb0","resolution":{"observed_at":"2026-08-07T10:19:51.407864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:51.010109Z","title":"Seizing serendipity: exploiting the value of past success in off-policy actor-critic","venue":null,"work_id":"4ee37037-1406-4bae-92d4-8b65cf5b2f67","year":2024},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.499898Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:58c7b421a1094000b76d79ae2c34881b06d091a446c1f28bbfe18c2f53b920fa","observation_id":"c6880da0-a7c5-4aa6-86ec-43e00e352a7f","resolution":{"observed_at":"2026-08-07T10:19:51.117765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:50.844670Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation","venue":null,"work_id":"d351a6f8-157c-4de4-8028-6d82f737dc66","year":2018},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.565608Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:499f78aa2dddc02fbe0051bdbb0fbe556c7ccc0465d4d487614f884a3d843f7f","observation_id":"56b0703c-6b37-4983-9bb8-31292def33a7","resolution":{"observed_at":"2026-08-07T10:19:50.905539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:46.634948Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.634948Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:75f46806638ce8c38db2b64c640701f13717bbada10a637a1c3d14f76b056d0e","observation_id":"a42b7053-01e2-453a-b0b1-4cd20fc06f7c","resolution":{"observed_at":"2026-08-07T10:19:46.634948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:50.553933Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":"8c872c90-aa97-4954-a337-d546ab312251","year":2019},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.698273Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:e1728cdbcf39b717f1dc955d6b381a292e2695f540512646fa3a8b249abc3915","observation_id":"52bab990-8632-44ea-8975-839eadde2fac","resolution":{"observed_at":"2026-08-07T10:19:50.694062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:50.349282Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"47d65a67-aa4a-41a8-b6df-3c5c85b5b626","year":2020},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.770953Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:d1c1e29dd9a337d346bcad0694219b3f8aa2ed8fdbfd24e0ed10bef7676bd6be","observation_id":"3b0fc27d-a44b-4f6f-9c8d-a40993c67cb9","resolution":{"observed_at":"2026-08-07T10:19:50.480294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:50.167190Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning","venue":null,"work_id":"b870b57b-573d-4cd6-b993-1b9c1f1bcf11","year":2020},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.831857Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:a4c343c7924b12738bd4b8b089e64ed7fd2410ee612fbadc1530b86cef51075c","observation_id":"02c3b8f7-5121-48ec-b9d4-4ba63752c3a9","resolution":{"observed_at":"2026-08-07T10:19:50.243561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T10:19:46.934739Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:46.934739Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:0fbc4a5e58fabb5341d24eec1dbf659d1609e26977bf3bdba6f09f366c39cc36","observation_id":"881e225e-6388-435d-a79a-5ca3fe2a34eb","resolution":{"observed_at":"2026-08-07T10:19:46.934739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:47.029223Z","title":"Playing atari with deep reinforcement learning, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.029223Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:ccfc02d198fea1f5e629b149ffa138fbcddbe0d49809ac41a9a5a2106aea440c","observation_id":"6facc739-eb3e-4637-98f3-83ab11f51b1f","resolution":{"observed_at":"2026-08-07T10:19:47.029223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:47.140492Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.140492Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:76e574dd6341c7b8f9e99d27b6154d9aa4e17ed6653146a7d66d6cb9e1f65589","observation_id":"b5d58713-2671-421c-a068-32ac12f65beb","resolution":{"observed_at":"2026-08-07T10:19:47.140492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.992616Z","title":"Curriculum dropout","venue":null,"work_id":"6452d7cf-632a-4f75-9c34-ef194bf4ee80","year":2017},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.193512Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:362e67c57ae244b123247ba663ead69a5c4e992a38668fa7b72a900146f912ec","observation_id":"b359830d-c8cd-45a7-9fd2-ceabd3fa7bc2","resolution":{"observed_at":"2026-08-07T10:19:50.064348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.925707Z","title":"Stabilizing extreme q-learning by maclaurin expansion","venue":null,"work_id":"32424007-cb2d-421f-9573-72372312d821","year":2024},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.263505Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:554cf9affbaa6aa05319a52d4776ac1daaea648ec4fc8e6f9b5eb2dfd76b9197","observation_id":"3d6005e5-7c19-40d1-addb-4b852fb2fe78","resolution":{"observed_at":"2026-08-07T10:19:49.970652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.812649Z","title":"and Niranjan, M","venue":null,"work_id":"22c00c2c-6475-4f61-b6fc-5d380b150c3e","year":1994},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.342525Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:f16f9f707bb313fbe616d11a5571fa0d75dda3954cbcec19b36b31f1847b0312","observation_id":"03340be4-19ca-4bad-aa9b-5a9dcd729d3f","resolution":{"observed_at":"2026-08-07T10:19:49.866604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.747089Z","title":"Trust region policy optimization","venue":null,"work_id":"fd09c0f4-0a3a-471a-8a40-0dcb3cb14233","year":2015},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.409151Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:411d2c864367b810bfe7f1831d442bd874c7d73b2d5128aea5f39538a45c99fd","observation_id":"ab148013-765b-4f15-8fca-d6660c3ab6d3","resolution":{"observed_at":"2026-08-07T10:19:49.776975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:47.463138Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.463138Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:3694cfba8fc192c2535926b5686b7163fe9650c4eb43659f68da6fc2ae81300f","observation_id":"7f6d060f-9686-4adb-a57a-768e76528ca4","resolution":{"observed_at":"2026-08-07T10:19:47.463138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.621293Z","title":"Solving continuous control via q-learning","venue":null,"work_id":"47094377-0df7-4775-af72-a2f7b4a6a01b","year":2023},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.567098Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:6c83df1735f0b8fd68bd92fcb389816677710cd74ef8541b40d53d7524a59b75","observation_id":"c87f85e4-8b3d-4c0a-9f5b-cc00c061ec5c","resolution":{"observed_at":"2026-08-07T10:19:49.667511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.521889Z","title":"Growing Q -networks: S olving continuous control tasks with adaptive control resolution","venue":null,"work_id":"8293d7a4-e5a2-431d-9f11-55e9b7c5f544","year":2024},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.665258Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:4cfe67597b9df06765e95982a3ea533437f64627f326c210aa028fed37eb6fba","observation_id":"e9f5f068-c203-4565-aeb8-405dca379fed","resolution":{"observed_at":"2026-08-07T10:19:49.559832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.408932Z","title":"Dual RL : Unification and new methods for reinforcement and imitation learning","venue":null,"work_id":"b55a0806-765c-42a0-bfd8-576a3ede94f5","year":2024},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.739882Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:de9707f21c5fabfc1e702ed50bff3ad629cf9db307bd1b600604f99c9ae7b5ae","observation_id":"924d39d6-b358-436e-a5da-3c2b6a0cbbef","resolution":{"observed_at":"2026-08-07T10:19:49.478106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:47.818822Z","title":"Learning to predict by the method of temporal differences","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.818822Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:efe251a4c76baf99da7e29afb6dbaf6ab63838b0651967cf481f4489472c4ee2","observation_id":"65d2a1ec-1373-4076-86ee-2f8c9a73238c","resolution":{"observed_at":"2026-08-07T10:19:47.818822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:47.874160Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.874160Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:665d867fb3d8767fb4f81d5ca5423e07dfeb0affb854e6ae19dc1d0c6958f538","observation_id":"1fa07a46-5611-4109-8c48-654dcdd26bf6","resolution":{"observed_at":"2026-08-07T10:19:47.874160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.274337Z","title":"Deepmind control suite, 2018","venue":null,"work_id":"55edb593-4d53-480a-9eae-97c1bdc8b592","year":2018},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:47.949840Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:ba911e92431083737c38ad3fab1a6c32fdac9074d418d8c8397a361a60101b32","observation_id":"ac71ebbe-adae-4ae9-8bb1-1263ef7bbdc6","resolution":{"observed_at":"2026-08-07T10:19:49.324942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.164395Z","title":"Action branching architectures for deep reinforcement learning","venue":null,"work_id":"79f3542b-d1a6-401c-9266-46881611f4ba","year":2018},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.022560Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:45579dc382dfa7ebaf65489acb7e40036768067b75c100e78254dec41c5cb73b","observation_id":"50bf035f-377f-4013-907d-d15fe03e0952","resolution":{"observed_at":"2026-08-07T10:19:49.202948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:48.122721Z","title":"A deep hierarchical approach to lifelong learning in minecraft","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.122721Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:7b53b146069db27564941c9998843a321348e3d848d129ef13d3f70575b8a414","observation_id":"423310dc-48f6-40a0-a343-1e8d9b011de3","resolution":{"observed_at":"2026-08-07T10:19:48.122721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:49.045668Z","title":"and Schwartz, A","venue":null,"work_id":"939b8ca2-42da-45d5-acd5-d42a7a580f23","year":1993},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.202504Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:7d74f7d369518ef14e02bf0842d96ef634614d41049ab5dc98f1a68ea4db0087","observation_id":"0e3a9e91-1812-4068-9ed5-f05dd61910fb","resolution":{"observed_at":"2026-08-07T10:19:49.108975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:48.288319Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.288319Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:b9f518500f674cba6bf42316e8286e065b3c882b9e0659201fd69519c5350c30","observation_id":"7b510924-3e4f-40b8-9538-aa1f4b053952","resolution":{"observed_at":"2026-08-07T10:19:48.288319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:48.919508Z","title":null,"venue":null,"work_id":"cffd0499-cd8e-4888-ae59-b434e7e1340d","year":1989},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.364793Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:2b018706cf148deab6072011aa476b13b09264794177a741cfd2a03c1fb86a2e","observation_id":"7a28cff0-59c5-41b6-999e-9d67139228da","resolution":{"observed_at":"2026-08-07T10:19:48.975376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:48.449376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.449376Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:3e6811167ae7963a8cb67a45107c4b955bb6879106c8596cf6d9aa9d6f8c22e3","observation_id":"43eeef58-3b37-41e5-9679-cb3fedc0bc5e","resolution":{"observed_at":"2026-08-07T10:19:48.449376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:48.751801Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"c70e57c1-6def-445d-b952-57c316e9eafe","year":2019},"citing_paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:19:48.526180Z"},"links":{"citing_paper":"/paper/2506.05968"},"observation_digest":"sha256:6aab70dd60d4f9b6daf338e4a1f068bc46e3f20efd20245656eef621034d3553","observation_id":"a0aa191d-f2e4-40fa-9ff7-402ae11b50b8","resolution":{"observed_at":"2026-08-07T10:19:48.813577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05968","last_updated":"2025-08-13T08:35:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:10:51.403042Z","submitted_at":"2025-06-06T10:46:20Z","title":"Gradual Transition from Bellman Optimality Operator to Bellman Operator in Online Reinforcement Learning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2506.05968."}