{"as_of":"2026-08-08T16:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97ec1c5fa2a096b1fc3923d5ac2ca9c69de9906a83fc6bc8414a29635b004092","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:45.632354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.943655Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-07-06T15:18:07.416392Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T13:48:36.369334Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2304.10573"},"observation_digest":"sha256:9ceb0de61cb55f8357053fd318c0894e1574ab7801a15df472a3fab4f4f68b29","observation_id":"575ff729-ed03-4652-b4e6-6f605c574e73","resolution":{"observed_at":"2026-05-13T13:48:36.476653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T14:14:45.632354Z","title":"Extreme q-learning: Maxent rl without entropy.arXiv preprint arXiv:2301.02328,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19923","last_updated":"2025-05-26T12:45:54Z","snapshot_observed_at":"2026-08-07T14:01:31.748245Z","submitted_at":"2025-05-26T12:45:54Z","title":"Learning to Trust Bellman Updates: Selective State-Adaptive Regularization for Offline RL","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.632354Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2505.19923"},"observation_digest":"sha256:7f0ad93ec2c2ec6a607ca781d39f19d7737b90e8e0fbc603cdfad6f2796353c4","observation_id":"202fe6ac-af03-4756-8236-36e4ef3b38c3","resolution":{"observed_at":"2026-08-07T14:14:45.632354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T05:22:24.560434Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08417","last_updated":"2025-06-10T03:43:22Z","snapshot_observed_at":"2026-08-07T05:09:28.766545Z","submitted_at":"2025-06-10T03:43:22Z","title":"Offline RL with Smooth OOD Generalization in Convex Hull and its Neighborhood","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:22:24.560434Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.08417"},"observation_digest":"sha256:094dee5e9061c69d58aacfda56ddd5e0ffae830ce30676d6969b2e2c426a2016","observation_id":"14dd046c-95d9-4c78-9362-9a3b7e400315","resolution":{"observed_at":"2026-08-07T05:22:24.560434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-07T04:27:30.548506Z","title":"Extreme q-learning: Maxent rl without entropy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12095","last_updated":"2025-06-12T11:39:21Z","snapshot_observed_at":"2026-08-07T04:19:53.564835Z","submitted_at":"2025-06-12T11:39:21Z","title":"DoublyAware: Dual Planning and Policy Awareness for Temporal Difference Learning in Humanoid Locomotion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:30.548506Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2506.12095"},"observation_digest":"sha256:91cffae66b0f16711fcfbda32adcf3877f8ef91efe49cee3ef4375906afb962c","observation_id":"6b556c63-0a75-4c9d-a391-14da58e48501","resolution":{"observed_at":"2026-08-07T04:27:30.548506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:ad36ed11d140ce8090d46d1d435bd6800dded48de21b8db1cd0848e997f38008","observation_id":"09ecb643-05b9-49bf-94ae-8708d9a5997a","resolution":{"observed_at":"2026-05-10T06:51:46.587307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:52b41292efeded0f7bf0ed65b6648f5abda64dcc4204263aa064017dfc15a9a6","observation_id":"d11e5360-8f6a-457d-9fe9-64a546f422c7","resolution":{"observed_at":"2026-05-11T08:56:00.657389Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.06104","last_updated":"2026-05-07T12:20:25Z","snapshot_observed_at":"2026-08-05T12:13:27.618448Z","submitted_at":"2026-05-07T12:20:25Z","title":"Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T13:56:01.365382Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.06104"},"observation_digest":"sha256:0f5c8b161b54b5ba57ddcc8d3f72d116b815249ddd017c2d86e453df68670036","observation_id":"bf7a61dd-b81f-4142-a925-aa35fc35e55f","resolution":{"observed_at":"2026-05-11T18:46:10.148459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.14779","last_updated":"2026-05-14T12:48:44Z","snapshot_observed_at":"2026-07-06T23:26:09.066863Z","submitted_at":"2026-05-14T12:48:44Z","title":"Peng's Q($\\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:43.298829Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.14779"},"observation_digest":"sha256:ae399573098bf66d77815d87a16edc874374f0bddd2d4a4b541d6550407df924","observation_id":"3d758c3f-83aa-4a98-86e0-7347ec0464ca","resolution":{"observed_at":"2026-07-01T14:25:45.853436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2605.20408","last_updated":"2026-05-19T19:04:47Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:04:47Z","title":"Spectral Souping: A Unified Framework for Online Preference Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:56.356555Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2605.20408"},"observation_digest":"sha256:82ea0c16aaaf5542d6e75557f6b89aafd538182832617cd464ffde9fccb419a7","observation_id":"0729d11e-2144-4596-9322-bf9bc9c14bbb","resolution":{"observed_at":"2026-05-21T07:59:50.924661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":"2301.02328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-07-03T04:17:36.943655Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":"e99ef3f5-ad9c-46de-ac20-b3ff28a87b76","year":2023},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:14f42cfccee19e11285e3b6414c91f0a1b36ddc14e1f578780affffcca37a08a","observation_id":"e8b078c2-2a53-450e-8180-6e537c3574f3","resolution":{"observed_at":"2026-07-03T04:17:36.945140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-01T17:45:22.550304Z","title":"arXiv preprint arXiv:2301.02328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":269,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:22.550304Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:7997d182eafa9bf9698099475a0da1184d21188a985451eb0625339c77fd6499","observation_id":"b8ac3f31-467e-42f2-b8c9-b082063529b4","resolution":{"observed_at":"2026-08-01T17:45:22.550304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2301.02328/citation-record","integrity":"/paper/2301.02328/integrity","json":"/paper/2301.02328/citation-record.json","paper":"/paper/2301.02328"},"outbound":[],"paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T01:37:06.867043Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2301.02328."}