{"as_of":"2026-08-22T02:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2adc61b5169699809947d3ea72a7329f900eed0bc5f4fcc68b704be6c726f24","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:17:41.939227Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:43:15.128113Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-12T19:02:50.926448Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11099","last_updated":"2024-11-17T15:00:39Z","snapshot_observed_at":"2026-08-17T13:01:35.480466Z","submitted_at":"2024-11-17T15:00:39Z","title":"Mitigating Relative Over-Generalization in Multi-Agent Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T19:02:50.926448Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2411.11099"},"observation_digest":"sha256:8a9adba177f34d479b4ca05f79ccbcf97e29126762311a9676eb5380684fb184","observation_id":"c7714f3f-054e-41d6-b19f-15301083ebf4","resolution":{"observed_at":"2026-08-12T19:02:50.926448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-15T22:17:41.939227Z","title":"Uncertainty Weighted Actor -Critic for Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07911","last_updated":"2025-05-12T13:34:50Z","snapshot_observed_at":"2026-08-18T05:05:18.837905Z","submitted_at":"2025-05-12T13:34:50Z","title":"Combining Bayesian Inference and Reinforcement Learning for Agent Decision Making: A Review","version":1},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-08-15T22:17:41.939227Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2505.07911"},"observation_digest":"sha256:546e06617b3f6b65626c560ca637bc60da6ddefa39c5bb80460b69c368ec2c6c","observation_id":"9e394043-acc7-4829-a3c8-2dce28da6763","resolution":{"observed_at":"2026-08-15T22:17:41.939227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2105.08140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-06-29T08:43:15.128113Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":"c873ffab-0d41-4e45-949f-aeae2e19e89d","year":null},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-08-15T17:39:17.142597Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:e53cd5a2d77370840c21a64b57b3f336c5025cf2e43290b18fcde15a50d3e86b","observation_id":"cd89333e-74bc-4e73-9bc8-3c96b01c2613","resolution":{"observed_at":"2026-05-11T08:56:00.734820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2105.08140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-06-29T08:43:15.128113Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":"c873ffab-0d41-4e45-949f-aeae2e19e89d","year":null},"citing_paper":{"arxiv_id":"2605.08202","last_updated":"2026-05-06T01:21:53Z","snapshot_observed_at":"2026-08-11T17:05:23.744856Z","submitted_at":"2026-05-06T01:21:53Z","title":"Beyond Penalization: Diffusion-based Out-of-Distribution Detection and Selective Regularization in Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T02:17:25.783688Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2605.08202"},"observation_digest":"sha256:74570a1ec98b698b516f89d84958b4b2e706f78ef6281ab4a88cfbf3c08f7651","observation_id":"9c4d26f6-1093-42de-b6f9-f4cb7be3b953","resolution":{"observed_at":"2026-05-12T07:41:50.547178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2105.08140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-06-29T08:43:15.128113Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":"c873ffab-0d41-4e45-949f-aeae2e19e89d","year":null},"citing_paper":{"arxiv_id":"2606.07592","last_updated":"2026-05-28T17:05:05Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-28T17:05:05Z","title":"UNIQ: Conformal Calibration for Adaptive Conservatism in Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T08:39:34.884726Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2606.07592"},"observation_digest":"sha256:d33580168caedf77745ee2f2729a932417dee0aa3e100ba329048d44867702a5","observation_id":"1273e49c-7c95-4b3f-84d3-f000ba58e8fb","resolution":{"observed_at":"2026-06-29T08:43:15.129743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":176,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:7b920e9ba9b32fd97615c190abc13161e67f9a4e2c6ac5c784be8aee91ccb13b","observation_id":"b02f5f93-5f63-4162-94f2-c034f54f4e04","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-02T08:40:52.852816Z","title":"arXiv preprint arXiv:2105.08140 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-15T22:59:02.741838Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:52.852816Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:1b9bad1693bc06baf1cde1d1eb7f68f161b795e35d371835c62f8085232049c7","observation_id":"3e3ed705-f1f9-4f08-9ccb-495cb2c68033","resolution":{"observed_at":"2026-08-02T08:40:52.852816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-01T14:19:58.343808Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-16T12:20:22.787261Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.343808Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:ab9459bee026cc2df908039ecb5aa56a1c629a5c76584e47f6817bd724057d23","observation_id":"a074f1fd-fa65-4776-a518-e65e3bfced2f","resolution":{"observed_at":"2026-08-01T14:19:58.343808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-01T12:41:27.456257Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning.arXiv preprint arXiv:2105.08140, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26599","last_updated":"2026-07-29T08:20:17Z","snapshot_observed_at":"2026-08-10T22:26:24.189672Z","submitted_at":"2026-07-29T08:20:17Z","title":"Uncertainty-Guided LLM Semantic Augmentation for Heterogeneous Treatment Effect Estimation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T12:41:27.456257Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.26599"},"observation_digest":"sha256:13e3cb798e71b6dc31480d6a6243775e4577e1705c49409df09cc7c7c49b7c45","observation_id":"9b78a919-2db4-40d0-8f21-70201db89ad9","resolution":{"observed_at":"2026-08-01T12:41:27.456257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-15T14:57:30.244330Z","title":"Uncertainty weighted actor-critic for offline reinforcement learning.arXiv preprint arXiv:2105.08140,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03108","last_updated":"2026-08-04T04:30:02Z","snapshot_observed_at":"2026-08-20T16:28:43.560200Z","submitted_at":"2026-08-04T04:30:02Z","title":"Convex-Hull-Neighborhood Smooth Dual Generalization: Controlling Local Correction Propagation in Offline RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T14:57:30.244330Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2608.03108"},"observation_digest":"sha256:0d721dcece36c88ba50dc49d6629a64a7f4b51d28ea7787cc7b9f2462862e980","observation_id":"685f7411-20ce-4c0a-968f-f571d87c969c","resolution":{"observed_at":"2026-08-15T14:57:30.244330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2105.08140/citation-record","integrity":"/paper/2105.08140/integrity","json":"/paper/2105.08140/citation-record.json","paper":"/paper/2105.08140"},"outbound":[],"paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T04:44:00.054882Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2105.08140."}