{"as_of":"2026-08-07T09:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2c8ef89de12088c31602e2f3437f09d0b840ddc61f00f56db0166329303411f","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:20:00.443820Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26509/citation-record","integrity":"/paper/2607.26509/integrity","json":"/paper/2607.26509/citation-record.json","paper":"/paper/2607.26509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.345315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.345315Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:dc672ebff5ecfecb59403a2a853107aed35ef4da33127858440b153a3492bbce","observation_id":"feaae68f-2f0e-4845-96c1-d60edd8a5752","resolution":{"observed_at":"2026-08-01T14:19:56.345315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.454068Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.454068Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:7952ab8377bbb6e4934e7ae5b32ee7f4aee775c3f9ab859e44aa82882b74c4d0","observation_id":"7179c424-98b8-45a6-aa07-ee39bbc4cd2f","resolution":{"observed_at":"2026-08-01T14:19:56.454068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.572836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.572836Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:b57048e2ee78ba31df154c8144316b6364718cc3649c41f57fc95d0498821ef3","observation_id":"2ff5af11-d22d-4f6a-b9d0-76adfb126434","resolution":{"observed_at":"2026-08-01T14:19:56.572836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.671393Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.671393Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:0681ac41fb0042a219bcad475d12029c5afe20f95f95ebdb641c8339fae19737","observation_id":"6cfec29c-dee3-4690-86f4-6668e591827f","resolution":{"observed_at":"2026-08-01T14:19:56.671393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.775235Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.775235Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:c9dd520f718be70ce8f7353d05eb1ec61acf60acd180fc74827acace6cbb91f2","observation_id":"8733a819-08ae-40a2-af3a-c21ef6abf65b","resolution":{"observed_at":"2026-08-01T14:19:56.775235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.879256Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.879256Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:af5446d79cba3da60dd7df3ba8dcf03249d2389abc700f9f202eef67410b132e","observation_id":"2f68c1fe-8df9-48de-8e5f-34156681f7b2","resolution":{"observed_at":"2026-08-01T14:19:56.879256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:56.981625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:56.981625Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:fe1ff2480bbf1425a6dccaf49eab124c15bd79bd6cf1d0a10abc287afef9bdba","observation_id":"f09eb1e3-209c-4600-a507-4c430f2ef10d","resolution":{"observed_at":"2026-08-01T14:19:56.981625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-01T14:19:57.131516Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.131516Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:91f2b9f68aabdd8fa41dc28fe9ef7873f5028d4b0adcfa326755471d818b2b3c","observation_id":"a0d53f79-8bc4-49ad-b68b-0cac5cce3db6","resolution":{"observed_at":"2026-08-01T14:19:57.131516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.256589Z","title":"Fujimoto, H","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.256589Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:a0a86589b4bcf93256165e7bd3b2b3d02da53d3d1786de19b24e32d729d4bc52","observation_id":"fdcd6f40-9586-4647-930c-f773dab28eab","resolution":{"observed_at":"2026-08-01T14:19:57.256589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.342573Z","title":"Tesauro, et al., Temporal difference learning and td-gammon, Communications of the ACM 38 (3) (1995) 58–68","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.342573Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:f2540b9ee30b3a2e54f6c749073b1e34d465fbeb0958c305cf4382dc5ffd2586","observation_id":"1aad6f97-5987-4dd1-864a-64798499ffe0","resolution":{"observed_at":"2026-08-01T14:19:57.342573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.454575Z","title":"Cetin, O","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.454575Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:a3a8151223a1b816b5417aa2923d4b6dc8f4581c55494ff28bfda73327397313","observation_id":"317eb993-e171-4c03-b25c-b77444ef3d48","resolution":{"observed_at":"2026-08-01T14:19:57.454575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.554927Z","title":"Nauman, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.554927Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:d42d189f49e310d8058bbd3caea8020922a0b28feaf44df003aedbcf32338a6e","observation_id":"12875ec7-173c-46bc-83d5-b9ca0c3ca470","resolution":{"observed_at":"2026-08-01T14:19:57.554927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.722916Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.722916Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:3a7fe45d6abeff2c6bbf4c2d5437e3ece7a9fdd022accf71965944820ffa7583","observation_id":"84f51ae3-3d94-498e-8d57-07120340cc4c","resolution":{"observed_at":"2026-08-01T14:19:57.722916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.870507Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.870507Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:dd4c43be29ef74b6e26f6300e7b7c0cb5dbfdb18fac7335c9fa317964556c5b2","observation_id":"8ac3efae-3aa3-47d8-a294-b9eb8525c085","resolution":{"observed_at":"2026-08-01T14:19:57.870507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:57.980728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:57.980728Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:ff8620475657b5231bbd9f6956097188b22246e84844fb745c01585facc13957","observation_id":"58169d2d-22b0-4e6b-90f3-7adc5deefa4c","resolution":{"observed_at":"2026-08-01T14:19:57.980728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-01T14:19:58.045890Z","title":"Schaul, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.045890Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:3fa0bee1709cb232ab21875b9c35fb9043c5584b9a877910f847e5a86648b214","observation_id":"12d79805-ed10-4f11-b540-7590531e0c31","resolution":{"observed_at":"2026-08-01T14:19:58.045890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.123100Z","title":"Fujimoto, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.123100Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:137787ffc887bf95ecf39a0b888c17a3cb9faaed12ad41e641fc0b49962c636c","observation_id":"27520478-4065-40d0-b7d6-6f8cc0ddd8b0","resolution":{"observed_at":"2026-08-01T14:19:58.123100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.198535Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.198535Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:17e3f334ea5c2bf65582f0ef01247142255932e0e848a18563d294b8692903ab","observation_id":"f0d1f00b-6248-41b8-ac3b-0464fc02fc5c","resolution":{"observed_at":"2026-08-01T14:19:58.198535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.271877Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.271877Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:dbad4f603ae152a7db113b55da335ec6587daf8b53464e00f5d48e21f6e19bac","observation_id":"24c3c813-1cb8-4079-8cb7-015bf8f45da7","resolution":{"observed_at":"2026-08-01T14:19:58.271877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08140","last_updated":"2021-05-17T20:16:46Z","snapshot_observed_at":"2026-07-06T11:10:17.453429Z","submitted_at":"2021-05-17T20:16:46Z","title":"Uncertainty Weighted Actor-Critic for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.08140","snapshot_observed_at":"2026-08-01T14:19:58.343808Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.343808Z"},"links":{"cited_paper":"/paper/2105.08140","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:c09e1be423feeb873d55f3db4e477cc5ef12a0040cb3277f4f44477f0815ea1e","observation_id":"a074f1fd-fa65-4776-a518-e65e3bfced2f","resolution":{"observed_at":"2026-08-01T14:19:58.343808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.416980Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.416980Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:c199107842c1fe3ea4259ba402a83c267784b2ef8f43acb403c5349cbd2dda1b","observation_id":"ad3503b5-d135-475c-9d01-0b47fa6d4d41","resolution":{"observed_at":"2026-08-01T14:19:58.416980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.496770Z","title":"Van Hasselt, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.496770Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:093768205b87c76c4a30c33682a6ee544eeef52496c6d9c87aa4c35f603f04c3","observation_id":"d12f6818-06b8-496e-88cd-dba4daaa0aa0","resolution":{"observed_at":"2026-08-01T14:19:58.496770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-06T06:51:06.607084Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-01T14:19:58.566038Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.566038Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:12fcf1002a51f58726046c9063153ba96460ce62925d4879cdbc86a8bd0669f6","observation_id":"5837f5c2-4c72-4f00-98e0-e0f509e345b8","resolution":{"observed_at":"2026-08-01T14:19:58.566038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.665041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.665041Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:b7344d73f00e5ee67a2011ec5eacd118e5f5eb25331d96214233c55d873e7e41","observation_id":"f8defb5d-9ab7-4afa-b96a-58fe376965bf","resolution":{"observed_at":"2026-08-01T14:19:58.665041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.740250Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.740250Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:84320473fc76818180f6cc8db0ef0f18a1c8914cc3d973ce009957e5bb53a123","observation_id":"f4105ee3-6099-4726-b9be-fa4e0aae6c60","resolution":{"observed_at":"2026-08-01T14:19:58.740250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.801555Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.801555Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:80073a2508608584e071dd3aeaac315ad90f3ca54d8df9bf9abdc119af59c5cc","observation_id":"54f65f79-d978-4237-a220-46c624e43566","resolution":{"observed_at":"2026-08-01T14:19:58.801555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-07T08:10:41.731546Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-01T14:19:58.893464Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.893464Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:3bae4ef108d17bac865a1bb4a2f8916c60cd2abf05a7a29be7b9351504cef035","observation_id":"4fcd855e-68aa-4d55-ab2e-2a862282c663","resolution":{"observed_at":"2026-08-01T14:19:58.893464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:58.988156Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:58.988156Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:003336dc9b7abd3bab92247f1d1cd5806e81eb08e6778015d57050b654d9d45c","observation_id":"87ba3c41-7aa8-4e41-bea0-6b54f0861db0","resolution":{"observed_at":"2026-08-01T14:19:58.988156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:59.077231Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.077231Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:c5d0558ca1be68f5d2dcfc1d2104e96ba96baf288466cd66d587cd97cedf869b","observation_id":"576af92a-a6a8-4fb5-918a-0a064d829d9c","resolution":{"observed_at":"2026-08-01T14:19:59.077231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:59.169694Z","title":"Moskovitz, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.169694Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:f0db0efd032feb6be386215a701925dd1d303d72336f80420099aa39d27b09cd","observation_id":"303dc241-5205-4c4b-b91a-b14777f59d8a","resolution":{"observed_at":"2026-08-01T14:19:59.169694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-01T14:19:59.358820Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.358820Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:1df29fb30dba8258864de6f025d51ab06e68254d9edb42ec65732a01a9e2fecd","observation_id":"c27d9a3b-3085-47ad-a5f4-a2a852990263","resolution":{"observed_at":"2026-08-01T14:19:59.358820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-01T14:19:59.537141Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.537141Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:25da11a0f6c371c1e31e5c748d92d5d9a384f8677d9582ca45827768d88a1483","observation_id":"89fc52d4-b86b-4934-b810-98dccf4fd844","resolution":{"observed_at":"2026-08-01T14:19:59.537141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:59.674034Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.674034Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:281a28b9d6ee53fb110b10cd33a0e2aa76fc5661d103f672f68cca9fa2e2a626","observation_id":"9d814c5d-4041-404d-8e5d-b0935e44b517","resolution":{"observed_at":"2026-08-01T14:19:59.674034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:19:59.825409Z","title":"Zhang, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.825409Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:0bddff70ce1f7280acfc686db6db66fb5cf780454e9e09fe7c6dba043aeadfc1","observation_id":"554a53ac-b034-47a1-9dc8-62d3eb95f108","resolution":{"observed_at":"2026-08-01T14:19:59.825409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14139","last_updated":"2025-05-20T09:43:05Z","snapshot_observed_at":"2026-07-06T21:26:54.693576Z","submitted_at":"2025-05-20T09:43:05Z","title":"FlowQ: Energy-Guided Flow Policies for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14139","snapshot_observed_at":"2026-08-01T14:19:59.991253Z","title":"Alles, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:19:59.991253Z"},"links":{"cited_paper":"/paper/2505.14139","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:7b06646b25d6be3264087343da6cf6f66aca31b23f58bc2513838e6090c17f31","observation_id":"7a705d2d-e3e4-42e3-aacb-279a33792de1","resolution":{"observed_at":"2026-08-01T14:19:59.991253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:20:00.129349Z","title":"Hassani, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T14:20:00.129349Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:a49991615e6384a9ad8833982eac2320f2be406cc9c1dd2638865ce4c57b3876","observation_id":"cae1e53f-0f96-4287-895f-b40f327a4ffc","resolution":{"observed_at":"2026-08-01T14:20:00.129349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:20:00.219119Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T14:20:00.219119Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:ae0a4912b7037789352edbf1ba156bc0c8058ae175f80afb53cbbda9edad12cd","observation_id":"e55c1a13-c8bc-4282-96c1-3ad281306983","resolution":{"observed_at":"2026-08-01T14:20:00.219119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-01T14:20:00.288012Z","title":"Brockman, V","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T14:20:00.288012Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:af07d109d3ae4d301dce671d9cbbfdd40d1e3f231296aa155bd53a118f8d62a6","observation_id":"03fe2268-d5bb-4a6c-b23d-dcfc61694285","resolution":{"observed_at":"2026-08-01T14:20:00.288012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:20:00.353496Z","title":"Coumans, Y","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T14:20:00.353496Z"},"links":{"citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:b4fe2db98f5c4c7133477f98ebc5c4b82c30514ad6cea4d1a4a2eeeefa06689e","observation_id":"26adee7a-c462-4769-8ad7-2596ef62d964","resolution":{"observed_at":"2026-08-01T14:20:00.353496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-01T14:20:00.443820Z","title":"Tassa, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T14:20:00.443820Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2607.26509"},"observation_digest":"sha256:688540a57a7627ed039d204df43676b1a6eb953a8f42a1a09c2e11b08188836c","observation_id":"1f059672-91dd-436d-9679-ae8180939ce2","resolution":{"observed_at":"2026-08-01T14:20:00.443820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26509","last_updated":"2026-07-29T06:18:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T07:43:12.234195Z","submitted_at":"2026-07-29T06:18:19Z","title":"Collaborative Weighting with Pessimistic Critic for Mitigating Overestimation in Off-Policy Reinforcement Learning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.26509."}