{"as_of":"2026-08-08T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:882c70d1480b4778a1ae426550b23464810046f9bbc6d7f8253a4d56a6f328a3","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:42:34.550668Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01639/citation-record","integrity":"/paper/2506.01639/integrity","json":"/paper/2506.01639/citation-record.json","paper":"/paper/2506.01639"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.444604Z","title":"Deriving and improving cma-es with information geometric trust regions","venue":null,"work_id":"16f660fa-f130-4180-ad82-ed72df987fa7","year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.434436Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:ae415af92de670a985ed29ee339886d8ab6fe1809368b21338d3e90d079f53d6","observation_id":"037ab0cc-4bfe-4cb9-83c5-532dc0ba7cdc","resolution":{"observed_at":"2026-08-07T11:42:35.449301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.434273Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":"3ab8a652-79ae-4fc3-95fd-f4200f98f3e4","year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.454596Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:9f2a80293b8ce05afe18a3022d753e8bdb2eafcc09730bc435c9a36d752995de","observation_id":"e99c98b3-4569-4f1f-8ab5-30ed82433c2b","resolution":{"observed_at":"2026-08-07T11:42:35.438011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-07-06T06:45:27.162265Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-07T11:42:33.475700Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.475700Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:2d7f47c1400454fb8e394ccc9544404b7eac28ec973ee9abb734edaa891123a2","observation_id":"edc3fbf0-fb53-47d0-ad32-f868c9c1eef6","resolution":{"observed_at":"2026-08-07T11:42:33.475700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.424312Z","title":"Improved soft actor-critic: Mixing prioritized off-policy samples with on-policy experiences","venue":null,"work_id":"d43dcdc4-3f1a-405e-94ea-6e7dad7c81df","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.497612Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:29abb141979b948b9e49bc6416c9909ee7bb49f159a9b6b3636919d66874399e","observation_id":"669f855a-fb1f-4345-8f34-9131c79842e1","resolution":{"observed_at":"2026-08-07T11:42:35.427993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.414999Z","title":"Sukhatme","venue":null,"work_id":"c199de95-5d54-468f-8d49-a90a6928407e","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.519432Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:d15113227081dae58a3d34889f989a2ec3dede54b0ea4e4823ccf50a53f8d38d","observation_id":"998ab124-4c61-4dbe-9271-1092e56717df","resolution":{"observed_at":"2026-08-07T11:42:35.418179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.404003Z","title":"Box2d: A 2d physics engine for games","venue":null,"work_id":"38ccc803-7f4a-4695-9230-6ff1b447f1d6","year":2011},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.548555Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:87b69b18baf497a1c18aaa5e193f0e7c1643b41b59a98ec6ade9c86b12750d11","observation_id":"a76f75fc-75d7-4c36-86b2-3f2e8582a2bd","resolution":{"observed_at":"2026-08-07T11:42:35.408208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:33.569756Z","title":"Greedification operators for policy optimization: Investigating forward and reverse kl divergences","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.569756Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:68ddd76d945a13059f5840bb64292702c7a500a7508be85dc3a20c54d01402d3","observation_id":"91e8e127-d4ff-421f-950a-dd767d09f0a5","resolution":{"observed_at":"2026-08-07T11:42:33.569756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.389252Z","title":"Using expectation-maximization for reinforcement learning","venue":null,"work_id":"681aabd2-5e35-4112-b46c-0ef90ef3a030","year":1997},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.606210Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:aa3d7feac94750b1f6bc65fdc505f6c1a4536867ae9687c1011e7a79b28001fb","observation_id":"c3becc7a-769b-42c3-9abb-f51c1c418bb5","resolution":{"observed_at":"2026-08-07T11:42:35.392907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.379708Z","title":"Soft actor-critic for navigation of mobile robots","venue":null,"work_id":"f0967976-bfb4-4657-9852-233013ad198e","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.642675Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:160f3c262f92c6a1a0143857bc973743d71c53d53b7a79767496b98816c93b32","observation_id":"a15b1794-9e53-4f58-a320-1a8848be737a","resolution":{"observed_at":"2026-08-07T11:42:35.383303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.371171Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":"9eed3ab7-a45d-4c74-8725-edbec1893819","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.671122Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:56fe27131f3f583b8bfb90ebf17b5281d0f0f08d9c1f96ec15ff2373f27218c3","observation_id":"4c72111c-d7f2-4dc9-991f-b248de50cd2f","resolution":{"observed_at":"2026-08-07T11:42:35.374373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.361236Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":"3c5a1be1-a210-4ef2-b3e3-b1bb0d5d7d9f","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.692111Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:e0aa976991509272bf83ec234ef2f5cbef8446383713a360e7d268fb490b6a6b","observation_id":"9e1a854b-3c7a-4867-a536-e8a699640a70","resolution":{"observed_at":"2026-08-07T11:42:35.364809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.351593Z","title":"Virel: A variational inference framework for reinforcement learning","venue":null,"work_id":"cb0c2f97-def5-49a4-b30e-858a7a074e0e","year":2019},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.713449Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:9c73cb513afcd777a8d272d1565b4c91ba0300615eee73493086c4824ee9da7c","observation_id":"a0d0cc48-fe5e-45cc-9910-719dcbb4657c","resolution":{"observed_at":"2026-08-07T11:42:35.355409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.342156Z","title":"Brax - a differentiable physics engine for large scale rigid body simulation","venue":null,"work_id":"ea24d268-08bd-43bd-a004-e4923c7377ba","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.734844Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:d67243dcfa5274ada90da9a7d9cc8d8d8a5fdd735b3d2eff9a661ff84013a298","observation_id":"3032c6c8-423b-4b27-b522-9467f96829ad","resolution":{"observed_at":"2026-08-07T11:42:35.345980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.332038Z","title":"Iq-learn: Inverse soft-q learning for imitation","venue":null,"work_id":"3825c717-44fb-41a0-9ea5-5054fc8a9088","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.756905Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:ec812a1b44d99d38352535a689123998ed91e09e3d9185c55f2e7f0e3eb834ab","observation_id":"cfe213d7-5062-4740-bba8-ddca2d989ba3","resolution":{"observed_at":"2026-08-07T11:42:35.336235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.322787Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"efbe27cb-932d-4897-8ca2-4b817685139c","year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.779818Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:508d0ef2fddfcdc7489cb9154350925f9b004fdb86a4820e6eae6e5339e6bb26","observation_id":"589bee85-2e5e-4e9a-9106-8d32a3887ca8","resolution":{"observed_at":"2026-08-07T11:42:35.326371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.313716Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"855ead6b-3f3a-40a9-b894-d68a8587ace3","year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.801739Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:b45dbdb6487f036e9444de201bfdf6643a3d91142b106f54cc94abcef5bbc63b","observation_id":"13f7922a-3653-4d92-8f01-029b477554f0","resolution":{"observed_at":"2026-08-07T11:42:35.317218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-07T11:42:33.823457Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.823457Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:339c5eb66198d0fba907f78677ba1847e0f442f2635ca58f15dd978101801d46","observation_id":"09af56c0-619f-4464-b928-8b977479ce74","resolution":{"observed_at":"2026-08-07T11:42:33.823457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.303995Z","title":"The curse of dimensionality for numerical integration of smooth functions","venue":null,"work_id":"4a2661d8-de34-41e8-81b1-81faae390edf","year":2014},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.844042Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:22f3d8b96df14980500c02dce2a255a7813a6f270d0b5b067f6d46b707a47f2d","observation_id":"07c4f6a2-5767-458f-b939-a5c2a23099d9","resolution":{"observed_at":"2026-08-07T11:42:35.307790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.294420Z","title":"Graph soft actor–critic reinforcement learning for large-scale distributed multirobot coordination","venue":null,"work_id":"1dc243e0-a076-4d07-9aa9-62de760aeeac","year":2025},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.874324Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:2ab476281930ee1ea68ac6b4a68965bfa6d2470bdec0d96bd0691669a72ad55a","observation_id":"6f661f2b-2f62-430a-b6b9-17b221abea52","resolution":{"observed_at":"2026-08-07T11:42:35.297605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.285394Z","title":"Cleanrl: High-quality single-file implementations of deep reinforcement learning algorithms","venue":null,"work_id":"b59b534b-10be-40fe-b154-6540c32808e9","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.903554Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:1f54fa1692f57ef7a38a7dbd13fa5e967a5060a1ad7c411865de7c90d7fdbd42","observation_id":"c1ada51c-5566-4cae-8b05-ee776a377e36","resolution":{"observed_at":"2026-08-07T11:42:35.288646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.274657Z","title":"Accelerating reinforcement learning with value-conditional state entropy exploration","venue":null,"work_id":"717459c8-72a5-4da5-9456-5ae559f996f9","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.931033Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:647d2da9fc5c6b95be8641a7d5155e13a7e7120cc0e9a915497c4ae37389fda3","observation_id":"9ee33d03-f8d9-4270-a3e6-bdcd64224198","resolution":{"observed_at":"2026-08-07T11:42:35.278864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.264091Z","title":"Optimistic reinforcement learning by forward kullback--leibler divergence optimization","venue":null,"work_id":"ce0bb546-dc13-404d-8eba-0766824610fa","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.952445Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:8a408d26b6fe1a460535502d245c7b5975bbeeb461717817732457f61ac2e118","observation_id":"fff43b0d-d505-4b4c-bb31-b943f546a04b","resolution":{"observed_at":"2026-08-07T11:42:35.268488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.254302Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"853fab3e-291b-4b14-8c0c-1bfb42defaab","year":2020},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.973438Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:161dc68c2be589f785a69ead5d39fccebd8ec5f90a0bba6e5ce778e73f4a2025","observation_id":"f4940d73-37ee-4291-af6e-d085bf9bb700","resolution":{"observed_at":"2026-08-07T11:42:35.258046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T11:42:33.995064Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:33.995064Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:52fd3f8bd1457fc753112309cbfb13e6a5a4ea7cac8b9dcd901a25275b600577","observation_id":"af218bc2-7795-4bd9-99b4-11c5e994d2ce","resolution":{"observed_at":"2026-08-07T11:42:33.995064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.244809Z","title":"Constrained variational policy optimization for safe reinforcement learning","venue":null,"work_id":"8e6160b3-0898-4319-87b0-2ed967534e10","year":2022},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.017398Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:262a6066dba02937f332083a8927bab888fe712602052000970db9161d1e363b","observation_id":"7a4ee0e9-c39c-4524-871a-32c1d5b62299","resolution":{"observed_at":"2026-08-07T11:42:35.248022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.235017Z","title":"Algorithm 145: Adaptive numerical integration by simpson's rule","venue":null,"work_id":"6dd5228d-09d7-46e5-aa85-16ede0deacd7","year":1962},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.042879Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:bd77d4856ba53a1520f98144dcc03c8b1c48c50d0315c90a1a284c5c59d84590","observation_id":"ef99ea56-bcce-4636-9b5a-a19d99e946b8","resolution":{"observed_at":"2026-08-07T11:42:35.238937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.223376Z","title":"On principled entropy exploration in policy optimization","venue":null,"work_id":"95f2c8bd-60b6-4030-94b6-673608bd6f30","year":2019},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.064724Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:23400c213d4a9b399d83bfb79abdfac0614f7ca3f8e13db6200e671432981f7b","observation_id":"31cb562f-2668-4bdc-998a-82683a8e3736","resolution":{"observed_at":"2026-08-07T11:42:35.227828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.213524Z","title":"Importance sampling techniques for policy optimization","venue":null,"work_id":"dd19398e-c5e5-492a-aeae-33844b089898","year":2020},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.095121Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:8419ec01c63dfe9c9519f78bfe1f057734c2d129d6a35c25364037a96b3d4ca7","observation_id":"a4ce579e-74e0-4780-b0b3-f6b3ebf5c88f","resolution":{"observed_at":"2026-08-07T11:42:35.217571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.147276Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.147276Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:6673d493698e5ab0cbcd0af17f1f651cca7be2abd0dcf2563c55c8431b0c7fb8","observation_id":"ebb7a7e3-ef59-4277-9405-574668b10395","resolution":{"observed_at":"2026-08-07T11:42:34.147276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.197433Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"b5bdf9fc-dab2-40ba-b18b-7df5cf8d115f","year":1928},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.170202Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:f85602c3b2eb30fb448102e56c72f94555e61c8248ac788ab99bb464d8bd0fca","observation_id":"9198cf18-ceb7-4813-9cd9-0f3804966b78","resolution":{"observed_at":"2026-08-07T11:42:35.201661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09321","last_updated":"2017-03-15T22:55:17Z","snapshot_observed_at":"2026-07-06T05:20:25.405556Z","submitted_at":"2016-11-28T20:15:55Z","title":"Improving Policy Gradient by Exploring Under-appreciated Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09321","snapshot_observed_at":"2026-08-07T11:42:34.196122Z","title":"Improving policy gradient by exploring under-appreciated rewards","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.196122Z"},"links":{"cited_paper":"/paper/1611.09321","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:7275d5be3a3c0d4ab840ec0cab30fe4548c5f24f1fb1671ac71422e0cfff4824","observation_id":"c4b94ee6-79d0-4931-8ac2-ba475ccf4576","resolution":{"observed_at":"2026-08-07T11:42:34.196122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.217785Z","title":"Stable-baselines3: Reliable reinforcement learning implementations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.217785Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:3e17f64353fe235b4b8a16e2601769511630d876e8f8e0c1da59923326109a16","observation_id":"c225e167-9421-4220-b4f7-27df15930022","resolution":{"observed_at":"2026-08-07T11:42:34.217785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.164002Z","title":"Trust region policy optimization","venue":null,"work_id":"fa2ecb10-41e0-4320-b820-e7a802b4f00e","year":2015},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.238985Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:a6a82e9a87418f54afae8a7dfd2b78cee851df6521374e195061a994b522a707","observation_id":"69f38043-f28e-468a-a69e-d6efaccbcd41","resolution":{"observed_at":"2026-08-07T11:42:35.182420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:42:34.261078Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.261078Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:2a066653be78763ffe05680e64fc1fbfb1546ab06e14f23fe70924947da3cf04","observation_id":"a83300ff-a461-4fae-ab21-f7d0736b5e1d","resolution":{"observed_at":"2026-08-07T11:42:34.261078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.096009Z","title":"Monte carlo sampling methods","venue":null,"work_id":"0ff4e4ea-ff15-4961-a89c-ab9c211b0fda","year":2003},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.285541Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:0a211fe73c0353af49c1f123c0470cc1f673280cdd8d48a2d3dac7786ebc8c9b","observation_id":"1513d567-505b-47af-9015-2f7aca0c2c7d","resolution":{"observed_at":"2026-08-07T11:42:35.134269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:35.035156Z","title":"V-mpo: On-policy maximum a posteriori policy optimization for discrete and continuous control","venue":null,"work_id":"7cb3ba5c-43c9-4fd2-ad6a-da9b09472320","year":2020},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.312110Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:5811dbec026ab7089d67ed8006767a60e4bdc044429d082033ec3cb8d40e885e","observation_id":"10f56de9-2b04-4e8c-af7e-3c56428a2a02","resolution":{"observed_at":"2026-08-07T11:42:35.056253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05296","last_updated":"2017-06-16T14:47:21Z","snapshot_observed_at":"2026-07-06T05:47:10.770104Z","submitted_at":"2017-06-16T14:47:21Z","title":"Value-Decomposition Networks For Cooperative Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05296","snapshot_observed_at":"2026-08-07T11:42:34.333612Z","title":"Value-decomposition networks for cooperative multi-agent learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.333612Z"},"links":{"cited_paper":"/paper/1706.05296","citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:20a5030b319b8423b72ff6679e6c14668539380b304474aa9220df76e90815b1","observation_id":"884cde22-32a5-463b-b479-c70cad6a28a7","resolution":{"observed_at":"2026-08-07T11:42:34.333612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.371554Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.371554Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:34a7cd59c1832b4a0ada6ca803e951685e1eaadee144b913c6bb679fd1c58c7f","observation_id":"a0e0493e-d1ca-4cdc-96c2-5fbe9793ae0a","resolution":{"observed_at":"2026-08-07T11:42:34.371554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.393604Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.393604Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:eb2444731bedea2a1a4f50405064b8c775880322d94a3a8cd2eca97b2fc883a9","observation_id":"e1a785fa-c6f7-4a64-910c-c4b7f60424ba","resolution":{"observed_at":"2026-08-07T11:42:34.393604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.965635Z","title":"Probabilistic inference for solving discrete and continuous state markov decision processes","venue":null,"work_id":"32d481b2-8507-4dcf-8193-e3357214bd6c","year":2006},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.414592Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:65f768f0c937b583a7cec944514e7b8c1dabe310ccf24795b2d4f950c5143854","observation_id":"4872ae71-a7d7-4117-b3db-df8724e4ae0b","resolution":{"observed_at":"2026-08-07T11:42:34.998747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.922255Z","title":"Self-play reinforcement learning guides protein engineering","venue":null,"work_id":"e0063880-521b-4436-b128-4153f3dfb0d2","year":2023},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.436726Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:5a46340f81609705322cff8b3a29be60f80d4748db2ff16f01105494f6dc61fb","observation_id":"e2e48a29-57ef-40ea-b092-25ed2df07db4","resolution":{"observed_at":"2026-08-07T11:42:34.939905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.869430Z","title":"Scalable trust-region method for deep reinforcement learning using kronecker-factored approximation","venue":null,"work_id":"48798fff-c3d2-4811-9671-e53a88065e46","year":2017},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.458763Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:e5645df6c026f7d1593e452eb72d649345a72d37b9b88953a5aeb416f33d8cff","observation_id":"1b92f031-66b6-4596-a6af-efae17983045","resolution":{"observed_at":"2026-08-07T11:42:34.897254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.811037Z","title":"Monocular vision approach for soft actor-critic based car-following strategy in adaptive cruise control","venue":null,"work_id":"bd3d9f1d-1ee8-4af3-9c10-b5957d2c601d","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.480133Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:230697fde30b3c33ff44d5e4c960a90083b22c23d80cab8b6b5e9e90703d877c","observation_id":"d012f224-7276-4e29-92e3-93359c316e22","resolution":{"observed_at":"2026-08-07T11:42:34.839762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.758395Z","title":"Wcsac: Worst-case soft actor critic for safety-constrained reinforcement learning","venue":null,"work_id":"4a9fefbc-e98a-40c7-906c-d905b7f5f729","year":2021},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.501065Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:b5ba9ab6aefbc9dac1d6b4bb33fc1eb1976c1e93db9e291e9cb457cc8dd64d5e","observation_id":"1bdd5f55-a73a-40ce-a820-4a8fafe4d91e","resolution":{"observed_at":"2026-08-07T11:42:34.785426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.714909Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":"e8c53c1c-cc00-4271-8e3c-d735dfea47b8","year":2008},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.523235Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:a3cd1016d61d40794d159f419c6ca7a645dfc4fe3fdf6fa44f1699749be745d8","observation_id":"84d7064f-7693-4298-be96-8accd733b318","resolution":{"observed_at":"2026-08-07T11:42:34.731567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:42:34.670712Z","title":"Wasserstein gradient flows for optimizing gaussian mixture policies","venue":null,"work_id":"0c1ab005-075a-4f3f-81f5-aa1bf070110e","year":2024},"citing_paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:42:34.550668Z"},"links":{"citing_paper":"/paper/2506.01639"},"observation_digest":"sha256:9bc340e0f2f56559eec0274554804133f41902901bff2c3d8621634f082492cc","observation_id":"7cb4a608-aa9c-4c54-b024-3d59f93e49df","resolution":{"observed_at":"2026-08-07T11:42:34.688869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01639","last_updated":"2025-06-02T13:15:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:34:39.102121Z","submitted_at":"2025-06-02T13:15:30Z","title":"Bidirectional Soft Actor-Critic: Leveraging Forward and Reverse KL Divergence for Efficient Reinforcement Learning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2506.01639."}