{"as_of":"2026-08-07T09:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ebd0a22042c53709b2b12eeafa07c55ec1e46907df4328709e0515aa24f8892","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:33:08.990277Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09157/citation-record","integrity":"/paper/2605.09157/integrity","json":"/paper/2605.09157/citation-record.json","paper":"/paper/2605.09157"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning: Theory and algorithms","venue":null,"work_id":"f3f36881-629a-4a9b-803b-55f13c314dde","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:027691cc3579a6ef355567456c5ed165b7ff9add495bd65c08153d263b0f6569","observation_id":"06d884c3-8bf8-4ebd-ae18-fcea3c060862","resolution":{"observed_at":"2026-05-12T14:31:39.475200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the impact of entropy on policy optimization","venue":null,"work_id":"d2f06410-e7e0-4cbd-82ae-b02d1fccfa1b","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:90a2b45f21d92aa856b7325fd42bdadbb89ddc4edffd821713fdf062dd59b7ef","observation_id":"f1c6a39a-bc3c-4ee0-bfeb-cab54e2c18a7","resolution":{"observed_at":"2026-05-12T14:31:39.471699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10176","last_updated":"2021-03-18T11:23:39Z","snapshot_observed_at":"2026-07-06T10:51:06.246768Z","submitted_at":"2021-03-18T11:23:39Z","title":"Maximum Entropy Reinforcement Learning with Mixture Policies","version":1},"cited_work":{"arxiv_id":"2103.10176","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.10176","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximum entropy reinforcement learning with mixture policies","venue":null,"work_id":"870f9cb2-0e9a-4bf4-b7e2-d8d63bbc89cb","year":2021},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/2103.10176","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:e3eb530806303329af4a7f76c20c8cf05d8a089b042d86d141d65939ca3b484e","observation_id":"b32971d6-eae0-44ce-a01b-38de8aa42cb1","resolution":{"observed_at":"2026-05-12T06:11:22.891727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the sample complexity and metastability of heavy-tailed policy search in continuous control","venue":null,"work_id":"ae020f2c-f50c-4dc7-9b93-91fc2b43d351","year":2024},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:dcf280ce257a3616128d260aebdeff806ca6be47a7568f557106fc9d49f52a1b","observation_id":"e2be3b7e-52b7-4277-91c9-591d28336bc4","resolution":{"observed_at":"2026-05-12T14:31:39.457205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:166bc32399d9af586e42adfff102b4d5e15ecb4f7a29e362e813da55070df4ed","observation_id":"05b4147b-b880-403a-80eb-33d724805114","resolution":{"observed_at":"2026-05-12T06:11:22.773603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"JAX : composable transformations of P ython+ N um P y programs","venue":null,"work_id":"7791d92e-2663-44fa-9146-c1bbe7702d95","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:16966afff059f55b1e65f653388f7f503ced9e0e5a79a8e95f60f12a10931cf4","observation_id":"2fc38d5b-9d69-4c65-9198-9ee53fdcec2c","resolution":{"observed_at":"2026-05-12T14:31:39.468041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:7c4e525c0c23fc72a2ad199047eb40bb759e05a985d6af2632acb7ccc1ab5ae5","observation_id":"5f3b3339-1883-4c3c-bca2-1c56f4043eb4","resolution":{"observed_at":"2026-05-12T06:11:22.836602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On upper and lower bounds for the variance of a function of a random variable","venue":null,"work_id":"b5419588-b455-41e8-91f8-e616e65d77d7","year":1982},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:b1df847efbe199d7bee8c1174d5c4b2edc57aba94f927bf2290515c92074e07e","observation_id":"7db74fb0-6519-4492-b292-b43139624b99","resolution":{"observed_at":"2026-05-12T14:31:39.442004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Myosuite: A contact-rich simulation suite for musculoskeletal motor control","venue":null,"work_id":"17e72a22-e7f4-4f51-a10a-c52ef153e7bf","year":2022},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:351bd9019266cb78d7a1d0fe6d706d016c6d428f551702c4ff4ef3ed8624d0c2","observation_id":"3ba1d749-aa97-4144-b0ec-7bc13c1d5770","resolution":{"observed_at":"2026-05-12T14:31:39.333236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specializing versatile skill libraries using local mixture of experts","venue":null,"work_id":"57b4b8e2-068d-42df-9109-d92620c1e200","year":2022},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:f3c40e0da06cdc0516f89a89b26069e6b1cd2c866bd4d73a7761ddcbe2a0f2d2","observation_id":"118e43a9-53e5-4c8f-b83e-3e05fb59c4eb","resolution":{"observed_at":"2026-05-12T14:31:39.420430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving stochastic policy gradients in continuous control with deep reinforcement learning using the beta distribution","venue":null,"work_id":"6a956aad-31ca-4f4f-93ec-d198c90ac23e","year":2017},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:045989a9e27e56903e500d39cfa65a5044d7a3c09605ef51958f7f0215840d7a","observation_id":"909acd8f-cbe1-45ec-9780-dd1435c3acb8","resolution":{"observed_at":"2026-05-12T14:31:39.423647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical relative entropy policy search","venue":null,"work_id":"924def29-cb5c-488f-a181-10238d454af4","year":2012},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:b17e565e9681b0b42eaeec6eacdfed3dd9e90bae1d29ab3b4cee90ae08ba8877","observation_id":"a66c1beb-ea0d-428b-b567-aa9ab1150f10","resolution":{"observed_at":"2026-05-12T14:31:39.438300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-free reinforcement learning with continuous action in practice","venue":null,"work_id":"fc384626-2ceb-4e00-b759-b959e4e95791","year":2012},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:4af97183d2c4603be5d81c1be8c90151fd4cf0ec01aaaa76a5ed49a1d43e7379","observation_id":"b1c7b8da-de2e-4be9-bd8a-ffea9a47fbc9","resolution":{"observed_at":"2026-05-12T14:31:39.412879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"73c31e41-df41-47d6-aee5-14dda6b88c8f","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:9d646d4e1200ad666581d5e4e69c3ae72f84705f032373d97173b25da8b80372","observation_id":"b32533d6-f5cf-4a08-b6c8-c9c783185888","resolution":{"observed_at":"2026-05-12T14:31:39.416738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uncertainty in deep learning","venue":null,"work_id":"181fe691-1747-479c-9755-eaa295779fd9","year":2016},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:a793a38912935d7993c6807b58d30487f9c7827b2d12647dd8ba19fadc503fe3","observation_id":"6cb18d3e-4abf-4b81-998f-bf71e8ebb0c2","resolution":{"observed_at":"2026-05-12T14:31:39.434060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acquiring diverse robot skills via maximum entropy deep reinforcement learning","venue":null,"work_id":"58414f25-cc2d-45e2-8587-109e92ebf0ba","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:aadfcb9f9da8149aafa98152e575e6cd465a120866cb8f7112e32450433b8c75","observation_id":"62e38cab-91c7-4fe7-bfc4-ec742dbdce88","resolution":{"observed_at":"2026-05-12T14:31:39.463877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"3e06b8d0-0680-4806-94db-7502fd6dac9f","year":2017},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:3da3c802bbd8b624f6fc8eee43c488930206a3ed69bac69e03455e36b61ad47a","observation_id":"ee7d3d50-1cf3-4368-8805-dc3180aa5f10","resolution":{"observed_at":"2026-05-12T14:31:39.341082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"3132f562-5471-40c8-973b-0b21e199dc3c","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:f831e837c27788553ac1079e61c5a30e0f032805c66f362dd524f39c6aa2bd72","observation_id":"6651af1a-3c40-41d8-9399-0b80f53dfc78","resolution":{"observed_at":"2026-05-12T14:31:39.445703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":"1801.01290","doi":"10.48550/arxiv.1801.01290","metadata_source":"pith","pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","venue":"cs.LG","work_id":"6674e5db-4e1c-49c0-b598-c108a0ecadb6","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:cc48ccf68ebaaae538bba61f6a05802fbd101d2ce0ab57746bc3f2ed5a8899d5","observation_id":"ec6809bb-1d1e-429c-b991-6a88a7570380","resolution":{"observed_at":"2026-05-13T01:48:10.852058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":"1812.05905","doi":"10.48550/arxiv.1812.05905","metadata_source":"pith","pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Actor-Critic Algorithms and Applications","venue":"cs.LG","work_id":"bb49c9fb-03b2-4226-9edb-50186b8193e4","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:79f124c9cab17213581dd4aade8d2e0d2c7f3698f818d92010a440603802f2e0","observation_id":"ab3fee38-09ea-4d14-8349-e644b5aee0e6","resolution":{"observed_at":"2026-05-13T14:32:42.077468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T09:49:21.584701+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning latent dynamics for planning from pixels","venue":null,"work_id":"2f36e6e5-5bd4-4fd2-a38a-f7aebbfce579","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:61c9e5f5aef83d4a232eac33654665d7dd01c9238aaeda64fb76b12158a3e9d2","observation_id":"0cb0d849-adb8-470f-9f09-e0b366946746","resolution":{"observed_at":"2026-05-12T14:31:39.348406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning continuous control policies by stochastic value gradients","venue":null,"work_id":"ae688523-974d-498b-ba5f-4410b272b009","year":2015},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:939f5cd45b692f7feed70a9825d9f8e1f61cc02ff3fec8bbf474d40c38cad7f3","observation_id":"24c601ab-44b5-42d1-bb89-1caa69715d2a","resolution":{"observed_at":"2026-05-12T14:31:39.449355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.02829","last_updated":"2020-02-07T15:01:20Z","snapshot_observed_at":"2026-07-06T08:55:37.851828Z","submitted_at":"2020-02-07T15:01:20Z","title":"Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)","version":1},"cited_work":{"arxiv_id":"2002.02829","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.02829","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Off-policy maximum entropy reinforcement learning: Soft actor-critic with advantage weighted mixture policy (sac-awmp)","venue":null,"work_id":"a8cbae14-0bae-4b06-80fa-a94d54436cda","year":2002},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/2002.02829","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:86ff18f1a97fc90efddd48c8951fc7fba005aadc4844ae076a2f560f7e473ec9","observation_id":"9bdc9302-e4c8-40e7-962e-0a641dce73a8","resolution":{"observed_at":"2026-05-12T06:11:22.842950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03062","last_updated":"2021-11-04T17:59:56Z","snapshot_observed_at":"2026-07-06T12:05:35.871537Z","submitted_at":"2021-11-04T17:59:56Z","title":"Generalization in Dexterous Manipulation via Geometry-Aware Multi-Task Learning","version":1},"cited_work":{"arxiv_id":"2111.03062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.03062","snapshot_observed_at":"2026-07-04T06:59:38.340560Z","title":"Generalization in dexterous manipulation via geometry-aware multi-task learning","venue":null,"work_id":"1946cbb8-0ae5-4610-9255-6bbbc23e4baf","year":2021},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/2111.03062","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:fde3934336dcdfda9e37390febf4bb1c050e37189fd63bf5ee7efbd5bd39c1d1","observation_id":"05787a78-2e17-40e7-8e28-bac7c0d6a8cd","resolution":{"observed_at":"2026-05-12T06:11:22.869984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":"b9a14842-a63e-4456-9834-84759074099d","year":2016},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:2425e3542c979b03749b9fa701f110c87de7feeacf6969f1c35ce42fe2db71d4","observation_id":"5bd5f78e-1ac0-4fc7-9760-2cdbb4358992","resolution":{"observed_at":"2026-05-12T14:31:39.408638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:7a70424bc4ec04d087e040e894c0e1c661d25b3462e8c85a1a3fa02a35f003f7","observation_id":"8204c685-b8ff-4d7a-8205-18a6fe6554bb","resolution":{"observed_at":"2026-05-12T06:11:22.822486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Student-t policy in reinforcement learning to acquire global optimum of robot control","venue":null,"work_id":"98c6af32-6e03-4830-931a-04cffcf7f1ef","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:50cecc82a397cde0b8cad70e7767c775f4df148c189806c66e75f898859fdd51","observation_id":"edc0f208-e1a9-40ad-885c-6cfe51ab770f","resolution":{"observed_at":"2026-05-12T14:31:39.344630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-free policy learning with reward gradients","venue":null,"work_id":"17c394e1-92ee-47a0-a94b-dffb29596867","year":2022},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:b3f5662bea55a2630d7938ecbc8e2b7e5f4e93ad3b8fbdc090590e2c3a3c7acd","observation_id":"d19de21d-04e0-434b-8da2-c5d9069155be","resolution":{"observed_at":"2026-05-12T14:31:39.403437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic latent actor-critic: Deep reinforcement learning with a latent variable model","venue":null,"work_id":"9855c3b3-4d7b-42c0-b93a-deb2363767a5","year":2020},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:6972d9748517d793c0cbb9798ab52461ff21e7c9e6f2415124fef066c78091a4","observation_id":"edbf07ce-4e8c-4b45-81e6-b909cb9ab6a8","resolution":{"observed_at":"2026-05-12T14:31:39.360619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":"1509.02971","doi":"10.1137/22m1480409","metadata_source":"pith","pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Continuous control with deep reinforcement learning","venue":"cs.LG","work_id":"41a65444-c819-4303-a1f1-b075aa86d40c","year":2015},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:063917ed369374705133facc9054679c895e081d986f54b07efb694630be316a","observation_id":"401bcb7b-f6a2-438f-a555-c3c2390f38ee","resolution":{"observed_at":"2026-05-12T06:11:22.882243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The concrete distribution: A continuous relaxation of discrete random variables","venue":null,"work_id":"2874f7f9-494f-49bf-938c-3347d87ee170","year":2016},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:85a75bce41b6cc1755438bf9837083429ca617458dd495d0fd6f7ff51cd7dd67","observation_id":"5efc6f9f-c731-4be9-bd12-3b99f976e4c2","resolution":{"observed_at":"2026-05-12T14:31:39.395773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging exploration in off-policy algorithms via normalizing flows","venue":null,"work_id":"ad00a9d9-6052-4592-acda-8ad5418b17ee","year":2020},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:de1a97694f91d86b59cc698b15a0eaa750108014e88f730ad46a601186480d15","observation_id":"778148b4-3481-47bf-a690-7047da57cfa5","resolution":{"observed_at":"2026-05-12T14:31:39.426968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S\\ 2\\ AC : Energy-based reinforcement learning with stein soft actor critic","venue":null,"work_id":"12bfaeac-1101-4d92-b242-5da370b6b43c","year":2024},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:ed0cf96a633a5af1747415078736165b885e1b0f83c24f4f7f8b071b057cd264","observation_id":"230c3560-1cd5-42af-9c9f-aaf452f73c92","resolution":{"observed_at":"2026-05-12T14:31:39.388980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing reparameterization gradient variance","venue":null,"work_id":"156d9f2f-aa04-4a46-a01c-13071b04aba4","year":2017},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:57d5b7d0414dc645a0ff6fc9a8eed44b13ccb13b2c039e1b8025d4dcdbb64bf2","observation_id":"886fd1d4-3473-43bd-9540-cfb50801a3fa","resolution":{"observed_at":"2026-05-12T14:31:39.382179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"b7aeacc5-8b3a-4a80-bf02-be39954b062f","year":2020},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:9ff46f0afd5be7cf63182ce03486de497ea320635f1310f7c9cab0e145e0f2e4","observation_id":"8d6b7756-aefc-4310-af21-97711315d561","resolution":{"observed_at":"2026-05-12T14:31:39.352376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robot skill adaptation via soft actor-critic gaussian mixture models","venue":null,"work_id":"2a4aafbe-6681-486f-9b8b-af4210e6375f","year":2022},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:95810998f45c519b89057f8c0fe4d0184fce752a685b2b72994b08f704719f22","observation_id":"6e72d158-8db5-491b-8aad-b2dafa102802","resolution":{"observed_at":"2026-05-12T14:31:39.375590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Greedy actor-critic: A new conditional cross-entropy method for policy improvement","venue":null,"work_id":"3bddf4e5-c106-4913-bd26-2d64fa2650ba","year":2022},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:14e7292b2aa73a50d9063cbc7b5d3d5ee74ee388d8b7fb7ff52206bf93bb70b4","observation_id":"a00a0810-6996-4cd5-a81f-d8d212df6b29","resolution":{"observed_at":"2026-05-12T14:31:39.385436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"6addb0b0-6828-4fcd-ab53-dcc750a8a8cb","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:f094cf3b7f131c7fd527d51d6c8bf9b5d90db12c921bc038e718ed2aaf9c7e5e","observation_id":"ac3acd16-06f0-43fe-a8b1-58c906e84da7","resolution":{"observed_at":"2026-05-12T14:31:39.430748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09464","last_updated":"2018-03-10T18:11:25Z","snapshot_observed_at":"2026-08-02T00:57:15.173797Z","submitted_at":"2018-02-26T17:20:14Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","version":2},"cited_work":{"arxiv_id":"1802.09464","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.09464","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","venue":"cs.LG","work_id":"885194fc-d60a-4643-9eaf-ba0dca0e6165","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1802.09464","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:a7c443837530c57cde0f3cb59261f81678d5a7fa97596fa81ab99fa7c5ed31df","observation_id":"74b000b0-27a9-498e-bb44-2d6f490ea4e3","resolution":{"observed_at":"2026-05-12T06:11:22.860842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09122","last_updated":"2021-04-19T08:21:56Z","snapshot_observed_at":"2026-07-06T11:01:29.967128Z","submitted_at":"2021-04-19T08:21:56Z","title":"Probabilistic Mixture-of-Experts for Efficient Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2104.09122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09122","snapshot_observed_at":"2026-06-29T14:03:29.510145Z","title":"Janner, M.; Fu, J.; Zhang, M.; and Levine, S","venue":null,"work_id":"11062be1-263d-496d-b7ce-e68bae5db606","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/2104.09122","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:5a277fb39f0bafed78d22b0cca6b4edc29425dcad73affeec25429c0f44e4578","observation_id":"94c67878-6e7c-49af-a7fb-a6104e4d653d","resolution":{"observed_at":"2026-05-12T06:11:22.787704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:635174efd342920270c3f668e4e71ba430dc9525b947fbbe011f2cb4abcc2959","observation_id":"64d3372a-b612-4f17-b336-2fe671f8e3d3","resolution":{"observed_at":"2026-05-12T06:11:22.853183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Strength through diversity: Robust behavior learning via mixture policies","venue":null,"work_id":"fbd5c5eb-664f-4859-8508-fb94cea18e20","year":2022},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:44e6f033c19668b160acdb2a5fbf569fc1a1a1345ae62c722e613bbdbf9c8a62","observation_id":"db6aecc0-cc08-491f-989d-461bb9b13083","resolution":{"observed_at":"2026-05-12T14:31:39.460617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":"6c4ca315-17e1-4366-954e-02e4e512a3fa","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:e0dea9a61c58fad4a20edd9429e5d76514acb6a6e93f787f3685e0a088ef8a3d","observation_id":"829b5396-cb1f-47cb-a712-8bb4668cee7a","resolution":{"observed_at":"2026-05-12T14:31:39.453498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":"2fae6588-1247-40c6-b2a2-eef678d620ae","year":1999},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:58c8083868a03d42da2f6edc973abeaa67b6a121c59924035076b1b4c9c220b1","observation_id":"d2a5742c-9dbb-4f2d-851a-0a58ca80a436","resolution":{"observed_at":"2026-05-12T14:31:39.368000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06798","last_updated":"2019-02-03T16:26:40Z","snapshot_observed_at":"2026-07-06T06:45:24.737298Z","submitted_at":"2018-06-10T08:24:36Z","title":"Implicit Policy for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1806.06798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1806.06798","snapshot_observed_at":"2026-07-04T23:22:02.244370Z","title":"Implicit policy for reinforcement learning","venue":null,"work_id":"7cbdd419-26b7-415a-a693-58901c39afed","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1806.06798","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:061e4440f0a4e4ba0eaf7ec368fb5182af0f40d5d2e6c9efe61562a25f3f45d7","observation_id":"4feeb983-2734-402d-8b34-b4e00a139782","resolution":{"observed_at":"2026-07-04T23:22:02.244370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":"1801.00690","doi":"10.48550/arxiv.1801.00690","metadata_source":"pith","pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepMind Control Suite","venue":"cs.AI","work_id":"54294ef0-c651-4d5a-a72b-f85a88329a71","year":2018},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:f4e7d569393261b0fd82c71e74830064706a83d1c5eadf34a6c274650b95a2ee","observation_id":"e07a08fa-4270-4e26-89b5-a175398eb3a5","resolution":{"observed_at":"2026-05-13T07:44:14.794093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SciPy 1.0: fundamental algorithms for scientific computing in Python","venue":null,"work_id":"78095e37-be54-492d-9114-04c99f23e49c","year":2020},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:95a698f1000093abdd9710702984dd7e7c0586e4060b2cd9410098def847f73c","observation_id":"b285df28-723d-41dc-9c03-e28c7ae86042","resolution":{"observed_at":"2026-05-12T14:31:39.378562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion policies as an expressive policy class for offline reinforcement learning","venue":null,"work_id":"3c82e131-073f-4113-91ae-90800f7d753f","year":2023},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:bb57e4d0838d8a848e5477f1cbb80c7f77c16174678e677e0a571ff5f14fc2b7","observation_id":"fb737d3b-6080-41b3-b898-2656305d3810","resolution":{"observed_at":"2026-05-12T14:31:39.364539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":"9c17082f-01f4-4228-8d71-08b7812dada8","year":1992},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:6bea2c1c7a6f73a6592bfe4f8e35ad2e1adc416181fd19392f633dba3cb4b592","observation_id":"47089ed9-a9d7-4e04-812d-60245b9a7c24","resolution":{"observed_at":"2026-05-12T14:31:39.400109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Variance reduction properties of the reparameterization trick","venue":null,"work_id":"0457a55e-f923-410c-9b2a-d43c07a5b6ea","year":2019},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:bf992f33cb848505f1707ca3035c9b5983ff07e17f3f959ddbdc4283d24a464f","observation_id":"7ceb34f8-9a68-479a-8a09-19a580605d33","resolution":{"observed_at":"2026-05-12T14:31:39.392327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":"275a8827-babf-4aed-accb-88555203508e","year":2020},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:45e622f476ee278f9bd67cfd629d7520790d8a74b388977f4688a79931b705ea","observation_id":"8be5421a-2b10-4700-88c2-94ef8f603f4d","resolution":{"observed_at":"2026-05-12T14:31:39.337375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent state marginalization as a low-cost approach for improving exploration","venue":null,"work_id":"6826887a-bd48-495e-9793-85372cc56304","year":2023},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:9ada082ad4af028f07c42940940a50b0537270a5acec2caed5e40a80a6491752","observation_id":"4f2c4491-6930-4690-9a65-3fa6f9570eb8","resolution":{"observed_at":"2026-05-12T14:31:39.355835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model-based reparameterization policy gradient methods: Theory and practical algorithms","venue":null,"work_id":"d79ed114-e52e-4b46-9878-d83b141312be","year":2024},"citing_paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T04:33:08.990277Z"},"links":{"citing_paper":"/paper/2605.09157"},"observation_digest":"sha256:c726173375f17fa6b7339af0fae918eb699711b2b9eadc01b2f689f2c2c35180","observation_id":"570cccc1-1752-43e0-b5fa-78d2ef814852","resolution":{"observed_at":"2026-05-12T14:31:39.371561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09157","last_updated":"2026-05-09T20:37:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T18:03:50.564757Z","submitted_at":"2026-05-09T20:37:52Z","title":"Revisiting Mixture Policies in Entropy-Regularized Actor-Critic"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":39},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2605.09157."}